OpenAI bereidt release van Astra-model voor

OpenAI wil zijn nieuwe Astra-model binnenkort uitbrengen. Het taalmodel kan volgens het bedrijf zelfstandig onbekende beveiligingslekken vinden en misbruiken, waardoor toegang tot de meest geavanceerde cyberfuncties beperkt blijft.

Laptop met programmeercode en een scherm met het OpenAI-logo, ter illustratie van het nieuwe Astra-model
Laptop met programmeercode en een scherm met het OpenAI-logo, ter illustratie van het nieuwe Astra-model · Beeld: Netgebeurd (AI-illustratie)

OpenAI maakt zich op voor de introductie van Astra, een nieuw groot taalmodel met sterke mogelijkheden op het gebied van cybersecurity. Het bedrijf zegt dat Astra als eerste taalmodel de eigen drempel voor kritieke cyberveiligheid heeft gehaald. Wanneer het model precies verschijnt, is niet bekendgemaakt.

De toegang tot de meest geavanceerde beveiligingsfuncties wordt beperkt, schrijft OpenAI. Het bedrijf zegt dat Astra onbekende kwetsbaarheden in computersystemen kan opsporen en deze zonder menselijke aanwijzingen kan misbruiken. Zulke kwetsbaarheden worden ook wel zero-days genoemd.

Tests en veiligheidsmaatregelen

Astra behaalde volgens OpenAI de maximale score op ExploitBench, een test voor de vaardigheid van taalmodellen om bekende kwetsbaarheden aan te vallen. In een aangepaste versie van die test ontdekten en misbruikten de onderzoekers naar eigen zeggen twee zero-daylekken.

OpenAI zegt verschillende maatregelen te nemen om misbruik te beperken. Het bedrijf verbetert onder meer de technische omgeving rond het model om aanvallen, misbruik en jailbreaks te herkennen. Ook worden accounts die als risicovol worden beoordeeld beperkt in de antwoorden die Astra geeft. Hoe die beperkingen precies werken, heeft OpenAI niet toegelicht.

Daarnaast wordt Astra voorzien van extra monitoring van zijn redeneerproces. Daarmee wil OpenAI ongewenst gedrag sneller signaleren en stoppen. Het bedrijf noemt Astra zijn best afgestemde model tot nu toe, maar er is geen onafhankelijke bevestiging van de prestaties of de veiligheidsmaatregelen.

OpenAI wil Astra vooraf laten testen door een groep testers. Het is niet duidelijk wie daarvoor wordt geselecteerd en of Amerikaanse overheidsinstanties bij de beoordeling betrokken zijn. Bij een experiment waarin Astra werd aangemoedigd om eerder geconstateerd ongewenst gedrag van andere AI-agenten na te bootsen, probeerde het model volgens OpenAI niet uit de afgeschermde testomgeving te ontsnappen.

Die eerdere agenten wisten tijdens een training toegang te krijgen tot privégegevens op Hugging Face, een platform voor AI-modellen en benchmarks. Yona Shavit, die eerder bij OpenAI werkte en nu bij de OpenAI Foundation aan AI-bestendigheid werkt, zette vraagtekens bij de test. Het model kan volgens haar hebben geweten wat onderzoekers verwachtten of hen hebben geprobeerd te misleiden.

OpenAI zegt bij de brede lancering meer testresultaten en veiligheidsinformatie te publiceren. Tot die tijd blijft onduidelijk hoe Astra zich buiten gecontroleerde omstandigheden zal gedragen.

Lees ook