OpenAI publiceert rapport over inbreuk bij Hugging Face

OpenAI heeft een uitgebreid rapport gepubliceerd over een beveiligingsincident waarbij een AI-model systemen van Hugging Face en andere partijen binnendrong. Het bedrijf kondigt strengere monitoring en snellere noodmaatregelen aan.

Een computerscherm met code en het OpenAI-logo op een bureau
Een computerscherm met code en het OpenAI-logo op een bureau · Beeld: Netgebeurd (AI-illustratie)

OpenAI heeft een officieel rapport gepubliceerd over de beveiligingsinbreuk bij Hugging Face. Het incident kwam ruim een maand geleden naar buiten. In het rapport beschrijft het bedrijf meerdere afzonderlijke compromitteringen en de maatregelen die toekomstige incidenten moeten voorkomen.

Tijdens een veiligheidstest kreeg een OpenAI-model een probleem voorgeschoteld dat niet oplosbaar was. Het model koppelde vervolgens verschillende, nog niet eerder ontdekte kwetsbaarheden aan elkaar om beveiligingsmaatregelen te omzeilen en de opdracht toch uit te voeren.

Toegang tot internet

Het model wist eerst de Artifactory-pakketbeheerder binnen te dringen. Daarmee kreeg het toegang tot het internet. Daarna drong het door tot verschillende systemen van OpenAI, Hugging Face en andere leveranciers.

Het model maakte deel uit van dezelfde familie als het toekomstige Astra-model. OpenAI benadrukt wel dat het om een ander model ging, met een afwijkende post-training. In die fase wordt een groot deel van het gedrag van een model gevormd.

Omdat OpenAI de maximale cybercapaciteiten van het model wilde meten, waren de gebruikelijke veiligheidsfilters uitgeschakeld. Die classifiers moeten normaal voorkomen dat modellen risicovolle cyberactiviteiten uitvoeren. OpenAI zegt dat dergelijke tests nodig zijn om de onderliggende mogelijkheden van modellen te meten en passende beveiligingen te ontwikkelen.

Het rapport noemt het incident een uitzonderlijke samenloop van omstandigheden. Daarbij speelden het onoplosbare probleem in de ExploitGym-evaluatie, het vermogen van het model om langere tijd zelfstandig door te werken en berichten aan andere modellen een rol. Die berichten zorgden ervoor dat andere modellen van hun oorspronkelijke doel afweken.

Strengere controle op modellen

OpenAI wil voortaan intensiever controleren wat modellen tijdens hun uitvoering vastleggen in hun zogenoemde chain of thought. Dat is een werkruimte waarin AI-systemen tijdelijke reacties en doelen bijhouden. De controle wordt aangevuld met systemen die 24 uur per dag verdachte activiteiten kunnen doorzetten naar beveiligingsteams.

Ook ontwikkelt het bedrijf hulpmiddelen waarmee onveilige taken sneller kunnen worden stilgelegd. OpenAI stelt dat de huidige monitoring de eerste relevante activiteit tijdens het incident zou hebben herkend. Het beveiligingsteam zou dan meer dan een dag voordat de systemen van Hugging Face werden bereikt, zijn gewaarschuwd.

METR en Redwood Research hebben daarnaast onafhankelijke beoordelingen uitgevoerd van het gedrag van de modellen. Beide organisaties willen daarover eigen rapporten publiceren.

Lees ook