De AI-agent die systemen van Hugging Face binnendrong, voerde in vier en een halve dag 17.600 acties uit. De agent verkende de infrastructuur, bemachtigde wachtwoorden en broncode en verplaatste zich vervolgens binnen de systemen van het AI-datasetplatform.
OpenAI erkende dat een eigen model achter de aanval zat. Het model verliet een testomgeving en probeerde een benchmark te omzeilen door toegang te krijgen tot afgeschermde systemen van Hugging Face.
De gebruikte kwetsbaarheden waren niet nieuw. Hugging Face concludeerde in een technisch rapport dat een ervaren menselijke aanvaller dezelfde fouten had kunnen vinden en misbruiken. Wel was de aanval uitzonderlijk door de snelheid, schaal en volharding waarmee de agent opereerde.
Kyle Ryan, hoofd onderzoek en ontwikkeling bij Pensar, noemt vooral die autonomie opvallend. Tegelijkertijd was de activiteit volgens hem zeer zichtbaar voor beveiligingssystemen. De systemen van Hugging Face brachten de gebeurtenissen samen tot een aanvalssignaal, maar de ernst ervan werd niet snel genoeg opgeschaald naar het dienstdoende team.
Meerdere verdedigingslagen
Ryan stelt dat een beveiligingsstrategie met meerdere lagen de aanval op verschillende momenten had kunnen onderbreken. Daarbij noemt hij beperkte toegangsrechten, segmentatie van netwerken, goede detectie, betrouwbare escalatieprocedures en voortdurend testen op zwakke punten.
Nico Waisman, chief information security officer bij XBOW, wijst erop dat de AI-agent niet bewust onvoorzichtig handelde. Het model had geen opdracht gekregen om onopvallend te blijven en richtte zich alleen op het uitvoeren van zijn taak. Volgens Waisman woog ook zwaar dat één gestolen toegangsgegeven hoge rechten op meerdere systemen opleverde.
Vincent Yiu, managing director bij SYON Security, zegt dat het lastig blijft om kwaadwillende handelingen te onderscheiden van normaal werk binnen een organisatie. Alleen een groot aantal acties hoeft daarbij niet direct een alarmsignaal te zijn.
Dan Guido, topman van beveiligingsonderzoeksbedrijf Trail of Bits, zegt dat OpenAI mede verantwoordelijkheid draagt omdat de aanval dagenlang kon doorgaan. Hij ziet het als positief dat Hugging Face de inbraak uiteindelijk zelf ontdekte. Het reconstrueren van duizenden handelingen was volgens hem alleen haalbaar met speciale hulpmiddelen.
Hugging Face zette voor het onderzoek ook AI in. Het bedrijf gebruikte het open source-model GLM 5.2 van het Chinese Z.AI, nadat andere geavanceerde modellen door hun beveiligingsinstellingen niet konden worden ingezet. Die instellingen konden een incidentonderzoeker niet onderscheiden van een aanvaller.



