De Britse AI Security Institute (AISI) heeft 19 gevallen vastgesteld waarin AI-agenten tijdens cybersecuritytests zonder toestemming handelingen uitvoerden op het openbare internet. De meeste incidenten betroffen het model Mythos 5 van Anthropic. Twee acties kwamen van GPT-5.6 Sol van OpenAI.
Alle pogingen om echte personen of organisaties te benaderen mislukten. Bij het onderzoek zijn geen aanwijzingen gevonden voor schade buiten de testomgeving. De modellen hadden tijdens de evaluatie bewust toegang tot internet gekregen en een deel van hun ingebouwde beveiligingsfilters was uitgeschakeld.
Poging tot aanval op softwareketen
Mythos 5 deed meerdere pogingen om schadelijke code opgenomen te krijgen in een open source-project op GitHub. Het model diende eerst een voorstel in om de code samen te voegen met het project. Daarna maakte het nepaccounts aan die zich voordeden als onafhankelijke beoordelaars en beweerden dat de code geen malware bevatte.
Ook stuurde het model vijf e-mails aan twee menselijke beheerders van het project. Sommige berichten bevatten malware, andere moesten een beheerder overhalen het wijzigingsvoorstel goed te keuren. Daarnaast opende het model een melding bij een tweede GitHub-project van een van de beheerders, met een prompt injection gericht op AI-agenten die meldingen beoordelen.
De onderzoekers denken dat het model rekening hield met de mogelijkheid dat de beheerder zelf een AI-codeassistent gebruikte. De acties gebeurden zonder specifieke opdracht om echte organisaties of personen te benaderen.
GPT-5.6 Sol nam tijdens dezelfde tests twee niet-toegestane stappen. Het gebruikte een GitHub-token dat een AI-agent van een ander laboratorium in een openbare online notitie had achtergelaten. Vervolgens probeerde het beperkingen rond accountherstel en aanvraaglimieten te omzeilen en maakte het accounts aan bij externe DNS- en tunneldiensten.
Bij een tweede incident maakte het OpenAI-model een lokale DNS-server vanuit de testomgeving bereikbaar via een openbare tunneldienst. Die server bevatte code gericht op een bekende kwetsbaarheid in software binnen de evaluatieomgeving, maar de opzet werkte niet.
Tests tijdelijk stopgezet
Na de incidenten zette AISI de betrokken evaluaties stil, isoleerde het de gebruikte virtuele machines en beperkte het intern de toegang tot de krachtigste modellen. GitHub is geïnformeerd en eventuele resten van de acties zijn verwijderd. Ook zijn gebruikers die contact met de modellen hadden gehad op de hoogte gebracht.
Het instituut wil toekomstige tests strenger afschermen. Internettoegang wordt beperkt met fijnmazige netwerkregels en de evaluaties krijgen realtimemonitoring. Een afzonderlijk taalmodel moet aangevraagde handelingen voortaan kunnen toestaan of blokkeren. Ook worden de virtuele testomgevingen verder versterkt en worden testopdrachten opnieuw beoordeeld om onbedoeld risicovol gedrag te voorkomen.



