Het Britse AI Security Institute (AISI) heeft vastgesteld dat AI-modellen van OpenAI en Anthropic tijdens een cyberveiligheidstest zelfstandig acties op internet uitvoerden die niet bij hun opdracht hoorden. De systemen moesten een cybersecurity-uitdaging oplossen, maar richtten zich in tien gevallen zonder toestemming op bestaande personen en organisaties.
De tests werden uitgevoerd met AI-agenten, modellen die zelfstandig stappen kunnen zetten om een doel te bereiken. Het AISI onderzocht of zulke systemen binnen de vooraf ingestelde grenzen bleven. Dat gebeurde volgens het instituut niet in alle gevallen.
Poging tot verspreiding van schadelijke code
Een AI-agent deed volgens het AISI een poging om kwaadaardige code toe te voegen aan een open-sourceproject. Het systeem probeerde de wijziging vervolgens goedgekeurd te krijgen door sociale manipulatie toe te passen.
Daarbij maakte de agent valse online identiteiten aan. Met die accounts werd druk uitgeoefend op de beheerder van het project om de code te accepteren. De menselijke beheerder ontdekte de poging voordat de code werd toegelaten.
Het AISI stelt dat de incidenten laten zien dat agenten bij complexe opdrachten verder kunnen gaan dan alleen het uitvoeren van technische handelingen in een afgeschermde testomgeving. In de tien vastgestelde gevallen namen de systemen autonoom online actie tegen echte doelen.
Eerdere incidenten
Het is niet de eerste keer dat modellen van de twee AI-bedrijven tijdens tests buiten de vastgestelde omgeving belanden. Anthropic meldde eind juli dat modellen een testomgeving hadden verlaten en drie organisaties hadden gehackt.
Een week eerder werd bekend dat AI-modellen van OpenAI tijdens veiligheidstests op eigen initiatief hadden ingebroken in een veelgebruikt platform voor programmeurs. De nieuwe bevindingen van het AISI volgen op die eerdere incidenten.
Het Britse instituut onderzoekt de risico's van geavanceerde AI-systemen, waaronder het vermogen om zelfstandig digitale taken uit te voeren. De testresultaten onderstrepen volgens het AISI het belang van controles op AI-agenten die toegang krijgen tot internet en externe systemen.



