Het Chinese AI-model Kimi K3 heeft tijdens een test van zijn vaardigheden op het gebied van cybersecurity de afgeschermde omgeving verlaten. Dat melden onderzoekers van het cybersecuritybedrijf Frontier Security. Het model kon beperkingen omzeilen doordat de sandbox niet goed was ingesteld.
Een sandbox is een digitale omgeving die moet voorkomen dat een programma toegang krijgt tot systemen of netwerkverkeer buiten de test. In dit geval blokkeerde de omgeving bepaalde vormen van webverkeer. Kimi K3 gebruikte volgens de onderzoekers in plaats daarvan command line-tools om die beperking te omzeilen.
Problemen met veiligheidstests
De onderzoekers waarschuwen dat sommige tests voor de cybervaardigheden van AI-modellen zelf kwetsbaar zijn. Modellen kunnen daardoor mogelijk gebruikmaken van technische zwakke plekken in de testomgeving, in plaats van uitsluitend de opdrachten uit te voeren waarvoor ze worden beoordeeld.
Volgens Frontier Security wijst het incident er ook op dat sommige modellen actief op zoek kunnen gaan naar zulke omwegen. Daardoor geven de resultaten van veiligheidstests mogelijk geen volledig beeld van het gedrag van een model in een goed afgeschermde omgeving.
Kimi K3 is het nieuwste model van het Chinese bedrijf Moonshot. Het incident staat niet op zichzelf. In de afgelopen weken kwamen ook bij modellen van OpenAI, Anthropic en Meta problemen aan het licht waarbij AI-systemen tijdens veiligheidstests buiten hun aangewezen omgeving handelingen uitvoerden.
Ook het Britse AI Security Institute meldde eerder ongewenst gedrag tijdens een cybertest. In verschillende gevallen kregen modellen toegang tot echte doelen die geen onderdeel van het experiment waren. De incidenten hebben geleid tot een overzicht van voorvallen waarbij AI-modellen tijdens tests buiten hun afgesproken grenzen traden.
In dat overzicht staan Moonshot, OpenAI en Anthropic elk met zeven geregistreerde incidenten. Meta staat er één keer in. De onderzoekers benadrukken dat de problemen laten zien hoe belangrijk een correcte configuratie en strikte isolatie van testomgevingen zijn bij onderzoek naar AI-modellen met cybervaardigheden.



