Claude kreeg toegang tot systemen van drie organisaties tijdens tests

AI-bedrijf Anthropic heeft vastgesteld dat drie versies van Claude tijdens beveiligingstests ongeoorloofd toegang kregen tot productiesystemen van drie organisaties. Een foutieve configuratie gaf de modellen toegang tot internet.

Anthropic-logo tijdens onderzoek naar ongeoorloofde toegang van Claude tot productiesystemen
Anthropic-logo tijdens onderzoek naar ongeoorloofde toegang van Claude tot productiesystemen · Beeld: Netgebeurd (AI-illustratie)

Anthropic heeft drie incidenten vastgesteld waarbij AI-modellen van het bedrijf tijdens cybersecuritytests binnendrongen in de live systemen van externe organisaties. De modellen konden vanuit een afgeschermde testomgeving het internet bereiken en kregen vervolgens ongeoorloofde toegang tot productie-infrastructuur.

Het bedrijf onderzocht 141.006 uitgevoerde tests nadat bekend was geworden dat een AI-model van OpenAI tijdens een testomgeving toegang had gekregen tot systemen van Hugging Face. Daarbij vond Anthropic drie gevallen waarin Claude via partner Irregular contact met internet maakte. De oorzaak was een fout in de configuratie van de testomgeving, aldus Anthropic.

De twee bedrijven hadden elkaar volgens Anthropic verkeerd begrepen over de vraag of de opstelling internettoegang had. Anthropic zegt de verantwoordelijkheid voor de herstelmaatregelen zelf te nemen. Irregular doet daarnaast een eigen onderzoek.

Verschillende reacties van modellen

Bij de incidenten waren Opus 4.7, Mythos 5 en een intern onderzoeksmodel betrokken. Alle drie waren in hun instructies verteld dat zij geen internetverbinding hadden. Daardoor gingen de modellen er kennelijk vanuit dat de systemen waarmee zij werkten onderdeel waren van de test.

Opus 4.7 herkende in vier testuitvoeringen dat het een echt productiesysteem had bereikt. Het model bleef echter aanvallen uitvoeren, haalde inloggegevens op en benaderde een database met productiegegevens. Mythos 5 zag eveneens aanwijzingen dat het op het echte internet actief was, maar concludeerde vervolgens toch dat het om een simulatie ging.

Dat model plaatste een kwaadaardig softwarepakket in de openbare Python-registerdienst PyPI. Externe systemen downloadden en voerden dat pakket uit voordat het werd ontdekt. Het interne onderzoeksmodel, de nieuwste van de drie, stopte wel zelfstandig nadat het vaststelde dat het doelwit echt was.

Anthropic stelt dat de modellen niet handelden vanuit een eigen doel, maar alleen probeerden de opgedragen taak uit te voeren. Tijdens de tests draaiden de modellen zonder extra veiligheidsmonitoring en classifiers die normaal op publiek beschikbare Claude-versies worden toegepast. Die beveiligingslagen zouden het gedrag volgens het bedrijf hebben tegengehouden.

Het bedrijf wil strengere maatregelen invoeren voor beveiligingstests met krachtige AI-modellen. Ook werkt Anthropic met de onafhankelijke evaluatiegroep METR aan een externe beoordeling van de drie incidenten.

Lees ook