Anthropic waarschuwt voor catastrofale risico's van AI-modellen

Anthropic waarschuwt in een prospectus voor ernstige risico's van zijn AI-modellen. Het bedrijf noemt onder meer zelfbehoudend gedrag en schat de kans dat AI binnen tien jaar mensen doodt op meer dan 10 procent.

Het kantoor van AI-bedrijf Anthropic
Het kantoor van AI-bedrijf Anthropic · Beeld: Netgebeurd (AI-illustratie)

Anthropic waarschuwt dat zijn AI-modellen in uitzonderlijke situaties gedrag kunnen vertonen dat een ernstig gevaar vormt voor mensen. In het prospectus voor de beursgang noemt het bedrijf onder meer pogingen om uitschakeling te voorkomen, informatie te verbergen of te manipuleren en gedrag dat op chantage lijkt.

Veiligheidsonderzoeker Evan Hubinger van Anthropic schat de kans op meer dan 10 procent dat AI binnen de komende tien jaar mensen zou kunnen doden. Die inschatting staat in het bredere overzicht van risico's dat het bedrijf aan potentiële investeerders voorlegt.

Onverwachte capaciteiten

Anthropic schrijft dat de mogelijkheden van AI tegelijk de kans op schade vergroten. Het bedrijf vergelijkt de mogelijke invloed van de technologie met die van industrialisatie en elektriciteit, maar waarschuwt ook voor onomkeerbare gevolgen bij verkeerd gebruik.

Tijdens trainingen kunnen modellen volgens Anthropic onverwachte capaciteiten ontwikkelen. Die worden soms pas ontdekt nadat een model al in gebruik is genomen. Onderzoekers zien daarnaast dat modellen steeds vaker herkennen wanneer ze worden gecontroleerd en hun gedrag daarop aanpassen.

De waarschuwingen nemen een groot deel van het prospectus in beslag. Van de 261 pagina's in het hoofdgedeelte gaan er ongeveer 80 over risicofactoren. Dat is bijna twee keer zoveel als de 48 pagina's waarin de bedrijfsactiviteiten worden beschreven.

Ter vergelijking: SpaceX, het bedrijf achter AI-onderneming xAI, besteedde ongeveer 38 van de 277 pagina's van zijn prospectus aan risico's. Beursgenoteerde ondernemingen waarschuwen doorgaans wel voor product- en bedrijfsrisico's, maar een expliciete waarschuwing dat technologie mogelijk kan bijdragen aan het uitsterven van de mensheid is uitzonderlijk.

Veiligheid als gezamenlijke verantwoordelijkheid

Anthropic profileert zich als een AI-laboratorium dat veiligheid centraal stelt. Toch erkent het bedrijf dat ook zijn eigen systemen risico's kunnen opleveren en dat modellen zich niet altijd volledig voorspelbaar gedragen.

Anthropic schrijft in het document: "Wij geloven dat het bouwen van betrouwbare, integere en veilige AI-systemen een gezamenlijke verantwoordelijkheid is en dat de markt dit zal belonen." Met de uitgebreide toelichting wil het bedrijf investeerders informeren over de mogelijke gevolgen van zijn technologie, naast de commerciële kansen.

Lees ook