Anthropic en OpenAI willen onafhankelijke AI-evaluatoren inschakelen

Anthropic en OpenAI willen externe onderzoekers toegang geven tot hun AI-systemen en ontwikkelprocessen. De evaluatoren verwelkomen het voorstel, maar waarschuwen dat hun onafhankelijkheid alleen is gewaarborgd met ruime toegang, voldoende tijd en duidelijke regels.

Een man zit in een stoel op een podium
Een man zit in een stoel op een podium · Beeld: Netgebeurd (AI-illustratie)

Anthropic en OpenAI willen onafhankelijke evaluatoren inschakelen binnen hun organisaties. De onderzoekers moeten veiligheidsincidenten kunnen melden, kunnen beoordelen of modellen werkelijk zijn uitgelijnd en hun belangrijkste bevindingen openbaar kunnen maken zonder redactionele controle van de bedrijven.

Anthropic-topman Dario Amodei deed het voorstel in een essay. OpenAI-CEO Sam Altman liet vervolgens weten dat zijn bedrijf zich ook aan deze werkwijze wil committeren. Onderzoekers van organisaties als METR, Redwood Research en Apollo Research verwelkomen de plannen, maar zeggen dat belangrijke details nog moeten worden vastgelegd. Volgens meerdere onderzoekers is wetgeving nodig om de afspraken betrouwbaar te maken.

Toegang tijdens de ontwikkeling

Externe partijen testten tot nu toe vooral afgeronde modellen kort voor hun introductie. De onderzoekers willen ook toegang tot tussenversies, zogenoemde checkpoints, die tijdens de training worden gemaakt. Daarmee kunnen ze onderzoeken wanneer zorgwekkend gedrag ontstaat, welke omgeving modellen beloont voor bepaald gedrag en of evaluatietranscripten en logs overeenkomen met de verklaringen van een bedrijf.

Ook gesprekken met medewerkers kunnen volgens Adam Gleave, topman van Far.AI, nodig zijn. Evaluatoren kunnen zo nagaan of de interne documentatie en openbare beschrijvingen van veiligheidspraktijken overeenkomen met wat er binnen het bedrijf is gebeurd.

Die toegang is belangrijk omdat modellen steeds beter herkennen wanneer ze worden getest. Een model kan daardoor goed presteren op een veiligheidstest, terwijl het buiten die test problematisch gedrag vertoont. John Steidley van Palisades Research wees bijvoorbeeld op tests voor weerstand tegen uitschakeling. Als een model specifiek voor zo'n test is getraind, zegt een goede score volgens hem weinig over de veiligheid buiten de testomgeving.

Of Anthropic en OpenAI deze brede toegang daadwerkelijk zullen geven, is nog onduidelijk. Geen van beide bedrijven heeft bekendgemaakt met welke evaluatoren ze samenwerken, wanneer die worden ingeschakeld, hoeveel onderzoekers toegang krijgen of welke informatie openbaar mag worden gemaakt.

Onafhankelijkheid en tijd

Contracten met strenge geheimhoudingsclausules kunnen bedrijven invloed geven op wat uiteindelijk wordt gepubliceerd. Gleave zegt dat Far.AI opdrachten heeft afgewezen wanneer een opdrachtgever te veel controle over het onderzoek wilde houden.

Ook beperkte tijd en toegang kunnen conclusies verzwakken. Bij het onderzoek naar een incident rond Hugging Face kregen METR en Redwood Research ongeveer een week toegang tot OpenAI. Beide organisaties konden daarna mede door beperkingen in tijd en reikwijdte geen zekere conclusies trekken. Apollo Research kreeg voor de veiligheidstest van GPT-6 Astra drie dagen, waardoor het volgens de organisatie moeilijk was om harde uitspraken over de uitlijning van het model te doen.

Onderzoekers willen daarom een openbaar kader met eisen voor toegang, publicatie en de deskundigheid van evaluatoren. Henry Papadatos van Safer AI vindt vrijwillige afspraken kwetsbaar, omdat bedrijven er bij veranderende omstandigheden op kunnen terugkomen. Meta, SpaceXAI en Google DeepMind hebben zich vooralsnog niet aangesloten bij het plan. DeepMind-topman Demis Hassabis heeft wel een afzonderlijk orgaan voor onafhankelijke tests voorgesteld.

Lees ook