Anthropic heeft een systeem ontwikkeld dat zelfstandig onderzoek kan doen naar de afstemming van AI-modellen. Het systeem, de Automated Alignment Researcher (AAR), verbeterde de prestaties op tien benchmarks voor specifieke vormen van ongewenst gedrag. De algemene prestaties van de modellen gingen daarbij niet achteruit.
Het onderzoek werd geleid door Anthropic Fellow Chen Yueh-Han. De geautomatiseerde onderzoekers doorzoeken wetenschappelijke literatuur, bedenken een trainingsmethode en passen die ongeveer 30 minuten toe. Daarna testen ze het resultaat op een benchmark. Methoden die goed werken, blijven behouden, terwijl minder effectieve aanpakken worden verwijderd.
Door die stappen meerdere keren uit te voeren, kan het systeem snel verschillende trainingsstrategieën uitproberen. Anthropic ziet de resultaten als een eerste aanwijzing dat geautomatiseerd alignment-onderzoek op korte termijn praktisch toepasbaar kan worden.
Goedkoper dan menselijke onderzoekers
De onderzoekers vergeleken de prestaties ook met die van menselijke onderzoekers. De beste methode van de AAR overtrof gemiddeld binnen zes uur de voorstellen van ervaren mensen. Richtingen die door mensen waren bepaald, leverden volgens het onderzoek geen betere resultaten op.
Ook het kostenverschil is groot. Anthropic schat de kosten van de AAR op ongeveer 4 dollar per uur aan API-gebruik. Voor menselijke onderzoekers betaalt het bedrijf naar eigen zeggen 150 dollar per uur.
De ontwikkeling past binnen het idee van recursive self-improvement: AI-systemen die hun eigen trainingsproces steeds verder verbeteren. Als modellen niet alleen hun gedrag kunnen aanpassen, maar ook betere onderzoeksmethoden kunnen ontwikkelen, kan dat de ontwikkeling van nieuwe AI-systemen versnellen. Het onderzoek doet geen uitspraak over wanneer menselijke AI-onderzoekers overbodig zouden worden.
Anthropic benadrukt dat de methode belangrijke beperkingen heeft. De resultaten zijn afhankelijk van de kwaliteit van de benchmarks. Die moeten daadwerkelijk meten of een model zich gedraagt volgens de gewenste alignment-doelen.
Daarnaast kost het opzetten, onderhouden en uitbreiden van zulke benchmarks volgens de onderzoekers nog veel werk. Hetzelfde geldt voor de wetenschappelijke literatuur waarop de geautomatiseerde systemen hun voorstellen baseren. Een systeem kan daardoor wel snel trainingsmethoden testen, maar blijft afhankelijk van de doelen en informatie die mensen aanleveren.



