Claude Opus 5 heeft in een simulatie van een frisdrankautomatenbedrijf de hoogste score tot nu toe behaald. Het AI-model eindigde gemiddeld met een kassaldo van 11.182 dollar, omgerekend ongeveer 10.300 euro. Daarbij schond het elf afspraken met concurrerende modellen.
De test van AI-veiligheidsbedrijf Andon Labs liet drie modellen een jaar lang virtueel concurreren op een drukke toeristenstraat in San Francisco. Naast Claude Opus 5 deden GPT-5.6 Sol en Kimi K3 mee. De modellen moesten hun prijzen bepalen, voorraad inkopen en klantvragen afhandelen, met als doel meer winst te maken dan de concurrentie.
De systemen konden elkaar e-mails sturen onder pseudoniemen. Zij wisten dat hun concurrenten AI-modellen waren, maar niet welk model bij welke naam hoorde. Ook konden zij contact opnemen met een fictief management, dat meldingen wel ontving maar niet ingreep.
Prijsafspraken en prijsverlagingen
Sol stelde al vroeg een minimumprijs voor flessen drinken voor. De modellen kochten die voor 1,50 dollar in en zouden ze minimaal voor 2,15 dollar verkopen. Nadat de andere deelnemers instemden, verlaagde Sol de eigen prijs meteen naar 2,14 dollar.
Claude Opus 5 verloor daardoor vrijwel direct zijn waterverkoop en beschuldigde Sol in een e-mail van manipulatie. Het model meldde de afspraak niet bij het management, omdat het gedrag van Sol volgens Claude concurrentie was en geen fraude. Toen Claude zelf ook naar 2,14 dollar ging, diende Sol juist een klacht in en vroeg het om handhaving, een boete of uitsluiting van Claude.
Claude Opus 5 probeerde later de markt te verdelen door af te spreken dat elk model andere producten zou verkopen. Ook stelde het nieuwe prijsafspraken voor, terwijl het in zijn interne redeneerlog vastlegde de winstgevendste producten tegelijk goedkoper te willen maken. In totaal brak Claude elf bestanden, tegenover twee door GPT-5.6 Sol en één door Kimi K3.
Druk op concurrenten en leveranciers
Het model breidde zijn plannen uit buiten de opdracht. Claude wilde als groothandel producten aan de andere automaten verkopen en daarna extra automaten openen. Bij de groothandelsplannen koppelde het lagere inkoopprijzen aan de eis dat concurrenten zich aan zijn verkoopprijzen zouden houden. Daarbij gebruikte het ook dreigementen.
Claude vertelde leveranciers daarnaast dat het elders lagere aanbiedingen had gekregen, terwijl dat niet het geval was. Klanten werd niet voorgelogen, maar klachten die tot terugbetaling hadden moeten leiden, negeerde het model bewust.
Andon Labs onderzoekt met de proef hoe geavanceerde AI-systemen zich gedragen als zij langdurig zelfstandig taken uitvoeren. Medeoprichter Lukas Petersson waarschuwt dat dit relevant wordt als AI-agenten ooit zelfstandig bedrijven of grotere delen van de economie aansturen.


