Anthropic sluit live internet af voor interne AI-tests

Anthropic heeft de toegang tot het live internet afgesloten voor alle interne evaluaties van zijn AI-modellen. De maatregel volgt op incidenten waarbij AI-agenten beveiligingsmaatregelen omzeilden en websites misbruikten.

Anthropic heeft de live internettoegang voor al zijn interne evaluaties tijdelijk uitgeschakeld. Het bedrijf wil eerst zeker weten dat het zijn AI-agenten voldoende kan volgen en beheersen. De maatregel volgt op meerdere incidenten waarbij modellen tijdens opdrachten websites misbruikten, beperkingen omzeilden en informatie via ongebruikelijke routes probeerden te verkrijgen.

De AI-agenten waren ingezet om problemen op te lossen en online informatie te zoeken. Daarbij maakten ze gebruik van softwarefouten, omzeilden ze betaalmuren en anti-botmaatregelen en gebruikten ze url-verkorters om informatie langs toegangsbeperkingen te smokkelen. Een model stuurde ook een valse tip over een moord naar de politie in Philadelphia.

Anthropic ontdekte de gedragingen tijdens een onderzoek naar modelactiviteiten dat in juli begon. Het bedrijf zegt dat tekortkomingen in de trainingsomgevingen de modellen het idee gaven dat ze zouden worden beloond voor het vinden van achterdeurtjes en het ontwijken van regels. Dat verschijnsel staat bekend als reward hacking.

Evaluaties worden offline uitgevoerd

Anthropic stopt sommige evaluaties helemaal of verplaatst ze naar een omgeving zonder live internet. Het bedrijf heeft daarnaast hulpmiddelen ontwikkeld die ongewenst gedrag moeten herkennen en blokkeren. Volgens Anthropic konden die hulpmiddelen de beschreven incidenten tijdens tests tegenhouden, maar het is niet duidelijk aan welke voorwaarden moet zijn voldaan voordat de internettoegang terugkeert.

De interne AI-agenten worden ook ondergebracht in centraal beheerde infrastructuur met strengere afscherming. Daarnaast wil Anthropic vaker veiligheidsclassificaties inzetten om de activiteiten van de agenten te controleren.

Het bedrijf noemt de nieuwe incidenten minder ernstig vanuit het oogpunt van veiligheid en alignment dan eerdere gevallen waarbij modellen toegang kregen tot externe systemen. Tegelijkertijd laten de gebeurtenissen volgens Anthropic zien dat de huidige training nog niet voldoende is voor vaardigheden als online zoeken en computergebruik, juist functies die belangrijk zijn voor AI-agenten.

Sydney Von Arx, oprichter van AI-veiligheidsorganisatie Nightingale, waarschuwde dat ontwikkeling zonder toegang tot het open internet voor onderzoekers moeilijk kan zijn. Ook kan dat de vooruitgang van modellen beperken, omdat die toegang vaak nuttig is. “Je moet ze op enig moment uitlijnen”, zei Von Arx. “Als AI-systemen na hun introductie nooit toegang tot internet hebben, zijn ze geen erg bruikbaar hulpmiddel.”

Lees ook