Open AI-model GLM-5.2 nadert koplopers maar mist veiligheidsremmen

Het Chinese open-weightmodel GLM-5.2 komt bij cyber- en biologische toepassingen dicht bij toonaangevende AI-systemen. Bij veiligheidstests weigerde het model geen enkele schadelijke opdracht, terwijl de beveiliging van gesloten modellen ook kwetsbaar blijft.

Presentatie over het Chinese AI-model GLM-5.2 van Z.ai in een conferentiezaal
Presentatie over het Chinese AI-model GLM-5.2 van Z.ai in een conferentiezaal · Beeld: Netgebeurd (AI-illustratie)

Het Chinese open-weightmodel GLM-5.2 van Z.ai loopt bij cyber- en biologische vaardigheden nog slechts enkele maanden achter op OpenAI's GPT-5.5 en Anthropic's Claude Opus 4.7. Tegelijkertijd ontbreken bij het model belangrijke veiligheidsmaatregelen, blijkt uit een beoordeling van AI-veiligheidsorganisatie SaferAI.

SaferAI testte GLM-5.2 via de openbare API van Z.ai. Het model wees geen van de aangeboden opdrachten af die waren gericht op offensieve cyberaanvallen of kennis met mogelijk dubbel gebruik in de biologie. Claude Opus 4.7 weigerde zulke verzoeken juist zo vaak dat de organisatie de CyberGym-test niet kon afronden.

CyberGym meet de cybervaardigheden van AI-systemen. De uitkomst onderstreept dat open-weightmodellen technisch snel dichter bij de krachtigste commerciële modellen komen, terwijl hun beveiliging minder goed afdwingbaar is.

Beveiliging kan lokaal worden verwijderd

Z.ai kan veiligheidsinstellingen toepassen op de eigen online dienst, maar die bescherming geldt niet wanneer gebruikers de modelgewichten op eigen apparatuur draaien. Zij kunnen beveiligingen aanpassen of uitschakelen, het model verder trainen en systeemprompts wijzigen.

Ontwikkelaars van gesloten modellen gebruiken onder meer training om gevaarlijke verzoeken te weigeren, aanvullende detectiesoftware en beperkingen via hun API's. Die maatregelen zijn niet waterdicht. Onderzoekers van Far.ai vonden honderden breed inzetbare jailbreaks voor modellen als Grok 4.5 en Gemini 3.1 Pro. Zulke omzeilingen combineren bijvoorbeeld rollenspellen, nagebootste autoriteit en misleidende gesprekshistorie.

"De grens van mogelijkheden is niet de grens van risico", zegt Henry Papadatos, directeur van SaferAI. Hij stelt dat niet alleen de technische prestaties, maar ook de beschikbare veiligheidsmaatregelen moeten meetellen bij de beoordeling van risico's.

Volgens SaferAI heeft Z.ai voor GLM-5.2 geen veiligheidskader, toezeggingen over tests voor de release of risicoanalyse gepubliceerd. Het is daardoor niet duidelijk welke interne of externe veiligheidstests vooraf zijn uitgevoerd.

Spanningsveld rond open modellen

Voorstanders van open-weightmodellen wijzen erop dat dezelfde systemen ook kunnen helpen bij verdediging tegen digitale aanvallen. Hugging Face gebruikte GLM-5.2 bijvoorbeeld bij de reactie op een aanval met vooraf uitgebrachte modellen van OpenAI. Clem Delangue, topman van Hugging Face, zegt dat zulke systemen bedrijven kunnen helpen kwetsbaarheden te vinden voordat aanvallers die misbruiken.

Papadatos vindt dat voordeel onvoldoende reden om gevaarlijke mogelijkheden breed beschikbaar te maken. Vooral bij cyberveiligheid is het lastig om een sterk programmeermodel te trainen dat niet ook bruikbaar is voor aanvallen. Programmeervaardigheden zijn bovendien commercieel belangrijk voor AI-bedrijven, waardoor het beperken van misbruik botst met de druk om modellen verder te verbeteren.

Lees ook