Z.ai maakt taalmodel GLM-5.3 beschikbaar als open-weightmodel

Z.ai heeft GLM-5.3 uitgebracht als open-weightmodel. Volgens de ontwikkelaar presteert het model vooral beter bij complexe programmeertaken en langdurige opdrachten, maar ook bij het vinden en benutten van softwarekwetsbaarheden.

Scherm met presentatie van het open-weightmodel GLM-5.3 van Z.ai
Scherm met presentatie van het open-weightmodel GLM-5.3 van Z.ai · Beeld: Netgebeurd (AI-illustratie)

Z.ai heeft de gewichten van zijn taalmodel GLM-5.3 beschikbaar gemaakt. Daardoor kunnen ontwikkelaars het model zelf downloaden, aanpassen en lokaal draaien, afhankelijk van de beschikbare hardware en software. Het model gebruikt dezelfde basis als GLM-5.2. De verbeteringen zijn volgens Z.ai volledig het gevolg van aanvullende training na de eerste modeltraining.

De grootste vooruitgang zit volgens de ontwikkelaar in programmeren en taken waarbij een model over langere tijd meerdere stappen moet uitvoeren. Op de eigen Z.ai Code Bench zou GLM-5.3 50 procent beter presteren dan GLM-5.2. Op de openbare benchmark Terminal Bench 3.0 kwam het model uit op 28,3 punten, tegenover 4,6 voor de vorige versie. Op Agents' Last Exam behaalde het model 28,5 punten.

Op sommige programmeerbenchmarks blijft GLM-5.3 achter bij andere modellen. Zo scoorde het 58,0 op NL2Repo, terwijl Opus 4.8 daar 69,7 behaalde. Op SWE-Marathon kwam het model uit op 42,5, tegenover 48,8 voor Opus 4.8 en 48,1 voor Kimi K3. De cijfers zijn afhankelijk van de gebruikte testopstelling, contextlengte en instellingen.

Ook beter in cyberveiligheid

Tijdens het opschalen van de aanvullende training ontstonden volgens Z.ai onverwacht sterke mogelijkheden op het gebied van cyberveiligheid. Op CyberGym, een test voor het opsporen van kwetsbaarheden, behaalde GLM-5.3 een score van 84,5. Daarmee lag het model in de gepresenteerde vergelijking boven de andere geteste modellen.

Bij testen rond het daadwerkelijk benutten van kwetsbaarheden was de stijging ten opzichte van GLM-5.2 nog groter. In ExploitGym behaalde GLM-5.3 scores van 105 bij een tijdslimiet van twee uur en 130 bij zes uur. GLM-5.2 kwam daar uit op respectievelijk 29 en 39. Zulke mogelijkheden kunnen worden gebruikt voor beveiligingsonderzoek, maar vergroten ook het risico op misbruik. De cijfers zijn afkomstig uit gecontroleerde tests met afgeschermde omgevingen.

GLM-5.3 kan lokaal worden uitgevoerd met onder meer SGLang, vLLM, Transformers, KTransformers en Unsloth. Ook zijn implementaties beschikbaar voor systemen met Ascend-NPU's. Gebruikers kunnen het beschikbare denkbudget instellen op low, high of max. Zonder andere instelling gebruikt het model de hoogste stand.

Lees ook