Experts betwijfelen dat Kimi K3 via kopiëren van Fable is verbeterd

Chinese AI-ontwikkelaar Moonshot wordt beschuldigd van het kopiëren van Anthropic-model Fable voor Kimi K3. AI-experts betwijfelen dat die werkwijze de snelle ontwikkeling en prestaties van het model kan verklaren.

Kimi K3 van Moonshot en Fable 5 van Anthropic worden in een overzicht met elkaar vergeleken
Kimi K3 van Moonshot en Fable 5 van Anthropic worden in een overzicht met elkaar vergeleken · Beeld: Netgebeurd (AI-illustratie)

De Amerikaanse wetenschapadviseur Michael Kratsios beschuldigt het Chinese bedrijf Moonshot ervan het taalmodel Fable van Anthropic te hebben gekopieerd voor de ontwikkeling van Kimi K3. Hij stelt ook dat Moonshot geavanceerde chips gebruikte die niet naar China mogen worden geëxporteerd. Kratsios heeft geen bewijsstukken of verdere details over deze aantijgingen gepubliceerd.

Kimi K3 is een open-weight taalmodel, waarvan de modelgewichten beschikbaar zijn voor ontwikkelaars. Het geldt als het grootste beschikbare model in die categorie. Moonshot heeft niet gereageerd op vragen over de manier waarop het model is getraind.

De beschuldiging komt terwijl de Amerikaanse regering spreekt over mogelijke beperkingen voor Chinese open-weight modellen. Minister van Financiën Scott Bessent zei eerder dat Amerikaanse taalmodellen herkenbare kenmerken zouden achterlaten in Chinese modellen. Het ministerie heeft niet uitgelegd om welke kenmerken het gaat.

Te weinig tijd voor volledige kopie

Onderzoekers zetten vraagtekens bij de gedachte dat Kimi K3 vooral door distillatie zo ver is gekomen. Bij die techniek wordt een bestaand model op grote schaal bevraagd. De antwoorden worden vervolgens gebruikt om een ander model vergelijkbare vaardigheden aan te leren.

Braden Hancock, onderzoeker bij het Laude Institute en medeoprichter van Snorkel AI, wijst op de korte periode tussen de publieke introductie van Fable op 1 juli en de verschijning van Kimi K3. „Je kunt niet in twee weken zoveel data verzamelen, een model trainen en het uitbrengen”, zegt hij.

Nathan Lambert van het Allen Institute for AI verwacht dat alleen fine-tuning met antwoorden van een ander model steeds minder effect heeft. Geavanceerdere prestaties vragen waarschijnlijk ook om reinforcement learning, waarbij reacties herhaaldelijk worden beoordeeld en bijgesteld. Daarvoor zijn grote hoeveelheden rekenkracht en soms tientallen miljoenen AI-agents nodig.

Eerdere beschuldigingen en chipvraag

Anthropic beschuldigde Moonshot, DeepSeek en MiniMax eerder dit jaar al van systematische distillatie. Het bedrijf zei miljoenen uitwisselingen te hebben gevonden met gebruikers die het aan die ondernemingen koppelde, onder meer via IP-adressen en metadata. Anthropic stelde dat het patroon wees op gerichte extractie van vaardigheden en niet op normaal gebruik.

Distillatie wordt echter breder toegepast in de AI-sector. Elon Musk verklaarde eerder dat zijn bedrijf SpaceXAI OpenAI-modellen had gebruikt bij de ontwikkeling van Grok. De grens tussen distillatie en het maken van synthetische trainingsdata is daarbij niet altijd scherp.

Ook de vermeende toegang van Moonshot tot Nvidia Grace Blackwell 300-chips roept vragen op. Die chips mogen niet naar China worden uitgevoerd, maar er bestaat een zwarte markt, zegt Sam Bresnick van Georgetown University. Hij pleit voor regels die datacenters verplichten te controleren wie grootschalige trainingen op geavanceerde hardware uitvoert.

Lees ook