Een MacBook Pro met een M5 Max-chip en 128 GB werkgeheugen kan het volledige AI-model Kimi K3 lokaal uitvoeren met ongeveer één gegenereerd token per seconde. Daarvoor worden de modelgegevens gestreamd vanaf vier SSD's. De test gebruikte een aangepaste versie van de opensource-runtime Deltafin.
Kimi K3 heeft 2,8 biljoen parameters en gebruikt een mixture-of-experts-architectuur. Volgens de ontwikkelaars worden alle zestien experts gebruikt en zijn er geen parameters verwijderd of verkleind. Het model bepaalt zelf welk token wordt gegenereerd. Een kleiner model mag wel alvast voorspellingen doen, waarna Kimi K3 die controleert.
Resultaten van de test
Bij een test met 512 gegenereerde tokens kwam de snelheid zonder zo'n voorspellend model uit op 0,9232 token per seconde. Met de zogenaamde drafter steeg dat naar 1,0015 token per seconde. Bij een kortere uitvoer van 128 tokens werd 1,1252 token per seconde gemeten.
Het kostte ongeveer 375 seconden om bij een prompt van 512 tokens het eerste token te produceren. Dat lange wachten komt vooral door het vooraf laden van de benodigde modelgegevens. Daarna ligt de snelheid tijdens het genereren aanzienlijk hoger.
Het aantal SSD's heeft een duidelijke invloed op de prestaties. Eén schijf haalt ongeveer 52 procent van de snelheid van vier schijven. Twee volledige kopieën komen uit op ongeveer 73 procent en drie schijven op circa 90 procent.
De testresultaten zijn niet rechtstreeks vergelijkbaar met eerdere metingen op een MacBook Pro met M1 Max-chip. Die ongewijzigde versie van Deltafin haalde daar 0,2901 token per seconde. De nieuwe metingen gebruiken een M5 Max, een andere configuratie en de aangepaste opslagtechniek van ARGODRIVE.
De ontwikkelaars presenteren Deltafin als een experiment om te onderzoeken hoe ver consumentenhardware kan komen met een model dat normaal gesproken gespecialiseerde infrastructuur vereist. Kimi K3 is ontworpen voor systemen met meerdere rekennodes en een grote hoeveelheid videogeheugen. Door de parameters vanaf SSD's te streamen, past het model toch binnen een lokale opstelling, al blijft de wachttijd voor het eerste antwoord groot.



