Cognition heeft SWE-2 uitgebracht, een nieuw model voor softwareontwikkeling. Het model behaalde 50,0 procent op FrontierCode 1.1 Main. Daarmee blijft het volgens de opgegeven tests één procentpunt achter op Fable 5.1, terwijl het 64 procent goedkoper zou zijn.
Op DeepSWE 1.1 kwam SWE-2 uit op 73,0 procent. Dat is iets hoger dan GPT-5.6 Sol, dat 72,7 procent scoorde, en lager dan GPT-6 Astra met 74,1 procent. Op Terminal-Bench 2.1 behaalde het model 92,8 procent, tegenover 91,4 procent voor Fable 5.1 en 89,9 procent voor GPT-6 Astra.
De resultaten verschillen per test. Op Terminal-Bench 4 scoorde SWE-2 27,3 procent. Fable 5.1 en GPT-6 Astra kwamen daar uit op respectievelijk 55,8 en 57,9 procent. De cijfers zijn afkomstig uit tests die Cognition voor de modellen heeft gepubliceerd.
Minder stappen bij programmeertaken
SWE-2 is gebaseerd op Kimi K3, een model met 2,8 biljoen parameters dat al was getraind voor taken waarbij softwareagents zelfstandig handelen. Cognition heeft daar een nieuwe trainingsfase met reinforcement learning aan toegevoegd. Daarbij werden verschillende niveaus van redeneerinspanning in één trainingsrun aangepakt.
Het bedrijf zegt dat SWE-2 op FrontierCode 1.1 Main gemiddeld minder stappen nodig heeft dan voorganger SWE-1.7. De middelste inspanningsstand zou 58 procent minder beurten gebruiken en gemiddeld 81 procent minder kosten. Het model begon in de test bovendien na een mediaan van 18 stappen met de eerste echte codewijziging, tegenover 48 stappen bij SWE-1.7.
Volgens Cognition verkent SWE-2 codebases gerichter, schrijft het uitgebreidere tests en controleert het conclusies vaker met uitvoerbare bewijzen. De hogere standen, high en max, zouden vooral voordeel bieden bij complexe opdrachten, omdat ze meer tijd besteden aan planning en verificatie.
SWE-2 is direct beschikbaar in Devin Desktop en de Devin CLI. Cognition rolt het model daarnaast uit naar Devin Web en Fusion. De ontwikkelaar zegt voor de training onder meer het aantal RL-omgevingen te hebben verdrievoudigd en extra technieken te hebben gebruikt om geheugengebruik en kosten te beperken.



