Ett annat sätt att svara

En grupp vid Stanfords Hazy Research-labb och Nvidia har släppt CLM-8B, en modell med öppna vikter som inte genererar text alls. Givet ett läge och en lista över möjliga handlingar skapar den en representation av var och en och returnerar den handling vars representation ligger närmast lägets.

Det är hela idén. Där en språkmodell skriver ut ett val token för token behandlar en kontrastiv språkmodell valet som ett matchningsproblem. Upphovspersonerna är Jacky Kwok, Hangoo Kang, Tarun Suresh, Jon Saad-Falcon, Marco Pavone, Christopher Ré och Azalia Mirhoseini. Kwok presenterade modellen den 23 september.

Det är den andra modellen av det här slaget den här månaden, efter TypeSafe AI:s Jev som öppnade tidig tillgång den 15 september. CLM-8B är den öppna.

Vad som faktiskt tränas

8B i namnet är en fryst Qwen3-8B-kodare. Det laget tränat är två små projektionshuvuden — ett för lägen, ett för handlingar — ovanpå den, med ett dubbelriktat kontrastivt InfoNCE-mål som drar ihop rätt par av läge och handling och skjuter isär konkurrerande handlingar.

Närbild på ett kretskort
Det som tränats är två små projektionshuvuden ovanpå en fryst Qwen3-8B-kodare. Illustrationsbild. Jeremy Waterhouse · pexels · Pexels License

Träningen skedde i tre steg: omkring 60 miljoner fråge- och svarspar från Nemotron, därefter omkring 30 miljoner syntetiska svåra negativa exempel och slutligen ungefär en miljon agentförlopp.

Eftersom lägen och handlingar kodas var för sig kan en handlings representation beräknas en gång och återanvändas. Där kommer hastigheten ifrån: kandidatuppsättningen behöver inte läsas om vid varje beslut.

Siffrorna, och vem som tagit fram dem

Samtliga siffror nedan är upphovspersonernas egna, publicerade tillsammans med modellen.

Utan efterträning uppger de prestanda “i nivå med Jev på datoranvändning, spel och verktygsanrop, med upp till 9 gånger lägre latens”. VentureBeats genomgång redovisar jämförelserna: 95,2 procent på verktygsanropstestet BFCL v4 mot Jevs 99,2, och 26 av 30 lösta WikiRacing-uppgifter mot Jevs 30. Bytet är träffsäkerhet mot latens, och modellkortet säger det rakt ut.

En utvecklare som skriver kod på en bärbar dator
Modellen siktar på anropen för routing och verktygsval. Illustrationsbild. Lukas Blazek · pexels · Pexels License

Finjusterad som verifierare — alltså för att poängsätta kandidatlösningar snarare än att välja verktyg — uppger de 81,6 procent på DeepSWE och 87,6 procent på Terminal-Bench 2.1, siffror de beskriver som de bästa kända för den rollen, med fyra till sex gånger lägre latens. Inget av resultaten har ännu reproducerats oberoende.

Varför det spelar roll

Routing, triage, rangordning och val av utdata är anrop programvara gör hela tiden, och i dag löses de flesta genom att be en stor språkmodell skriva ett svar och sedan tolka det. En modell som returnerar valet direkt tar bort både genereringskostnaden och tolkningssteget.

Jev visade att det finns en marknad för det. CLM-8B lägger samma form under Apache 2.0, med koden på GitHub och en testmiljö vid sidan av, vilket innebär att jämförelsen nu kan köras av vem som helst i stället för att rapporteras av endera leverantören.

Laget uppger att en multimodal CLM-35B, tränad på ett bredare underlag, kommer i början av oktober.