Amazons Strands Labs har släppt Strands Decider 2B, en modell med öppen källkod som inte genererar text alls. Givet en uppsättning fördefinierade alternativ poängsätter den dem och returnerar det bästa med ett konfidensvärde. Det är hela utdatan.

Den är snabb just på grund av det den inte gör. Strands Labs uppger en mediantid på omkring 115 millisekunder på ett lokalt Nvidia RTX 3090 och omkring 153 millisekunder på en MacBook med M3-krets.

Så är den byggd

Modellen utgår från en förtränad Qwen3.5-2B-torso, tar bort språkmodelleringshuvudet och ersätter det med ett pekarhuvud som poängsätter de dolda tillstånden vid varje alternativposition mot positionen för ett svarstoken. Pekarhuvudet är drygt en miljon parametrar. Finjusteringen sker med en LoRA-adapter av rang 16.

Närbild på ett grafikkort till en dator
Strands Labs uppger en mediantid på omkring 115 millisekunder på ett RTX 3090. Illustrerande foto. Armando Are · pexels · Pexels License

Strands Labs uppger att modellen rankas som trea av 33 modeller i sin tvåmiljardersklass på JevBench för träffsäkerhet och kalibrering sammantaget — kalibreringen mäts med Brier-poäng, som frågar om konfidensvärdet betyder något, inte om svaret är rätt. Vikterna ligger på Hugging Face, och träningsdata, träningsskript och hela iterationshistoriken på GitHub.

Modellklassen är en månad gammal

Beslutsmodeller fanns inte som kategori i september. TypeSafe skapade en med Jev, uppkallad efter nationalekonomen William Stanley Jevons och hans argument att en fallande kostnad kan höja efterfrågan snarare än sänka den. Dussintals efterföljare har kommit.

En person som arbetar vid ett skrivbord med två skärmar på ett ljust kontor
Vikter, träningsdata och skript är publicerade. Illustrerande foto. RDNE Stock project · pexels · Pexels License

Marc Brooker, Amazon-ingenjören som ledde arbetet, beskrev attraktionen i driftstermer: ett steg i ett arbetsflöde som kan struktureras för att bli mer tillförlitligt, med lägre latens och potentiellt lägre kostnad. TypeSafes vd var mindre generös mot det fält bolaget startade och sade till TechCrunch att den nuvarande vågen verkar mer som maskininlärningsfolk som vill implementera en intressant arkitektur än ett team som ägnar sig åt att göra intelligens användbar.

Varför det betyder något bortom nyhetsvärdet

De flesta agentramverk dirigerar genom att be en stor modell skriva ut ett ord och sedan tolka det. Det är dyrt, långsamt och tyst opålitligt, eftersom en modell som skriver “alternativ B” inte ger något användbart mått på hur säker den var. Ett dedikerat huvud som returnerar en kalibrerad poäng över en fast alternativuppsättning tar bort båda problemen i just det steg där agenter oftast går fel.

Att följa

Om JevBench håller som mått. Ett riktmärke som skapats vid sidan av en produkt av det bolag som skapade kategorin är det självklara för en konkurrent att ifrågasätta, och hittills har ingen gjort det.