En modell som inte kan skriva
Perplexity släppte på torsdagen pplx-decider-v1-27b, en modell med öppna vikter publicerad på Hugging Face under Apache 2.0-licens och finjusterad från Qwen3.8-27B. Den är multimodal, tar emot text och bilder, och genererar ingen löptext. Den returnerar ett valt alternativ ur en fast mängd tillsammans med kalibrerade sannolikheter.
Det är den egenskap som definierar kategorin. En beslutsmodell svarar i en av några få typade former — ja eller nej, ett av n alternativ, ett ordnat betyg — och eftersom utrymmet för svar är slutet kan svaret kontrolleras i stället för tolkas. För en agent som avgör om ett hämtat textstycke stöder ett påstående, eller om ett supportärende är en återbetalningsbegäran, är det hela kravet.
Vad testerna säger, och vem som kört dem
På Perplexitys egen panel med elva tester och 7 210 exempel fick pplx-decider 85,71 procent totalt mot 84,51 procent för Jev, TypeSafe AI-modellen som öppnade kategorin i september. Modellkortet anger 90,60 procent på TabFact, 89,20 på Circa, 88,80 på RAGTruth, 84,18 på FinancialPhraseBank och 83,30 på WinoGrande, samt 74,76 procent totalt för den Qwen3.8-27B som den finjusterats från.

Marginalen mot Jev är 1,2 punkter på en panel Perplexity själv valt, och fördelningen är inte jämn: enligt AI Weeklys räkning får Jev högre poäng på sex av de elva testerna, medan Perplexity leder på FinancialPhraseBank, RAGTruth, TabFact och Circa. Störst skillnad är RAGTruth, där Perplexity anger 88,80 mot 77,27.
Ett försprång på en punkt på en panel leverantören valt är i sig inte ett förmågepåstående värt särskilt mycket. Att vikterna ligger på Hugging Face under Apache 2.0 är den del vem som helst med ett grafikkort kan kontrollera.
Tre på två dygn
Amazon öppnade Strands Decider, en modell med två miljarder parametrar, på onsdagen. Cloudflare öppnade två Clef-modeller samma vecka. Perplexitys är störst av de tre med 27 miljarder parametrar, och den enda som finjusterats från en befintlig öppen bas i stället för att tränas för ändamålet.

Hastigheten i den konvergensen är den egentliga nyheten. Agentsystem gör ett mycket stort antal små klassificeringsanrop, och vart och ett av dem går i dag genom en allmän modell som byggts för att skriva och ombeds att välja. Att ta betalt för genereringstoken som aldrig genereras är en uppenbar ineffektivitet, och marknaden har hittat den på en gång.
Vad man ska följa är om någon oberoende utvärderare publicerar en panel som ingen av dessa leverantörer valt. Fyra beslutsmodeller finns nu, och varje jämförelse mellan dem hittills har körts av en av deras upphovsmän.