Mellanprisets prislapp, flaggskeppets resultat

Anthropic släppte Claude Sonnet 5.5 på måndagen, sex dagar efter flaggskeppet Opus 5.5, och företagets egna siffror placerar den billigare modellen två poäng bakom den dyra på den utvärdering bolaget använder för allmänt kunskapsarbete. På GDPval-AA v2.1 anger Anthropic 1 844 för Sonnet 5.5 mot 1 846 för Opus 5.5.

Priset per token har inte ändrats. Sonnet 5.5 kostar 2 dollar per miljon inmatade tokens och 10 dollar per miljon utmatade, samma som Sonnet 5 och hälften av vad Opus 5.5 tar. Cacheläsningar ligger kvar på 0,20 dollar per miljon. Anthropics argument handlar om den totala notan snarare än om taxan: bolaget säger att modellen svarar mer än 30 procent snabbare och slutför en uppgift för upp till 30 procent mindre, eftersom den förbrukar färre tokens och gör färre verktygsanrop på vägen.

Kodsiffrorna flyttar sig långt

På Terminal-Bench 4.0, en utvärdering av agentdriven kodning, anger Anthropic 70,6 procent för Sonnet 5.5 mot 10,3 procent för Sonnet 5 — en skillnad som säger lika mycket om hur illa den äldre modellen klarade just den miljön som om den nya. CursorBench 4.0 går från 34,1 till 55,5 procent, med Opus 5.5 på 57,8. FrontierCode 1.1 rör sig från 42,4 till 46,2 procent, där Opus 5.5 fortfarande leder på 54,4. På OSWorld 2.1, testet för datoranvändning, anger Sonnet 5.5 80,1 procent mot Opus 5.5:s 81,8.

Portar på en nätverksswitch med patchkablar inkopplade i ett rack
Inferenskostnaden är Anthropics argument för modellen. Arkivbild, inte från ett av Anthropics datacenter. Vladimir Srajber · pexels · Pexels License

Samtliga dessa siffror är Anthropics egna, publicerade tillsammans med modellen och inte framtagna av en utomstående utvärderare. Ingen av dem har ännu reproducerats oberoende.

De kunder Anthropic citerar beskriver samma slags förbättring med sina egna ord. Box vice vd för AI sade att modellen var 2,4 gånger snabbare och använde 12 procent färre tokens totalt. Slack rapporterade omkring 14 procent färre utmatade tokens. Lovable, vars årstakt i omsättning passerade 600 miljoner dollar denna månad, sade att dess kodagent behövde omkring en tredjedel färre verktygsanrop för att slutföra ett jobb. Zendesk sade att supportärenden hanterades 20 procent snabbare.

Skydd lånade från flaggskeppet

Sonnet 5.5 är den första Sonnet-modellen som levereras med klassificerare som ska hindra någon från att extrahera dess resonemang för att träna en konkurrent — ett destillationsskydd som Anthropic tidigare har hållit för sina största modeller. Dess cybersäkerhetsskydd ligger på Opus 5.5-nivå, och Anthropic säger att förfrågningar med högre risk skickas tillbaka till Sonnet 5 i stället för att besvaras av den nya modellen. Godkända försvarare kan ansöka om tillgång till den begränsade förmågan genom ett Cyber Verification Program.

Två kollegor tittar på kod på en stor skärm i ett kontor
Anthropic säger att modellen slutför uppgifter med färre tokens och färre verktygsanrop. Arkivbild. Mikhail Nilov · pexels · Pexels License

Det är en försiktig hållning för en billig modell, och den kommer i en månad då agenter som körs på frontlinjesystem har nått myndighetsportaler och offentliga kodregister utan att någon bett dem om det.

Vad man ska hålla ögonen på

Modellen finns på Claude-plattformen och på AWS, Google Cloud och Microsoft Azure som claude-sonnet-5-5. De siffror som är värda att vänta på är de oberoende. Anthropics påstående om kostnad per uppgift vilar på att modellen väljer att göra mindre arbete, och det är precis det beteende som varierar mest mellan en leverantörs miljö och en kunds kodbas. De offentliga kodtabellerna och intelligensindexen sätter en siffra på skillnaden inom några dagar.