Mellomklassepris, flaggskipresultat

Anthropic slapp Claude Sonnet 5.5 mandag, seks dager etter flaggskipet Opus 5.5, og selskapets egne tall plasserer den billigere modellen to poeng bak den dyre på evalueringen selskapet bruker for allment kunnskapsarbeid. På GDPval-AA v2.1 oppgir Anthropic 1 844 for Sonnet 5.5 mot 1 846 for Opus 5.5.

Prisen per token er uendret. Sonnet 5.5 koster 2 dollar per million innmatede tokens og 10 dollar per million utmatede, det samme som Sonnet 5 og halvparten av hva Opus 5.5 tar. Cachelesing ligger fortsatt på 0,20 dollar per million. Anthropics argument handler om den samlede regningen og ikke om taksten: selskapet sier modellen produserer svar mer enn 30 prosent raskere og fullfører en oppgave for opptil 30 prosent mindre, fordi den bruker færre tokens og gjør færre verktøykall på veien.

Kodetallene flytter seg langt

På Terminal-Bench 4.0, en evaluering av agentdrevet koding, oppgir Anthropic 70,6 prosent for Sonnet 5.5 mot 10,3 prosent for Sonnet 5 — en forskjell som sier like mye om hvor dårlig den eldre modellen håndterte nettopp det oppsettet som om den nye. CursorBench 4.0 går fra 34,1 til 55,5 prosent, med Opus 5.5 på 57,8. FrontierCode 1.1 beveger seg fra 42,4 til 46,2 prosent, der Opus 5.5 fortsatt leder med 54,4. På OSWorld 2.1, testen for datamaskinbruk, oppgir Sonnet 5.5 80,1 prosent mot Opus 5.5 sine 81,8.

Porter på en nettverkssvitsj med patchkabler koblet inn i et rack
Inferenskostnaden er Anthropics argument for modellen. Arkivbilde, ikke fra et av Anthropics datasentre. Vladimir Srajber · pexels · Pexels License

Alle disse tallene er Anthropics egne, publisert sammen med modellen og ikke framstilt av en utenforstående evaluator. Ingen av dem er ennå reprodusert uavhengig.

Kundene Anthropic siterer beskriver samme forbedring med sine egne ord. Box’ visedirektør for AI sa at modellen var 2,4 ganger raskere og brukte 12 prosent færre tokens totalt. Slack rapporterte omtrent 14 prosent færre utmatede tokens. Lovable, hvis årstakt i omsetning passerte 600 millioner dollar denne måneden, sa at kodeagenten deres trengte omtrent en tredjedel færre verktøykall for å fullføre en jobb. Zendesk sa at støttesaker ble behandlet 20 prosent raskere.

Sikringer lånt fra flaggskipet

Sonnet 5.5 er den første Sonnet-modellen som leveres med klassifikatorer som skal hindre noen fra å hente ut resonnementet dens for å trene en konkurrent — et destillasjonsvern Anthropic tidligere har holdt for sine største modeller. Cybersikkerhetssikringene ligger på Opus 5.5-nivå, og Anthropic sier at forespørsler med høyere risiko sendes tilbake til Sonnet 5 i stedet for å bli besvart av den nye modellen. Godkjente forsvarere kan søke om tilgang til den begrensede evnen gjennom et Cyber Verification Program.

To kolleger som ser på kode på en stor skjerm på et kontor
Anthropic sier modellen fullfører oppgaver med færre tokens og færre verktøykall. Arkivbilde. Mikhail Nilov · pexels · Pexels License

Det er en forsiktig holdning for en billig modell, og den kommer i en måned der agenter som kjører på frontlinjesystemer har nådd offentlige portaler og kodearkiver uten at noen ba dem om det.

Hva man skal følge med på

Modellen finnes på Claude-plattformen og på AWS, Google Cloud og Microsoft Azure som claude-sonnet-5-5. Tallene det er verdt å vente på, er de uavhengige. Anthropics påstand om kostnad per oppgave hviler på at modellen velger å gjøre mindre arbeid, og det er nettopp den atferden som varierer mest mellom en leverandørs oppsett og en kundes kodebase. De offentlige kodetabellene og intelligensindeksene setter et tall på forskjellen innen få dager.