Mellemklassepris, flagskibsresultat
Anthropic udsendte Claude Sonnet 5.5 mandag, seks dage efter flagskibet Opus 5.5, og selskabets egne tal placerer den billigere model to point efter den dyre på den evaluering, selskabet bruger til almindeligt videnarbejde. På GDPval-AA v2.1 oplyser Anthropic 1.844 for Sonnet 5.5 mod 1.846 for Opus 5.5.
Prisen per token er uændret. Sonnet 5.5 koster 2 dollar per million indgående tokens og 10 dollar per million udgående, det samme som Sonnet 5 og halvdelen af, hvad Opus 5.5 tager. Cachelæsninger ligger fortsat på 0,20 dollar per million. Anthropics argument handler om den samlede regning og ikke om taksten: selskabet siger, at modellen leverer svar mere end 30 procent hurtigere og afslutter en opgave for op til 30 procent mindre, fordi den bruger færre tokens og foretager færre værktøjskald på vejen.
Kodetallene flytter sig langt
På Terminal-Bench 4.0, en evaluering af agentdrevet kodning, oplyser Anthropic 70,6 procent for Sonnet 5.5 mod 10,3 procent for Sonnet 5 — en forskel, der siger lige så meget om, hvor dårligt den ældre model håndterede netop det opsætning, som om den nye. CursorBench 4.0 går fra 34,1 til 55,5 procent, med Opus 5.5 på 57,8. FrontierCode 1.1 bevæger sig fra 42,4 til 46,2 procent, hvor Opus 5.5 stadig fører med 54,4. På OSWorld 2.1, testen for computerbrug, oplyser Sonnet 5.5 80,1 procent mod Opus 5.5’s 81,8.

Alle disse tal er Anthropics egne, offentliggjort sammen med modellen og ikke fremstillet af en udenforstående evaluator. Ingen af dem er endnu reproduceret uafhængigt.
De kunder, Anthropic citerer, beskriver samme forbedring med deres egne ord. Box’ vicedirektør for AI sagde, at modellen var 2,4 gange hurtigere og brugte 12 procent færre tokens i alt. Slack rapporterede omkring 14 procent færre udgående tokens. Lovable, hvis årstakt i omsætning passerede 600 millioner dollar denne måned, sagde, at deres kodeagent havde brug for omkring en tredjedel færre værktøjskald for at gennemføre et job. Zendesk sagde, at supportsager blev behandlet 20 procent hurtigere.
Værn lånt fra flagskibet
Sonnet 5.5 er den første Sonnet-model, der leveres med klassifikatorer, som skal forhindre nogen i at hente dens ræsonnement ud for at træne en konkurrent — et destillationsværn, Anthropic tidligere har holdt til sine største modeller. Cybersikkerhedsværnene ligger på Opus 5.5-niveau, og Anthropic siger, at forespørgsler med højere risiko sendes tilbage til Sonnet 5 i stedet for at blive besvaret af den nye model. Godkendte forsvarere kan søge om adgang til den begrænsede evne gennem et Cyber Verification Program.

Det er en forsigtig holdning for en billig model, og den kommer i en måned, hvor agenter, der kører på frontlinjesystemer, har nået offentlige portaler og kodearkiver, uden at nogen bad dem om det.
Hvad man skal holde øje med
Modellen findes på Claude-platformen og på AWS, Google Cloud og Microsoft Azure som claude-sonnet-5-5. De tal, der er værd at vente på, er de uafhængige. Anthropics påstand om omkostning per opgave hviler på, at modellen vælger at gøre mindre arbejde, og det er netop den adfærd, der varierer mest mellem en leverandørs opsætning og en kundes kodebase. De offentlige kodetabeller og intelligensindeksene sætter et tal på forskellen inden for få dage.