En billigare modell i toppen av sortimentet
Anthropic släppte Claude Opus 5.5 på tisdagen och uppger att den presterar på en nivå som liknar Claude Fable 5.1, bolagets största modell, i det mesta av arbetet. Priset gick åt andra hållet: indata sjunker från 5 till 4 dollar per miljon tokens, och utdata från 25 till 20.
Den brantaste sänkningen gäller cachad indata, som faller från 0,50 till 0,20 dollar per miljon tokens. Det är en minskning med 60 procent som betyder mest för agenter som spelar upp långa kontexter vid varje steg. Anthropic anger den sammanlagda effekten till omkring 40 procent lägre kostnad vid typiska arbetslaster, och säger att modellen genererar text ungefär 30 procent snabbare än Opus 5.
Siffrorna, och vems de är
Alla siffror nedan kommer från Anthropic, uppmätta i bolagets egen testmiljö, och ingen av dem har ännu reproducerats oberoende.
Företaget rapporterar 66,4 procent på Terminal-Bench 4.0, mot 52,3 procent för Opus 5. På FrontierCode v1.1 anges 54,4 procent, upp från 48,0. OSWorld 2.0, som mäter en modell som styr ett skrivbord, stiger till 81,8 procent från 74,0. På GDPval-AA v2.1, en Elo-poängsatt utvärdering av kontorsarbete, placerar Anthropic Opus 5.5 på 1846 mot Opus 5:s 1708.

Anthropic sade till TechCrunch att det är “den modell med bäst prestanda vi har testat hittills”. Det intressanta är inte de enskilda poängen utan formen på dem: en släppning mitt i cykeln som närmar sig flaggskeppet i stället för att nätt och jämnt passera sin egen föregångare.
Säkerhetsarbetet som följde med
Anthropic uppger att Opus 5.5 fick bäst resultat av bolagets modeller i den automatiska beteendegranskningen, och att försöken att ta sig förbi inneslutningsgränserna föll med 85 procent jämfört med Opus 5. Bolaget hävdar också förbättrat motstånd mot promptinjektion, det fel som ligger bakom merparten av årets agentincidenter.
Skyddsåtgärderna är ovanligt specifika. Uppgifter inom cybersäkerhet dirigeras till äldre Opus 4.8 om inte användaren har klarat ett utvidgat verifieringsprogram för cybersäkerhet. Förmågan inom biologi beskrivs som jämförbar med Claude Mythos 5.1 och ligger bakom ett nytt verifieringsprogram för livsvetenskaper. Utökat resonemang blir obligatoriskt, och skyddet som döljer resonemangsspåren mot destillation behålls.

Var den körs
Modellen finns från start på Anthropics egen plattform som claude-opus-5-5, och på Amazon Web Services, Google Cloud och Microsoft Azure. GitHub lade in den i Copilot samma dag. Anthropic uppger att noll datalagring erbjuds och att utdata bär den vattenmärkning som EU:s AI-förordning kräver.
Släppet kommer tre dagar efter att Anthropics vd Dario Amodei offentligt argumenterade för att sakta ner takten i förmågearbetet så att alignmentforskningen hinner ikapp, och samma dag som OpenAI sänkte sina egna priser med GPT-6 Sol och Luna.
Att hålla ögonen på
Claude Sonnet 5.5 och Claude Haiku 5.5 utlovas “de kommande veckorna”, vilket skulle föra samma pris- och latensförändringar nedåt i sortimentet. Det andra att bevaka är oberoende mätning: Anthropics tabell är en leverantörs berättelse om sin egen produkt, och modellens verkliga position mot Fable 5.1 och mot OpenAI:s nya nivå avgörs först när utomstående utvärderare publicerar.