En billigere model i toppen af sortimentet

Anthropic udsendte Claude Opus 5.5 tirsdag og oplyser, at den præsterer på et niveau, der ligner Claude Fable 5.1, selskabets største model, på det meste af arbejdet. Prisen gik den anden vej: input falder fra 5 til 4 dollar per million tokens, og output fra 25 til 20.

Det største fald gælder cachet input, som går fra 0,50 til 0,20 dollar per million tokens. Det er en reduktion på 60 procent, der betyder mest for agenter, som afspiller lange kontekster ved hvert skridt. Anthropic sætter den samlede effekt til omkring 40 procent lavere omkostning ved typiske arbejdsbelastninger og siger, at modellen genererer tekst cirka 30 procent hurtigere end Opus 5.

Tallene, og hvem de tilhører

Alle tal nedenfor stammer fra Anthropic, målt på selskabets egen testopstilling, og ingen af dem er endnu reproduceret uafhængigt.

Selskabet rapporterer 66,4 procent på Terminal-Bench 4.0 mod 52,3 procent for Opus 5. På FrontierCode v1.1 angiver det 54,4 procent, op fra 48,0. OSWorld 2.0, der måler en model, som styrer et skrivebord, stiger til 81,8 procent fra 74,0. På GDPval-AA v2.1, en Elo-bedømt evaluering af kontorarbejde, placerer Anthropic Opus 5.5 på 1846 mod Opus 5’s 1708.

Serverracks i en gang i et datacenter
Cachet input falder 60 procent, det fald der betyder mest for lange agenter. Illustrationsbillede. Brett Sayles · pexels · Pexels License

Anthropic sagde til TechCrunch, at det er “den model med bedst ydeevne, vi har testet til dato”. Det interessante er ikke de enkelte scorer, men formen på dem: en udgivelse midt i cyklussen, der nærmer sig flagskibet i stedet for lige akkurat at overhale sin egen forgænger.

Sikkerhedsarbejdet, der fulgte med

Anthropic oplyser, at Opus 5.5 fik det bedste resultat blandt selskabets modeller i den automatiske adfærdsrevision, og at forsøg på at omgå indeslutningsgrænserne faldt 85 procent i forhold til Opus 5. Selskabet hævder også bedre modstand mod promptinjektion, den fejl, der ligger bag størstedelen af årets agenthændelser.

Sikkerhedsforanstaltningerne er usædvanligt konkrete. Opgaver inden for cybersikkerhed sendes til ældre Opus 4.8, medmindre brugeren har gennemført et udvidet verifikationsprogram for cybersikkerhed. Evnen inden for biologi beskrives som sammenlignelig med Claude Mythos 5.1 og ligger bag et nyt verifikationsprogram for biovidenskab. Udvidet ræsonnement bliver obligatorisk, og beskyttelsen, der skjuler ræsonnementssporene mod destillering, bevares.

En ingeniør der gennemgår kode på en stor skærm
Anthropic rapporterer 66,4 procent på Terminal-Bench 4.0 mod 52,3 for Opus 5. Illustrationsbillede. ThisIsEngineering · pexels · Pexels License

Hvor den kører

Modellen er tilgængelig fra lanceringen på Anthropics egen platform som claude-opus-5-5 og på Amazon Web Services, Google Cloud og Microsoft Azure. GitHub tilføjede den til Copilot samme dag. Anthropic siger, at nul datalagring tilbydes, og at output bærer den vandmærkning, EU’s AI-forordning kræver.

Udgivelsen kommer tre dage efter, at Anthropics administrerende direktør Dario Amodei offentligt argumenterede for at sænke tempoet i arbejdet med evner, så alignmentforskningen kan følge med, og samme dag som OpenAI sænkede sine egne priser med GPT-6 Sol og Luna.

Hvad man skal holde øje med

Claude Sonnet 5.5 og Claude Haiku 5.5 er lovet “i de kommende uger”, hvilket ville føre de samme pris- og forsinkelsesændringer ned gennem sortimentet. Det andet, man skal holde øje med, er uafhængig måling: Anthropics tabel er en leverandørs beretning om sit eget produkt, og modellens faktiske placering over for Fable 5.1 og over for OpenAIs nye niveau bliver først afgjort, når udenforstående evaluatorer offentliggør.