En billigere modell på toppen av sortimentet

Anthropic slapp Claude Opus 5.5 tirsdag og sier den yter på et nivå som ligner Claude Fable 5.1, selskapets største modell, på det meste av arbeidet. Prisen gikk motsatt vei: inndata faller fra 5 til 4 dollar per million tokens, og utdata fra 25 til 20.

Det bratteste kuttet gjelder mellomlagret inndata, som faller fra 0,50 til 0,20 dollar per million tokens. Det er en reduksjon på 60 prosent som betyr mest for agenter som spiller av lange kontekster ved hvert steg. Anthropic anslår den samlede effekten til om lag 40 prosent lavere kostnad på vanlige arbeidslaster, og sier modellen genererer tekst rundt 30 prosent raskere enn Opus 5.

Tallene, og hvem de tilhører

Alle tallene under kommer fra Anthropic, målt på selskapets eget testoppsett, og ingen av dem er reprodusert uavhengig ennå.

Selskapet rapporterer 66,4 prosent på Terminal-Bench 4.0, mot 52,3 prosent for Opus 5. På FrontierCode v1.1 oppgir det 54,4 prosent, opp fra 48,0. OSWorld 2.0, som måler en modell som styrer et skrivebord, stiger til 81,8 prosent fra 74,0. På GDPval-AA v2.1, en Elo-poengsatt evaluering av kontorarbeid, plasserer Anthropic Opus 5.5 på 1846 mot Opus 5s 1708.

Serverracks i en gang i et datasenter
Mellomlagret inndata faller 60 prosent, kuttet som betyr mest for lange agenter. Illustrasjonsbilde. Brett Sayles · pexels · Pexels License

Anthropic sa til TechCrunch at det er “den modellen med best ytelse vi har testet til nå”. Det interessante er ikke de enkelte poengsummene, men formen på dem: en lansering midt i syklusen som nærmer seg flaggskipet i stedet for så vidt å passere sin egen forgjenger.

Sikkerhetsarbeidet som fulgte med

Anthropic sier Opus 5.5 fikk det beste resultatet av selskapets modeller i den automatiske atferdsgranskingen, og at forsøk på å omgå innesperringsgrensene falt 85 prosent mot Opus 5. Selskapet hevder også bedre motstand mot promptinjeksjon, feilen som ligger bak de fleste av årets agenthendelser.

Sikringstiltakene er uvanlig konkrete. Oppgaver innen cybersikkerhet rutes til eldre Opus 4.8 med mindre brukeren har bestått et utvidet verifiseringsprogram for cybersikkerhet. Evnen innen biologi beskrives som sammenlignbar med Claude Mythos 5.1 og ligger bak et nytt verifiseringsprogram for livsvitenskap. Utvidet resonnering blir obligatorisk, og beskyttelsen som skjuler resonneringssporene mot destillering beholdes.

En ingeniør som gjennomgår kode på en stor skjerm
Anthropic rapporterer 66,4 prosent på Terminal-Bench 4.0, mot 52,3 for Opus 5. Illustrasjonsbilde. ThisIsEngineering · pexels · Pexels License

Hvor den kjører

Modellen er tilgjengelig fra lansering på Anthropics egen plattform som claude-opus-5-5, og på Amazon Web Services, Google Cloud og Microsoft Azure. GitHub la den inn i Copilot samme dag. Anthropic sier null datalagring tilbys, og at utdata bærer vannmerkingen som EUs KI-forordning krever.

Lanseringen kommer tre dager etter at Anthropics toppsjef Dario Amodei offentlig argumenterte for å senke tempoet i arbeidet med evner slik at alignmentforskningen kan ta igjen, og samme dag som OpenAI kuttet sine egne priser med GPT-6 Sol og Luna.

Hva man bør følge med på

Claude Sonnet 5.5 og Claude Haiku 5.5 er lovet “i ukene som kommer”, noe som ville føre de samme pris- og forsinkelsesendringene nedover i sortimentet. Det andre å følge med på er uavhengig måling: Anthropics tabell er en leverandørs fortelling om sitt eget produkt, og modellens faktiske posisjon mot Fable 5.1 og mot OpenAIs nye nivå blir ikke avgjort før utenforstående evaluatorer publiserer.