En tidel av prisen

Anthropic slapp Claude Haiku 5.5 den 7. oktober og kaller den den billigste, raskeste og mest kapable lille modellen selskapet har sendt ut.

Prisen er nyheten. For forespørsler opptil 100 000 tokens koster inndata 0,10 dollar per million tokens og utdata 0,50. Haiku 4.5 tok 1,00 og 5,00 dollar — ti ganger så mye. Over 100 000 tokens i forespørselen tar den nye modellen 0,50 og 2,50, fortsatt halvparten av den gamle satsen. Cachelesninger faller fra 0,10 til 0,01 dollar og cacheskrivinger fra 1,25 til 0,125.

Anthropic anslår den gjennomsnittlige besparelsen til rundt 75%, med en fotnote som løser opp regnestykket: 90% lavere for forespørsler under 100 000 tokens, 50% lavere over. Også cachelesningsprisen for Sonnet 5.5 ble halvert ved lansering, fra 0,20 til 0,10 dollar.

Hva Anthropic sier den scorer

Alle tallene under er leverandørens egne, fra Anthropics interne målinger, og ingen er gjengitt uavhengig.

På OSWorld 2.1 gir selskapets tabell Haiku 5.5 72,4% mot 15,7% for Haiku 4.5 og 48,9% for OpenAIs GPT-6 Luna. På Terminal-Bench 4.0 oppgis 39,2%, mot 0,0% for Haiku 4.5 og 16,4% for GPT-6 Luna. På Humanity’s Last Exam uten verktøy rapporteres 45,9%, opp fra 10,2%.

En hånd bruker en kalkulator på et utskrevet ark med diagramtyper
Inndata faller fra 1,00 til 0,10 dollar per million tokens på korte forespørsler. Illustrasjonsbilde. RDNE Stock project · pexels · Pexels License

Sonnet 5.5 ligger fortsatt over på hver linje — 83,9% på OSWorld, 70,6% på Terminal-Bench — noe som er poenget med sortimentet snarere enn en svakhet ved det. To kunder siteres: Box rapporterte et resultat 11 poeng høyere enn Haiku 4.5 ved omtrent halve svartiden, og AlphaSense 0,84 mot 0,76 i sin egen Ask in Document-evaluering.

En innsatsbryter på en liten modell

Haiku 5.5 er den første modellen i Haiku-klassen med justerbar innsats, kontrollen som lar den som kaller bytte kostnad mot hvor hardt modellen arbeider med en forespørsel. Hittil har det vært en egenskap ved de store Claude-modellene.

Det betyr mer enn det høres ut som for arbeidet Haiku selges til: klassifisere, hente ut, rute, oppsummere samme dokumenttype en million ganger. En billig modell med en bryter kan stilles inn per kø i stedet for per anvendelse.

Fiberoptiske kabler koblet til et patchpanel i et datasenter
Modellen kjører på AWS, Google Cloud, Azure og Anthropics egen plattform. Illustrasjonsbilde. Brett Sayles · pexels · Pexels License

Fotnoten til prisen

En detalj myker opp overskriftstallet. Haiku 5.5 bruker en oppdatert tokenisering, og Anthropic opplyser at den bruker noe flere tokens per oppgave enn forgjengeren. Et priskutt målt per token er ikke helt et priskutt målt per jobb, og den som regner på besparelsen bør måle den på egen trafikk.

Anthropic sier også at modellens cybersikkerhetssperrer er strammere enn Haiku 4.5 sine, men løsere enn Sonnet 5.5 sine, og melder om bedre alignment enn forrige versjon uten å tallfeste det. Kontekstvinduet oppgis ikke.

Hvor den kjører, og hva man skal følge

Modellen er tilgjengelig nå på Amazon Web Services, Google Cloud og Microsoft Azure i tillegg til Anthropics egen plattform.

Det som er verdt å følge, er om gulvet for små modeller fortsetter å synke. Anthropic har priset Haiku 5.5 inn i samme terreng som OpenAIs GPT-6 Luna, og beslutnings-API-et OpenAI lanserte samme uke tar 0,10 dollar per million innkommende tokens med gratis utdata. Det billige nivået er der volumet er, og begge laboratoriene ser nå ut til å prise det som en posisjon snarere enn en margin.