En tiendedel af prisen

Anthropic udgav Claude Haiku 5.5 den 7. oktober og kalder den den billigste, hurtigste og mest kapable lille model, selskabet har sendt ud.

Prisen er nyheden. For forespørgsler op til 100.000 tokens koster input 0,10 dollar per million tokens og output 0,50. Haiku 4.5 tog 1,00 og 5,00 dollar — ti gange så meget. Over 100.000 tokens i forespørgslen tager den nye model 0,50 og 2,50, stadig halvdelen af den gamle takst. Cachelæsninger falder fra 0,10 til 0,01 dollar og cacheskrivninger fra 1,25 til 0,125.

Anthropic sætter den gennemsnitlige besparelse til omkring 75%, med en fodnote, der løser regnestykket: 90% lavere for forespørgsler under 100.000 tokens, 50% lavere derover. Også cachelæsningsprisen for Sonnet 5.5 blev halveret ved lanceringen, fra 0,20 til 0,10 dollar.

Hvad Anthropic siger, den scorer

Alle tal herunder er leverandørens egne, fra Anthropics interne målinger, og ingen af dem er gengivet uafhængigt.

På OSWorld 2.1 giver selskabets tabel Haiku 5.5 72,4% mod 15,7% for Haiku 4.5 og 48,9% for OpenAIs GPT-6 Luna. På Terminal-Bench 4.0 angives 39,2%, mod 0,0% for Haiku 4.5 og 16,4% for GPT-6 Luna. På Humanity’s Last Exam uden værktøjer rapporteres 45,9%, op fra 10,2%.

En hånd bruger en lommeregner på et udskrevet ark med diagramtyper
Input falder fra 1,00 til 0,10 dollar per million tokens på korte forespørgsler. Illustrationsbillede. RDNE Stock project · pexels · Pexels License

Sonnet 5.5 ligger stadig over på hver linje — 83,9% på OSWorld, 70,6% på Terminal-Bench — hvilket er pointen med sortimentet snarere end en svaghed ved det. To kunder citeres: Box rapporterede et resultat 11 point højere end Haiku 4.5 ved omtrent den halve svartid, og AlphaSense 0,84 mod 0,76 i sin egen Ask in Document-evaluering.

En indsatsknap på en lille model

Haiku 5.5 er den første model i Haiku-klassen med justerbar indsats, den kontrol der lader den, som kalder, bytte omkostning mod hvor hårdt modellen arbejder på en forespørgsel. Hidtil har det været en egenskab ved de store Claude-modeller.

Det betyder mere, end det lyder, for det arbejde Haiku sælges til: klassificere, udtrække, dirigere, opsummere den samme dokumenttype en million gange. En billig model med en knap kan indstilles per kø i stedet for per anvendelse.

Fiberoptiske kabler sat i et patchpanel i et datacenter
Modellen kører på AWS, Google Cloud, Azure og Anthropics egen platform. Illustrationsbillede. Brett Sayles · pexels · Pexels License

Fodnoten til prisen

En detalje blødgør overskriftstallet. Haiku 5.5 bruger en opdateret tokenisering, og Anthropic oplyser, at den bruger lidt flere tokens per opgave end forgængeren. En prisnedsættelse målt per token er ikke helt en prisnedsættelse målt per opgave, og den, der regner på besparelsen, bør måle den på sin egen trafik.

Anthropic siger også, at modellens cybersikkerhedsspærringer er strammere end Haiku 4.5’s, men løsere end Sonnet 5.5’s, og melder om bedre alignment end den forrige version uden at sætte tal på det. Kontekstvinduet oplyses ikke.

Hvor den kører, og hvad man skal følge

Modellen er tilgængelig nu på Amazon Web Services, Google Cloud og Microsoft Azure foruden Anthropics egen platform.

Det, der er værd at følge, er, om gulvet for små modeller bliver ved med at falde. Anthropic har prissat Haiku 5.5 i samme terræn som OpenAIs GPT-6 Luna, og det beslutnings-API, OpenAI lancerede samme uge, tager 0,10 dollar per million input-tokens med gratis output. Det billige niveau er der, hvor volumen er, og begge laboratorier ser nu ud til at prissætte det som en position snarere end en margin.