En tiondel av priset

Anthropic släppte Claude Haiku 5.5 den 7 oktober och kallar den den billigaste, snabbaste och mest kapabla lilla modell bolaget har skickat ut.

Priset är nyheten. För frågor upp till 100 000 tokens kostar inmatning 0,10 dollar per miljon tokens och utmatning 0,50. Haiku 4.5 tog 1,00 och 5,00 dollar — tio gånger så mycket. Över 100 000 tokens i frågan tar den nya modellen 0,50 och 2,50, fortfarande hälften av den gamla taxan. Cacheläsningar faller från 0,10 till 0,01 dollar och cacheskrivningar från 1,25 till 0,125.

Anthropic anger den genomsnittliga besparingen till omkring 75%, med en fotnot som löser upp räkningen: 90% lägre för förfrågningar under 100 000 tokens, 50% lägre däröver. Även Sonnet 5.5:s pris för cacheläsning halverades vid lanseringen, från 0,20 till 0,10 dollar.

Vad Anthropic säger att den presterar

Alla siffror nedan är tillverkarens egna, från Anthropics interna mätningar, och ingen har återskapats oberoende.

På OSWorld 2.1 ger bolagets tabell Haiku 5.5 72,4% mot 15,7% för Haiku 4.5 och 48,9% för OpenAIs GPT-6 Luna. På Terminal-Bench 4.0 anges 39,2%, mot 0,0% för Haiku 4.5 och 16,4% för GPT-6 Luna. På Humanity’s Last Exam utan verktyg rapporteras 45,9%, upp från 10,2%.

En hand använder en miniräknare på ett utskrivet blad med diagramtyper
Inmatning faller från 1,00 till 0,10 dollar per miljon tokens på korta frågor. Illustrativ bild. RDNE Stock project · pexels · Pexels License

Sonnet 5.5 ligger fortfarande över på varje rad — 83,9% på OSWorld, 70,6% på Terminal-Bench — vilket är poängen med sortimentet snarare än en brist i det. Två kunder citeras: Box rapporterade ett resultat 11 poäng högre än Haiku 4.5 vid ungefär halva svarstiden, och AlphaSense 0,84 mot 0,76 i sin egen utvärdering Ask in Document.

En ansträngningsratt på en liten modell

Haiku 5.5 är den första modellen i Haiku-klassen med justerbar ansträngning, reglaget som låter den som anropar byta kostnad mot hur hårt modellen arbetar på en förfrågan. Hittills har det varit en egenskap hos de stora Claude-modellerna.

Det betyder mer än det låter för det arbete Haiku säljs till: klassificera, extrahera, dirigera, sammanfatta samma dokumenttyp en miljon gånger. En billig modell med en ratt kan ställas in per kö i stället för per tillämpning.

Fiberoptiska kablar inkopplade i en patchpanel i ett datacenter
Modellen körs på AWS, Google Cloud, Azure och Anthropics egen plattform. Illustrativ bild. Brett Sayles · pexels · Pexels License

Fotnoten till priset

En detalj mjukar upp rubriksiffran. Haiku 5.5 använder en uppdaterad tokenisering, och Anthropic uppger att den förbrukar något fler tokens per uppgift än föregångaren. En prissänkning mätt per token är inte riktigt en prissänkning mätt per jobb, och den som räknar på besparingen bör mäta den på sin egen trafik.

Anthropic säger också att modellens cybersäkerhetsspärrar är hårdare än Haiku 4.5:s men lösare än Sonnet 5.5:s, och rapporterar förbättrad alignment jämfört med den tidigare versionen utan att sätta siffror på den. Kontextfönstret anges inte.

Var den körs, och vad man ska följa

Modellen finns nu på Amazon Web Services, Google Cloud och Microsoft Azure samt Anthropics egen plattform.

Det som är värt att följa är om golvet för små modeller fortsätter sjunka. Anthropic har prissatt Haiku 5.5 i samma terräng som OpenAIs GPT-6 Luna, och det besluts-API som OpenAI lanserade samma vecka tar 0,10 dollar per miljon intokens med gratis utmatning. Den billiga nivån är där volymen finns, och båda labben tycks nu prissätta den som en position snarare än en marginal.