Um décimo do preço
A Anthropic lançou o Claude Haiku 5.5 a 7 de outubro e descreve-o como o modelo pequeno mais barato, mais rápido e mais capaz que já publicou.
O preço é a notícia. Para pedidos até 100 mil tokens, a entrada custa 0,10 dólares por milhão de tokens e a saída 0,50. O Haiku 4.5 cobrava 1,00 e 5,00 dólares, dez vezes mais. Acima de 100 mil tokens de pedido, o novo modelo cobra 0,50 e 2,50, ainda metade da tarifa antiga. As leituras de cache descem de 0,10 para 0,01 dólares e as escritas de 1,25 para 0,125.
A Anthropic situa a poupança média em cerca de 75%, com uma nota de rodapé que resolve a conta: 90% menos para pedidos abaixo de 100 mil tokens, 50% menos acima disso. O preço de leitura de cache do Sonnet 5.5 também foi reduzido a metade no lançamento, de 0,20 para 0,10 dólares.
O que a Anthropic diz que ele pontua
Todos os números abaixo vêm do fabricante, das avaliações internas da Anthropic, e nenhum foi reproduzido de forma independente.
No OSWorld 2.1, a tabela da empresa dá ao Haiku 5.5 72,4% contra 15,7% do Haiku 4.5 e 48,9% do GPT-6 Luna, da OpenAI. No Terminal-Bench 4.0 dá 39,2%, contra 0,0% do Haiku 4.5 e 16,4% do GPT-6 Luna. No Humanity’s Last Exam sem ferramentas regista 45,9%, acima dos 10,2% anteriores.

O Sonnet 5.5 continua acima em todas as linhas — 83,9% no OSWorld, 70,6% no Terminal-Bench — o que é a razão de ser da gama e não um defeito. São citados dois clientes: a Box registou uma pontuação 11 pontos acima da do Haiku 4.5 com cerca de metade da latência, e a AlphaSense 0,84 contra 0,76 na sua própria avaliação Ask in Document.
Um botão de esforço num modelo pequeno
O Haiku 5.5 é o primeiro modelo da classe Haiku com ajuste de esforço, o controlo que permite a quem chama trocar gasto por quanto o modelo trabalha num pedido. Até agora era uma característica dos modelos Claude grandes.
Isso conta mais do que parece para o trabalho a que o Haiku se destina: classificar, extrair, encaminhar, resumir um milhão de vezes o mesmo tipo de documento. Um modelo barato com um botão pode ser afinado por fila de trabalho e não por aplicação.

A nota de rodapé do preço
Um detalhe suaviza o número do título. O Haiku 5.5 usa um tokenizador atualizado, e a Anthropic diz que consome ligeiramente mais tokens por tarefa do que o antecessor. Um corte medido por token não é bem um corte medido por trabalho, e quem calcular a poupança deve medi-la no seu próprio tráfego.
A Anthropic acrescenta que as salvaguardas de cibersegurança do modelo são mais apertadas do que as do Haiku 4.5 mas mais folgadas do que as do Sonnet 5.5, e relata melhorias de alinhamento face à versão anterior sem lhes pôr número. Não indica a janela de contexto.
Onde corre, e o que vigiar
O modelo está disponível já na Amazon Web Services, na Google Cloud e no Microsoft Azure, além da plataforma da própria Anthropic.
O que vale a pena vigiar é se o chão dos modelos pequenos continua a descer. A Anthropic colocou o Haiku 5.5 no mesmo terreno do GPT-6 Luna, da OpenAI, e a API de decisões que a OpenAI lançou na mesma semana cobra 0,10 dólares por milhão de tokens de entrada com saída gratuita. O escalão barato é onde está o volume, e ambos os laboratórios parecem agora fixá-lo como posição e não como margem.