Preço de gama média, pontuação de topo
A Anthropic lançou o Claude Sonnet 5.5 na segunda-feira, seis dias depois do seu modelo principal Opus 5.5, e os números da própria empresa deixam o modelo barato dois pontos atrás do caro na avaliação que usa para trabalho intelectual geral. No GDPval-AA v2.1, a Anthropic indica 1.844 para o Sonnet 5.5 contra 1.846 do Opus 5.5.
O preço por token não mudou. O Sonnet 5.5 custa 2 dólares por milhão de tokens de entrada e 10 por milhão de saída, o mesmo do Sonnet 5 e metade do que o Opus 5.5 cobra. As leituras de cache continuam em 0,20 dólares por milhão. O argumento da Anthropic é sobre a conta total e não sobre a tarifa: a empresa diz que o modelo produz respostas mais de 30 por cento mais rápido e termina uma tarefa por até 30 por cento menos, porque gasta menos tokens e faz menos chamadas a ferramentas no caminho.
Os números de programação avançam muito
No Terminal-Bench 4.0, uma avaliação de programação com agentes, a Anthropic indica 70,6 por cento para o Sonnet 5.5 contra 10,3 por cento do Sonnet 5 — uma diferença que diz tanto sobre o mau desempenho do modelo antigo naquele ambiente específico como sobre o novo. O CursorBench 4.0 passa de 34,1 para 55,5 por cento, com o Opus 5.5 em 57,8. O FrontierCode 1.1 sobe de 42,4 para 46,2 por cento, onde o Opus 5.5 continua à frente com 54,4. No OSWorld 2.1, o teste de uso do computador, o Sonnet 5.5 marca 80,1 por cento contra os 81,8 do Opus 5.5.

Todos esses números são da Anthropic, publicados com o modelo e não produzidos por um avaliador externo. Nenhum foi ainda reproduzido de forma independente.
Os clientes que a Anthropic cita descrevem a mesma melhoria com as suas próprias palavras. O vice-presidente de IA da Box disse que o modelo era 2,4 vezes mais rápido e usava 12 por cento menos tokens no total. O Slack relatou cerca de 14 por cento menos tokens de saída. A Lovable, cuja receita anualizada passou os 600 milhões de dólares este mês, disse que o seu agente de programação precisou de cerca de um terço menos chamadas a ferramentas para concluir um trabalho. A Zendesk disse que os pedidos de apoio foram processados 20 por cento mais rápido.
Salvaguardas emprestadas do modelo principal
O Sonnet 5.5 é o primeiro modelo Sonnet a chegar com classificadores destinados a impedir que alguém extraia o seu raciocínio para treinar um rival, uma defesa contra destilação que a Anthropic reservava até agora aos seus modelos maiores. As suas salvaguardas de cibersegurança estão ao nível do Opus 5.5, e a Anthropic diz que os pedidos de maior risco são reencaminhados para o Sonnet 5 em vez de respondidos pelo modelo novo. Defensores aprovados podem pedir acesso à capacidade restrita através de um Cyber Verification Program.

É uma postura cautelosa para um modelo barato, e chega num mês em que agentes a correr sobre sistemas de fronteira alcançaram portais públicos de governos e registos de código sem que ninguém lhes tenha pedido.
O que observar
O modelo está na plataforma Claude e na AWS, Google Cloud e Microsoft Azure como claude-sonnet-5-5. Os números que vale a pena esperar são os independentes. A afirmação da Anthropic sobre custo por tarefa depende de o modelo decidir fazer menos trabalho, e esse é precisamente o comportamento que mais varia entre o ambiente de um fornecedor e o código de um cliente. As tabelas públicas de programação e os índices de inteligência vão pôr um número na diferença em poucos dias.