Um modelo mais barato no topo da linha
A Anthropic publicou o Claude Opus 5.5 na terça-feira e afirmou que ele rende a um nível semelhante ao do Claude Fable 5.1, o maior modelo da empresa, na maior parte do trabalho. O preço andou na direção oposta: a entrada cai de 5 para 4 dólares por milhão de tokens, e a saída de 25 para 20.
O corte mais acentuado está na entrada em cache, que desce de 0,50 para 0,20 dólar por milhão de tokens. É uma redução de 60 por cento que pesa sobretudo para agentes que reproduzem contextos longos a cada passo. A Anthropic estima o efeito combinado em cerca de 40 por cento menos em cargas de trabalho comuns, e diz que o modelo gera texto aproximadamente 30 por cento mais rápido que o Opus 5.
Os números, e de quem são
Todos os números abaixo são da Anthropic, medidos no banco de testes da própria empresa, e nenhum foi reproduzido de forma independente até agora.
A companhia relata 66,4 por cento no Terminal-Bench 4.0, contra 52,3 por cento do Opus 5. No FrontierCode v1.1 indica 54,4 por cento, ante 48,0. O OSWorld 2.0, que mede um modelo a operar um computador, sobe para 81,8 por cento desde 74,0. No GDPval-AA v2.1, uma avaliação de trabalho de escritório pontuada por Elo, a Anthropic coloca o Opus 5.5 em 1846 contra os 1708 do Opus 5.

A Anthropic disse à TechCrunch que é “o modelo com melhor desempenho que já testámos”. O interessante não são as pontuações isoladas, mas o formato delas: um lançamento de meio de ciclo que se aproxima do carro-chefe em vez de superar por pouco o seu antecessor.
O trabalho de segurança que veio junto
A Anthropic diz que o Opus 5.5 obteve o melhor resultado entre os seus modelos na auditoria automática de comportamento da empresa, e que as tentativas de contornar os limites de contenção caíram 85 por cento face ao Opus 5. A empresa também alega maior resistência à injeção de instruções, a falha que está por trás da maioria dos incidentes com agentes deste ano.
As salvaguardas são invulgarmente específicas. Tarefas de cibersegurança são encaminhadas para o antigo Opus 4.8, a menos que o utilizador tenha passado por um programa alargado de verificação em cibersegurança. A capacidade em biologia é descrita como comparável à do Claude Mythos 5.1 e fica atrás de um novo programa de verificação em ciências da vida. O raciocínio prolongado passa a ser obrigatório, e mantém-se a proteção que esconde os traços de raciocínio contra a destilação.

Onde funciona
O modelo está disponível desde o lançamento na plataforma da Anthropic como claude-opus-5-5, e na Amazon Web Services, na Google Cloud e no Microsoft Azure. O GitHub acrescentou-o ao Copilot no mesmo dia. A Anthropic diz oferecer retenção zero de dados e que a saída leva a marca de água exigida pela Lei de IA da União Europeia.
O lançamento chega três dias depois de o presidente-executivo da Anthropic, Dario Amodei, ter defendido publicamente abrandar o ritmo do trabalho em capacidades para que a investigação em alinhamento consiga acompanhar, e no mesmo dia em que a OpenAI baixou os seus próprios preços com o GPT-6 Sol e o Luna.
O que observar
O Claude Sonnet 5.5 e o Claude Haiku 5.5 estão prometidos para “as próximas semanas”, o que levaria as mesmas mudanças de preço e latência ao resto da linha. O outro ponto a observar é a medição independente: a tabela da Anthropic é o relato de um fornecedor sobre o seu próprio produto, e a posição real do modelo face ao Fable 5.1 e ao novo patamar da OpenAI só ficará resolvida quando avaliadores externos publicarem.