Um modelo mais barato no topo da linha

A Anthropic publicou o Claude Opus 5.5 na terça-feira e afirmou que ele rende a um nível semelhante ao do Claude Fable 5.1, o maior modelo da empresa, na maior parte do trabalho. O preço andou na direção oposta: a entrada cai de 5 para 4 dólares por milhão de tokens, e a saída de 25 para 20.

O corte mais acentuado está na entrada em cache, que desce de 0,50 para 0,20 dólar por milhão de tokens. É uma redução de 60 por cento que pesa sobretudo para agentes que reproduzem contextos longos a cada passo. A Anthropic estima o efeito combinado em cerca de 40 por cento menos em cargas de trabalho comuns, e diz que o modelo gera texto aproximadamente 30 por cento mais rápido que o Opus 5.

Os números, e de quem são

Todos os números abaixo são da Anthropic, medidos no banco de testes da própria empresa, e nenhum foi reproduzido de forma independente até agora.

A companhia relata 66,4 por cento no Terminal-Bench 4.0, contra 52,3 por cento do Opus 5. No FrontierCode v1.1 indica 54,4 por cento, ante 48,0. O OSWorld 2.0, que mede um modelo a operar um computador, sobe para 81,8 por cento desde 74,0. No GDPval-AA v2.1, uma avaliação de trabalho de escritório pontuada por Elo, a Anthropic coloca o Opus 5.5 em 1846 contra os 1708 do Opus 5.

Racks de servidores num corredor de centro de dados
A entrada em cache cai 60 por cento, o corte que mais pesa para agentes longos. Imagem ilustrativa. Brett Sayles · pexels · Pexels License

A Anthropic disse à TechCrunch que é “o modelo com melhor desempenho que já testámos”. O interessante não são as pontuações isoladas, mas o formato delas: um lançamento de meio de ciclo que se aproxima do carro-chefe em vez de superar por pouco o seu antecessor.

O trabalho de segurança que veio junto

A Anthropic diz que o Opus 5.5 obteve o melhor resultado entre os seus modelos na auditoria automática de comportamento da empresa, e que as tentativas de contornar os limites de contenção caíram 85 por cento face ao Opus 5. A empresa também alega maior resistência à injeção de instruções, a falha que está por trás da maioria dos incidentes com agentes deste ano.

As salvaguardas são invulgarmente específicas. Tarefas de cibersegurança são encaminhadas para o antigo Opus 4.8, a menos que o utilizador tenha passado por um programa alargado de verificação em cibersegurança. A capacidade em biologia é descrita como comparável à do Claude Mythos 5.1 e fica atrás de um novo programa de verificação em ciências da vida. O raciocínio prolongado passa a ser obrigatório, e mantém-se a proteção que esconde os traços de raciocínio contra a destilação.

Uma engenheira a rever código num monitor grande
A Anthropic relata 66,4 por cento no Terminal-Bench 4.0, contra 52,3 do Opus 5. Imagem ilustrativa. ThisIsEngineering · pexels · Pexels License

Onde funciona

O modelo está disponível desde o lançamento na plataforma da Anthropic como claude-opus-5-5, e na Amazon Web Services, na Google Cloud e no Microsoft Azure. O GitHub acrescentou-o ao Copilot no mesmo dia. A Anthropic diz oferecer retenção zero de dados e que a saída leva a marca de água exigida pela Lei de IA da União Europeia.

O lançamento chega três dias depois de o presidente-executivo da Anthropic, Dario Amodei, ter defendido publicamente abrandar o ritmo do trabalho em capacidades para que a investigação em alinhamento consiga acompanhar, e no mesmo dia em que a OpenAI baixou os seus próprios preços com o GPT-6 Sol e o Luna.

O que observar

O Claude Sonnet 5.5 e o Claude Haiku 5.5 estão prometidos para “as próximas semanas”, o que levaria as mesmas mudanças de preço e latência ao resto da linha. O outro ponto a observar é a medição independente: a tabela da Anthropic é o relato de um fornecedor sobre o seu próprio produto, e a posição real do modelo face ao Fable 5.1 e ao novo patamar da OpenAI só ficará resolvida quando avaliadores externos publicarem.