Un modèle moins cher en haut de gamme

Anthropic a publié Claude Opus 5.5 mardi et affirme qu’il atteint un niveau proche de celui de Claude Fable 5.1, son plus grand modèle, sur l’essentiel du travail. Le tarif, lui, a bougé dans l’autre sens : l’entrée tombe de 5 à 4 dollars par million de jetons, et la sortie de 25 à 20.

La baisse la plus forte porte sur l’entrée mise en cache, qui passe de 0,50 à 0,20 dollar par million de jetons. Cette réduction de 60 pour cent compte surtout pour les agents qui rejouent de longs contextes à chaque étape. Anthropic chiffre l’effet combiné à environ 40 pour cent de moins sur des charges de travail courantes, et dit que le modèle produit du texte à peu près 30 pour cent plus vite qu’Opus 5.

Les chiffres, et à qui ils appartiennent

Tous les chiffres qui suivent viennent d’Anthropic, mesurés sur son propre banc d’essai, et aucun n’a encore été reproduit de façon indépendante.

L’entreprise annonce 66,4 pour cent sur Terminal-Bench 4.0, contre 52,3 pour cent pour Opus 5. Sur FrontierCode v1.1, elle donne 54,4 pour cent, contre 48,0 auparavant. OSWorld 2.0, qui évalue un modèle pilotant un bureau, monte à 81,8 pour cent depuis 74,0. Sur GDPval-AA v2.1, une évaluation du travail de bureau notée en Elo, Anthropic place Opus 5.5 à 1846 face aux 1708 d’Opus 5.

Des baies de serveurs dans une allée de centre de données
L'entrée en cache baisse de 60 pour cent, la coupe qui compte le plus pour les agents longs. Image d'illustration. Brett Sayles · pexels · Pexels License

Anthropic a déclaré à TechCrunch qu’il s’agit du “modèle le plus performant que nous ayons testé à ce jour”. L’intéressant n’est pas chaque score pris isolément mais leur forme : une sortie de milieu de cycle qui se rapproche du vaisseau amiral au lieu de dépasser de peu son propre prédécesseur.

Le travail de sûreté livré avec

Anthropic indique qu’Opus 5.5 a obtenu le meilleur résultat de ses modèles à l’audit comportemental automatisé de l’entreprise, et que les tentatives de contourner les limites de confinement ont chuté de 85 pour cent par rapport à Opus 5. La société revendique aussi une meilleure résistance à l’injection d’instructions, la défaillance à l’origine de la plupart des incidents d’agents cette année.

Les garde-fous sont inhabituellement précis. Les tâches de cybersécurité sont renvoyées vers l’ancien Opus 4.8, sauf si l’utilisateur a passé un programme élargi de vérification en cybersécurité. La capacité en biologie est décrite comme comparable à celle de Claude Mythos 5.1 et placée derrière un nouveau programme de vérification en sciences du vivant. Le raisonnement étendu devient obligatoire, et la protection qui masque les traces de raisonnement contre la distillation est maintenue.

Une ingénieure relisant du code sur un grand écran
Anthropic annonce 66,4 pour cent sur Terminal-Bench 4.0, contre 52,3 pour Opus 5. Image d'illustration. ThisIsEngineering · pexels · Pexels License

Où il tourne

Le modèle est disponible dès le lancement sur la plateforme d’Anthropic sous le nom claude-opus-5-5, ainsi que sur Amazon Web Services, Google Cloud et Microsoft Azure. GitHub l’a ajouté à Copilot le même jour. Anthropic dit proposer une rétention de données nulle et indique que la sortie porte le filigrane exigé par le règlement européen sur l’IA.

La sortie intervient trois jours après que le directeur général d’Anthropic, Dario Amodei, a plaidé publiquement pour ralentir le travail sur les capacités afin que la recherche en alignement puisse suivre, et le jour même où OpenAI a baissé ses propres prix avec GPT-6 Sol et Luna.

Ce qu’il faut surveiller

Claude Sonnet 5.5 et Claude Haiku 5.5 sont promis “dans les prochaines semaines”, ce qui étendrait les mêmes changements de prix et de latence au reste de la gamme. L’autre point à surveiller est la mesure indépendante : le tableau d’Anthropic est le récit d’un fournisseur sur son propre produit, et la position réelle du modèle face à Fable 5.1 et au nouveau palier d’OpenAI ne sera tranchée qu’à la publication des évaluateurs extérieurs.