Un tarif de milieu de gamme, un score de haut de gamme
Anthropic a publié Claude Sonnet 5.5 lundi, six jours après son modèle phare Opus 5.5, et ses propres chiffres placent le modèle le moins cher à deux points du plus cher sur l’évaluation que l’entreprise utilise pour le travail intellectuel général. Sur GDPval-AA v2.1, Anthropic annonce 1 844 pour Sonnet 5.5 contre 1 846 pour Opus 5.5.
Le prix au token n’a pas bougé. Sonnet 5.5 coûte 2 dollars le million de tokens en entrée et 10 dollars le million en sortie, comme Sonnet 5 et la moitié de ce que facture Opus 5.5. Les lectures de cache restent à 0,20 dollar le million. L’argument d’Anthropic porte sur la facture totale et non sur le tarif : l’entreprise affirme que le modèle produit ses réponses plus de 30 % plus vite et termine une tâche pour jusqu’à 30 % de moins, parce qu’il dépense moins de tokens et fait moins d’appels d’outils en chemin.
Les chiffres de programmation bougent beaucoup
Sur Terminal-Bench 4.0, une évaluation de programmation par agents, Anthropic annonce 70,6 % pour Sonnet 5.5 contre 10,3 % pour Sonnet 5 — un écart qui dit autant du mauvais comportement de l’ancien modèle dans cet environnement précis que des qualités du nouveau. CursorBench 4.0 passe de 34,1 à 55,5 %, Opus 5.5 étant à 57,8. FrontierCode 1.1 monte de 42,4 à 46,2 %, où Opus 5.5 reste devant à 54,4. Sur OSWorld 2.1, le test d’utilisation de l’ordinateur, Sonnet 5.5 annonce 80,1 % contre 81,8 % pour Opus 5.5.

Tous ces chiffres sont ceux d’Anthropic, publiés avec le modèle et non produits par un évaluateur extérieur. Aucun n’a encore été reproduit de façon indépendante.
Les clients cités par Anthropic décrivent la même amélioration avec leurs propres mots. Le vice-président IA de Box a dit que le modèle était 2,4 fois plus rapide et consommait 12 % de tokens en moins au total. Slack a fait état d’environ 14 % de tokens de sortie en moins. Lovable, dont le chiffre d’affaires annualisé a dépassé 600 millions de dollars ce mois-ci, a dit que son agent de programmation avait besoin d’environ un tiers d’appels d’outils en moins pour finir un travail. Zendesk a indiqué que les tickets d’assistance étaient traités 20 % plus vite.
Des garde-fous emprntés au modèle phare
Sonnet 5.5 est le premier modèle Sonnet livré avec des classificateurs destinés à empêcher quiconque d’extraire son raisonnement pour entraîner un concurrent, une défense contre la distillation que Anthropic réservait jusqu’ici à ses plus grands modèles. Ses garde-fous de cybersécurité sont réglés au niveau d’Opus 5.5, et Anthropic dit que les demandes les plus risquées sont renvoyées vers Sonnet 5 plutôt que traitées par le nouveau modèle. Les défenseurs agréés peuvent demander l’accès à la capacité restreinte via un Cyber Verification Program.

C’est une posture prudente pour un modèle bon marché, et elle arrive dans un mois où des agents tournant sur des systèmes de pointe ont atteint des portails publics et des registres de code sans que personne le leur demande.
Ce qu’il faut suivre
Le modèle est disponible sur la plateforme Claude et sur AWS, Google Cloud et Microsoft Azure sous l’identifiant claude-sonnet-5-5. Les chiffres qui valent l’attente sont les chiffres indépendants. L’affirmation d’Anthropic sur le coût par tâche repose sur le fait que le modèle choisit d’en faire moins, et c’est précisément le comportement qui varie le plus entre l’environnement d’un fournisseur et le code d’un client. Les classements publics de programmation et les indices d’intelligence chiffreront l’écart en quelques jours.