Un dixième du prix
Anthropic a publié Claude Haiku 5.5 le 7 octobre, en le présentant comme le petit modèle le moins cher, le plus rapide et le plus capable qu’elle ait livré.
Le prix est l’information. Pour les requêtes allant jusqu’à 100 000 jetons, l’entrée coûte 0,10 dollar le million de jetons et la sortie 0,50. Haiku 4.5 facturait 1,00 et 5,00 dollars, dix fois plus. Au-delà de 100 000 jetons en entrée, le nouveau modèle facture 0,50 et 2,50, soit encore la moitié de l’ancien tarif. Les lectures de cache passent de 0,10 à 0,01 dollar, et les écritures de 1,25 à 0,125.
Anthropic chiffre l’économie moyenne à environ 75%, avec une note de bas de page qui explique le calcul : 90% de moins pour les requêtes sous 100 000 jetons, 50% de moins au-dessus. Le prix de lecture de cache de Sonnet 5.5 a également été divisé par deux au lancement, de 0,20 à 0,10 dollar.
Ce qu’Anthropic dit de ses scores
Tous les chiffres ci-dessous viennent du fournisseur, tirés des évaluations internes d’Anthropic, et aucun n’a été reproduit de façon indépendante.
Sur OSWorld 2.1, le tableau de l’entreprise donne 72,4% à Haiku 5.5 contre 15,7% à Haiku 4.5 et 48,9% à GPT-6 Luna d’OpenAI. Sur Terminal-Bench 4.0, il donne 39,2%, contre 0,0% pour Haiku 4.5 et 16,4% pour GPT-6 Luna. Sur Humanity’s Last Exam sans outils, il rapporte 45,9%, contre 10,2% auparavant.

Sonnet 5.5 reste au-dessus sur chaque ligne — 83,9% sur OSWorld, 70,6% sur Terminal-Bench — ce qui est la raison d’être de la gamme plutôt qu’un défaut. Deux clients sont cités : Box a rapporté un score supérieur de 11 points à celui de Haiku 4.5 pour environ la moitié de la latence, et AlphaSense 0,84 contre 0,76 sur sa propre évaluation Ask in Document.
Un réglage d’effort sur un petit modèle
Haiku 5.5 est le premier modèle de la classe Haiku doté d’un réglage d’effort, la commande qui permet d’échanger de la dépense contre l’intensité de travail du modèle sur une requête. Jusqu’ici c’était une caractéristique des grands modèles Claude.
Cela compte plus qu’il n’y paraît pour le travail auquel Haiku est destiné : classer, extraire, aiguiller, résumer un million de fois le même type de document. Un modèle bon marché doté d’un réglage peut être ajusté par file de traitement plutôt que par application.

La note de bas de page du prix
Un détail adoucit le chiffre du titre. Haiku 5.5 utilise un tokeniseur mis à jour, et Anthropic indique qu’il consomme un peu plus de jetons par tâche que son prédécesseur. Une baisse mesurée par jeton n’est pas tout à fait une baisse mesurée par tâche, et qui calcule l’économie devrait la mesurer sur son propre trafic.
Anthropic ajoute que les garde-fous de cybersécurité du modèle sont plus stricts que ceux de Haiku 4.5 mais plus souples que ceux de Sonnet 5.5, et signale des progrès d’alignement par rapport à la version précédente sans les chiffrer. La fenêtre de contexte n’est pas indiquée.
Où il tourne, et ce qu’il faut suivre
Le modèle est disponible dès maintenant sur Amazon Web Services, Google Cloud et Microsoft Azure, ainsi que sur la plateforme d’Anthropic.
Ce qu’il faut suivre, c’est de savoir si le plancher des petits modèles continue de descendre. Anthropic a placé Haiku 5.5 sur le même terrain que GPT-6 Luna d’OpenAI, et l’API de décision lancée la même semaine par OpenAI facture 0,10 dollar le million de jetons en entrée, la sortie étant gratuite. Le palier bon marché est là où se trouve le volume, et les deux laboratoires semblent désormais le traiter comme une position plutôt que comme une marge.