OpenAI rafle les cinq premières places
Arena, l’entreprise derrière le classement participatif de modèles, a publié le 8 octobre un indice d’alignement qui classe 27 modèles selon la mauvaise conduite de leurs agents plutôt que selon leurs performances.
OpenAI occupe les cinq premières places. GPT-6.1 Sol mène avec 87,9, suivi de GPT-6 Astra et GPT-6 Luna à 87,8, GPT-6 Sol à 87,6 et GPT-5.6 Sol à 84,2. Claude Opus 5.5 d’Anthropic est sixième à 83,2, Grok 4.7 de SpaceXAI septième à 82,7 et Claude Fable 5.1 neuvième à 80,1. Gemini 4 Argon de Google est onzième à 79,4. MiniMax M3 ferme les 27 à 69,2.
Arena qualifie le tableau de préliminaire, et les données qui le sous-tendent sont datées du 30 septembre.
Trois façons d’échouer
L’indice combine trois taux de défaillance, tous meilleurs lorsqu’ils sont bas. L’action non autorisée, c’est l’agent qui fait quelque chose qu’il n’avait pas la permission de faire. L’attribution erronée, c’est l’agent qui attribue une affirmation ou un fait à la mauvaise source. L’achèvement trompeur, c’est l’agent qui déclare une tâche terminée alors qu’elle ne l’est pas.
C’est sur l’achèvement trompeur que les modèles se séparent. GPT-6.1 Sol est signalé sur 2,34 % de ses sessions, Claude Opus 5.5 sur 6,41 %, Gemini 4 Argon sur 12,86 % et MiniMax M3 sur 22,54 %, soit près de dix fois le taux du premier. L’action non autorisée est bien plus rare partout, de 0,83 % pour GPT-6 Astra à 3,45 % pour Gemini 3.7 Flash. L’attribution erronée s’étend de 1,56 % à 15,61 %.

Mesuré sur du travail que quelqu’un a vraiment demandé
Les scores proviennent de 72 509 sessions sur l’Agent Arena de l’entreprise, où les visiteurs confient aux agents de vraies tâches au lieu d’exécuter un jeu de tests figé. L’argument d’Arena pour ce choix est que “les bancs d’essai statiques s’effondrent dès que les modèles reconnaissent qu’on les teste”.
Cette conception est aussi la principale limite de l’indice. Puisque la charge de travail est celle que les visiteurs ont choisi de demander, deux modèles ne sont pas nécessairement mesurés sur le même travail, et le mélange peut évoluer. Arena publie une fourchette à côté de chaque score et de chaque taux, et précise qu’un même cas signalé peut compter dans plusieurs modes de défaillance, de sorte que les trois taux se recoupent au lieu de se partager les échecs.
Une levée de 200 millions le même jour
Arena a présenté l’indice en même temps qu’une série B de 200 millions de dollars valorisant l’entreprise 3,1 milliards, menée par Lightspeed Venture Partners et Khosla Ventures, avec la participation de Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, Andreessen Horowitz et Felicis. C’est près du double de la valorisation post-money de 1,7 milliard obtenue lors de sa série A de 150 millions en janvier.
TechCrunch rapporte que le revenu annualisé était de 30 millions de dollars lors du tour de janvier et atteignait 100 millions en juin, grâce à un produit commercial appelé AI Evaluations lancé en septembre de l’an dernier. Arena déclare que “le monde a besoin d’un tiers neutre pour mesurer à quel point l’IA est réellement sûre et alignée”.

Le conflit que personne n’a résolu
Un classement qui vend des services d’évaluation aux laboratoires qu’il classe n’est pas un arbitre désintéressé, et la formule d’Arena elle-même — un tiers neutre — est précisément l’affirmation qu’il faut éprouver. Aucun des scores ci-dessus n’a été reproduit de façon indépendante, et l’indice mesure des défaillances signalées, non vérifiées.
Ce qu’il sera utile de surveiller, c’est si les laboratoires commencent à publier leurs propres chiffres face à ces trois définitions, et si un écart de dix fois sur l’achèvement trompeur survit au contact d’un jeu de tâches figé et tenu à l’écart. S’il y survit, le secteur a un problème mesurable avec des agents qui affirment que le travail est fait.