Quarante pour cent que les laboratoires ne voient pas

Artificial Analysis a publié le 4 septembre la version 4.2 de son indice d’intelligence, et le principal changement n’est pas un score. Les jeux de tests conservés secrets pèsent désormais 40 % de l’indice, deux fois plus qu’en version 4.1. Cette part est constituée d’AA-Briefcase, d’AA-Omniscience et des solutions de CritPt, et Artificial Analysis annonce qu’elle augmentera encore en version 5.

Le raisonnement est simple. Un indice bâti sur des tests publics peut être optimisé, volontairement ou par contamination des données d’entraînement, et un modèle qui a de fait déjà vu l’épreuve n’est pas mesuré. Garder les réponses privées est la seule défense d’un évaluateur indépendant.

Artificial Analysis présente la v4.2 comme une livraison intermédiaire qui avance des éléments de la version 5 prévue, afin que l’indice suive le rythme de la frontière.

Ce qui entre et ce qui sort

Deux évaluations ont été ajoutées. AA-Briefcase est le jeu maison de travail intellectuel agentique, construit avec des experts du secteur autour de projets réalistes en plusieurs étapes et noté par un mélange de grille et de comparaison par paires sur la réussite de la tâche, la qualité analytique et la présentation. GDP.pdf, construit par Surge AI, teste le raisonnement documentaire professionnel en un seul tour sur 100 PDF issus de dix domaines, en obligeant le modèle à rassembler des éléments dispersés sur 4 592 pages de texte, tableaux, graphiques, notes de bas de page et exclusions.

Une analyste examinant des graphiques sur un grand écran
AA-Briefcase note le travail agentique sur la réussite de la tâche, la qualité analytique et la présentation. Leeloo The First · pexels · Pexels License

Une évaluation est sortie. GPQA Diamond, le jeu de raisonnement scientifique de niveau doctoral qui figure depuis deux ans sur les fiches des modèles de frontière, a été retiré : Artificial Analysis le qualifie d’évaluation exceptionnelle désormais saturée. En parallèle, AA-LCR est passé en version 1.1 avec son propre prompt de notation et des corrigés rectifiés, et GDPval-AA v2 et AA-Briefcase ont reçu un meilleur échantillonnage et une échelle Elo réancrée pour que les notes restent stables à mesure que de nouveaux modèles arrivent.

L’ordre après la refonte

Sur l’indice refondu, Claude Fable 5.1 d’Anthropic est en tête. GPT-6 Astra d’OpenAI arrive deuxième, avec ce qu’Artificial Analysis décrit comme un gain d’environ quatre points sur l’entrée précédente d’OpenAI. Meta est le troisième laboratoire, devant SpaceXAI, Kimi de Moonshot, Z.AI et Google.

Ce sont des mesures indépendantes et non des chiffres communiqués par les éditeurs : Artificial Analysis exécute chaque évaluation lui-même via les API publiques des modèles. C’est précisément pour cela qu’un tel chiffre pèse là où le tableau de résultats d’un laboratoire ne pèse pas.

Des graphiques imprimés et un tableur posés sur un bureau
Les scores de la version 4.2 ne se comparent pas à ceux de la 4.1, les composants et pondérations ayant changé. Max Vakhtbovych · pexels · Pexels License

Pourquoi les numéros de version comptent ici

Une conséquence mérite d’être dite nettement. Comme les composants et les pondérations ont changé, un score en v4.2 ne se compare pas à un score en v4.1. Un modèle qui semble avoir progressé ou reculé entre les deux a peut-être simplement été mesuré autrement, et le retrait d’un test saturé comprime mécaniquement le haut de l’échelle.

Ce qu’il faut suivre, c’est la version 5, où Artificial Analysis annonce une part secrète encore plus grande. L’échange consenti est la transparence contre l’intégrité : plus la part de l’indice que le public ne peut pas inspecter est grande, plus il est difficile à manipuler — et difficile à auditer.