Deux résultats, un même ensemble de modèles

Mercor a publié jeudi des références humaines pour une série de tâches comptables simplifiées, et la comparaison est déséquilibrée. Douze comptables juniors, tous agréés et avec en moyenne environ cinq ans et demi d’expérience, ont obtenu 37 % en moyenne sur quatre scénarios de clôture mensuelle, avec des résultats individuels allant de zéro à près de 90 % et des durées de 30 à 180 minutes par tâche. Mercor affirme que Claude Opus 5 a obtenu 100 % sur ses vingt tentatives, chacune bouclée en moins de dix minutes.

Dix-huit mois plus tôt, dit Mercor, les modèles se situaient sous la moyenne humaine sur ces mêmes tâches.

C’est un chiffre. L’autre se trouve dans le test complet dont ces tâches ont été simplifiées, et il est nettement moins flatteur.

Ce que dit la version difficile

APEX-Accounting, construit par Mercor avec l’éditeur de logiciels financiers Ramp, compte 160 tâches réparties sur dix entreprises simulées, avec en moyenne 7,5 fichiers d’entrée par tâche et 2 186 critères de notation rédigés par des professionnels de la comptabilité. Sur cette suite, le tableau de Mercor place Claude Opus 5.5 à 61,8 %, Fable 5.1 à 61,0 % et GPT-6 Astra à 57,9 %, chacun avec une marge d’erreur proche de quatre points.

Des rangées de classeurs sur des étagères de bureau
APEX-Accounting pose 160 tâches sur dix entreprises simulées. Photo d'illustration. Zulfugar Karimov · pexels · Pexels License

Les chiffres de constance sont la lecture la plus dure. Chaque modèle est exécuté huit fois par tâche. Le modèle le plus constant a réussi une tâche sur les huit exécutions dans seulement 2,6 % des cas, et aucun modèle n’a entièrement résolu près de 60 % des tâches sur une quelconque exécution. Mercor indique qu’environ sept échecs sur dix des trois meilleurs modèles sont des échecs de raisonnement, et non des défauts à trouver un fichier ou à suivre une consigne.

Pourquoi l’écart entre les deux chiffres est l’information

Les tâches simplifiées isolent ce que les modèles actuels font sans conteste bien : lire beaucoup de fichiers avec soin, ne pas perdre un chiffre, et faire ce que la consigne disait. Ce sont de vraies compétences comptables, et un humain qui les exécute à la onzième heure d’affilée les exécute moins bien qu’une machine qui n’a pas de onzième heure.

Ce que les tâches simplifiées retirent, c’est tout ce qui rend une clôture difficile : le jugement sur le chiffre qui cloche, l’appel à la personne qui l’a passé, le fait de savoir que ce client-là enregistre toujours la charge à payer en retard. Mercor le dit explicitement : les auteurs notent que les tâches ne mesurent qu’un sous-ensemble des compétences comptables et excluent la communication avec le client et le contexte tacite.

Deux personnes discutant à une table de café avec des tasses
Le test exclut la communication avec le client et le contexte tacite. Photo d'illustration. August de Richelieu · pexels · Pexels License

Cette réserve porte beaucoup, et elle mérite de rester accrochée au 100 %.

À qui appartient ce test

Aucun des deux chiffres n’est indépendant. Mercor est une place de marché qui vend du travail humain expert aux laboratoires d’IA pour exactement ce type de données, et Ramp vend des logiciels financiers. Un test montrant que les modèles sont proches sans y être est un test qui plaide pour davantage de données d’experts, c’est-à-dire pour le produit de Mercor. Cela ne rend pas les mesures fausses — les grilles ont été écrites par des professionnels de grands cabinets comptables, et la notation est faite par un juge modèle qui, selon l’entreprise, rejoint les correcteurs humains dans 97 % des cas — mais c’est l’évaluation d’un fournisseur sur un marché où il vend.

Les tâches sont par ailleurs fixes et publiques, ce qui signifie que leur valeur se dégrade à mesure qu’elles entrent dans les données d’entraînement. 61,8 % en octobre 2026 est une affirmation sur ce mois-ci.

Ce qu’il faut suivre, c’est la colonne Pass^8 plutôt que la moyenne du titre. Un modèle qui clôture correctement six fois sur huit n’a pas clôturé. Il a produit quelque chose qu’un contrôleur doit encore vérifier, et c’est précisément la part que le 100 % ne couvre pas.