Två resultat, samma uppsättning modeller
Mercor publicerade på torsdagen mänskliga referensvärden för en uppsättning förenklade redovisningsuppgifter, och jämförelsen är ojämn. Tolv juniora revisorer, samtliga auktoriserade och med i snitt ungefär fem och ett halvt års erfarenhet, snittade 37 procent över fyra månadsbokslutsscenarier, med enskilda resultat från noll till omkring 90 procent och tider på mellan 30 och 180 minuter per uppgift. Mercor säger att Claude Opus 5 fick 100 procent på samtliga tjugo försök och klarade vart och ett på under tio minuter.
Arton månader tidigare, säger Mercor, låg modellerna under det mänskliga snittet på samma uppgifter.
Det är den ena siffran. Den andra finns i det fullständiga test som uppgifterna förenklats från, och den är betydligt mindre smickrande.
Vad den svåra versionen säger
APEX-Accounting, byggt av Mercor tillsammans med finansmjukvarubolaget Ramp, är 160 uppgifter fördelade på tio simulerade företag, med i snitt 7,5 indatafiler per uppgift och 2 186 bedömningskriterier skrivna av yrkesverksamma redovisare. På den sviten placerar Mercors tabell Claude Opus 5.5 på 61,8 procent, Fable 5.1 på 61,0 och GPT-6 Astra på 57,9, var och en med en felmarginal nära fyra punkter.

Konsistenssiffrorna är den tyngre läsningen. Varje modell körs åtta gånger per uppgift. Den mest konsekventa modellen klarade en uppgift alla åtta gångerna bara 2,6 procent av tiden, och ingen modell löste fullt ut nära 60 procent av uppgifterna i någon körning. Mercor säger att ungefär sju av tio misslyckanden hos de tre bästa modellerna är resonemangsfel snarare än misslyckanden att hitta en fil eller följa en instruktion.
Varför glappet mellan siffrorna är nyheten
De förenklade uppgifterna isolerar det som dagens modeller otvetydigt är bra på: att läsa många filer noggrant, att inte tappa ett tal och att göra det instruktionen sade. Det är verkliga redovisningsfärdigheter, och en människa som utför dem elfte timmen i rad gör dem sämre än en maskin som inte har någon elfte timme.
Vad de förenklade uppgifterna tar bort är allt som gör ett bokslut svårt: bedömningen av vilken siffra som är fel, samtalet till den som bokfört den, vetskapen om att just den här kunden alltid bokar upplupna poster sent. Mercor säger det rakt ut: författarna noterar att uppgifterna mäter endast en delmängd av redovisningsfärdigheter och utesluter kundkommunikation och tyst kunskap.

Den reservationen bär mycket vikt, och den bör sitta kvar bredvid de 100 procenten.
Vems test det här är
Ingen av siffrorna är oberoende. Mercor är en marknadsplats som säljer expertarbetskraft till AI-labb för exakt den här sortens data, och Ramp säljer finansmjukvara. Ett test som visar att modellerna är nära men inte framme är ett test som argumenterar för mer expertdata, vilket är Mercors produkt. Det gör inte mätningarna felaktiga — bedömningsmallarna skrevs av yrkesverksamma från stora redovisningsbyråer, och rättningen görs av en modellbaserad bedömare som bolaget säger överensstämmer med mänskliga rättare i 97 procent av fallen — men det är en leverantörs egen utvärdering av en marknad den säljer till.
Uppgifterna är dessutom fasta och offentliga, vilket gör att deras värde urholkas när de hamnar i träningsdata. 61,8 procent i oktober 2026 är ett påstående om den här månaden.
Vad man ska följa är kolumnen Pass^8 snarare än rubrikgenomsnittet. En modell som stänger böckerna korrekt sex gånger av åtta har inte stängt böckerna. Den har producerat något en controller fortfarande måste kontrollera, vilket är just den del de 100 procenten inte täcker.