To resultater, samme sæt modeller

Mercor offentliggjorde torsdag menneskelige referenceværdier for et sæt forenklede regnskabsopgaver, og sammenligningen er skæv. Tolv juniorrevisorer, alle autoriserede og med i gennemsnit omkring fem et halvt års erfaring, lå på 37 procent i gennemsnit over fire scenarier for månedsafslutning, med individuelle resultater fra nul til omkring 90 procent og tider på mellem 30 og 180 minutter per opgave. Mercor siger, at Claude Opus 5 fik 100 procent i alle tyve forsøg og klarede hvert enkelt på under ti minutter.

Atten måneder tidligere, siger Mercor, lå modellerne under det menneskelige gennemsnit på de samme opgaver.

Det er det ene tal. Det andet findes i den fulde test, opgaverne er forenklet fra, og det er betydeligt mindre smigrende.

Hvad den svære version siger

APEX-Accounting, bygget af Mercor sammen med finanssoftwarefirmaet Ramp, er 160 opgaver fordelt på ti simulerede virksomheder, med i gennemsnit 7,5 inputfiler per opgave og 2.186 bedømmelseskriterier skrevet af regnskabsfolk. På den suite placerer Mercors tabel Claude Opus 5.5 på 61,8 procent, Fable 5.1 på 61,0 og GPT-6 Astra på 57,9, hver med en fejlmargin tæt på fire point.

Rækker af ringbind på kontorhylder
APEX-Accounting stiller 160 opgaver fordelt på ti simulerede virksomheder. Illustrationsfoto. Zulfugar Karimov · pexels · Pexels License

Konsistenstallene er den hårdere læsning. Hver model køres otte gange per opgave. Den mest konsistente model fik en opgave rigtig alle otte gange i blot 2,6 procent af tilfældene, og ingen model løste fuldt ud næsten 60 procent af opgaverne i nogen kørsel. Mercor siger, at omkring syv ud af ti fejl hos de tre bedste modeller er ræsonnementsfejl og ikke fejl i at finde en fil eller følge en instruks.

Hvorfor afstanden mellem de to tal er historien

De forenklede opgaver isolerer det, nutidens modeller utvetydigt er gode til: at læse mange filer omhyggeligt, ikke at tabe et tal og at gøre det, instruksen sagde. Det er reelle regnskabsfærdigheder, og et menneske, der udfører dem i ellevte time i træk, gør det dårligere end en maskine, der ikke har nogen ellevte time.

Hvad de forenklede opgaver fjerner, er alt det, der gør en afslutning svær: vurderingen af hvilket tal der er forkert, opkaldet til den, der bogførte det, viden om at netop denne kunde altid bogfører periodiseringen for sent. Mercor siger det lige ud: forfatterne noterer, at opgaverne kun måler et udsnit af regnskabsfærdigheder og udelader kundekommunikation og tavs kontekst.

To personer der taler ved et cafébord med kaffekopper
Testen udelader kundekommunikation og tavs kontekst. Illustrationsfoto. August de Richelieu · pexels · Pexels License

Det forbehold bærer meget, og det fortjener at blive hængende ved de 100 procent.

Hvis test det er

Ingen af tallene er uafhængige. Mercor er en markedsplads, der sælger ekspert-arbejdskraft til AI-laboratorier til præcis denne slags data, og Ramp sælger finanssoftware. En test, der viser, at modellerne er tæt på, men ikke fremme, er en test, der argumenterer for mere ekspertdata, hvilket er Mercors produkt. Det gør ikke målingerne forkerte — bedømmelsesskemaerne blev skrevet af fagfolk fra store revisionsfirmaer, og bedømmelsen foretages af en modelbaseret dommer, som selskabet siger stemmer overens med menneskelige bedømmere i 97 procent af tilfældene — men det er en leverandørs egen evaluering af et marked, den sælger ind i.

Opgaverne er desuden faste og offentlige, hvilket betyder, at deres værdi forvitrer, efterhånden som de ender i træningsdata. 61,8 procent i oktober 2026 er en påstand om denne måned.

Det, man bør følge, er Pass^8-kolonnen frem for gennemsnittet i overskriften. En model, der lukker regnskabet korrekt seks ud af otte gange, har ikke lukket regnskabet. Den har produceret noget, en controller stadig skal kontrollere, og det er netop den del, de 100 procent ikke dækker.