To resultater, samme sett med modeller

Mercor publiserte torsdag menneskelige referanseverdier for et sett forenklede regnskapsoppgaver, og sammenligningen er skjev. Tolv juniore regnskapsførere, alle autoriserte og med i snitt rundt fem og et halvt års erfaring, oppnådde 37 prosent i snitt over fire scenarier for månedsavslutning, med individuelle resultater fra null til rundt 90 prosent og tider på mellom 30 og 180 minutter per oppgave. Mercor sier Claude Opus 5 fikk 100 prosent på alle tjue forsøk, og fullførte hvert av dem på under ti minutter.

Atten måneder tidligere, sier Mercor, lå modellene under det menneskelige snittet på de samme oppgavene.

Det er det ene tallet. Det andre finnes i den fullstendige testen oppgavene er forenklet fra, og det er betydelig mindre smigrende.

Hva den vanskelige versjonen sier

APEX-Accounting, bygget av Mercor sammen med finansprogramvareselskapet Ramp, er 160 oppgaver fordelt på ti simulerte selskaper, med i snitt 7,5 inndatafiler per oppgave og 2 186 vurderingskriterier skrevet av regnskapsfaglige. På den suiten plasserer Mercors tabell Claude Opus 5.5 på 61,8 prosent, Fable 5.1 på 61,0 og GPT-6 Astra på 57,9, hver med en feilmargin nær fire poeng.

Rader med permer på kontorhyller
APEX-Accounting stiller 160 oppgaver over ti simulerte selskaper. Illustrasjonsfoto. Zulfugar Karimov · pexels · Pexels License

Konsistenstallene er den tyngre lesningen. Hver modell kjøres åtte ganger per oppgave. Den mest konsistente modellen fikk en oppgave riktig alle åtte gangene bare 2,6 prosent av tiden, og ingen modell løste fullt ut nær 60 prosent av oppgavene i noen kjøring. Mercor sier at omtrent sju av ti feil hos de tre beste modellene er resonneringsfeil, ikke feil i å finne en fil eller følge en instruks.

Hvorfor avstanden mellom de to tallene er saken

De forenklede oppgavene isolerer det dagens modeller utvilsomt er gode på: å lese mange filer nøye, å ikke miste et tall, og å gjøre det instruksen sa. Det er reelle regnskapsferdigheter, og et menneske som utfører dem i ellevte time på rad, gjør dem dårligere enn en maskin som ikke har noen ellevte time.

Det de forenklede oppgavene fjerner, er alt som gjør en avslutning vanskelig: vurderingen av hvilket tall som er galt, telefonen til den som førte det, kunnskapen om at akkurat denne kunden alltid bokfører påløpte kostnader sent. Mercor sier det rett ut: forfatterne noterer at oppgavene bare måler et utvalg av regnskapsferdigheter, og utelater kundekommunikasjon og taus kontekst.

To personer som snakker ved et kafébord med kaffekopper
Testen utelater kundekommunikasjon og taus kontekst. Illustrasjonsfoto. August de Richelieu · pexels · Pexels License

Det forbeholdet bærer mye, og det fortjener å bli hengende ved de 100 prosentene.

Hvem testen tilhører

Ingen av tallene er uavhengige. Mercor er en markedsplass som selger ekspert menneskelig arbeidskraft til KI-laboratorier for nøyaktig denne typen data, og Ramp selger finansprogramvare. En test som viser at modellene er nære, men ikke framme, er en test som argumenterer for mer ekspertdata, som er Mercors produkt. Det gjør ikke målingene gale — vurderingsmalene ble skrevet av fagfolk fra store regnskapsselskaper, og poenggivingen gjøres av en modellbasert dommer som selskapet sier samsvarer med menneskelige sensorer i 97 prosent av tilfellene — men det er en leverandørs egen evaluering av et marked den selger inn i.

Oppgavene er dessuten faste og offentlige, noe som betyr at verdien forvitrer etter hvert som de havner i treningsdata. 61,8 prosent i oktober 2026 er en påstand om denne måneden.

Det man bør følge, er Pass^8-kolonnen heller enn gjennomsnittet i overskriften. En modell som lukker bøkene riktig seks av åtte ganger, har ikke lukket bøkene. Den har produsert noe en controller fortsatt må kontrollere, og det er nettopp den delen de 100 prosentene ikke dekker.