Førti prosent laboratoriene ikke ser
Artificial Analysis publiserte 4. september versjon 4.2 av intelligensindeksen sin, og den viktigste endringen er ikke en poengsum. Testsett som holdes skjult, står nå for 40 prosent av indeksens vekt, dobbelt så mye som i versjon 4.1. Den skjulte delen består av AA-Briefcase, AA-Omniscience og løsningene til CritPt, og Artificial Analysis sier andelen skal vokse igjen i versjon 5.
Resonnementet er enkelt. En indeks bygget på offentlige tester kan optimeres mot, enten bevisst eller ved at treningsdata forurenses, og en modell som i praksis allerede har sett prøven, blir ikke målt. Å holde svarene skjult er det eneste forsvaret en uavhengig evaluator har.
Artificial Analysis beskriver v4.2 som en mellomutgave som framskynder deler av den planlagte versjon 5, slik at indeksen holder tritt med fronten.
Hva som kom inn, og hva som gikk ut
To evalueringer kom til. AA-Briefcase er selskapets eget sett for agentbasert kunnskapsarbeid, bygget med bransjeeksperter rundt realistiske prosjekter i flere trinn og vurdert med en blanding av vurderingsmatrise og parvis sammenligning på oppgaveløsning, analytisk kvalitet og presentasjon. GDP.pdf, laget av Surge AI, prøver profesjonell dokumentresonnering i én runde over 100 pdf-filer fra ti områder, der modellen må sy sammen belegg spredt over 4 592 sider med tekst, tabeller, diagrammer, fotnoter og unntak.

Én evaluering forsvant. GPQA Diamond, settet med naturvitenskapelig resonnering på doktorgradsnivå som i to år har stått på modellkortene til frontmodellene, ble fjernet — Artificial Analysis kaller det en fremragende evaluering som nå er mettet. Samtidig gikk AA-LCR til versjon 1.1 med egen vurderingsprompt og rettede fasitnøkler, og GDPval-AA v2 og AA-Briefcase fikk bedre utvalg og en reforankret Elo-skala, slik at vurderingene holder seg stabile når nye modeller kommer til.
Rekkefølgen etter ombyggingen
I den ombygde indeksen leder Anthropics Claude Fable 5.1. OpenAIs GPT-6 Astra ligger på andreplass, med det Artificial Analysis oppgir som om lag fire poengs framgang fra OpenAIs forrige bidrag. Meta er tredje laboratorium, foran SpaceXAI, Moonshots Kimi, Z.AI og Google.
Dette er uavhengige målinger, ikke tall oppgitt av leverandørene: Artificial Analysis kjører hver evaluering selv gjennom modellenes offentlige API-er. Det er nettopp derfor et slikt tall veier, mens et laboratoriums egen resultattabell ikke gjør det.

Hvorfor versjonsnumrene betyr noe her
Én følge fortjener å sies rett ut. Fordi både komponenter og vekter er endret, kan en poengsum i v4.2 ikke sammenlignes med en i v4.1. En modell som ser ut til å ha vunnet eller tapt terreng mellom versjonene, kan rett og slett ha blitt målt annerledes, og å fjerne en mettet test presser rent mekanisk sammen toppen av skalaen.
Det man skal følge med på, er versjon 5, der Artificial Analysis har sagt at den skjulte andelen vokser videre. Byttet selskapet gjør, er åpenhet mot pålitelighet: jo mer av indeksen offentligheten ikke kan granske, desto vanskeligere er den å spille mot — og desto vanskeligere å etterprøve.