Fyrre procent, laboratorierne ikke ser
Artificial Analysis offentliggjorde den 4. september version 4.2 af sit intelligensindeks, og den vigtigste ændring er ikke en score. Testsæt, der holdes skjult, står nu for 40 procent af indeksets vægt, dobbelt så meget som i version 4.1. Den skjulte del består af AA-Briefcase, AA-Omniscience og løsningerne til CritPt, og Artificial Analysis siger, at andelen vokser igen i version 5.
Ræsonnementet er enkelt. Et indeks bygget på offentlige tests kan optimeres imod, bevidst eller ved at træningsdata forurenes, og en model, der i praksis allerede har set prøven, bliver ikke målt. At holde svarene hemmelige er det eneste forsvar, en uafhængig evaluator har.
Artificial Analysis beskriver v4.2 som en mellemudgave, der fremrykker dele af den planlagte version 5, så indekset følger med fronten.
Hvad der kom ind, og hvad der gik ud
To evalueringer kom til. AA-Briefcase er firmaets eget sæt til agentbaseret vidensarbejde, bygget med brancheeksperter omkring realistiske projekter i flere trin og bedømt med en blanding af bedømmelsesmatrix og parvis sammenligning på opgaveløsning, analytisk kvalitet og præsentation. GDP.pdf, bygget af Surge AI, prøver professionel dokumentræsonnering i én runde over 100 pdf-filer fra ti områder, hvor modellen skal samle belæg spredt over 4.592 sider med tekst, tabeller, diagrammer, fodnoter og undtagelser.

Én evaluering forsvandt. GPQA Diamond, sættet med naturvidenskabelig ræsonnering på ph.d.-niveau, som i to år har stået på frontmodellernes modelkort, blev fjernet — Artificial Analysis kalder det en fremragende evaluering, der nu er mættet. Samtidig gik AA-LCR til version 1.1 med egen bedømmelsesprompt og rettede facitlister, og GDPval-AA v2 og AA-Briefcase fik bedre stikprøver og en genforankret Elo-skala, så bedømmelserne holder sig stabile, når nye modeller kommer til.
Rækkefølgen efter ombygningen
I det ombyggede indeks fører Anthropics Claude Fable 5.1. OpenAIs GPT-6 Astra ligger nummer to, med hvad Artificial Analysis opgør som omkring fire points fremgang fra OpenAIs forrige bidrag. Meta er tredje laboratorium, foran SpaceXAI, Moonshots Kimi, Z.AI og Google.
Det er uafhængige målinger, ikke tal opgivet af leverandørerne: Artificial Analysis kører hver evaluering selv gennem modellernes offentlige API’er. Det er netop derfor, et sådant tal vejer, hvor et laboratoriums egen resultattabel ikke gør.

Hvorfor versionsnumrene betyder noget her
Én følge fortjener at blive sagt lige ud. Fordi både komponenter og vægte er ændret, kan en score i v4.2 ikke sammenlignes med en i v4.1. En model, der ser ud til at have vundet eller tabt terræn mellem versionerne, kan simpelthen være målt anderledes, og at fjerne en mættet test presser rent mekanisk toppen af skalaen sammen.
Det, man skal følge, er version 5, hvor Artificial Analysis har sagt, at den skjulte andel vokser yderligere. Byttet, firmaet foretager, er åbenhed mod troværdighed: jo mere af indekset offentligheden ikke kan efterse, desto sværere er det at spille mod — og desto sværere at efterprøve.