Fyrtio procent som laboratorierna inte ser

Artificial Analysis publicerade den 4 september version 4.2 av sitt intelligensindex, och den viktigaste förändringen är inte en poäng. Hemlighållna testmängder står nu för 40 procent av indexets vikt, dubbelt så mycket som i version 4.1. Den hemliga delen utgörs av AA-Briefcase, AA-Omniscience och lösningarna till CritPt, och Artificial Analysis säger att andelen ska växa igen i version 5.

Resonemanget är enkelt. Ett index byggt på offentliga tester går att optimera mot, avsiktligt eller genom att träningsdata förorenas, och en modell som i praktiken redan har sett provet mäts inte. Att hålla svaren hemliga är det enda försvar en oberoende utvärderare har.

Artificial Analysis beskriver v4.2 som en mellanversion som tidigarelägger delar av den planerade version 5 för att indexet ska hålla jämna steg med utvecklingen.

Vad som kom in och vad som gick ut

Två utvärderingar tillkom. AA-Briefcase är företagets eget test av agentbaserat kunskapsarbete, byggt tillsammans med branschexperter kring realistiska flerstegsprojekt och bedömt med en blandning av bedömningsmatris och parvis jämförelse i uppgiftslösning, analytisk kvalitet och presentation. GDP.pdf, byggt av Surge AI, prövar professionellt dokumentresonemang i ett enda svarssteg över 100 pdf-filer från tio områden, där modellen måste väva ihop belägg spridda över 4 592 sidor text, tabeller, diagram, fotnoter och undantag.

En analytiker som granskar diagram på en stor skärm
AA-Briefcase bedömer agentbaserat kunskapsarbete efter uppgiftslösning, analytisk kvalitet och presentation. Leeloo The First · pexels · Pexels License

En utvärdering försvann. GPQA Diamond, mängden med naturvetenskapligt resonemang på forskarnivå som funnits på frontmodellernas modellkort i två år, togs bort — Artificial Analysis kallar den en utmärkt utvärdering som nu är mättad. Samtidigt gick AA-LCR till version 1.1 med egen bedömningsprompt och rättade svarsnycklar, och GDPval-AA v2 och AA-Briefcase fick bättre urval och en omankrad Elo-skala så att betygen håller sig stabila när nya modeller tillkommer.

Ordningen efter ombygget

I det ombyggda indexet leder Anthropics Claude Fable 5.1. OpenAI:s GPT-6 Astra ligger tvåa, med vad Artificial Analysis anger som ungefär fyra poängs förbättring mot OpenAI:s föregående bidrag. Meta är tredje laboratorium, före SpaceXAI, Moonshots Kimi, Z.AI och Google.

Detta är oberoende mätningar, inte siffror från tillverkarna: Artificial Analysis kör varje utvärdering själv via modellernas offentliga API:er. Det är just därför en sådan siffra väger, medan ett laboratoriums egen resultattabell inte gör det.

Utskrivna diagram och ett kalkylblad på ett skrivbord
Poäng från version 4.2 går inte att jämföra med version 4.1, eftersom komponenter och vikter ändrades. Max Vakhtbovych · pexels · Pexels License

Varför versionsnumren spelar roll här

En följd förtjänar att sägas rakt ut. Eftersom både komponenter och vikter ändrades går en poäng i v4.2 inte att jämföra med en poäng i v4.1. En modell som ser ut att ha vunnit eller tappat mark mellan versionerna kan helt enkelt ha mätts på ett annat sätt, och att ta bort ett mättat test pressar rent mekaniskt ihop toppen av skalan.

Det man ska följa är version 5, där Artificial Analysis sagt att den hemliga andelen växer ytterligare. Bytet företaget gör är öppenhet mot tillförlitlighet: ju mer av indexet allmänheten inte kan granska, desto svårare är det att spela mot — och desto svårare att kontrollera.