Vad som ändrades
Artificial Analysis publicerade version 4.3 av sitt Intelligence Index den 7 september, två dagar efter version 4.2. Företaget beskriver båda som mellansläpp tidigarelagda från en planerad version 5, och takten är själva poängen: indexet revideras snabbare än modellerna det rangordnar släpps.
Två utvärderingar byttes. Terminal-Bench gick från v2.1 till v4.0, som beskrivs som svårare terminaluppgifter över flera domäner. Och testet τ³-Banking ersattes av AutomationBench-AA, ett test för automatisering av affärsflöden med hemlig testmängd, som ärver samma vikt på 5 procent.
Kategorivikterna låg still: Agenter 30 procent, Generellt 30 procent, Kodning 20 procent och Vetenskapligt resonemang 20 procent. Det som rörde sig är hur stor del av indexet ett labb inte kan se. Utvärderingar med hemliga testmängder står nu för 45 procent av helheten, upp från 40 procent i version 4.2 — som i sin tur var en fördubbling mot version 4.1.

Rangordningen
I version 4.3 delar Claude Fable 5.1 och GPT-6 Astra förstaplatsen på 53 poäng. Därefter kommer Claude Opus 5 på 51, Claude Fable 5 på 50, Metas Muse Spark 1.3 på 48 och GPT-5.6 Sol på 47.
Det är en förändring mot version 4.2, publicerad två dagar tidigare, där Fable 5.1 ledde ensam. Artificial Analysis tillskriver förskjutningen de punkter där modellerna skiljer sig åt: Fable 5.1 får högre poäng på AA-Briefcase och SciCode, medan Astra får högre poäng på Terminal-Bench v4.0 och på nytillkomna AutomationBench-AA. Byt in ett svårare terminaltest och ett agentiskt automationstest, och avståndet krymper.
Indexet vilar nu på tio utvärderingar: AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA-Omniscience och AA-LCR v1.1.
Siffran under delade förstaplatsen
Den mer användbara uppgiften är inte delningen utan vad den kostar. Artificial Analysis anger GPT-6 Astra till 3,26 dollar per uppgift mot Claude Fable 5.1:s 7,63 — 57 procent lägre för samma uppmätta poäng.
Det är en jämförelse en köpare kan agera på, och också en som behöver sina förbehåll. Kostnad per uppgift beror på hur många token en modell lägger på att tänka, vilket varierar med uppgiftsmixen; en annan uppsättning om tio utvärderingar hade gett ett annat förhållande.

Att läsa ett index som rör sig så här ofta
Det här är oberoende mätningar, inte poäng som leverantörerna själva rapporterar, och det är vad som gör dem värda att läsa. Men två revisioner på två dagar påminner om vad ett sammanvägt index faktiskt är: en viktad uppfattning om vilka förmågor som räknas. Byt ut de ingående testerna, och rangordningen ändras utan att någon modell ändrats.
Den växande andelen hemliga testmängder är ett direkt svar på den bräckligheten. Om nästan halva indexet inte går att träna mot blir en poäng svårare att tillverka. Det betyder också att allmänheten inte kan granska den halvan — avvägningen Artificial Analysis har valt, och värd att sätta ord på.
Att hålla ögonen på
Om version 5 kommer med samma beståndsdelar eller ännu en omgruppering, och om Astra och Fable behåller sin delade plats. En förstaplats som byter händer genom ett testbyte snarare än genom en ny modell säger lika mycket om indexet som om modellerna.