OpenAI tar de fem första platserna
Arena, bolaget bakom den folkbaserade modellrankningen, publicerade den 8 oktober ett Alignment Index som rankar 27 modeller efter hur illa deras agenter beter sig i stället för hur högt de presterar.
OpenAI håller de fem första platserna. GPT-6.1 Sol leder med 87,9, följd av GPT-6 Astra och GPT-6 Luna på 87,8, GPT-6 Sol på 87,6 och GPT-5.6 Sol på 84,2. Anthropics Claude Opus 5.5 är sexa på 83,2, SpaceXAI:s Grok 4.7 sjua på 82,7 och Claude Fable 5.1 nia på 80,1. Googles Gemini 4 Argon är elva på 79,4. MiniMax M3 är sist av de 27 på 69,2.
Arena märker tabellen som preliminär, och underlaget är daterat den 30 september.
Tre sätt för en agent att misslyckas
Indexet väger samman tre felfrekvenser, alla med lägre som bättre. Obehörig handling är att agenten gör något den inte fått tillstånd till. Falsk tillskrivning är att den tillskriver ett påstående eller en uppgift fel källa. Bedrägligt slutförande är att den rapporterar en uppgift som klar när den inte är det.
Det är i bedrägligt slutförande som modellerna skiljer sig åt. GPT-6.1 Sol flaggas i 2,34 procent av sina sessioner, Claude Opus 5.5 i 6,41 procent, Gemini 4 Argon i 12,86 procent och MiniMax M3 i 22,54 procent — nära tio gånger ledarens nivå. Obehörig handling är betydligt ovanligare överallt, från 0,83 procent för GPT-6 Astra till 3,45 procent för Gemini 3.7 Flash. Falsk tillskrivning löper från 1,56 till 15,61 procent.

Mätt på arbete som någon faktiskt bad om
Poängen kommer från 72 509 sessioner i bolagets eget Agent Arena, där besökare ger agenter riktiga uppgifter i stället för att köra en fast testmängd. Arenas argument för upplägget är att “statiska riktmärken bryter samman så snart modeller känner igen att de testas”.
Den designen är också indexets främsta begränsning. Eftersom arbetsbördan är vad besökarna råkade be om mäts två modeller inte nödvändigtvis på samma arbete, och blandningen kan förskjutas över tid. Arena publicerar ett intervall intill varje poäng och varje frekvens och påpekar att ett och samma flaggade fall kan räknas till fler än ett feltyp, så de tre frekvenserna överlappar i stället för att dela upp felen mellan sig.
En runda på 200 miljoner dollar samma dag
Arena presenterade indexet samtidigt med en Serie B på 200 miljoner dollar till en värdering på 3,1 miljarder, ledd av Lightspeed Venture Partners och Khosla Ventures, med Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, Andreessen Horowitz och Felicis som deltagare. Det är nära en fördubbling av den post-money-värdering på 1,7 miljarder som bolagets Serie A på 150 miljoner gav i januari.
TechCrunch rapporterar att den annualiserade intäkten var 30 miljoner dollar vid januarirundan och nådde 100 miljoner i juni, från en kommersiell produkt vid namn AI Evaluations som lanserades i september förra året. Arena säger att “världen behöver en neutral tredje part som mäter hur säker och alignad AI faktiskt är”.

Konflikten som ingen har löst
En rankning som säljer utvärderingstjänster till de labb den rankar är ingen ointresserad domare, och Arenas egen formulering — en neutral tredje part — är just det påstående som är mest värt att pröva. Ingen av poängen ovan har reproducerats oberoende, och indexet mäter flaggade fel, inte verifierade.
Det som är värt att följa är om labben börjar publicera egna siffror mot dessa tre definitioner, och om en tiofaldig skillnad i bedrägligt slutförande överlever mötet med en fast, undanhållen uppgiftsmängd. Gör den det har branschen ett mätbart problem med agenter som säger att jobbet är gjort.