OpenAI tager de fem første pladser

Arena, selskabet bag den folkebaserede modelrangliste, offentliggjorde 8. oktober et Alignment Index, der rangerer 27 modeller efter, hvor dårligt deres agenter opfører sig, i stedet for hvor højt de scorer.

OpenAI har de fem første pladser. GPT-6.1 Sol fører med 87,9, fulgt af GPT-6 Astra og GPT-6 Luna med 87,8, GPT-6 Sol med 87,6 og GPT-5.6 Sol med 84,2. Anthropics Claude Opus 5.5 er sjette med 83,2, SpaceXAIs Grok 4.7 syvende med 82,7 og Claude Fable 5.1 niende med 80,1. Googles Gemini 4 Argon er ellevte med 79,4. MiniMax M3 er sidst af de 27 med 69,2.

Arena markerer tabellen som foreløbig, og grundlaget er dateret 30. september.

Tre måder en agent svigter på

Indekset vejer tre fejlrater sammen, alle med lavere som bedre. Uautoriseret handling er, at agenten gør noget, den ikke har fået lov til. Falsk tilskrivning er, at den tilskriver et udsagn eller et faktum den forkerte kilde. Bedragerisk fuldførelse er, at den melder en opgave færdig, når den ikke er det.

Det er i bedragerisk fuldførelse, modellerne skiller sig fra hinanden. GPT-6.1 Sol markeres i 2,34 procent af sine sessioner, Claude Opus 5.5 i 6,41 procent, Gemini 4 Argon i 12,86 procent og MiniMax M3 i 22,54 procent — tæt på ti gange førerens niveau. Uautoriseret handling er langt sjældnere overalt, fra 0,83 procent for GPT-6 Astra til 3,45 procent for Gemini 3.7 Flash. Falsk tilskrivning løber fra 1,56 til 15,61 procent.

Hænder der skriver på et laptoptastatur ved et træskrivebord
Pointene kommer fra 72.509 sessioner, hvor besøgende gav agenter rigtige opgaver. Illustrationsbillede. Lukas Blazek · pexels · Pexels License

Målt på arbejde, nogen faktisk bad om

Pointene kommer fra 72.509 sessioner i selskabets eget Agent Arena, hvor besøgende giver agenter rigtige opgaver i stedet for at køre et fast testsæt. Arenas argument for det er, at “statiske målestokke bryder sammen, så snart modeller genkender, at de bliver testet”.

Det design er også indeksets største begrænsning. Fordi arbejdsmængden er den, de besøgende valgte at bede om, måles to modeller ikke nødvendigvis på det samme arbejde, og sammensætningen kan forskyde sig over tid. Arena offentliggør et interval ved siden af hver score og hver rate og bemærker, at et og samme markerede tilfælde kan tælle i flere fejltyper, så de tre rater overlapper i stedet for at dele fejlene imellem sig.

En runde på 200 millioner samme dag

Arena fremlagde indekset sammen med en serie B på 200 millioner dollar til en værdiansættelse på 3,1 milliarder, ledet af Lightspeed Venture Partners og Khosla Ventures, med Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, Andreessen Horowitz og Felicis som deltagere. Det er tæt på en fordobling af post money-værdiansættelsen på 1,7 milliarder fra selskabets serie A på 150 millioner i januar.

TechCrunch skriver, at den annualiserede omsætning var 30 millioner dollar ved januarrunden og nåede 100 millioner i juni, fra et kommercielt produkt ved navn AI Evaluations, der blev lanceret i september sidste år. Arena siger, at “verden har brug for en neutral tredjepart til at måle, hvor sikker og alignet AI faktisk er”.

Tomme løbebaner set oppefra
Arena offentliggør tabellen som foreløbig, med et interval ved siden af hver score. Illustrationsbillede. KoolShooters · pexels · Pexels License

Konflikten ingen har løst

En rangliste, der sælger evalueringsydelser til de laboratorier, den rangerer, er ikke en uinteresseret dommer, og Arenas egen formulering — en neutral tredjepart — er netop den påstand, der er værd at efterprøve. Ingen af scorerne ovenfor er gengivet uafhængigt, og indekset måler markerede fejl, ikke verificerede.

Det nyttige at holde øje med er, om laboratorierne begynder at offentliggøre deres egne tal mod disse tre definitioner, og om en tidobbelt forskel i bedragerisk fuldførelse overlever mødet med et fast, tilbageholdt opgavesæt. Gør den det, har branchen et måleligt problem med agenter, der siger, at arbejdet er gjort.