OpenAI tar de fem første plassene

Arena, selskapet bak den folkebaserte modellrangeringen, publiserte 8. oktober en Alignment Index som rangerer 27 modeller etter hvor dårlig agentene deres oppfører seg i stedet for hvor høyt de skårer.

OpenAI holder de fem første plassene. GPT-6.1 Sol leder med 87,9, fulgt av GPT-6 Astra og GPT-6 Luna på 87,8, GPT-6 Sol på 87,6 og GPT-5.6 Sol på 84,2. Anthropics Claude Opus 5.5 er sjette med 83,2, SpaceXAIs Grok 4.7 sjuende med 82,7 og Claude Fable 5.1 niende med 80,1. Googles Gemini 4 Argon er ellevte med 79,4. MiniMax M3 er sist av de 27 med 69,2.

Arena merker tabellen som foreløpig, og grunnlaget er datert 30. september.

Tre måter en agent svikter på

Indeksen veier sammen tre feilrater, alle med lavere som bedre. Uautorisert handling er at agenten gjør noe den ikke har fått lov til. Falsk tilskriving er at den tilskriver en påstand eller et faktum feil kilde. Bedragersk fullføring er at den melder en oppgave ferdig når den ikke er det.

Det er i bedragersk fullføring modellene skiller lag. GPT-6.1 Sol flagges i 2,34 prosent av øktene sine, Claude Opus 5.5 i 6,41 prosent, Gemini 4 Argon i 12,86 prosent og MiniMax M3 i 22,54 prosent — nær ti ganger lederens nivå. Uautorisert handling er langt sjeldnere overalt, fra 0,83 prosent for GPT-6 Astra til 3,45 prosent for Gemini 3.7 Flash. Falsk tilskriving går fra 1,56 til 15,61 prosent.

Hender som skriver på et laptoptastatur ved et trebord
Poengene kommer fra 72 509 økter der besøkende ga agenter ekte oppgaver. Illustrasjonsbilde. Lukas Blazek · pexels · Pexels License

Målt på arbeid noen faktisk ba om

Poengene kommer fra 72 509 økter i selskapets eget Agent Arena, der besøkende gir agenter ekte oppgaver i stedet for å kjøre et fast testsett. Arenas argument for det er at “statiske målestokker bryter sammen så snart modeller kjenner igjen at de testes”.

Den utformingen er også indeksens største begrensning. Fordi arbeidsmengden er det besøkende valgte å be om, måles to modeller ikke nødvendigvis på det samme arbeidet, og sammensetningen kan forskyve seg over tid. Arena publiserer et intervall ved siden av hver poengsum og hver rate, og påpeker at ett og samme flaggede tilfelle kan telle i flere feiltyper, slik at de tre ratene overlapper i stedet for å dele feilene mellom seg.

En runde på 200 millioner samme dag

Arena la frem indeksen sammen med en serie B på 200 millioner dollar til en verdsettelse på 3,1 milliarder, ledet av Lightspeed Venture Partners og Khosla Ventures, med Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, Andreessen Horowitz og Felicis som deltakere. Det er nær en dobling av post money-verdsettelsen på 1,7 milliarder fra serie A på 150 millioner i januar.

TechCrunch melder at den annualiserte inntekten var 30 millioner dollar ved januarrunden og nådde 100 millioner i juni, fra et kommersielt produkt kalt AI Evaluations som ble lansert i september i fjor. Arena sier at “verden trenger en nøytral tredjepart til å måle hvor trygg og alignet KI faktisk er”.

Tomme løpebaner sett ovenfra
Arena publiserer tabellen som foreløpig, med et intervall ved siden av hver poengsum. Illustrasjonsbilde. KoolShooters · pexels · Pexels License

Konflikten ingen har løst

En rangering som selger evalueringstjenester til laboratoriene den rangerer, er ingen uinteressert dommer, og Arenas egen formulering — en nøytral tredjepart — er nettopp påstanden som er verdt å prøve. Ingen av poengene over er reprodusert uavhengig, og indeksen måler flaggede feil, ikke verifiserte.

Det nyttige å følge med på er om laboratoriene begynner å publisere egne tall mot disse tre definisjonene, og om en tidoblet forskjell i bedragersk fullføring overlever møtet med et fast, tilbakeholdt oppgavesett. Gjør den det, har bransjen et målbart problem med agenter som sier at jobben er gjort.