Resultatet
GPT-6 Astra (Max) toppar Arena.ai:s lista Code Arena: WebDev med 1 797 poäng, före Claude Fable 5.1 (Max) på 1 762 och Claude Opus 5 (Max) på 1 688. Alibabas Qwen3.8-Max-0902 ligger fyra på 1 686 och Moonshots Kimi K3 (Max) femma på 1 674. Listan uppdaterades senast den 5 september och bygger på 650 961 röster över 126 modeller.
OpenAI släppte Astra den 3 september, vilket gör detta till en placering intjänad på två dygns röstning.
Så fungerar listan
Code Arena är en publikröstad rankning av Elo-typ. En besökare skickar in en webbutvecklingsuppgift, får två anonyma försök och röstar på det den föredrar; modellernas identitet avslöjas efter rösten. Arena uppger att uppgifterna omfattar agentbaserade kodningsflöden som kräver resonemang i flera steg och användning av verktyg, enligt CryptoBriefings sammanfattning.
Den konstruktionen har en verklig styrka och en verklig svaghet, och båda spelar roll här.

Vad 35 poäng betyder och inte betyder
Styrkan är att uppgifterna inte är en fast datamängd som ett labb kan träna mot. Ingen kan memorera utvärderingen, eftersom utvärderingen är vad en främling skrev in i morse.
Svagheten är vad en röst faktiskt mäter. En röstare tittar hastigt på två renderade resultat och väljer ett. Det belönar utdata som ser färdig ut: kompletta layouter, rimlig formgivning, självsäker struktur. Det belönar inte kod som är korrekt under förhållanden röstaren inte testade, säker mot indata röstaren inte gav, eller möjlig för någon annan att underhålla om ett halvår. Ett försprång på 35 Elo-poäng på en preferenslista säger vilken utdata folk gillade bäst, och stannar där.
Det är också värt att notera att ett betyg bara betyder något mot betyg tagna samma dag. Listor som denna rör sig löpande i takt med rösterna, och avståndet mellan etta och tvåa den 5 september är inget varaktigt faktum om någon av modellerna.
Prisvinkeln
De två i toppen är prissatta identiskt, till 10 dollar per miljon indatatoken och 50 dollar per miljon utdatatoken, med kontextfönster på en miljon token, enligt CryptoBriefings redogörelse för listan. Det är den del av resultatet som har kommersiella följder: på en lista som många köpare faktiskt konsulterar kom den nya ettan inte med ett pristillägg.

Var de kinesiska modellerna hamnar
Att fjärde och femte platsen går till Qwen3.8-Max och Kimi K3 är det tystare fyndet. Båda ligger efter täten, men med mindre marginal än avståndet mellan etta och trea, på en lista röstad av dem som dök upp och inte av ett labbs egen utvärderingsrigg.
Vad man bör följa
Om Astra håller placeringen när röstantalet växer — tidiga placeringar på preferenslistor är brusiga, och en två dagar gammal modell har ett nyhetsövertag som klingar av. Den mer informativa signalen blir var dessa fem modeller ligger på samma lista om en månad, och om något med publicerade vikter sluter det avstånd som återstår.