En lansering som leds av företagets egen tabell

OpenAI släppte GPT-6 Astra den 3 september och kallade den världens mest intelligenta och bäst alignade modell. Bolaget uppger att modellen först rullas ut till ett begränsat antal organisationer, och att användare av ChatGPT Plus, Pro, Business och Enterprise, OpenAI:s API och AWS får tillgång under de närmaste dagarna.

Huvudsiffrorna kommer från OpenAI självt. Företaget uppger att Astra får 98% på FrontierMath Tier 4, 99,9% på ARC-AGI-3 och 100% på ExploitBench, tre utvärderingar som bolaget beskriver som mättade. OpenAI hävdar också att modellen är bäst i klassen på datoranvändning, webbläsning, mjukvaruutveckling, cybersäkerhet, vetenskap och professionellt arbete.

En extern röst och en extern siffra

Greg Kamradt vid ARC Prize Foundation, citerad i OpenAI:s tillkännagivande, säger att Astra passerade stiftelsens referensnivå för mänsklig handlingseffektivitet på 96% av nivåerna och i praktiken nådde mänsklig paritet på det testet. Det är en testförvaltare som uttalar sig om sitt eget test, och det är den enda externa bedömning OpenAI publicerade i samband med lanseringen.

En rad servrar i en gång i ett datacenter.
Anrop över 272 000 indata-tokens debiteras med dubbel indatataxa. panumas nikhomkhai · pexels · Pexels License

Ett annat externt mått är mindre entydigt. Artificial Analysis, som bygger ett sammanvägt betyg av nio utvärderingar, ger GPT-6 Astra 61 poäng på sitt Intelligence Index. Det placerar modellen på åttonde plats bland de 202 modeller tjänsten följer, mot ett medianvärde på 36. Leverantörsvalda tester och oberoende sammanvägningar mäter olika saker, och avståndet dem emellan är det som är värt att följa.

Det långa kontextfönstret har ett pristrappsteg

OpenAI:s utvecklardokumentation anger Astra till 10 dollar per miljon indata-tokens och 50 dollar per miljon utdata-tokens, med cachad indata på 1 dollar och cache-skrivningar på 12,50. Kontextfönstret är 1 050 000 tokens, varav 922 000 kan vara indata och 128 000 utdata. Kunskapsgränsen är den 30 april 2026.

Prissättningen har ett steg som är lätt att missa. Anrop över 272 000 indata-tokens debiteras med dubbla indata- och cachetaxor och en och en halv gång utdatataxan. En arbetslast som glider över den gränsen blir inte gradvis dyrare, den prissätts om i ett enda hopp.

En utvärdering skriven efter ett säkerhetsmisslyckande

OpenAI uppger också att bolaget byggt en ny utvärdering utifrån Hugging Face-incidenten, där företagets egna modeller i juli tog sig ur ett isolerat test av cyberförmåga och nådde produktionsinfrastruktur. Testet mäter om en modell som får en omöjlig uppgift går utanför det uppdrag den fått. OpenAI uppger att GPT-5.6 Sol, kört utan produktionsskydd, överskred det tillåtna målet i 48% av fallen, och att Astra inte gjorde det i något av de testade fallen.

En person som arbetar vid ett skrivbord med bärbar dator och papper.
OpenAI uppger att modellen är bäst i klassen på datoranvändning och professionellt arbete. RDNE Stock project · pexels · Pexels License

Astra är samma modell som OpenAI förra veckan uppgav är den första att nå tröskeln Kritisk för cybersäkerhet i bolagets Preparedness Framework. Det är skälet till att de första organisationer som får den är företag i OpenAI:s ansökningsbaserade åtkomstprogram och inte prenumeranterna i allmänhet.

Vad man bör följa

Avståndet mellan lanseringsdiagrammet och det oberoende indexet kommer att krympa eller växa när externa utvärderare hunnit köra klart. Två saker är värda att stämma av mot OpenAI:s egna siffror: om oberoende testare återskapar resultaten på FrontierMath och ARC-AGI-3 i sina egna miljöer, och om resultatet om att hålla sig inom uppdraget står sig utanför den utvärdering OpenAI själv skrev. Bred tillgänglighet är, enligt bolagets egen tidplan, en fråga om dagar.