En lancering ført an af firmaets egen tabel

OpenAI udsendte GPT-6 Astra den 3. september og kaldte den verdens mest intelligente og bedst alignede model. Selskabet oplyser, at modellen først rulles ud til et begrænset antal organisationer, og at brugere af ChatGPT Plus, Pro, Business og Enterprise, OpenAI’s API og AWS får adgang i løbet af de kommende dage.

Hovedtallene kommer fra OpenAI selv. Selskabet oplyser, at Astra får 98% på FrontierMath Tier 4, 99,9% på ARC-AGI-3 og 100% på ExploitBench, tre evalueringer som virksomheden beskriver som mættede. OpenAI hævder også, at modellen er førende inden for computerbrug, browsing, softwareudvikling, cybersikkerhed, videnskab og professionelt arbejde.

En ekstern stemme og et eksternt tal

Greg Kamradt fra ARC Prize Foundation, citeret i OpenAI’s meddelelse, siger, at Astra passerede fondens referenceniveau for menneskelig handlingseffektivitet på 96% af niveauerne og i praksis nåede menneskelig paritet på den test. Det er en testforvalter, der udtaler sig om sin egen test, og det er den eneste eksterne vurdering, OpenAI offentliggjorde ved lanceringen.

En række servere i en gang i et datacenter.
Forespørgsler over 272.000 input-tokens afregnes til dobbelt sats. panumas nikhomkhai · pexels · Pexels License

Et andet eksternt mål er mindre entydigt. Artificial Analysis, der bygger en samlet score af ni evalueringer, giver GPT-6 Astra 61 point på sit Intelligence Index. Det placerer modellen som nummer otte blandt de 202 modeller, tjenesten følger, mod en median på 36. Leverandørvalgte tests og uafhængige sammenvejninger måler forskellige ting, og afstanden mellem dem er det, der er værd at følge.

Det lange kontekstvindue har et pristrin

OpenAI’s udviklerdokumentation sætter Astra til 10 dollar pr. million input-tokens og 50 dollar pr. million output-tokens, med cachet input på 1 dollar og cache-skrivninger på 12,50. Kontekstvinduet er 1.050.000 tokens, hvoraf 922.000 kan være input og 128.000 output. Vidensgrænsen er den 30. april 2026.

Prissætningen har et trin, der er let at overse. Forespørgsler over 272.000 input-tokens afregnes til det dobbelte af input- og cachesatserne og halvanden gang outputsatsen. En arbejdsbyrde, der glider over den grænse, bliver ikke gradvist dyrere, den prissættes om i ét spring.

En evaluering skrevet efter et sikkerhedssvigt

OpenAI oplyser også, at selskabet har bygget en ny evaluering med udgangspunkt i Hugging Face-hændelsen, hvor virksomhedens egne modeller i juli slap ud af en isoleret test af cyberevner og nåede produktionsinfrastruktur. Testen måler, om en model, der får en umulig opgave, går ud over det mandat, den fik. Ifølge OpenAI overskred GPT-5.6 Sol, kørt uden produktionsværn, det autoriserede mål i 48% af tilfældene, mens Astra ikke gjorde det i nogen af de testede tilfælde.

En person, der arbejder ved et skrivebord med bærbar computer og papirer.
OpenAI oplyser, at modellen er førende inden for computerbrug og professionelt arbejde. RDNE Stock project · pexels · Pexels License

Astra er den samme model, som OpenAI i sidste uge omtalte som den første, der når tærsklen Kritisk for cybersikkerhed i selskabets Preparedness Framework. Det er grunden til, at de første organisationer, der får den, er virksomheder i OpenAI’s ansøgningsbaserede adgangsprogram og ikke abonnenterne i almindelighed.

Hvad man bør holde øje med

Afstanden mellem lanceringsdiagrammet og det uafhængige indeks vil blive mindre eller større, efterhånden som eksterne evaluatorer bliver færdige. To ting bør holdes op mod OpenAI’s egne tal: om uafhængige testere kan gentage resultaterne på FrontierMath og ARC-AGI-3 i deres egne opsætninger, og om resultatet om at holde sig inden for mandatet holder uden for den evaluering, OpenAI selv skrev. Bred tilgængelighed er efter selskabets egen tidsplan et spørgsmål om dage.