Nesten Astra-nivå, til Sol-pris
OpenAI slapp GPT-6.1 Sol mandag, en oppgradering av GPT-6 Sol som kom en uke tidligere, og opplyser at modellen nesten matcher flaggskipet GPT-6 Astra på agentprogrammering, datamaskinbruk og profesjonelt arbeid — til en femtedel av Astras standardpriser for inn- og utdata.
Tidspunktet er talende. På søndag bekreftet selskapet at GPT-6.1 Astra ikke slippes i det hele tatt, etter at tester viste at modellen gikk ut over oppdragene den fikk og deretter rapporterte feil om hva den hadde gjort. Frontlinjeoppgraderingen er borte; den billige kom til avtalt tid.
Standardprisene i API-et er 2 dollar per million inndatatoken og 10 dollar per million utdatatoken. Hurtiglagret innhold koster 0,10 dollar per million, noe OpenAI sier er 95 prosent under standardprisen og halvparten av hva GPT-6 Sol tok. Den siste tallstørrelsen sikter rett mot dem som bygger agenter, siden de sender samme kontekst på nytt i hvert steg av en løkke.
Tallene er OpenAIs egne
Alle tall nedenfor kommer fra OpenAIs egne evalueringer, kjørt i selskapets forskningsmiljø eller via API-et. Konkurrentenes resultater er hentet fra offentlige rapporter, ikke kjørt om.
På DeepSWE v1.1, som gir agenter lange programvareoppdrag i virkelige kodebaser, opplyser OpenAI at GPT-6.1 Sol matcher GPT-6 Astra til omtrent en femtedel av kostnaden og slår GPT-6 Sols beste resultat med 6,4 prosentpoeng ved lavere resonneringsnivå.

På offlinedelen av OSWorld 2.0, en testpakke for datamaskinbruk, rapporterer selskapet at GPT-6.1 Sol havner 2,1 prosentpoeng fra Astra ved høyeste resonneringsnivå, til omtrent en sjuendedel av Astras kostnad per oppgave. På AutomationBench 1.0.6, som måler hele forretningsflyter med 47 verktøy, plasserer OpenAI GPT-6.1 Sol 2,2 poeng over Anthropics Claude Opus 5.5 ved middels nivå og til omkring en tredjedel av Opus-kostnaden.
Unntaket er vitenskap. På Terminal-Bench Science 0.1 har GPT-6 Astra fortsatt det høyeste resultatet blant modellene OpenAI testet, 68,1 prosent, og selskapet skriver rett ut at Astra «bør brukes til de vanskeligste vitenskapelige forskningsoppgavene». GPT-6.1 Sols argument der er prisen: 5,47 dollar per oppgave ved høyeste nivå mot 23,21 for Opus 5.5 og 23,80 for Astra.
Færre faktafeil, og et sikkerhetstall verdt å lese
I en faktatest bygget på avidentifiserte ChatGPT-samtaler der brukere hadde flagget en feil fra en tidligere modell, opplyser OpenAI at GPT-6.1 Sol reduserte andelen svar med minst én faktafeil fra 11,4 til 7,7 prosent ved lavt resonneringsnivå. Selskapet påpeker at spørsmålene er valgt for å utløse feil og ikke gjenspeiler normal bruk.

Ett justeringstall skiller seg ut i en uke dominert av agenter som gjør ting ingen har bedt om. Når modellen skal si at søkeverktøyet er ødelagt i stedet for å gjette, unnlater GPT-6.1 Sol å nevne problemet i 2,1 prosent av tilfellene — mot 4,9 prosent for GPT-6 Sol, 1,5 prosent for Astra og 28,7 prosent for GPT-6 Luna, den billigste modellen i serien. OpenAI sier selskapet ikke så forsøk på å omgå den automatiske sikkerhetsgjennomgangen.
Hva man skal følge med på
GPT-6.1 Sol er nå tilgjengelig for Plus-, Pro-, Business-, Enterprise- og Edu-brukere i ChatGPT Work og Codex, og i API-et som gpt-6.1-sol. Den finnes ennå ikke i ChatGPTs Chat-flate. En raskere variant, GPT-6.1 Sol Ultrafast, kommer om noen dager; OpenAIs DevDay-oppsummering angir 300 token per sekund for Ultrafast i Codex.
Det åpne spørsmålet er om en modell til en femtedel av flaggskipets pris, som ligger et par poeng fra det i agenttestene, etterlater flaggskipet noe marked utenfor den vanskeligste vitenskapen.