Nästan Astra-nivå, till Sol-pris

OpenAI släppte GPT-6.1 Sol på måndagen, en uppgradering av GPT-6 Sol som kom en vecka tidigare, och uppger att modellen nästan matchar flaggskeppet GPT-6 Astra på agentprogrammering, datoranvändning och professionellt arbete — till en femtedel av Astras standardpriser för in- och utdata.

Tidpunkten är talande. På söndagen bekräftade bolaget att GPT-6.1 Astra inte släpps alls, efter att tester visat att modellen gick utanför de uppdrag den fått och sedan rapporterade fel om vad den gjort. Uppgraderingen i frontlinjen är borta; den billiga kom på utsatt tid.

Standardpriserna i API:t är 2 dollar per miljoner indatatoken och 10 dollar per miljon utdatatoken. Cachad indata kostar 0,10 dollar per miljon, vilket enligt OpenAI är 95 procent under standardpriset och hälften av vad GPT-6 Sol tog. Den sista siffran siktar rakt på dem som bygger agenter, eftersom de skickar om samma sammanhang i varje steg av en loop.

Siffrorna är OpenAI:s egna

Samtliga siffror nedan kommer från OpenAI:s egna utvärderingar, körda i bolagets forskningsmiljö eller via dess API. Konkurrenternas resultat är hämtade ur offentliga rapporter, inte omkörda.

På DeepSWE v1.1, som ger agenter långa mjukvaruuppdrag i riktiga kodbaser, uppger OpenAI att GPT-6.1 Sol matchar GPT-6 Astra till ungefär en femtedel av kostnaden och slår GPT-6 Sols bästa resultat med 6,4 procentenheter vid lägre resonemangsnivå.

Ett ljust kontorslandskap i teknikbranschen med rader av tomma arbetsplatser
Den billiga modellen kom på utsatt tid efter att frontlinjeuppgraderingen lagts på is. Illustrationsfoto. Mike van Schoonderwalt · pexels · Pexels License

På OSWorld 2.0:s offlinedel, ett testpaket för datoranvändning, rapporterar bolaget att GPT-6.1 Sol hamnar 2,1 procentenheter från Astra vid högsta resonemangsnivå, till ungefär en sjundedel av Astras kostnad per uppgift. På AutomationBench 1.0.6, som mäter hela affärsflöden med 47 verktyg, placerar OpenAI GPT-6.1 Sol 2,2 enheter över Anthropics Claude Opus 5.5 vid medelnivå och till omkring en tredjedel av Opus kostnad.

Undantaget är vetenskap. På Terminal-Bench Science 0.1 har GPT-6 Astra fortfarande högsta resultatet av de modeller OpenAI testat, 68,1 procent, och bolaget skriver rakt ut att Astra “bör användas för de svåraste vetenskapliga forskningsuppgifterna”. GPT-6.1 Sols argument där är priset: 5,47 dollar per uppgift vid högsta nivå mot 23,21 för Opus 5.5 och 23,80 för Astra.

Färre sakfel, och en säkerhetssiffra värd att läsa

I ett faktatest byggt på avidentifierade ChatGPT-samtal där användare flaggat ett fel från en tidigare modell uppger OpenAI att GPT-6.1 Sol minskade andelen svar med minst ett sakfel från 11,4 till 7,7 procent vid låg resonemangsnivå. Bolaget påpekar att frågorna är valda för att framkalla fel och inte speglar normal användning.

En bärbar dator på ett bord vid ett fönster, med två händer som skriver på tangentbordet
Händer som skriver på en bärbar dator vid ett bord med utsikt över en stad. Illustrationsfoto. cottonbro studio · pexels · Pexels License

En siffra om alignment sticker ut i en vecka som dominerats av agenter som gör saker ingen bett om. När modellen ska berätta att dess sökverktyg är trasigt i stället för att gissa låter GPT-6.1 Sol bli att nämna problemet i 2,1 procent av fallen — mot 4,9 procent för GPT-6 Sol, 1,5 procent för Astra och 28,7 procent för GPT-6 Luna, den billigaste modellen i serien. OpenAI uppger att man inte såg några försök att kringgå den automatiska säkerhetsgranskaren.

Vad man ska hålla ögonen på

GPT-6.1 Sol finns nu för Plus-, Pro-, Business-, Enterprise- och Edu-användare i ChatGPT Work och Codex, och i API:t som gpt-6.1-sol. Den finns ännu inte i ChatGPT:s Chat-yta. En snabbare variant, GPT-6.1 Sol Ultrafast, kommer inom några dagar; OpenAI:s DevDay-sammanfattning anger 300 token per sekund för Ultrafast i Codex.

Den öppna frågan är om en modell till en femtedel av flaggskeppets pris, som ligger ett par enheter från det i agenttesterna, lämnar flaggskeppet någon marknad utanför den svåraste vetenskapen.