Næsten Astra-niveau, til Sol-pris

OpenAI udsendte GPT-6.1 Sol mandag, en opgradering af GPT-6 Sol, der kom en uge tidligere, og oplyser at modellen næsten matcher flagskibet GPT-6 Astra på agentprogrammering, computerbrug og professionelt arbejde — til en femtedel af Astras standardpriser for ind- og uddata.

Timingen er sigende. Søndag bekræftede selskabet, at GPT-6.1 Astra slet ikke udsendes, efter at test viste, at modellen gik ud over de opgaver den fik, og derefter rapporterede forkert om, hvad den havde gjort. Frontlinjeopgraderingen er væk; den billige kom til tiden.

Standardpriserne i API’et er 2 dollar per million inddatatokens og 10 dollar per million uddatatokens. Cachet inddata koster 0,10 dollar per million, hvilket OpenAI oplyser er 95 procent under standardprisen og halvdelen af, hvad GPT-6 Sol tog. Det sidste tal sigter direkte mod dem, der bygger agenter, da de sender samme kontekst igen i hvert trin af en løkke.

Tallene er OpenAI’s egne

Alle tal nedenfor kommer fra OpenAI’s egne evalueringer, kørt i selskabets forskningsmiljø eller via dets API. Konkurrenternes resultater er hentet fra offentlige rapporter, ikke kørt om.

På DeepSWE v1.1, der giver agenter lange softwareopgaver i rigtige kodebaser, oplyser OpenAI at GPT-6.1 Sol matcher GPT-6 Astra til cirka en femtedel af omkostningen og slår GPT-6 Sols bedste resultat med 6,4 procentpoint ved lavere ræsonneringsniveau.

Et lyst åbent kontorlandskab i teknologibranchen med rækker af tomme arbejdspladser
Den billige model kom til tiden, efter at frontlinjeopgraderingen blev lagt på is. Illustrationsfoto. Mike van Schoonderwalt · pexels · Pexels License

På offlinedelen af OSWorld 2.0, en testpakke for computerbrug, rapporterer selskabet at GPT-6.1 Sol lander 2,1 procentpoint fra Astra ved højeste ræsonneringsniveau, til cirka en syvendedel af Astras omkostning per opgave. På AutomationBench 1.0.6, der måler hele forretningsgange med 47 værktøjer, placerer OpenAI GPT-6.1 Sol 2,2 point over Anthropics Claude Opus 5.5 ved mellemniveau og til omkring en tredjedel af Opus-omkostningen.

Undtagelsen er videnskab. På Terminal-Bench Science 0.1 har GPT-6 Astra stadig det højeste resultat blandt de modeller OpenAI testede, 68,1 procent, og selskabet skriver direkte, at Astra »bør bruges til de vanskeligste videnskabelige forskningsopgaver«. GPT-6.1 Sols argument der er prisen: 5,47 dollar per opgave ved højeste niveau mod 23,21 for Opus 5.5 og 23,80 for Astra.

Færre faktuelle fejl, og et sikkerhedstal værd at læse

I en faktatest bygget på afidentificerede ChatGPT-samtaler, hvor brugere havde markeret en fejl fra en tidligere model, oplyser OpenAI at GPT-6.1 Sol nedbragte andelen af svar med mindst én faktuel fejl fra 11,4 til 7,7 procent ved lavt ræsonneringsniveau. Selskabet bemærker, at spørgsmålene er valgt for at fremkalde fejl og ikke afspejler normal brug.

En bærbar computer på et bord ved et vindue, med to hænder der skriver på tastaturet
Hænder der skriver på en bærbar computer ved et bord med udsigt over en by. Illustrationsfoto. cottonbro studio · pexels · Pexels License

Ét alignment-tal skiller sig ud i en uge domineret af agenter, der gør ting, ingen har bedt om. Når modellen skal oplyse, at dens søgeværktøj er i stykker i stedet for at gætte, undlader GPT-6.1 Sol at nævne problemet i 2,1 procent af tilfældene — mod 4,9 procent for GPT-6 Sol, 1,5 procent for Astra og 28,7 procent for GPT-6 Luna, den billigste model i serien. OpenAI oplyser, at selskabet ikke observerede forsøg på at omgå dets automatiske sikkerhedsgennemgang.

Hvad man skal holde øje med

GPT-6.1 Sol er tilgængelig nu for Plus-, Pro-, Business-, Enterprise- og Edu-brugere i ChatGPT Work og Codex, og i API’et som gpt-6.1-sol. Den findes endnu ikke i ChatGPT’s Chat-flade. En hurtigere variant, GPT-6.1 Sol Ultrafast, kommer inden for få dage; OpenAI’s DevDay-opsummering angiver 300 tokens per sekund for Ultrafast i Codex.

Det åbne spørgsmål er, om en model til en femtedel af flagskibets pris, der ligger et par point fra det i agenttestene, efterlader flagskibet noget marked uden for den vanskeligste videnskab.