Ett forskningsavtal, inte en produktlansering
OpenAI uppgav den 6 oktober att bolaget samarbetar direkt med ett litet antal mjukvarubolag för att göra deras svåraste kundarbetsflöden till tränings- och utvärderingsuppgifter för sina agenter. Först ut är Ironclad, en plattform för avtalshantering. Poängen, enligt OpenAI, är att träna modeller “att förstå ett företags affärsregler, utföra arbetsflöden i flera steg och verifiera att arbetet uppfyller de ursprungliga kraven”.
Det är en annan sorts affär än ett API-partnerskap. Ironclad bidrog med driftade instanser av sin egen produkt där modellerna kunde öva, och bolagets anställda — plus OpenAI-personal som använder Ironclad internt — hjälpte till att ta fram 11 uppgifter inom juridik, kommersiellt arbete och inköp. Exemplen som nämns omfattar att sätta upp sekretessavtal, skapa godkännandeprocesser för inköp och uppdatera en återanvändbar avtalsklausul så att den speglar den jurisdiktion beställaren väljer. OpenAI uppskattar att var och en skulle ta en van användare omkring 30 till 40 minuter.

Siffrorna, och vad de mäter
Varje uppgift bedömdes mot mellan 8 och 50 kriterier beroende på komplexitet. OpenAI uppgav att forskarna sedan byggde syntetiska träningsuppgifter kring representativa arbetsflöden och använde förstärkningsinlärning för att förbättra modellerna genom övning.
I jämförelsen mellan GPT-6 Astra med Max-resonemang och GPT-5.6 Sol med High-resonemang — inställningarna där vardera presterade bäst — rapporterade OpenAI ett medelvärde på 55,0 procent för Astra mot 41,6 procent för Sol, och en uppskattad genomsnittstid per försök på 19,2 minuter mot 37,0. En icke släppt intern modell som användes i utvecklingen av Astra fick 63,7 procent.
Fotnoterna spelar roll. OpenAI anger att resultaten omfattar de 11 uppgifterna och inte alla Ironclad-flöden, och att tiderna är “simulerade uppskattningar baserade på antagna hastigheter för modellens bearbetning och generering, inte uppmätta tidsbesparingar hos kunder”. De syntetiska träningsuppgifterna byggdes från avtal i SEC:s EDGAR-databas efter filtrering för personuppgifter; OpenAI säger att bolaget inte använde kunddata, sina egna interna avtal eller icke-offentliga avtal från Ironclads kunder.

Varför det är värt att notera
Rubriksiffran är mindre intressant än upplägget. Frontlabben håller på att få slut på svåra, verifierbara uppgifter som liknar riktigt arbete, och publika benchmarks blir förorenade eller mättade. Att köpa tillgång till en leverantörs levande produkt, dess domänexperter och dess definition av framgång är ett svar på det — och det ger labbet en privat utvärderingsmängd som ingen annan kan köra.
Ironclads tekniska chef Sunita Verma formulerade begränsningen snarare än segern: “Agenter behöver förstå hela avtalslivscykeln, inklusive hur affärsflöden hänger ihop samtidigt som de kontroller team förlitar sig på bevaras.” OpenAI:s egen text går längre och säger att felläget — en agent som tappar bort en affärsregel halvvägs — “understryker varför mänsklig tillsyn fortfarande spelar roll” och varför en komplett avtalsplattform “förblir nödvändig”.
OpenAI bjuder in fler mjukvarubolag att ansöka, och ber om en konkret uppgift som misslyckas, belägg för var agenter fallerar på den, och personer som kan arbetet. Det som ska följas är hur många leverantörer som bedömer att lämna över sina svåraste arbetsflöden till ett frontlabb är en bra affär.