Vad som släpptes

OpenAI släppte ChatGPT Images 2.5 den 8 september och beskriver den som sin nya ledande bildmodell. Den rullas ut till användare av ChatGPT, ChatGPT Work och Codex på alla nivåer, på dator, mobil och webb.

Bolaget uppger att modellen ger mer naturligt ljus och rikare texturer, bevarar motiv från användarens referensfoton bättre, följer redigeringsinstruktioner mer tillförlitligt över flera turer i ett samtal, och återger bilder som innehåller information från verkligheten mer korrekt. Det uppger också att genereringslatensen sjunker med upp till 50 procent jämfört med Images 2.0.

Detta är OpenAI:s egna beskrivningar av sin egen modell, publicerade utan någon oberoende utvärdering vid sidan av. Behandla dem som påståenden tills någon mätt dem.

Sketch, och skiftet det signalerar

Den verkligt nya gränssnittsdelen är Sketch, som anropas genom att skriva “@Sketch” i en chatt och låter användaren rita direkt i ChatGPT och använda teckningen som referens för den färdiga bilden.

En person som redigerar fotografier på en datorskärm
OpenAI uppger att modellen följer redigeringsinstruktioner mer tillförlitligt över flera turer. Illustrativ bild. George Milton · pexels · Pexels License

Vid sidan av den kommer mallar för vanliga format som flygblad och produktbilder, möjligheten att lämna kommentarer direkt på en genererad bild för att styra en riktad redigering, samt delning av prompter.

Lästa tillsammans är detta inte funktioner för bildgenerering. Det är funktioner för dokumentredigering. Mönstret som hållit sedan de första diffusionsmodellerna — skriv en prompt, få en bild, skriv en bättre prompt — utgår från att resultatet är slit-och-släng. Mallar, kommentarer på delar av bilden och en skissyta utgår från motsatsen: att användaren har något bestämt i tankarna, ska iterera på ett enda alster och behöver kunna peka på en del av det.

API-sidan

Två följemodeller gick till utvecklare. GPT-Image-2.5 Flare positioneras som förval, och OpenAI uppger att den ger bilder av högre kvalitet än GPT-Image-2 med 50 procent lägre latens. GPT-Image-2.5 Sunburst riktar sig till premiumflöden som behöver hårdare kontroll över på varandra följande redigeringar.

En formgivare som skissar på papper vid ett skrivbord
Det nya verktyget Sketch låter användaren rita en referens direkt i ChatGPT. Illustrativ bild. https://kaboompics.com/ · pexels · Pexels License

Båda kostar 8,00 dollar per miljon tokens bildinmatning och 30,00 dollar per miljon tokens bildutmatning. Att dela upp en enda bildmodell i ett snabbt förval och en kontrollerad premiumnivå speglar vad OpenAI redan gör med sina textmodeller, och det säger var bolaget tror att pengarna finns: inte i enstaka generationer, utan i flöden där en bild går igenom fem redigeringar och varje redigering måste bevara den förra.

Vad som är värt att följa

Om löftet om redigering över flera turer håller. Att bevara ett motiv genom flera på varandra följande redigeringar har varit svagheten hos varje bildmodell hittills — bakgrunder driver, ansikten ändras, text bryts ned — och det är just det som mallarna och kommentarsfunktionen förutsätter fungerar. De första oberoende testerna kommer att väga tyngre än lanseringsinlägget.