Qué se ha lanzado

OpenAI publicó ChatGPT Images 2.5 el 8 de septiembre y lo describe como su nuevo modelo de imagen de referencia. Está llegando a los usuarios de ChatGPT, ChatGPT Work y Codex en todos los niveles, en escritorio, móvil y web.

La empresa afirma que el modelo produce una iluminación más natural y texturas más ricas, conserva mejor a los sujetos de las fotos de referencia del usuario, sigue las instrucciones de edición con más fiabilidad a lo largo de varios turnos de conversación y representa con más exactitud imágenes que contienen información del mundo real. También dice que la latencia de generación baja hasta un 50% frente a Images 2.0.

Son descripciones que OpenAI hace de su propio modelo, publicadas sin una evaluación independiente que las acompañe. Conviene tomarlas como afirmaciones hasta que alguien las mida.

Sketch y el cambio que señala

La pieza de interfaz realmente nueva es Sketch, que se invoca escribiendo “@Sketch” en el chat y permite dibujar directamente en ChatGPT y usar ese dibujo como referencia para la imagen final.

Una persona editando fotografías en la pantalla de un ordenador
OpenAI afirma que el modelo sigue las instrucciones de edición con más fiabilidad a lo largo de varios turnos. Imagen ilustrativa. George Milton · pexels · Pexels License

Junto a ella llegan plantillas para formatos habituales como folletos y fotos de producto, la posibilidad de dejar comentarios directamente sobre una imagen generada para dirigir una edición concreta, y el uso compartido de instrucciones.

Leídas en conjunto, no son funciones de generación de imágenes: son funciones de edición de documentos. El patrón vigente desde los primeros modelos de difusión —escribir una orden, obtener una imagen, escribir una orden mejor— da por hecho que el resultado es desechable. Las plantillas, los comentarios por zonas y un lienzo de boceto suponen lo contrario: que el usuario tiene algo concreto en mente, va a iterar sobre una sola pieza y necesita señalar una parte de ella.

El lado de la API

Dos modelos acompañantes llegaron a los desarrolladores. GPT-Image-2.5 Flare se plantea como la opción por defecto, y OpenAI afirma que ofrece imágenes de mayor calidad que GPT-Image-2 con un 50% menos de latencia. GPT-Image-2.5 Sunburst apunta a flujos de trabajo premium que necesitan un control más estricto a lo largo de ediciones sucesivas.

Un diseñador dibujando sobre papel en una mesa
La nueva herramienta Sketch permite dibujar una referencia directamente en ChatGPT. Imagen ilustrativa. https://kaboompics.com/ · pexels · Pexels License

Ambos cuestan 8,00 dólares por millón de tokens de entrada de imagen y 30,00 por millón de tokens de salida. Dividir un único modelo de imagen en una opción rápida por defecto y un nivel premium controlado replica lo que OpenAI ya hace con sus modelos de texto, y revela dónde cree la empresa que está el dinero: no en generaciones sueltas, sino en flujos donde una imagen pasa por cinco ediciones y cada una debe conservar la anterior.

Qué vigilar a partir de ahora

Si se sostiene la promesa de edición en varios turnos. Conservar un sujeto a lo largo de ediciones sucesivas ha sido el punto débil de todos los modelos de imagen hasta la fecha —los fondos derivan, las caras cambian, el texto se degrada—, y es justo lo que las plantillas y los comentarios dan por funcionando. Las primeras pruebas independientes valdrán más que el anuncio.