Qué mide el banco de pruebas
Un artículo publicado en arXiv el 7 de octubre presenta UltraText Bench, una prueba para saber si un generador de imágenes puede representar texto visual denso: cadenas largas repartidas por varias regiones de una misma imagen, colocadas donde dice el prompt y todavía legibles al salir.
El banco de pruebas tiene 432 prompts revisados por humanos en 24 categorías de escenas del mundo real y tres niveles de dificultad, repartidos a partes iguales entre inglés y chino. Cada prompt aporta las cadenas exactas de entre cuatro y doce regiones de texto distintas, junto a una referencia estructurada que describe el contenido, la colocación y los atributos visuales de cada región.
La generación es solo a partir del prompt. No hay imagen de referencia, ni máscara de composición, ni paso de edición: al modelo se le dice cuáles son las palabras y dónde van, y tiene que producir la imagen de una sola vez.
Cómo se puntúa
La puntuación es automática. Los autores usan un modelo de visión y lenguaje llamado Q-Judger para comparar cada imagen generada con la referencia completa en cuatro dimensiones: fidelidad del texto, nitidez del texto, calidad espacial y calidad de la escena. Diez participantes intervinieron en una evaluación humana de esas puntuaciones automáticas.

Separar la fidelidad de la nitidez resulta importante. Los autores informan de que Z-Image-Turbo gana 3,81 puntos de nitidez sobre Z-Image-Base mientras pierde 14,76 puntos de fidelidad con los ajustes reportados: es decir, produce un texto más limpio y legible pero con más caracteres equivocados. Una puntuación compuesta única habría mostrado una mejora.
Dónde se caen los modelos
El resultado principal es lo que ocurre cuando sube la carga de texto. En 24 configuraciones de modelo, el rendimiento sigue al número de regiones y de caracteres más que a la dificultad de la escena. El compuesto en inglés de Qwen-Image-2512 cae de 86,50 en el nivel más fácil a 42,86 en el más difícil.
Eso es aproximadamente la mitad de la puntuación, en un modelo que es claramente bueno en la parte fácil. La representación de cadenas cortas —un cartel, una etiqueta, una palabra en una taza— ha mejorado lo suficiente en todo el sector como para dejar de separar modelos. Un menú, un póster o un formulario sí lo hacen.

Cómo leer las cifras
Son cifras de los propios autores, publicadas en un preprint sin revisión por pares, y el evaluador es a su vez un modelo leyendo texto pequeño. La evaluación humana contó con diez personas, lo que es una comprobación de cordura más que una validación.
El banco cubre solo inglés y chino, lo que deja fuera las escrituras donde representar texto es más difícil: la ligadura árabe, las conjuntas del devanagari, la composición de derecha a izquierda. Y como con cualquier conjunto fijo de prompts, las puntuaciones significarán menos cuando los prompts estén en los datos de entrenamiento.
Por qué importa
El texto denso es la distancia entre una imagen generada que parece un documento y una que es un documento. Un modelo capaz de colocar doce cadenas correctas en los sitios correctos es un modelo capaz de producir un póster, una diapositiva, un prototipo de envase o una pantalla de interfaz utilizables. Con esta evidencia, ninguno de los sistemas probados llega al nivel de dificultad más alto, y los que parecen más cerca son los que se miden en el más bajo.