Un lanzamiento abierto para leer y cerrado para vender

El equipo Qwen de Alibaba publicó el domingo Qwen-Image-2.1, un modelo unificado de texto a imagen y edición de imagen con 7.000 millones de parámetros en su componente de generación visual, repartidos en 32 capas de transformador de difusión de flujo único. Los pesos están en Hugging Face, GitHub y ModelScope, con una demo al lado.

Los términos son el cambio. Qwen-Image-2.1 se distribuye bajo la Licencia de Investigación Qwen, que concede derechos solo para fines no comerciales y exige un acuerdo aparte para el uso comercial. El anterior Qwen-Image se publicó bajo Apache 2.0, que no impone esa restricción.

Es un estrechamiento significativo dentro de una misma familia. Cualquiera puede descargar el modelo, inspeccionarlo, afinarlo y escribir sobre él. Un estudio que quiera incluir su salida en un entregable para un cliente tiene que ir a pedirlo.

Fotografías impresas extendidas sobre una mesa
Ilustración: Qwen-Image-2.1 acepta hasta diez imágenes de referencia a la vez. George Milton · pexels · Pexels License

Qué hace el modelo

La lista de funciones apunta a trabajo de producción más que a demostraciones. Qwen-Image-2.1 genera en proporciones de hasta 2048 por 2048 píxeles, acepta hasta diez imágenes de referencia a la vez y produce salida RGBA nativa: capas transparentes que se componen sin un paso de enmascarado aparte.

La edición es local, no de imagen completa. Un usuario puede rodear una región, dibujar sobre ella o aportar una máscara, y el modelo edita dentro de ese límite. Alibaba afirma que el modelo preserva la identidad de personas y productos entre ediciones, y destaca mejoras en tipografía, iluminación de retrato y detalle fino. El trabajo de eficiencia está en la atención de granularidad mixta y la reutilización de caché KV de prefijo, de donde sale la aceleración con entradas de varias imágenes.

Alibaba dice que el modelo supera a la mayoría de sistemas de código cerrado en esta tarea manteniéndose en 7.000 millones de parámetros. Es la caracterización de sus propios resultados; todavía no hay evaluación independiente de Qwen-Image-2.1, y la ficha de modelo publicada con el lanzamiento no incluye puntuaciones de referencia.

Una persona dibujando en una tableta gráfica
Ilustración: las ediciones pueden limitarse a una región rodeada o enmascarada. Michael Burrows · pexels · Pexels License

Por qué la licencia importa más que el recuento de parámetros

El campo de la generación de imágenes con pesos abiertos se ha definido tanto por la licencia permisiva como por la capacidad. Un modelo de 7.000 millones de parámetros que corre en una sola tarjeta de consumo y genera capas transparentes es justo lo que adoptan los estudios pequeños y quienes construyen herramientas, y justo lo que no pueden adoptar bajo una licencia no comercial.

El efecto práctico es partir el público. Investigadores y aficionados reciben el modelo en las mismas condiciones que antes. Los usuarios comerciales quedan encaminados a una negociación, que es el objetivo del cambio: convierte un canal de distribución gratuito en un embudo de ventas sin renunciar al beneficio reputacional de publicar pesos.

Qué vigilar

Si los próximos modelos de lenguaje de Qwen siguen el mismo camino. La línea de imagen ha pasado de Apache 2.0 a una licencia de investigación en dos lanzamientos; los modelos de texto son el caso de más consecuencias, y Alibaba no ha dicho nada sobre cambiar sus términos. Lo otro que vigilar es cómo son en realidad las condiciones comerciales cuando alguien reciba una oferta, ya que la licencia de investigación no nombra ni precio ni procedimiento.