El equipo Qwen de Alibaba lanzó Qwen-Image-3.0, la tercera versión de su generador de imágenes. Según el equipo, la primera versión se enfocó en la "precisión", mientras que la segunda apuntó a "precisión, variedad, completitud, belleza y autenticidad". Esta vez Qwen resume su objetivo en una sola palabra: "Real". El modelo está pensado para trabajo práctico como diagramación de diarios, storyboards y hojas de examen, no solo para producir imágenes atractivas.

Prompts largos, diseños complejos en una pasada

Qwen-Image-3.0 acepta prompts de hasta 4.500 tokens. De acuerdo con el equipo, eso le da al modelo espacio suficiente para crear diseños densos en una sola pasada en lugar de ensamblarlos a partir de varias imágenes.

Una de las demostraciones empaqueta nueve infografías separadas en una grilla de 3 x 3, cada una con su propio texto, fórmulas e ilustraciones. Los paneles cubren distancias seguras de seguimiento cerca de túneles, líneas perpendiculares, una lección confuciana sobre emoción y razón, y la velocidad de desprendimiento de un proyectil desde un cilindro rotatorio. Otros paneles explican el ciclo de vida de la duela hepática, el dolor torácico del lado derecho, los teoremas de Sylow para grupos de orden 72, los controles internos en bancos y el ADN en células animales y vegetales.

El modelo también maneja interfaces anidadas. Un ejemplo parte con una ventana de VSCode que contiene una pantalla de Qwen Chat. Dentro de esa pantalla hay una conversación de WeChat, que a su vez incluye un afiche que explica cómo preparar café de filtro.

Qué tan pequeño puede escribir

Qwen afirma que el modelo puede producir texto legible de apenas diez píxeles. Sus ejemplos incluyen una infografía sobre el tiburón ballena repleta de texto y una página completa de un paper ficticio de geometría algebraica. El paper contiene ecuaciones LaTeX de varias líneas con subíndices, superíndices, llaves, fracciones, sumatorias y productorias. Otras demostraciones muestran una página de diario simulada y comentarios manuscritos en rojo que parecen notas de un profesor.

Qwen-Image-3.0 también apunta al detalle fotográfico en retratos y objetos, con poros visibles, textura de piel y hebras individuales de cabello. En otra demostración de edición, el modelo repara una pintura tradicional de tinta dañada que muestra águilas en combate: rellena las áreas faltantes respetando la pincelada y el sombreado original.

Doce idiomas y datos en vivo

Qwen describe su tercera área de foco como "conocimiento profundo". El modelo soporta doce idiomas de forma nativa, incluidos japonés, coreano y español. Los ejemplos publicados también lo muestran recreando interfaces de sitios web, juegos y transmisiones en vivo. En una demostración de edición, el modelo convierte la foto de un insecto en una lámina de identificación completa, con taxonomía, etiquetas de rasgos físicos, vistas ampliadas y una barra de escala. Según Qwen, además puede incorporar datos de internet en vivo, y los usa para generar cosas como un pronóstico del tiempo para Hangzhou.

Alibaba lanzó el antecesor directo, Qwen-Image-2.0, apenas en mayo pasado. El reporte técnico se concentró en mejoras de eficiencia de entrenamiento e inferencia, incluida una variante más rápida que necesitaba solo cuatro pasos por imagen en lugar de 40. En pruebas sobre la propia plataforma de arena de Alibaba, Qwen-Image-2.0 quedó apenas detrás de GPT-Image-2 de OpenAI y de Nano Banana Pro de Google.

Por ahora, Qwen-Image-3.0 parece estar disponible solo mediante acceso a la API por invitación. El modelo debería aparecer pronto en aplicaciones propias como Qwen Chat. Es poco probable que los pesos se liberen bajo una licencia abierta, como sí ocurrió con el Qwen-Image original.

Tecnología impresionante, casos de uso discutibles

El valor práctico de algunas demostraciones sigue siendo poco claro. Los investigadores normalmente escriben y componen sus papers en LaTeX en lugar de renderizarlos como imágenes, así que las páginas generadas por IA con fórmulas podrían servir más para maquetas y borradores visuales que para papers finales.

Una duda similar aplica a las páginas de diario y las infografías complejas. Los modelos de imagen modernos pueden editar elementos de texto individuales, pero los formatos editables y con búsqueda siguen ofreciendo más flexibilidad para trabajo de producción. Aun así, los ejemplos muestran cuánto ha avanzado el renderizado de texto y podrían apuntar a aplicaciones útiles más allá de las demostraciones exhibidas.