Dos modelos frontera de pesos abiertos se publicaron con un día de diferencia esta semana. Z.ai liberó GLM-5.3-Flash, un modelo multimodal de mezcla de expertos con 320.000 millones de parámetros y 18.000 millones activos. El equipo Qwen de Alibaba liberó Qwen3.8-Flash-Next, un modelo de 125.000 millones con 6.000 millones activos que adelanta la arquitectura Qwen4.

Los dos equipos diseñaron sus sistemas de forma independiente. Aun así, sus configuraciones se leen casi como copias. Ambos usan un híbrido 3:1 de atención lineal y atención completa. Ambos seleccionan contexto con un indexador comprimido limitado a 2.048 tokens. Ambos ensanchan el flujo residual en cuatro ramas con compuertas. Ambos entrenan con el optimizador Muon, separando las matrices de parámetros fusionadas antes de ortogonalizarlas.

¿Qué trae cada uno de los dos modelos?

GLM-5.3-Flash es el primer modelo nativamente multimodal de la serie GLM-5 y salió bajo licencia MIT en Hugging Face. Z.ai lo probó de forma anónima como Ox Alpha en OpenRouter, donde se convirtió en el modelo más popular de la semana. Fue entrenado con un corpus multimodal de 30 billones de tokens y sirve una ventana de contexto de un millón de tokens. Según Z.ai, supera a GLM-5.2 en todos los benchmarks a una décima parte del precio y se acerca a Claude Opus 4.8 en tareas de programación y agénticas. El precio de lista es de 0,15 dólares por millón de tokens de entrada y 0,50 dólares por millón de salida.

Qwen3.8-Flash-Next cumple el mismo rol que cumplió Qwen3-Next para Qwen3.5: una vista previa pública de la siguiente familia arquitectónica. La ficha del modelo declara 125.000 millones de parámetros en el cuerpo principal más una tabla de embeddings N-grama de 51.000 millones, con 6.000 millones activados por token. El contexto nativo es de 262.144 tokens, extensible a un millón con YaRN. El equipo Qwen informa que el entrenamiento requirió cerca de una novena parte del cómputo de Qwen3.7-Plus.

GLM-5.3-FlashQwen3.8-Flash-Next
Parámetros totales320.000 millones125.000 millones (+51.000 M de N-grama)
Parámetros activos18.000 millones (5,6%)6.000 millones (4,8%)
Capas45 (34 lineales / 11 completas)48 (bloques de 3+1)
Contexto nativo1 millón de tokens262.144 tokens
LicenciaMITPesos abiertos

Tres de cada cuatro capas de atención son lineales

GLM-5.3-Flash apila 45 capas: 34 de atención lineal y 11 de atención completa, según la configuración publicada. Qwen3.8-Flash-Next apila 48 capas en un bloque que se repite, con 3 capas Gated DeltaNet más 1 capa de Qwen Sparse Attention, según la receta de vLLM. Ambos aterrizan en la misma proporción 3:1.

Las capas lineales son las baratas. En vez de una caché KV que crece con el texto, comprimen todo el historial en un estado recurrente de tamaño fijo. El cómputo por token se mantiene constante sin importar el largo del contexto. GLM usa Kimi Delta Attention (KDA), el diseño de atención lineal que introdujo Kimi Linear, de Moonshot AI, que aplica una compuerta de decaimiento por canal. Qwen usa su propio Gated DeltaNet (GDN), que aplica la compuerta por cabeza. Distinta granularidad, misma familia de regla delta, mismo trabajo.

El cuarto restante de las capas hace la recuperación precisa de largo alcance. GLM usa atención latente multicabeza (MLA) sin codificación posicional, al estilo de DeepSeek. Qwen usa atención de consulta agrupada dentro de QSA. Ahí es donde vive realmente la caché KV.

¿Cómo recortan el contexto sin perder precisión?

Ninguno de los dos deja que sus capas de atención completa miren el contexto entero. Ambos enganchan un pequeño indexador entrenado que puntúa fragmentos del historial y conserva solo los ganadores. Los parámetros coinciden casi exactamente.

Las capas dispersas de GLM usan un indexador de 32 cabezas con selección de los 2.048 mejores, heredado de DSA de DeepSeek. Para bajar el costo del indexador en contextos de un millón de tokens, Z.ai introduce IndexPool, que comprime cuatro vectores clave del indexador en uno solo mediante agrupación ponderada antes de puntuar. El QSA de Qwen opera con granularidad de microbloques: el indexador liviano puntúa bloques de 4 tokens y conserva los 512 mejores, que son exactamente 2.048 tokens. O sea, los dos modelos comprimen el contexto cuatro veces antes de puntuar y los dos limitan el presupuesto de atención a 2.048 tokens. Qwen le atribuye a QSA aceleraciones de hasta 7,6 veces en prellenado y 4,9 veces en decodificación frente a la atención completa con un millón de tokens.

El efecto combinado del lado de GLM es grande. Comparada con el modelo GLM-5.3 completo, Z.ai reporta que la arquitectura Flash recorta el cómputo de atención unas 3 veces y el tamaño de la caché KV 4,4 veces, mientras casi reduce a la mitad los parámetros activos (18.000 millones frente a 32.000 millones) y el número de capas (45 frente a 92).

Cuatro flujos residuales en vez de uno

Los dos modelos abandonan el flujo residual único que define a los transformers desde 2017. Los dos lo ensanchan a cuatro ramas paralelas, con compuertas que controlan qué lee y qué escribe cada bloque.

GLM adopta Manifold-Constrained Hyper-Connections (mHC), un diseño originado en DeepSeek, configurado con 4 ramas en los pesos publicados. Qwen escribió su propia variante, Gated Residual, que modula el flujo a través de 4 flujos ensanchados con una compuerta de lectura dependiente de los datos y una compuerta escalar de escritura por rama. Según el equipo Qwen, Gated Residual elimina el paso extra de mezcla entre ramas que usan las Hyper-Connections, lo que reduce la sobrecarga de acceso a memoria, y la compuerta suprime los valores atípicos de activación lo suficiente como para permitir almacenamiento residual en FP8. El detalle relevante es que el equipo Qwen probó los dos enfoques por ablación y los encontró equivalentes en calidad. Dos laboratorios, dos implementaciones, una conclusión idéntica: cuatro flujos con compuertas le ganan a uno.

Muon, con las matrices fusionadas separadas por componente

Los dos modelos entrenan con el optimizador Muon. Y los dos aplican el mismo refinamiento sutil: las matrices de proyección fusionadas se separan en sus transformaciones independientes antes de que Muon las ortogonalice. Qwen documenta la separación de las proyecciones fusionadas QKV, SwiGLU y GDN, y asigna Muon a los mapas lineales de dos dimensiones genuinos y AdamW a embeddings, enrutadores y parámetros de bajo rango. Qwen además reajustó sus leyes de escalado para la nueva arquitectura y eliminó por completo el calentamiento del tamaño de lote, tras medir que ese calentamiento costaba un 18,8% más de pasos del optimizador sin mejorar los resultados.

En qué discrepan: la codificación posicional

La única división limpia está en las incrustaciones rotatorias de posición en las capas de atención completa. GLM-5.3-Flash las elimina: la configuración fija qk_rope_head_dim = 0, con lo que sus capas dispersas MLA quedan totalmente sin codificación posicional. La información de posición fluye de forma implícita a través de las capas lineales recurrentes.

Qwen intentó lo mismo y conservó RoPE. De acuerdo con el informe técnico de Qwen3.8-Next, la variante sin codificación posicional no produjo ninguna diferencia medible durante el preentrenamiento. La falla apareció después: tras el post-entrenamiento, esa variante a menudo no lograba dejar de generar texto. Es un resultado útil como advertencia para el campo. Las curvas de pérdida del preentrenamiento pueden esconder defectos de comportamiento que solo se manifiestan después del ajuste con retroalimentación humana.

La convergencia amplia, y el único disidente

Esta receta no se limita a dos laboratorios. DeepSeek fue pionero del patrón de indexador disperso más presupuesto de 2.048 tokens con DSA en DeepSeek-V3.2-Exp, y mHC es un diseño de DeepSeek que hoy viaja dentro de GLM. Kimi, de Moonshot, aportó KDA, exactamente la capa de atención lineal que adoptó GLM. Los modelos abiertos chinos se están polinizando entre sí y convergen en configuraciones compartidas.

El disidente notable es MiniMax. Durante el desarrollo de M2, el equipo probó de forma extensiva atención lineal y de ventana deslizante a escala y encontró déficits severos en razonamiento de múltiples saltos, sobre todo más allá de los 32.000 tokens de contexto después del ajuste supervisado. M2 salió con atención softmax completa en todas sus capas. Para M3, MiniMax adoptó MiniMax Sparse Attention (MSA), que dispersa la atención softmax mediante selección de bloques pero no incluye ninguna capa de atención lineal. Así que el campo no está del todo resuelto. Z.ai, Qwen, DeepSeek y Kimi apuestan a que un híbrido lineal 3:1 preserva el razonamiento. Las ablaciones de MiniMax dicen que no, al menos para su arquitectura.

¿Qué significa esto para quien quiera correrlos acá?

La licencia MIT de GLM-5.3-Flash permite uso comercial y autohospedaje, pero el tamaño manda: 320.000 millones de parámetros en precisión FP8 implican del orden de 320 GB solo en pesos, muy por encima de los 80 o 96 GB de una sola GPU de centro de datos. Qwen3.8-Flash-Next es la puerta de entrada más realista para un laboratorio o una universidad de la región, con 125.000 millones de parámetros en el cuerpo principal.

En servicios por API la aritmética es distinta: procesar un millón de tokens de entrada y un millón de salida con GLM-5.3-Flash cuesta 0,65 dólares de lista, un orden de magnitud por debajo de los modelos cerrados de frontera con los que la propia Z.ai se compara.