La empresa china de inteligencia artificial Moonshot AI anunció Kimi K3 esta mañana y lo describió como su "modelo más capaz hasta la fecha, con 2,8 billones de parámetros". Por ahora está disponible a través de su sitio web y su API, y la liberación de pesos abiertos está prometida "para el 27 de julio de 2026".

Moonshot lo presenta como el primer "modelo abierto de la clase 3 billones", arrebatándole la corona al v4 Pro de 1,6 billones de DeepSeek. Según sus benchmarks autoinformados, K3 supera en la mayoría de las pruebas a Claude Opus 4.8 max y a GPT-5.5 high, aunque queda por debajo de Claude Fable 5 y GPT-5.6 Sol.

Qué tan capaz es Kimi K3 en las mediciones independientes

El informe de Artificial Analysis aporta cifras concretas:

  • En su evaluación privada de trabajo intelectual de largo horizonte, Kimi K3 alcanza un Elo global de 1547, 732 puntos más que Kimi K2.6 y solo por detrás de Claude Fable 5.
  • El costo por tarea (0,94 dólares) es similar al de GPT-5.6 Sol (1,04 dólares), cerca de la mitad que Opus 4.8 (1,80 dólares) y más alto que sus pares de pesos abiertos.
  • El consumo de tokens bajó de forma notable: K3 usa un 21% menos de tokens de salida que K2.6.

El modelo además encabeza ahora el ranking de código frontend de Arena.ai, superando incluso a Claude Fable 5.

Cuánto cuesta y por qué importa el precio

El precio es uno de los datos más llamativos: 3 dólares por millón de tokens de entrada y 15 por millón de salida, el mismo nivel que la gama Claude Sonnet de Anthropic. Eso lo convierte en el modelo más caro liberado hasta ahora por un laboratorio chino. Es un salto importante frente a modelos previos como Kimi K2.6, que costaba 0,95 y 4 dólares. Los 2,8 billones de parámetros también más que duplican el tamaño de aquel modelo de 1 billón.

El test del pelícano en bicicleta

El analista Simon Willison sometió al modelo a su prueba habitual: generar un SVG de un pelícano montado en bicicleta.

Código
llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle'

El dibujo le costó 95 tokens de entrada y 16.658 de salida (13.241 de ellos de razonamiento), para un total de 25 centavos de dólar. Como K3 acepta imágenes, Willison le pidió luego que describiera el propio SVG generado y obtuvo un texto alternativo muy preciso por apenas 0,6 centavos.

De ese ejercicio salen varias observaciones sobre el modelo:

  • Por ahora K3 tiene un único nivel de esfuerzo de razonamiento, "max", y se nota: consumió 13.241 tokens de razonamiento para producir 3.417 de respuesta. Es caro.
  • El prompt "Generate an SVG of a pelican riding a bicycle" suma 95 tokens de entrada, cuando los tokenizadores de OpenAI y Anthropic cuentan entre 10 y 30. Un simple "hi" contabilizó 86 tokens, lo que sugiere un prompt de sistema oculto de unos 85 tokens que el modelo se negó a revelar.
  • La visión funciona bien: la descripción de la imagen fue de buena calidad.

Sirve todavía comparar modelos con un pelícano

Willison es el primero en relativizar su propia prueba. El test tiene ya 21 meses y, admite, nunca fue un buen benchmark: nació como una broma sobre lo absurdamente difícil que es comparar estos modelos. Durante el primer año mostró una correlación sorprendente con la calidad real, pero esa conexión hoy está casi rota. Los pelícanos de GPT-5.6 y Claude Fable 5 quedan por debajo del de GLM-5.2, un modelo que Willison aprecia pero no considera de primer nivel.

La mayor limitación, reconoce, es que el pelícano no toca lo que más importa en los modelos actuales: el uso de herramientas de forma agéntica y la capacidad de operar con fiabilidad a medida que las conversaciones se alargan.

Aun así, el ejercicio conserva valor como "hola mundo" para probar un modelo, como estimación rápida de costo y razonamiento, y como confirmación de que el modelo genera SVG válido y entiende geometría básica, algo especialmente relevante en los modelos pequeños que corren en un portátil.