Saltar al contenido
Etiqueta

#multimodal

10 notas publicadas

FLUX 3 Video llega con audio nativo y clips de 20 segundos
IA

FLUX 3 Video llega con audio nativo y clips de 20 segundos

Black Forest Labs abrió su modelo de video a todo el público mediante su interfaz de programación, con diálogos sincronizados en más de 14 idiomas y cobro por segundo generado.

The Decoder
FLUX 3 de Black Forest Labs: IA multimodal y robótica
IA

FLUX 3 de Black Forest Labs: IA multimodal y robótica

BFL presenta FLUX 3, un modelo multimodal capaz de generar video con audio, texto y controlar robots, superando a competidores como Gemini Omni y Grok Imagine.

Latent Space
Flux 3 genera videos con audio nativo de hasta 20 segundos
IA

Flux 3 genera videos con audio nativo de hasta 20 segundos

Black Forest Labs presenta un modelo multimodal que aprende de imágenes, video y audio, y que la empresa alemana ya prueba en robótica junto a Audi.

The Decoder
Qwen 3.8: Alibaba planta cara a Kimi K3 con pesos abiertos
IA

Qwen 3.8: Alibaba planta cara a Kimi K3 con pesos abiertos

El modelo multimodal de 2,4 billones de parámetros llega en versión preview y busca frenar el impulso de Kimi K3 antes de que Moonshot AI salga a bolsa.

The Decoder
Inkling, el mejor modelo abierto de EE.UU. bajo licencia Apache 2.0
IA

Inkling, el mejor modelo abierto de EE.UU. bajo licencia Apache 2.0

Thinking Machines Lab, la empresa de Mira Murati, presenta su primer modelo entrenado desde cero: 975.000 millones de parámetros, multimodal y con pesos abiertos de uso comercial libre.

Latent Space
Kimi K3: el mayor modelo abierto jamás liberado
IA

Kimi K3: el mayor modelo abierto jamás liberado

Moonshot AI presenta un modelo de 2,8 billones de parámetros con contexto de 1 millón de tokens y pesos abiertos prometidos para el 27 de julio, que ya lidera el ranking de código frontend.

Latent Space
Thinking Machines Lab lanza Inkling, su primer modelo abierto
IA

Thinking Machines Lab lanza Inkling, su primer modelo abierto

Inkling es un modelo open-weight de 975.000 millones de parámetros entrenado desde cero para entender texto, audio y video, y podría posicionar a la startup de Mira Murati frente a OpenAI y Anthropic.

Wired
Cohere libera un modelo abierto para transcribir árabe difícil
IA

Cohere libera un modelo abierto para transcribir árabe difícil

El sistema de reconocimiento de voz tiene 2.000 millones de parámetros, se publica bajo licencia Apache 2.0 y ataca dialectos, mezcla árabe-inglés y vocabulario especializado.

The Decoder
Nano Banana 2 Lite y Gemini Omni Flash: IA rápida y eficiente
IA

Nano Banana 2 Lite y Gemini Omni Flash: IA rápida y eficiente

Google presentó dos nuevos modelos de IA enfocados en alta velocidad, eficiencia de costos y capacidades avanzadas de edición de video y generación de imágenes.

Google DeepMind

Etiquetas relacionadas

Otros temas que aparecen junto a #multimodal en nuestra cobertura editorial.