
NVIDIA FLARE baja el tráfico federado de 28,6 GB a 94 MB
El truco es intercambiar solo adaptadores LoRA sobre un modelo base congelado. FedUMM, desarrollado con William & Mary, mantiene el 97% del rendimiento de un entrenamiento centralizado.
10 notas publicadas

Black Forest Labs abrió su modelo de video a todo el público mediante su interfaz de programación, con diálogos sincronizados en más de 14 idiomas y cobro por segundo generado.

BFL presenta FLUX 3, un modelo multimodal capaz de generar video con audio, texto y controlar robots, superando a competidores como Gemini Omni y Grok Imagine.

Black Forest Labs presenta un modelo multimodal que aprende de imágenes, video y audio, y que la empresa alemana ya prueba en robótica junto a Audi.

El modelo multimodal de 2,4 billones de parámetros llega en versión preview y busca frenar el impulso de Kimi K3 antes de que Moonshot AI salga a bolsa.

Thinking Machines Lab, la empresa de Mira Murati, presenta su primer modelo entrenado desde cero: 975.000 millones de parámetros, multimodal y con pesos abiertos de uso comercial libre.

Moonshot AI presenta un modelo de 2,8 billones de parámetros con contexto de 1 millón de tokens y pesos abiertos prometidos para el 27 de julio, que ya lidera el ranking de código frontend.

Inkling es un modelo open-weight de 975.000 millones de parámetros entrenado desde cero para entender texto, audio y video, y podría posicionar a la startup de Mira Murati frente a OpenAI y Anthropic.

El sistema de reconocimiento de voz tiene 2.000 millones de parámetros, se publica bajo licencia Apache 2.0 y ataca dialectos, mezcla árabe-inglés y vocabulario especializado.

Google presentó dos nuevos modelos de IA enfocados en alta velocidad, eficiencia de costos y capacidades avanzadas de edición de video y generación de imágenes.
Otros temas que aparecen junto a #multimodal en nuestra cobertura editorial.