
NVIDIA comprime Nemotron 3.5 Lightning de 66 GB a 22 GB
La destilación consciente de cuantización (QAD) permite llevar los pesos a 4 bits y triplicar el rendimiento sin perder la precisión del modelo original en BF16.
20 notas publicadas

Artificial Analysis midió el modelo abierto de NVIDIA: la mayor velocidad de su clase, un salto de nueve puntos en inteligencia y un Elo agéntico superior al de modelos cuatro veces más grandes.

El gigante tecnológico presenta un modelo ligero de pesos abiertos y una herramienta para optimizar costos de ejecución en agentes de IA, impulsando su ecosistema.

NVIDIA expande su familia Nemotron con un modelo de 30B parámetros diseñado para agentes inteligentes, optimizado para ejecución local y menores costos.

NVIDIA expande su ecosistema con el modelo Nemotron 3.5 Lightning y la biblioteca NeMo Switchyard para optimizar el despliegue de agentes IA autónomos.

NVIDIA libera un modelo Mixture-of-Experts de 30.000 millones de parámetros totales y 3.000 millones activos, con hasta 4 veces más velocidad de salida que rivales de su tamaño.

El modelo de NVIDIA alcanza 97,1% de tasa de aprobacion en el benchmark CVDP usando hasta 71% menos tokens que sus rivales de codigo abierto en diseno de chips.

La nueva plataforma de NVIDIA se diseño para el post-entrenamiento continuo de la IA agentica, entrenando los modelos mas grandes con la cuarta parte de las GPUs que la generacion Blackwell.

La startup japonesa apuesta por la inteligencia colectiva: varios modelos abiertos coordinados que, dice, pueden competir con los sistemas frontera individuales.

El desafío de razonamiento de NVIDIA reunió a más de 5.000 participantes que partieron del mismo modelo abierto, y sus mejores soluciones revelan cómo mejorar la precisión sin cambiar el modelo base.

La estrategia de modelos abiertos busca que empresas y países personalicen, auditen y controlen su propia IA, con ahorros de costo de hasta 20 veces frente a modelos cerrados equivalentes.

Un pipeline iterativo con NeMo Data Designer, NeMo Curator y modelos Nemotron produjo 502.536 titulares únicos en 82 rondas sobre un solo nodo B200, para entrenar modelos de IA financiera.

NVIDIA y LangChain muestran cómo la ingeniería de arnés acerca a un modelo abierto a la precisión de frontera, ajustando el entorno del agente en lugar de los pesos del modelo.

NVIDIA describe un asistente que reúne contexto, corre análisis especializado y redacta una recomendación por cada alarma, con inferencia acelerada por GPU y respuesta en segundos.

LangChain ajustó su harness Deep Agents para el modelo abierto de NVIDIA y logró paridad con los modelos cerrados a un décimo del costo de inferencia.

Los papers aceptados en la conferencia muestran que los modelos de frontera abiertos y la infraestructura abierta ya son la base del trabajo científico en inteligencia artificial.

Guía técnica para decidir entre prompting, SFT, RLHF y RLVR con verificadores. Nemotron 3 Super se entrenó con 21 verificadores NeMo Gym, 37 datasets y 1,2 millones de rollouts.

El motor inteligente de Palantir corre modelos NVIDIA Nemotron en infraestructura aislada de redes inseguras, apuntando a las 3 millones de personas que trabajan en agencias civiles estadounidenses.

El equipo de NVIDIA reduce el checkpoint del modelo de 550B desde 1.121 GB en BF16 a 352 GB en NVFP4, con la técnica four-over-six que recupera 98,5% de la precisión sobre Blackwell.

La pila reúne modelos abiertos, blueprints y runtime seguro en un mismo stack para que empresas construyan agentes IA especializados sin depender de terceros.
Otros temas que aparecen junto a #nemotron en nuestra cobertura editorial.