
Nvidia compraría Hugging Face por 12.900 millones de dólares
El reporte de The Information sitúa el precio en unas 80 veces los ingresos anualizados de la plataforma, que hoy bordean los 150 millones de dólares.
12 notas publicadas

NVIDIA libera junto a CUDA 13.3 un conjunto oficial de bibliotecas con versionado semántico, y declara a Python un ciudadano de primera clase de su plataforma, a la par de C++.

Investigadores de Berkeley presentan una capa de traducción que permite adaptar kernels de CUDA a MLX, logrando mejoras de rendimiento de hasta 20x.

Las dos empresas integraron simulación acelerada por GPU en toda la cadena de fabricación de chips, desde el diseño de materiales a escala atómica hasta el gemelo digital de una fábrica completa.

Aprende a integrar herramientas de verificación de errores y depuración en tiempo real para optimizar el rendimiento de tus aplicaciones de trazado de rayos en la GPU.

NVIDIA explica cómo combinar operaciones en un solo kernel reduce el tráfico a memoria global y el overhead de lanzamiento, con ejemplos en CUDA C++, torch.compile y cuda.compute.

Con Nsight Systems y Nsight Compute la ocupación GPU subió de 15% a 30-50%, el kernel interpolate cayó de 4.184 ms a 83.81 μs y el renderBackward se dividió por tipo de sensor.

El stack full-stack de inferencia sobre GB300 combina Dynamo, TensorRT-LLM, NVFP4 y NVLink para multiplicar por 20 el throughput por GPU y desplomar el costo por token.

La operación paga 2,5 veces la valuación de hace nueve meses e integra a 150 ingenieros, incluido Chris Lattner (creador de LLVM y Swift), a la apuesta de Qualcomm por el centro de datos.

NVIDIA detalla cuatro cambios algorítmicos al pooling BEV que llevan la latencia de 274 µs a 16,4 µs en RTX PRO 6000 Blackwell Max-Q gracias a FP8 y mejor uso de caché L2.

Headers como cuda/stream, cuda/buffer y cuda/launch ofrecen tipos fuertes, dependencias explícitas y APIs asíncronas por defecto, sin reescribir el código que usa CUDA Runtime.

El workflow Build Your Own Transaction Model combina cuDF, cuML y NeMo AutoModel para llegar a un Llama de 29M parámetros que mejora 50% la precisión sobre XGBoost en detección de fraude.
Otros temas que aparecen junto a #cuda en nuestra cobertura editorial.