Saltar al contenido
Etiqueta

#cuda

12 notas publicadas

CUDA Python 1.0 estabiliza el acceso completo a la GPU
IA

CUDA Python 1.0 estabiliza el acceso completo a la GPU

NVIDIA libera junto a CUDA 13.3 un conjunto oficial de bibliotecas con versionado semántico, y declara a Python un ciudadano de primera clase de su plataforma, a la par de C++.

NVIDIA Developer
De CUDA a MLX: Optimizando kernels de IA en Apple Silicon
IA

De CUDA a MLX: Optimizando kernels de IA en Apple Silicon

Investigadores de Berkeley presentan una capa de traducción que permite adaptar kernels de CUDA a MLX, logrando mejoras de rendimiento de hasta 20x.

Berkeley AI Research
NVIDIA y Applied Materials simulan la fábrica de chips entera
IA

NVIDIA y Applied Materials simulan la fábrica de chips entera

Las dos empresas integraron simulación acelerada por GPU en toda la cadena de fabricación de chips, desde el diseño de materiales a escala atómica hasta el gemelo digital de una fábrica completa.

NVIDIA Developer
Depuración de apps de Ray Tracing con NVIDIA OptiX Toolkit
IA

Depuración de apps de Ray Tracing con NVIDIA OptiX Toolkit

Aprende a integrar herramientas de verificación de errores y depuración en tiempo real para optimizar el rendimiento de tus aplicaciones de trazado de rayos en la GPU.

NVIDIA Developer
Fusión de kernels en CUDA para acelerar la memoria GPU
IA

Fusión de kernels en CUDA para acelerar la memoria GPU

NVIDIA explica cómo combinar operaciones en un solo kernel reduce el tráfico a memoria global y el overhead de lanzamiento, con ejemplos en CUDA C++, torch.compile y cuda.compute.

NVIDIA Developer
NuRec: NVIDIA acelera 50x su pipeline de reconstrucción neural
IA

NuRec: NVIDIA acelera 50x su pipeline de reconstrucción neural

Con Nsight Systems y Nsight Compute la ocupación GPU subió de 15% a 30-50%, el kernel interpolate cayó de 4.184 ms a 83.81 μs y el renderBackward se dividió por tipo de sensor.

NVIDIA Developer
NVIDIA baja hasta 5x el costo por token de DeepSeek V4 en Blackwell
IA

NVIDIA baja hasta 5x el costo por token de DeepSeek V4 en Blackwell

El stack full-stack de inferencia sobre GB300 combina Dynamo, TensorRT-LLM, NVFP4 y NVLink para multiplicar por 20 el throughput por GPU y desplomar el costo por token.

NVIDIA Blog
Qualcomm compra Modular por USD 4.000M para enfrentar a CUDA
IA

Qualcomm compra Modular por USD 4.000M para enfrentar a CUDA

La operación paga 2,5 veces la valuación de hace nueve meses e integra a 150 ingenieros, incluido Chris Lattner (creador de LLVM y Swift), a la apuesta de Qualcomm por el centro de datos.

Wired
BEVPoolV3 acelera percepción de IA física hasta 42x en GPU
IA

BEVPoolV3 acelera percepción de IA física hasta 42x en GPU

NVIDIA detalla cuatro cambios algorítmicos al pooling BEV que llevan la latencia de 274 µs a 16,4 µs en RTX PRO 6000 Blackwell Max-Q gracias a FP8 y mejor uso de caché L2.

NVIDIA Developer
CCCL Runtime: NVIDIA propone una capa C++ moderna para CUDA
IA

CCCL Runtime: NVIDIA propone una capa C++ moderna para CUDA

Headers como cuda/stream, cuda/buffer y cuda/launch ofrecen tipos fuertes, dependencias explícitas y APIs asíncronas por defecto, sin reescribir el código que usa CUDA Runtime.

NVIDIA Developer
NVIDIA libera receta para entrenar tu propio modelo de transacciones
IA

NVIDIA libera receta para entrenar tu propio modelo de transacciones

El workflow Build Your Own Transaction Model combina cuDF, cuML y NeMo AutoModel para llegar a un Llama de 29M parámetros que mejora 50% la precisión sobre XGBoost en detección de fraude.

NVIDIA Developer

Etiquetas relacionadas

Otros temas que aparecen junto a #cuda en nuestra cobertura editorial.