Saltar al contenido
Etiqueta

#pytorch

8 notas publicadas

PyTorch lleva Helion a las TPU de Google con kernels autoajustados
IA

PyTorch lleva Helion a las TPU de Google con kernels autoajustados

El nuevo backend compila el lenguaje de kernels de PyTorch a Pallas y alcanza 838 TFLOPs en atención flash sobre una TPU v7, cerca del 79% de utilización de un tensor core.

PyTorch Blog
Triton 3.7 permite extender el compilador de GPU sin forks
IA

Triton 3.7 permite extender el compilador de GPU sin forks

El nuevo sistema de plugins de PyTorch-Triton carga pases y extensiones en tiempo de ejecución y activa por defecto las TLX de Meta, con hasta 15% más rendimiento que las librerías del fabricante.

PyTorch Blog
PyTorch: normalización casi gratis fusionando kernels
IA

PyTorch: normalización casi gratis fusionando kernels

Ingenieros de Meta muestran cómo fundir operaciones de normalización como LayerNorm y RMSNorm dentro de los kernels GEMM y de atención para ocultar hasta el 90% de su latencia en GPU B200.

PyTorch Blog
Fusión de kernels en CUDA para acelerar la memoria GPU
IA

Fusión de kernels en CUDA para acelerar la memoria GPU

NVIDIA explica cómo combinar operaciones en un solo kernel reduce el tráfico a memoria global y el overhead de lanzamiento, con ejemplos en CUDA C++, torch.compile y cuda.compute.

NVIDIA Developer
PyTorch Monarch llega a GPUs AMD con tolerancia a fallos en ROCm
IA

PyTorch Monarch llega a GPUs AMD con tolerancia a fallos en ROCm

El runtime de programación distribuida pasa de CUDA-only a soportar el stack de AMD Instinct MI300 y MI355, con recuperación sin checkpoints validada en clusters de hasta 256 GPUs.

PyTorch Blog
PyTorch abre el capó de su infraestructura de tests generados
IA

PyTorch abre el capó de su infraestructura de tests generados

Por qué los nombres que fallan en CI no coinciden con los del código fuente, cómo funciona instantiate_device_type_tests() y cuál es la ruta oficial para reproducir un fallo en local sin adivinar.

PyTorch Blog
RadixArk libera Miles, stack PyTorch para RL en LLMs frontier
IA

RadixArk libera Miles, stack PyTorch para RL en LLMs frontier

El framework open source compone SGLang, Megatron-LM y Ray sobre PyTorch para hacer manejable el post-training por refuerzo de modelos densos y MoE a escala de cluster.

PyTorch Blog

Etiquetas relacionadas

Otros temas que aparecen junto a #pytorch en nuestra cobertura editorial.