
AMD salta de ROCm 7.14 a ROCm 10.0 y estrena ROCm.AI
El salto de versión ordena un esquema de numeración que se había vuelto confuso y llega con la primera entrega bajo el nuevo ciclo de lanzamientos cada seis semanas.
28 notas publicadas

El motor sombra de NVIDIA mantiene una réplica ya inicializada en la misma GPU y comparte los pesos en memoria, con lo que el reinicio en frío de 283 segundos se vuelve innecesario.

NVIDIA libera junto a CUDA 13.3 un conjunto oficial de bibliotecas con versionado semántico, y declara a Python un ciudadano de primera clase de su plataforma, a la par de C++.

Un experimento con 45 flujos generados por un agente de programación muestra que el detalle del prompt cambia el código y su costo, pero no la física del resultado.

La nueva actualización de la API Vulkan introduce la extensión VK_EXT_cooperative_matrix_maintenance1, optimizando el rendimiento en machine learning e inferencia.

Elon Musk anunció que la capacidad de cómputo de la compañía pasará de 1,4 gigavatios a cerca de diez antes de que termine 2027, con silicio de un solo proveedor.

NVIDIA documenta una arquitectura que combina KAI Scheduler y vCluster para dar a cada equipo su propio plano de control, con cuotas de GPU independientes y sin dividir el hardware físico.

El PCB corto de esta variante apenas alcanzó el punto de curvatura y salvó al núcleo, así que toda la reparación se redujo a resoldar un único módulo de memoria.

Tras el lanzamiento del MI455X, AMD cumple su tradición de hacer pública la documentación ISA para desarrolladores, fortaleciendo el soporte open source en Linux.

Análisis profundo sobre el diseño de arquitecturas de modelos de IA, el rol del group size y cómo maximizar el rendimiento en hardware NVIDIA para inferencia.

La industria de la IA enfrenta una nueva restricción crítica: la eficiencia operativa. Gestionar las GPUs como activos en tierra es el desafío financiero del momento.

La propuesta de Huawei para integrar su driver Vulkan en Mesa enfrenta rechazos técnicos debido a la negativa de liberar el compilador de shaders.

El desarrollo de código abierto para las tarjetas gráficas DG2 avanza, permitiendo por fin el uso de aceleración por hardware en el driver Xe de Linux.

Andrew rescató tarjetas Tesla V100 de 2017 del mercado de segunda mano y armó una placa PCI para dos GPUs, capaz de correr modelos como Gemma 4 26B y Qwen3 35B por completo en memoria.

Aprende a integrar herramientas de verificación de errores y depuración en tiempo real para optimizar el rendimiento de tus aplicaciones de trazado de rayos en la GPU.

La API IProgressMonitor, incluida en TensorRT desde hace varias versiones, permite seguir el progreso en tiempo real y abortar una compilación larga antes de malgastar horas de GPU.

La nueva GPU de la plataforma Vera Rubin apunta a las cargas de IA agentica con 336 mil millones de transistores, 288 GB de HBM4 y 50 petaflops en formato NVFP4.

El fabricante de chips financia al laboratorio detras de Claude, que a cambio desplegara hasta 2 gigavatios de GPU AMD Instinct MI450 en sistemas Helios desde 2027.

La nueva plataforma de centros de datos de NVIDIA ya corre en CoreWeave, Google Cloud, Microsoft Azure y Oracle, con un rediseño integral que va del chip a la red eléctrica.

La compañía detalla su avance para soportar la representación intermedia SPIR-V en ROCm, con la meta de un único binario portable entre distintas arquitecturas de GPU.

El nuevo sistema de plugins de PyTorch-Triton carga pases y extensiones en tiempo de ejecución y activa por defecto las TLX de Meta, con hasta 15% más rendimiento que las librerías del fabricante.

La vista previa técnica del stack de cómputo GPU de código abierto de AMD llega antes del evento Advancing AI, con mejoras de hasta 16% en cargas de IA como ComfyUI y más soporte para Windows.

NVIDIA reemplazó la comunicación por MPI orquestada desde la CPU con acceso directo entre GPUs vía NVSHMEM, y logró hasta el doble de rendimiento en los clústeres Eos y GB200 NVL72.

Una guía técnica de NVIDIA explica por qué la forma de un modelo (capas cuadradas, dimensiones múltiplos de 128 y más ancho que profundo) define cuánto rendimiento se saca de una GPU Blackwell.

NVIDIA explica cómo combinar operaciones en un solo kernel reduce el tráfico a memoria global y el overhead de lanzamiento, con ejemplos en CUDA C++, torch.compile y cuda.compute.

La plataforma de red de acceso radio acelerada por GPU logra hasta 1,62x más rendimiento en beamforming y 1,3x en adaptación de enlace frente a los métodos tradicionales basados en CPU.

El proyecto reparte cada píxel entre 8.192 chips CH570 a 100 MHz para construir una matriz LED RGB de 320x200, con un consumo de 2 kW alimentado por una fuente Corsair ATX de 3 kW.

El nuevo soporte multi-device del runtime habilita paralelismo de tensor y de contexto, y los benchmarks colocan a DeepSpeed Ulysses como la mejor estrategia para diffusion con secuencias largas.
Otros temas que aparecen junto a #gpu en nuestra cobertura editorial.