Saltar al contenido
Etiqueta

#gpu

28 notas publicadas

Dynamo restaura la inferencia de un LLM en 7,3 segundos
IA

Dynamo restaura la inferencia de un LLM en 7,3 segundos

El motor sombra de NVIDIA mantiene una réplica ya inicializada en la misma GPU y comparte los pesos en memoria, con lo que el reinicio en frío de 283 segundos se vuelve innecesario.

NVIDIA Developer
CUDA Python 1.0 estabiliza el acceso completo a la GPU
IA

CUDA Python 1.0 estabiliza el acceso completo a la GPU

NVIDIA libera junto a CUDA 13.3 un conjunto oficial de bibliotecas con versionado semántico, y declara a Python un ciudadano de primera clase de su plataforma, a la par de C++.

NVIDIA Developer
NVIDIA ALCHEMI: 45 simulaciones atómicas escritas por agentes
IA

NVIDIA ALCHEMI: 45 simulaciones atómicas escritas por agentes

Un experimento con 45 flujos generados por un agente de programación muestra que el detalle del prompt cambia el código y su costo, pero no la física del resultado.

NVIDIA Developer
Vulkan 1.4.359: Nueva mejora en Cooperative Matrix
Open Source

Vulkan 1.4.359: Nueva mejora en Cooperative Matrix

La nueva actualización de la API Vulkan introduce la extensión VK_EXT_cooperative_matrix_maintenance1, optimizando el rendimiento en machine learning e inferencia.

Phoronix Tests
SpaceX apunta a dos millones de GPUs Rubin de Nvidia
IA

SpaceX apunta a dos millones de GPUs Rubin de Nvidia

Elon Musk anunció que la capacidad de cómputo de la compañía pasará de 1,4 gigavatios a cerca de diez antes de que termine 2027, con silicio de un solo proveedor.

The Decoder
Clusters Kubernetes aislados por equipo sobre una misma GPU
IA

Clusters Kubernetes aislados por equipo sobre una misma GPU

NVIDIA documenta una arquitectura que combina KAI Scheduler y vCluster para dar a cada equipo su propio plano de control, con cuotas de GPU independientes y sin dividir el hardware físico.

NVIDIA Developer
Una RTX 5060 Ti doblada en un choque volvió a funcionar
Electrónica

Una RTX 5060 Ti doblada en un choque volvió a funcionar

El PCB corto de esta variante apenas alcanzó el punto de curvatura y salvó al núcleo, así que toda la reparación se redujo a resoldar un único módulo de memoria.

Tom's Hardware
AMD libera documentación técnica de la arquitectura CDNA5
Open Source

AMD libera documentación técnica de la arquitectura CDNA5

Tras el lanzamiento del MI455X, AMD cumple su tradición de hacer pública la documentación ISA para desarrolladores, fortaleciendo el soporte open source en Linux.

Phoronix Tests
Optimización de atención en modelos AI para inferencia rápida
IA

Optimización de atención en modelos AI para inferencia rápida

Análisis profundo sobre el diseño de arquitecturas de modelos de IA, el rol del group size y cómo maximizar el rendimiento en hardware NVIDIA para inferencia.

NVIDIA Developer
Gestión de GPUs: Por qué las GPUs ociosas son el nuevo problema
IA

Gestión de GPUs: Por qué las GPUs ociosas son el nuevo problema

La industria de la IA enfrenta una nueva restricción crítica: la eficiencia operativa. Gestionar las GPUs como activos en tierra es el desafío financiero del momento.

Hugging Face
Huawei considera driver Vulkan para Mesa, pero a medias
Open Source

Huawei considera driver Vulkan para Mesa, pero a medias

La propuesta de Huawei para integrar su driver Vulkan en Mesa enfrenta rechazos técnicos debido a la negativa de liberar el compilador de shaders.

Phoronix Tests
Intel mejora aceleración multimedia en GPUs Alchemist Linux
Open Source

Intel mejora aceleración multimedia en GPUs Alchemist Linux

El desarrollo de código abierto para las tarjetas gráficas DG2 avanza, permitiendo por fin el uso de aceleración por hardware en el driver Xe de Linux.

Phoronix Tests
GPUs Tesla V100 de datacenter reconvertidas para LLM locales
Electrónica

GPUs Tesla V100 de datacenter reconvertidas para LLM locales

Andrew rescató tarjetas Tesla V100 de 2017 del mercado de segunda mano y armó una placa PCI para dos GPUs, capaz de correr modelos como Gemma 4 26B y Qwen3 35B por completo en memoria.

Hackaday
Depuración de apps de Ray Tracing con NVIDIA OptiX Toolkit
IA

Depuración de apps de Ray Tracing con NVIDIA OptiX Toolkit

Aprende a integrar herramientas de verificación de errores y depuración en tiempo real para optimizar el rendimiento de tus aplicaciones de trazado de rayos en la GPU.

NVIDIA Developer
NVIDIA TensorRT: monitorear y cancelar builds de motores
IA

NVIDIA TensorRT: monitorear y cancelar builds de motores

La API IProgressMonitor, incluida en TensorRT desde hace varias versiones, permite seguir el progreso en tiempo real y abortar una compilación larga antes de malgastar horas de GPU.

NVIDIA Developer
NVIDIA Rubin: 10x más rendimiento agentico por watt
IA

NVIDIA Rubin: 10x más rendimiento agentico por watt

La nueva GPU de la plataforma Vera Rubin apunta a las cargas de IA agentica con 336 mil millones de transistores, 288 GB de HBM4 y 50 petaflops en formato NVFP4.

NVIDIA Developer
AMD invierte USD 5.000 millones en Anthropic para Claude
IA

AMD invierte USD 5.000 millones en Anthropic para Claude

El fabricante de chips financia al laboratorio detras de Claude, que a cambio desplegara hasta 2 gigavatios de GPU AMD Instinct MI450 en sistemas Helios desde 2027.

The Decoder
Vera Rubin: NVIDIA promete 10x más tokens por megavatio
IA

Vera Rubin: NVIDIA promete 10x más tokens por megavatio

La nueva plataforma de centros de datos de NVIDIA ya corre en CoreWeave, Google Cloud, Microsoft Azure y Oracle, con un rediseño integral que va del chip a la red eléctrica.

NVIDIA Blog
AMD lleva SPIR-V a ROCm: un binario para muchas GPUs
Open Source

AMD lleva SPIR-V a ROCm: un binario para muchas GPUs

La compañía detalla su avance para soportar la representación intermedia SPIR-V en ROCm, con la meta de un único binario portable entre distintas arquitecturas de GPU.

Phoronix Tests
Triton 3.7 permite extender el compilador de GPU sin forks
IA

Triton 3.7 permite extender el compilador de GPU sin forks

El nuevo sistema de plugins de PyTorch-Triton carga pases y extensiones en tiempo de ejecución y activa por defecto las TLX de Meta, con hasta 15% más rendimiento que las librerías del fabricante.

PyTorch Blog
AMD etiqueta ROCm 7.14 TheRock, su nuevo stack de cómputo GPU
Open Source

AMD etiqueta ROCm 7.14 TheRock, su nuevo stack de cómputo GPU

La vista previa técnica del stack de cómputo GPU de código abierto de AMD llega antes del evento Advancing AI, con mejoras de hasta 16% en cargas de IA como ComfyUI y más soporte para Windows.

Phoronix Tests
NVIDIA duplica el escalado de la dinámica molecular en GPUs
IA

NVIDIA duplica el escalado de la dinámica molecular en GPUs

NVIDIA reemplazó la comunicación por MPI orquestada desde la CPU con acceso directo entre GPUs vía NVSHMEM, y logró hasta el doble de rendimiento en los clústeres Eos y GB200 NVL72.

NVIDIA Developer
NVIDIA: diseñar modelos de IA pensados para la GPU
IA

NVIDIA: diseñar modelos de IA pensados para la GPU

Una guía técnica de NVIDIA explica por qué la forma de un modelo (capas cuadradas, dimensiones múltiplos de 128 y más ancho que profundo) define cuánto rendimiento se saca de una GPU Blackwell.

NVIDIA Developer
Fusión de kernels en CUDA para acelerar la memoria GPU
IA

Fusión de kernels en CUDA para acelerar la memoria GPU

NVIDIA explica cómo combinar operaciones en un solo kernel reduce el tráfico a memoria global y el overhead de lanzamiento, con ejemplos en CUDA C++, torch.compile y cuda.compute.

NVIDIA Developer
NVIDIA AI Aerial usa GPU para exprimir el espectro 5G y 6G
IA

NVIDIA AI Aerial usa GPU para exprimir el espectro 5G y 6G

La plataforma de red de acceso radio acelerada por GPU logra hasta 1,62x más rendimiento en beamforming y 1,3x en adaptación de enlace frente a los métodos tradicionales basados en CPU.

NVIDIA Developer
Bitluni une 8.192 MCUs RISC-V para armar una GPU casera
Electrónica

Bitluni une 8.192 MCUs RISC-V para armar una GPU casera

El proyecto reparte cada píxel entre 8.192 chips CH570 a 100 MHz para construir una matriz LED RGB de 320x200, con un consumo de 2 kW alimentado por una fuente Corsair ATX de 3 kW.

Hackaday
TensorRT 11.0 escala inferencia IA multi-GPU con NCCL nativo
IA

TensorRT 11.0 escala inferencia IA multi-GPU con NCCL nativo

El nuevo soporte multi-device del runtime habilita paralelismo de tensor y de contexto, y los benchmarks colocan a DeepSpeed Ulysses como la mejor estrategia para diffusion con secuencias largas.

NVIDIA Developer

Etiquetas relacionadas

Otros temas que aparecen junto a #gpu en nuestra cobertura editorial.