Saltar al contenido
Etiqueta

#inferencia

24 notas publicadas

Jalapeño: el primer chip de OpenAI rinde 1,9 veces por watt
Electrónica

Jalapeño: el primer chip de OpenAI rinde 1,9 veces por watt

La compañía midió su acelerador de inferencia contra sistemas comerciales en tres modelos de pesos abiertos y reporta hasta 4,1 veces más rendimiento en las cargas más interactivas.

Interesting Engineering
TensorRT Model Connect: de Hugging Face a C++ en dos comandos
IA

TensorRT Model Connect: de Hugging Face a C++ en dos comandos

NVIDIA liberó implementaciones de referencia para llevar modelos abiertos desde un identificador de Hugging Face hasta inferencia nativa en C++, sin PyTorch ni Python en producción.

NVIDIA Developer
Nvidia mide su Groq 3 LPU: 3.400 tokens por segundo
Electrónica

Nvidia mide su Groq 3 LPU: 3.400 tokens por segundo

Los primeros números independientes de los racks LPX llegan con una letra chica importante: la prueba corre sobre Gemma 4 31B, el mejor escenario posible para esta arquitectura.

The Register
Cerebras apilará DRAM sobre la oblea de su chip CS-6
Electrónica

Cerebras apilará DRAM sobre la oblea de su chip CS-6

En Hot Chips 2026 la compañía mostró el rack Nexus del CS-4, que duplica la potencia entregada a cada oblea, y adelantó dos generaciones completas de su hoja de ruta.

Tom's Hardware
Jalapeño por dentro: 64 núcleos, cada uno con su HBM4
Electrónica

Jalapeño por dentro: 64 núcleos, cada uno con su HBM4

OpenAI detalló en Hot Chips la arquitectura NUMA de su acelerador de inferencia: 216 GB de HBM4, dos redes internas separadas y más de la mitad del núcleo escrita con ayuda de sus propios modelos.

Tom's Hardware
Vera Rubin NVL72: hasta 30 veces más trabajo por megavatio
IA

Vera Rubin NVL72: hasta 30 veces más trabajo por megavatio

Nvidia midió sus nuevos sistemas contra el GB300 NVL72 usando trayectorias reales de sesiones de programación con agentes, aunque los resultados todavía esperan revisión de SemiAnalysis.

NVIDIA Blog
Jalapeño, el chip de OpenAI, supera a Blackwell y a Rubin
IA

Jalapeño, el chip de OpenAI, supera a Blackwell y a Rubin

El primer acelerador propio de OpenAI, hecho con Broadcom, se llevó los mejores números de rendimiento por watt en el banco de pruebas InferenceX, aunque no pasa de muestras de ingeniería.

The Decoder
Groq 3 LPX: 3.431 tokens por segundo y nada de HBM
Electrónica

Groq 3 LPX: 3.431 tokens por segundo y nada de HBM

Nvidia presentó en Hot Chips 2026 la arquitectura del rack que heredó de Groq y publicó su primer benchmark de terceros, medido por Artificial Analysis sobre Gemma 4 31B.

Tom's Hardware
Crescent Island: el acelerador de Intel para inferencia de 350 W
Electrónica

Crescent Island: el acelerador de Intel para inferencia de 350 W

La tarjeta PCIe refrigerada por aire monta hasta 480 GB de LPDDR5X y apuesta por cachés más grandes y motores XMX más profundos en lugar de perseguir el récord de potencia bruta.

Tom's Hardware
d-Matrix apila su acelerador sobre DRAM: 100 TB/s por tarjeta
Electrónica

d-Matrix apila su acelerador sobre DRAM: 100 TB/s por tarjeta

Raptor invierte el orden habitual del apilamiento 3D y deja el dado de cómputo arriba, pero la empresa aún no dice quién le fabrica la memoria a medida.

Tom's Hardware
Dynamo restaura la inferencia de un LLM en 7,3 segundos
IA

Dynamo restaura la inferencia de un LLM en 7,3 segundos

El motor sombra de NVIDIA mantiene una réplica ya inicializada en la misma GPU y comparte los pesos en memoria, con lo que el reinicio en frío de 283 segundos se vuelve innecesario.

NVIDIA Developer
Samsung LPDDR5X-PIM: 614 GB/s calculando en la memoria
Electrónica

Samsung LPDDR5X-PIM: 614 GB/s calculando en la memoria

La primera memoria de bajo consumo con lógica integrada multiplica por ocho el ancho de banda y rinde 3,01 veces más tokens por segundo en inferencia.

Tom's Hardware
Jetson Orin Nano 2: 78 TOPS y el doble de inferencia
Robótica

Jetson Orin Nano 2: 78 TOPS y el doble de inferencia

NVIDIA presentó su nuevo computador de entrada para IA de borde, que duplica el rendimiento del Orin Nano Super y consume 40% menos en modo de 15 watts.

The Robot Report
Jalapeño, el chip de OpenAI: 1,7 exaFLOPS y 27,5 TB de HBM4
Electrónica

Jalapeño, el chip de OpenAI: 1,7 exaFLOPS y 27,5 TB de HBM4

OpenAI mostró en Hot Chips su acelerador desarrollado con Broadcom, pensado solo para inferencia, con producción en volumen prevista para 2027.

The Register
NVIDIA comprime Nemotron 3.5 Lightning de 66 GB a 22 GB
IA

NVIDIA comprime Nemotron 3.5 Lightning de 66 GB a 22 GB

La destilación consciente de cuantización (QAD) permite llevar los pesos a 4 bits y triplicar el rendimiento sin perder la precisión del modelo original en BF16.

NVIDIA Developer
OpenAI lanza Ultrafast: GPT-5.6 Sol a 750 tokens por segundo
IA

OpenAI lanza Ultrafast: GPT-5.6 Sol a 750 tokens por segundo

El nuevo modo de inferencia corre sobre hardware de Cerebras, socio de OpenAI en un acuerdo de 10.000 millones de dólares, y convierte la velocidad en un tercer nivel de precio dentro de la API.

The Decoder
NVIDIA Rubin: 10x más rendimiento agentico por watt
IA

NVIDIA Rubin: 10x más rendimiento agentico por watt

La nueva GPU de la plataforma Vera Rubin apunta a las cargas de IA agentica con 336 mil millones de transistores, 288 GB de HBM4 y 50 petaflops en formato NVFP4.

NVIDIA Developer
High Bandwidth Flash: memoria de pendrive para la IA
Electrónica

High Bandwidth Flash: memoria de pendrive para la IA

Sandisk y SK Hynix apilan chips de flash NAND para crear una capa de memoria barata y de alta capacidad, pensada para servir los pesos de modelos gigantes en tareas de inferencia.

IEEE Spectrum Semiconductors
Frozen v2: el chip de Google que graba Gemini en el silicio
IA

Frozen v2: el chip de Google que graba Gemini en el silicio

El chip, atribuido a Jeff Dean, grabaría el plano de Gemini en el hardware para ser 6 a 10 veces más eficiente que los TPU actuales. Google lo desplegaría desde 2028 para abaratar la inferencia.

The Decoder
NVIDIA Confidential Computing rinde 98% del baseline sin cifrar
IA

NVIDIA Confidential Computing rinde 98% del baseline sin cifrar

El benchmark en HGX B300 con Qwen 3.5-397B-A17B-FP8 muestra menos del 8% de overhead con Confidential Computing activado.

NVIDIA Developer
OpenAI corta a la mitad el costo de ChatGPT para invitados
IA

OpenAI corta a la mitad el costo de ChatGPT para invitados

The Information reveló que la compañía optimizó la inferencia para visitantes sin cuenta y bajó a unos pocos cientos las GPU NVIDIA necesarias.

The Decoder
SGLang sirve DeepSeek-V4 en GB300 con 5x más throughput
IA

SGLang sirve DeepSeek-V4 en GB300 con 5x más throughput

Dos meses después del lanzamiento, el stack abierto pasó de 2.200 a 11.200 tok/s/GPU a la misma interactividad gracias a KV Compression V2, W4A4 MegaMoE y CUDA graphs rompibles en el prefill.

PyTorch Blog
Groq levanta USD 650M tras el not-acqui-hire de NVIDIA
IA

Groq levanta USD 650M tras el not-acqui-hire de NVIDIA

Seis meses después de licenciar su IP de LPU a NVIDIA y perder a su fundador, la chipmaker apuesta por su negocio neocloud con 13 data centers y nuevos ejecutivos al timón.

TechCrunch AI

Etiquetas relacionadas

Otros temas que aparecen junto a #inferencia en nuestra cobertura editorial.