La IA agéntica traslada cada vez más del camino crítico de ejecución hacia la CPU. Los agentes operan en entornos aislados para ejecutar código, invocar herramientas, recuperar contexto, consultar bases de datos y analizar resultados antes de devolver información al modelo. Cuando esos ciclos corren en paralelo a escala de una fábrica de IA, el rendimiento de la CPU pasa a definir tanto la respuesta de cada agente como el rendimiento total del sistema.

Eso crea un punto de diseño distinto. Las cargas de agentes dependen de un rendimiento de un solo hilo fuerte incluso con el socket a plena carga, de suficiente ancho de banda de memoria por núcleo, de latencia predecible bajo concurrencia y del manejo eficiente de flujos de control irregulares y cadenas de dependencias largas. Son requisitos distintos a los de las CPU de nube tradicionales, que suelen priorizar la densidad de núcleos.

La NVIDIA Vera CPU se construyó para esta clase de carga, con el núcleo Olympus en el centro de su diseño.

¿Qué hace distinto al núcleo Olympus?

Olympus se desarrolló mediante un co-diseño extremo a lo largo de la plataforma Vera Rubin, abarcando CPU, GPU, redes, almacenamiento, memoria y software. Es el motor de cómputo de la Vera CPU, diseñado desde cero para maximizar las instrucciones por ciclo (IPC) en cargas de infraestructura de IA altamente concurrentes. Combina alto rendimiento por hilo, ejecución fuera de orden profunda y tecnologías de aceleración de memoria.

Arquitectura del núcleo NVIDIA Olympus
Arquitectura del núcleo NVIDIA Olympus

El núcleo se organiza en cuatro bloques. El front end mantiene al núcleo abastecido de instrucciones útiles en pilas de software con muchas ramificaciones. En su centro está un predictor de ramas neuronal, diseñado para mejorar la precisión en patrones difíciles y estadísticamente sesgados. Al reducir la ejecución por caminos erróneos y admitir hasta dos ramas tomadas por ciclo, junto con un motor de decodificación de 10 vías, sostiene el flujo de control cuando el comportamiento del software es irregular.

El mid core expone y acelera el paralelismo oculto: un motor de renombrado amplio, un buffer de reordenamiento grande y capacidades como el renombrado de memoria y la predicción de valores reducen los bloqueos en código con muchos punteros. El motor de ejecución despacha operaciones enteras, de rama, vectoriales, de punto flotante, criptográficas y de memoria sobre un backend ancho. El subsistema de caché suma una jerarquía profunda y un prefetcher de grafos para cargas de analítica intensiva.

Multihilo espacial para llamadas a herramientas

El multihilo importa en cargas de agentes, que suelen ser en ráfagas y guiadas por eventos. El multihilo simultáneo (SMT) tradicional comparte un núcleo entre dos hilos, pero esa competencia por recursos genera un efecto de "vecino ruidoso" que degrada el rendimiento y la latencia de cola.

NVIDIA Spatial Multithreading (SMT)
NVIDIA Spatial Multithreading (SMT)

La Vera CPU adopta un enfoque distinto con NVIDIA Spatial Multithreading. En vez de depender solo del uso compartido oportunista, el ancho núcleo Olympus particiona los recursos de forma más efectiva entre dos hilos: puede operar como un núcleo de un solo hilo de alto rendimiento cuando se necesita el máximo por hilo, o como dos contextos más aislados cuando hace falta mayor densidad. Con 88 núcleos Olympus y 176 hilos, la Vera CPU soporta un gran número de tareas de agentes concurrentes con menor interferencia y latencia más consistente.

Malla coherente y memoria de alto ancho de banda

Un núcleo de alto IPC entrega todo su valor solo si el resto del procesador lo mantiene abastecido. La Vera CPU empareja al núcleo Olympus con la NVIDIA Scalable Coherency Fabric (SCF), que ofrece 3,4 TB/s de ancho de banda en el chip y caché unificada, y con memoria SOCAMM2 LPDDR5X que entrega hasta 1,2 TB/s de ancho de banda agregado con alta fiabilidad y eficiencia.

Subsistema de malla y memoria de NVIDIA
Subsistema de malla y memoria de NVIDIA

El movimiento de datos seguro y escalable se apoya en NVLink-C2C coherente, una arquitectura de doble socket con un solo dominio NUMA, PCIe 6.4, CXL 3.1 y Confidential Computing, lo que habilita un rendimiento predecible y el aislamiento seguro de máquinas virtuales a lo largo de la fábrica de IA.