La nueva generación de infraestructura para inteligencia artificial ya no se libra únicamente en el terreno de las GPU. NVIDIA y AMD están diseñando plataformas completas donde CPU, GPU, memoria, red y almacenamiento funcionan como un único sistema. En ese contexto nacen NVIDIA Vera Rubin y AMD Helios, dos arquitecturas que perseguirán el mismo objetivo, pero con filosofías bastante diferentes.
Las claves de Vera Rubin y Helios en 20 segundos
- NVIDIA apuesta por un ecosistema totalmente integrado alrededor de Vera Rubin.
- AMD responde con Helios, una plataforma abierta basada en los aceleradores Instinct MI500.
- Ambos sistemas están diseñados para escalar miles de GPU en una única infraestructura de IA.
- La diferencia no estará solo en la potencia, sino en la arquitectura completa del centro de datos.
NVIDIA: integración total desde el chip hasta el rack
Con Vera Rubin, NVIDIA mantiene la estrategia que tan buenos resultados le ha dado con DGX y GB200 NVL72.
La compañía no vende únicamente GPU. Diseña prácticamente toda la plataforma:
- CPU Vera basada en Arm.
- GPU Rubin.
- Red Spectrum-X e InfiniBand.
- BlueField DPU.
- NVLink y NVSwitch.
- Software CUDA, NCCL y toda la pila AI Enterprise.
El objetivo es que todo funcione como un único ordenador gigante.
La arquitectura NVL72 ya permite conectar decenas de GPU con un ancho de banda interno enorme. Rubin llevará este concepto aún más lejos, incrementando memoria HBM, capacidad de interconexión y eficiencia energética.
La ventaja es evidente: NVIDIA controla prácticamente todos los componentes críticos.
El inconveniente también.
El cliente entra en un ecosistema muy integrado donde cambiar una pieza resulta mucho más complejo.
AMD Helios apuesta por una arquitectura más abierta
AMD plantea una filosofía distinta.
Helios será la evolución natural de sus plataformas Instinct y utilizará la futura familia Instinct MI500, acompañada por procesadores EPYC Venice y una nueva generación de interconexiones de muy alta velocidad.
Aunque AMD también desarrolla una plataforma completa, su estrategia continúa siendo más abierta que la de NVIDIA.
La compañía mantiene una fuerte apuesta por:
- ROCm como alternativa a CUDA.
- CPU EPYC.
- GPU Instinct.
- Interconexiones UALink y Ultra Ethernet.
- Colaboración con distintos fabricantes OEM.
AMD intenta convencer a los grandes proveedores cloud ofreciendo mayor flexibilidad para construir infraestructuras personalizadas.
Dos filosofías para el mismo problema
El gran reto ya no consiste únicamente en fabricar GPU más rápidas.
El verdadero cuello de botella aparece cuando miles de aceleradores deben trabajar simultáneamente.
Entran entonces en juego aspectos como:
- latencia entre nodos;
- ancho de banda;
- memoria compartida;
- consumo energético;
- refrigeración;
- almacenamiento;
- software distribuido.
Por eso NVIDIA habla cada vez menos de GPU y más de AI Factory, mientras AMD utiliza el concepto de AI Infrastructure.
En ambos casos, la GPU es solo una parte del sistema.
Software: el mayor punto diferencial
Si existe una ventaja clara para NVIDIA, probablemente sea el software.
CUDA continúa siendo el estándar de facto para la mayoría de desarrolladores de IA.
A ello se suman herramientas como:
- TensorRT
- NCCL
- AI Enterprise
- NIM
- Dynamo
- NeMo
AMD ha mejorado enormemente ROCm durante los últimos dos años y cada vez más modelos funcionan correctamente sobre sus aceleradores Instinct.
Sin embargo, todavía existe una diferencia importante en madurez del ecosistema.
La batalla también se libra en memoria y almacenamiento
Otro cambio importante afecta al papel del almacenamiento.
Los modelos de IA ya no caben completamente dentro de la memoria HBM.
Por ello tanto NVIDIA como AMD están impulsando nuevas arquitecturas donde SSD PCIe Gen6, memoria CXL y almacenamiento distribuido pasan a formar parte de la jerarquía de memoria.
NVIDIA ya ha presentado iniciativas como Storage-Next y SCADA, mientras que todo apunta a que AMD seguirá una dirección similar en Helios para reducir la dependencia de la memoria HBM.
¿Cuál será mejor?
Todavía es pronto para responder.
Rubin aún no está disponible comercialmente y Helios llegará más adelante.
Además, muchas especificaciones completas todavía no se conocen.
Lo que sí parece claro es que la competencia ya no gira únicamente alrededor del rendimiento bruto de una GPU.
Las grandes compañías cloud evaluarán aspectos como:
- coste por token generado;
- eficiencia energética;
- facilidad de despliegue;
- ecosistema software;
- capacidad de escalado;
- disponibilidad de memoria;
- integración con redes y almacenamiento.
En definitiva, Vera Rubin y Helios representan dos formas distintas de construir la próxima generación de fábricas de inteligencia artificial. NVIDIA continúa apostando por una integración casi total de hardware y software, mientras AMD intenta ofrecer una alternativa más abierta y flexible para hiperescaladores y grandes centros de datos. La verdadera competencia ya no será entre GPU, sino entre plataformas completas capaces de alimentar la creciente demanda de modelos de IA cada vez más grandes y complejos.
Preguntas frecuentes
¿Qué es NVIDIA Vera Rubin?
Es la próxima plataforma de inteligencia artificial de NVIDIA, que combinará CPU Arm Vera, GPU Rubin, redes NVLink e InfiniBand y toda la pila de software CUDA.
¿Qué es AMD Helios?
Helios es la futura plataforma de IA de AMD basada en aceleradores Instinct MI500, procesadores EPYC y una arquitectura diseñada para grandes centros de datos.
¿La diferencia está solo en las GPU?
No. La competencia se centra cada vez más en plataformas completas que integran procesadores, memoria, redes, almacenamiento y software.
¿Cuál llegará antes?
NVIDIA y AMD han anunciado calendarios diferentes para sus próximas generaciones, pero ambas plataformas están previstas para los próximos ciclos de despliegue de infraestructura de IA en centros de datos.