NVIDIA mueve el controlador de memoria dentro de HBM y libera hasta un 25% del chip

NVIDIA ha presentado NVHBM, una nueva arquitectura de memoria de alto ancho de banda que traslada su controlador desde el acelerador hasta el propio base die de la pila HBM. La compañía asegura que el cambio puede proporcionar hasta un 30% más de ancho de banda, reducir un 15% el consumo de la memoria y liberar hasta un 25% del área del XPU frente a una implementación convencional con HBM4E. La tecnología se incorporará a NVLink Fusion y Amazon Web Services (AWS), a través de Annapurna Labs, será el primer socio anunciado para trabajar con ella.

Las claves de NVIDIA NVHBM en 20 segundos

  • NVHBM integra el controlador de memoria de NVIDIA directamente en el base die de la pila HBM.
  • NVIDIA afirma que ofrece hasta un 30% más de ancho de banda y consume un 15% menos.
  • El cambio puede liberar hasta un 25% del área del XPU frente a HBM4E convencional.
  • Varios fabricantes podrán suministrar NVHBM bajo una implementación común.
  • Annapurna Labs trabajará con NVIDIA en NVHBM y NVLink Fusion para futuras infraestructuras de AWS.

El anuncio llega cuando la memoria se ha convertido en una de las piezas que más condicionan el rendimiento de los aceleradores de inteligencia artificial. Los modelos de cientos de miles de millones o billones de parámetros necesitan mover enormes cantidades de datos entre memoria y unidades de cálculo, de modo que aumentar los FLOPS disponibles sirve de poco cuando el procesador permanece esperando los datos necesarios para utilizarlos.

NVHBM intenta modificar precisamente esa relación entre computación y memoria.

El controlador sale del XPU y entra en la pila HBM

En una arquitectura HBM tradicional, el controlador encargado de gestionar la comunicación con la memoria se encuentra dentro del propio acelerador. Eso significa que una parte del silicio disponible en el XPU debe reservarse para funciones relacionadas con memoria en lugar de utilizarse para unidades de cálculo.

NVIDIA propone trasladar ese componente.

NVHBM integra el controlador personalizado de NVIDIA dentro del base die de la pila tridimensional HBM, eliminándolo del die principal del XPU.

Según los datos publicados por la compañía, la comparación con una implementación estándar de HBM4E quedaría así:

CaracterísticaHBM4E convencionalNVIDIA NVHBM
Controlador de memoriaEn el XPUEn el base die de HBM
Ancho de bandaReferenciaHasta +30%
Consumo de HBMReferenciaHasta -15%
Área ocupada en XPU por controladorIntegrada en el chipSe traslada a HBM
Área adicional disponible en XPUHasta +25%
EnfoqueIntegración convencionalInfraestructura semi-personalizada

Las cifras son estimaciones publicadas por NVIDIA y tendrán que evaluarse sobre productos concretos cuando NVHBM llegue a sistemas comerciales. La comparación tampoco significa que cualquier acelerador vaya a obtener automáticamente un 25% más de rendimiento: NVIDIA habla de área de silicio liberada, no de rendimiento de cálculo adicional equivalente.

La ventaja para los diseñadores está precisamente en decidir qué hacer con ese espacio.

Un fabricante podría dedicarlo a más unidades de cálculo, aumentar determinadas cachés, introducir aceleradores especializados o simplemente diseñar un XPU más eficiente.

NVIDIA quiere entrar también en los chips personalizados de sus clientes

NVHBM adquiere más importancia cuando se observa como parte de NVLink Fusion, la propuesta con la que NVIDIA quiere llevar parte de su tecnología a procesadores que no necesariamente han sido diseñados por ella.

Los grandes proveedores cloud llevan años desarrollando aceleradores propios para reducir costes y adaptar el hardware a sus cargas de trabajo. Google tiene TPU, AWS desarrolla Trainium e Inferentia, Microsoft dispone de Maia y Meta también trabaja en sus propios aceleradores MTIA.

Ese movimiento podría interpretarse como una amenaza para NVIDIA: cada acelerador personalizado desplegado por un hyperscaler puede representar una carga que deja de ejecutarse sobre sus GPU.

NVLink Fusion plantea otra posibilidad.

En lugar de obligar a los clientes a escoger entre un acelerador NVIDIA o un ASIC propio, la compañía quiere que esos procesadores personalizados puedan utilizar componentes de su arquitectura, incluidos NVLink, NVLink-C2C, NVLink Switch, MGX y ahora NVHBM.

El resultado es una NVIDIA que intenta participar económicamente en la infraestructura de IA incluso cuando el procesador principal no lleva su logotipo.

La compañía define esta estrategia como una arquitectura «verticalmente integrada y horizontalmente abierta». El matiz es importante: la apertura consiste en permitir que procesadores de terceros entren en su infraestructura, pero utilizando tecnologías desarrolladas por NVIDIA.

AWS será el primer socio de NVHBM

El primer ejemplo anunciado es especialmente relevante.

Annapurna Labs, la división de Amazon responsable de buena parte del silicio personalizado de AWS, trabajará con NVIDIA en NVHBM y en la arquitectura NVLink de escalado dentro del rack.

La colaboración amplía el acuerdo previo alrededor de NVLink Fusion. AWS prevé incorporar esta tecnología a futuras generaciones de sus aceleradores Trainium, comenzando con Trainium4.

El objetivo es permitir que chips de Amazon y GPU de NVIDIA puedan formar parte de una arquitectura común a escala de rack.

Esto dibuja un escenario diferente al de hace unos años. AWS compite con NVIDIA desarrollando sus propios aceleradores, pero simultáneamente puede utilizar tecnología de interconexión y memoria de NVIDIA para construir sistemas heterogéneos.

La infraestructura resultante puede combinar diferentes tipos de procesadores según las características de cada carga.

La batalla de la IA se desplaza hacia la memoria

El anuncio también muestra cómo está cambiando el diseño de los aceleradores.

Durante las primeras fases del auge de la IA, buena parte de las comparaciones se concentraba en TFLOPS o PFLOPS. Con modelos cada vez mayores, la capacidad y el ancho de banda de memoria se han convertido en variables igual de importantes.

HBM coloca varias capas de DRAM apiladas verticalmente y conectadas mediante interfaces extremadamente anchas. La industria ha pasado progresivamente por HBM2, HBM2E, HBM3 y HBM3E, mientras HBM4 y posteriores generaciones elevan todavía más la integración.

Mover el controlador hacia el base die supone dar otro paso: la memoria deja de ser únicamente un componente conectado al acelerador y empieza a asumir funciones que anteriormente pertenecían al procesador.

Además, NVIDIA pretende establecer una implementación común de NVHBM disponible a través de varios proveedores de memoria.

Para los diseñadores de ASIC esto puede reducir parte del trabajo necesario para integrar y validar distintas memorias. También permite a NVIDIA extender su arquitectura hacia otra pieza estratégica de la cadena de suministro sin convertirse necesariamente en fabricante de DRAM.

De CUDA y las GPU a controlar la arquitectura del rack

NVHBM encaja además con la evolución reciente del negocio de NVIDIA.

La compañía acaba de comunicar que Data Center representa alrededor del 92,5% de sus ingresos trimestrales. En ese mercado ya no intenta vender únicamente aceleradores.

Su oferta abarca GPU, CPU, networking, NVLink, sistemas rack-scale, software y arquitecturas completas para centros de datos de IA. NVLink Fusion amplía esa estrategia hacia el mercado de los aceleradores personalizados.

Capa de infraestructuraTecnologías de NVIDIA
ComputaciónGPU, Grace y plataformas rack-scale
MemoriaNVHBM y controladores
Scale-upNVLink y NVLink Switch
Chip a chipNVLink-C2C
NetworkingSpectrum-X e InfiniBand
SistemasMGX y racks NVIDIA
SoftwareCUDA y librerías de IA
Chips personalizadosNVLink Fusion

La diferencia es relevante. NVIDIA ya no necesita fabricar necesariamente todos los procesadores de un sistema para intentar que su tecnología forme parte de ese sistema.

Un hyperscaler puede diseñar su propio XPU y seguir utilizando NVLink para conectarlo, NVHBM para su subsistema de memoria y tecnologías NVIDIA para integrarlo en una infraestructura a escala de rack.

Es una forma de adaptarse al crecimiento del silicio personalizado sin enfrentarse necesariamente a él en todas las cargas.

La cuestión pendiente será comprobar cuánto de ese 30% adicional de ancho de banda y 15% de ahorro energético se conserva cuando NVHBM llegue a productos comerciales, y qué fabricantes de memoria se incorporan al estándar.

Pero el movimiento resulta indicativo de hacia dónde se dirige la infraestructura de IA. La competición ya no consiste únicamente en fabricar la GPU más rápida. Cada vez importa más quién controla la comunicación entre cálculo, memoria y cientos de aceleradores dentro de un mismo sistema.

Preguntas frecuentes

¿Qué es NVIDIA NVHBM?

NVHBM es una tecnología de memoria de alto ancho de banda que integra el controlador personalizado de NVIDIA directamente en el base die de la pila HBM, en lugar de mantenerlo dentro del XPU.

¿Qué ventajas promete NVHBM frente a HBM4E?

NVIDIA afirma que puede proporcionar hasta un 30% más de ancho de banda, reducir un 15% el consumo de HBM y liberar hasta un 25% del área del XPU frente a una arquitectura HBM4E convencional.

¿NVHBM será exclusiva de las GPU NVIDIA?

El anuncio está precisamente orientado a NVLink Fusion y procesadores personalizados de terceros. NVIDIA afirma además que establecerá una implementación común que podrán ofrecer varios proveedores de memoria.

¿Qué relación tiene AWS con NVHBM?

Annapurna Labs será el primer socio anunciado para trabajar con NVIDIA en NVHBM. La colaboración forma parte de una relación más amplia alrededor de NVLink Fusion y de futuras generaciones de los aceleradores Trainium de AWS.

vía: blogs.nvidia

encuentra artículos

newsletter

Recibe toda la actualidad del sector tech y cloud en tu email de la mano de RevistaCloud.com.

Suscripción boletín

LO ÚLTIMO