NVIDIA quiere sacar más tokens de cada megavatio en sus fábricas de IA

NVIDIA está trasladando la optimización de los centros de datos de IA desde componentes aislados hacia la gestión conjunta de potencia, refrigeración, red y cargas de trabajo. Su plataforma NVIDIA DSX busca aumentar la cantidad de trabajo de IA que puede realizar una infraestructura con un presupuesto eléctrico fijo, con pruebas de Lambda que registran un 24 % más de tokens por segundo bajo el mismo límite de potencia.

Las claves de NVIDIA DSX en 30 segundos

  • Lambda ejecutó 19 nodos dentro del presupuesto eléctrico de 16 nodos a plena potencia.
  • El rendimiento del clúster pasó de unos 4 a 5 millones de tokens por segundo, un 24 % más.
  • El rendimiento por vatio mejoró un 23 % en esa validación.
  • Emerald AI ha reducido automáticamente una carga de 4 a 3 megavatios ante señales de Silicon Valley Power.
  • NVIDIA proyecta hasta un 40 % más de capacidad de GPU en determinados despliegues Vera Rubin con el mismo presupuesto eléctrico.

La expansión de la inteligencia artificial está convirtiendo la disponibilidad eléctrica en una de las restricciones que condicionan el crecimiento de las infraestructuras de computación acelerada. NVIDIA plantea que aumentar el número de megavatios no siempre es la única vía para obtener más capacidad: también se puede utilizar mejor la electricidad ya disponible.

Ese es el planteamiento de NVIDIA DSX, una plataforma que combina herramientas de diseño y simulación con software de operación, gestión dinámica de potencia y arquitecturas de referencia. La compañía presentó DSX en GTC Taipei y está utilizando las primeras validaciones para mostrar cómo puede aumentar el trabajo realizado por cada unidad de energía.

El indicador que NVIDIA coloca en el centro de esta estrategia es la cantidad de trabajo útil que una fábrica de IA puede producir por megavatio. En sistemas dedicados a inferencia, esto se puede observar mediante los tokens generados por segundo, aunque el resultado final depende de las cargas, la configuración y las condiciones concretas de cada instalación.

Lambda logra un 24 % más de tokens con el mismo presupuesto

Una de las pruebas más concretas procede de Lambda, proveedor de infraestructura de GPU. La empresa validó NVIDIA DSX MaxLPS en un clúster de cinco racks y 19 nodos basados en servidores NVIDIA HGX B200.

El sistema utiliza software de potencia dinámica para observar el consumo de las GPU y de los racks y redistribuir el margen disponible según las necesidades de las cargas. La idea es evitar que una configuración estática reserve potencia que en un momento determinado no se está utilizando.

En la prueba, Lambda consiguió ejecutar 19 nodos dentro del mismo presupuesto eléctrico que utilizaba como referencia para 16 nodos funcionando a plena potencia. El resultado fue un aumento aproximado del 24 % en el rendimiento agregado de tokens, desde unos 4,04 millones hasta aproximadamente 5 millones de tokens por segundo.

El rendimiento por vatio también aumentó un 23 %. NVIDIA y Lambda señalan que el comportamiento es especialmente relevante cuando entrenamiento e inferencia comparten infraestructura, porque sus perfiles de consumo no son idénticos y pueden dejar margen que un sistema de asignación estática no aprovecha.

La documentación de NVIDIA describe MaxLPS como un modelo de asignación dinámica que busca recuperar esa capacidad disponible dentro de un límite eléctrico determinado. En sus escenarios de referencia para futuras fábricas basadas en Vera Rubin NVL72, NVIDIA indica que el enfoque puede permitir hasta un 40 % más de GPU dentro del mismo presupuesto de potencia en determinados entornos. Se trata de una estimación de la compañía, no de un resultado general aplicable a cualquier centro de datos.

La propia documentación técnica pone como ejemplo un escenario ilustrativo de inferencia con un presupuesto de 1 megavatio en el que MaxLPS alcanza una capacidad de 400 GPU y un rendimiento de tokens equivalente a 1,35 veces el modo MaxP. NVIDIA advierte que materializar ese potencial requiere diseñar la instalación teniendo en cuenta también la refrigeración y otros elementos de la infraestructura.

Una fábrica de IA también puede responder a la red eléctrica

La otra parte de la propuesta afecta a la relación entre los centros de datos y la red eléctrica. NVIDIA describe una demostración realizada con Emerald AI y Silicon Valley Power, la compañía eléctrica que suministra energía a la zona de Santa Clara.

En uno de los episodios descritos por NVIDIA, Silicon Valley Power envió una señal para reducir el consumo de una fábrica de IA. Emerald AI Conductor recibió la instrucción y ajustó automáticamente las cargas flexibles: los trabajos de menor prioridad se ralentizaron o reprogramaron mientras las tareas consideradas prioritarias continuaron funcionando.

La potencia descendió de 4 a 3 megavatios sin intervención manual. NVIDIA señala además que Silicon Valley Power ha enviado más de 200 señales de demanda a esa instalación y que el mecanismo respondió en todos los casos descritos por la compañía.

Esta demostración utiliza Emerald AI Conductor y no es todavía una instalación de DSX Flex. NVIDIA la presenta como una experiencia previa que sirve de base para la estrategia de DSX Flex, que está diseñada para recibir señales de la red, como solicitudes de reducción de carga, eventos de respuesta a la demanda o determinadas señales de precio, y ajustar las prioridades de las cargas de IA.

Según NVIDIA, la primera implantación comercial específica de DSX Flex está prevista para una instalación de 96 megavatios en Manassas, Virginia, dentro del AI Factory Research Center de la compañía. La plataforma incorporará la integración de Emerald AI Conductor a medida que madure DSX Flex.

El concepto cambia ligeramente la forma de entender una fábrica de IA. La infraestructura no solo consume electricidad, sino que puede modificar temporalmente su demanda cuando determinadas cargas permiten hacerlo. Las tareas prioritarias continúan y otras pueden esperar a un momento con menor presión sobre la red.

800 VDC y una visión conjunta de la infraestructura

NVIDIA también está trabajando en una arquitectura de distribución eléctrica de 800 VDC, es decir, corriente continua a 800 voltios. La compañía plantea este diseño para reducir conversiones, mejorar la eficiencia de la entrega eléctrica y facilitar la alimentación de racks de computación acelerada con una densidad creciente.

La arquitectura de 800 VDC forma parte de los diseños de referencia de DSX. NVIDIA también señala una previsión de mejora de entre un 3 % y un 5 % en eficiencia de extremo a extremo frente a una distribución de 54 V en determinados escenarios asociados a Vera Rubin NVL72, con disponibilidad prevista para 2027. Esa cifra corresponde a una proyección de NVIDIA y depende de la configuración utilizada.

La propuesta completa de DSX incluye varias piezas. DSX MaxLPS se centra en obtener más rendimiento dentro de un presupuesto de potencia fijo; DSX Flex busca adaptar las cargas a las condiciones de la red; DSX OS proporciona software para la gestión del ciclo de vida de las fábricas; DSX Sim permite modelar las instalaciones antes de construirlas, y los diseños de referencia reúnen configuraciones validadas de computación, red, almacenamiento y sistemas de instalación.

NVIDIA también incorpora la refrigeración dentro de ese planteamiento. La compañía señala que determinados racks GB200 NVL72 con refrigeración líquida directa deben disipar alrededor de 120 kW de calor. Por eso, aumentar la potencia de cálculo sin considerar al mismo tiempo la refrigeración, la red o la distribución eléctrica puede dejar capacidad infrautilizada.

La tesis de NVIDIA es que la eficiencia de una fábrica de IA debe medirse por el trabajo que consigue realizar con los recursos disponibles, y no únicamente por las prestaciones máximas de una GPU. Los resultados de Lambda aportan una primera validación práctica de esa idea, mientras que la experiencia con Emerald AI muestra otra posibilidad: que determinadas instalaciones puedan ajustar su consumo ante las necesidades de la red.

El siguiente paso será comprobar cómo se comportan estas técnicas en despliegues mayores y con cargas de trabajo diferentes. Las cifras de Lambda corresponden a una configuración concreta, mientras que las mejoras proyectadas para Vera Rubin dependen de las condiciones de cada instalación.

Preguntas frecuentes

¿Qué es NVIDIA DSX?

NVIDIA DSX es una plataforma para diseñar y operar fábricas de IA combinando computación, potencia eléctrica, refrigeración, red y software con el objetivo de aumentar el rendimiento obtenido dentro de un presupuesto energético determinado.

¿Cuánto aumentó el rendimiento de Lambda?

Lambda consiguió un 24 % más de rendimiento agregado de tokens en una prueba con DSX MaxLPS, pasando de unos 4,04 millones a aproximadamente 5 millones de tokens por segundo dentro del mismo presupuesto de potencia.

¿Qué hace DSX Flex?

DSX Flex está diseñado para adaptar las cargas de trabajo de una fábrica de IA a señales de la red eléctrica, reduciendo temporalmente el consumo de determinadas tareas mientras mantiene las cargas prioritarias.

¿Qué papel tiene la arquitectura de 800 VDC?

NVIDIA incorpora 800 VDC a sus diseños de referencia para reducir la complejidad de conversión y mejorar la distribución eléctrica en instalaciones con racks de computación cada vez más densos.

vía: blogs.nvidia

encuentra artículos

newsletter

Recibe toda la actualidad del sector tech y cloud en tu email de la mano de RevistaCloud.com.

Suscripción boletín

LO ÚLTIMO