NVIDIA mide hasta 30 veces más rendimiento por MW con Vera Rubin frente a Blackwell

NVIDIA ha publicado nuevos resultados preliminares de Vera Rubin NVL72 que apuntan a un salto considerable en la eficiencia de la inferencia para inteligencia artificial agéntica. En pruebas realizadas por la propia compañía con el benchmark AgentX de SemiAnalysis, la nueva plataforma alcanza hasta 30 veces más throughput por megavatio que GB300 NVL72 y un coste por millón de tokens hasta 35 veces inferior en determinadas condiciones. Los resultados todavía están pendientes de revisión por SemiAnalysis.

Las claves de NVIDIA Vera Rubin en 30 segundos

  • Vera Rubin NVL72 alcanza hasta 30 veces más throughput por megavatio que GB300 NVL72 en DeepSeek V4 Pro.
  • NVIDIA cifra en hasta 35 veces la reducción del coste por millón de tokens frente a Blackwell en estas pruebas.
  • AgentX reproduce sesiones reales de programación con agentes, contexto creciente y llamadas a herramientas.
  • Blackwell también mejora: GB300 llega hasta 15 veces el rendimiento por MW de H200 con DeepSeek V4 Pro.
  • Las cifras de Vera Rubin han sido medidas por NVIDIA y siguen pendientes de validación por SemiAnalysis.

La comparación resulta especialmente interesante porque NVIDIA no está midiendo únicamente cuántos tokens puede generar una GPU en una prueba estática. AgentX intenta reproducir un escenario mucho más próximo al funcionamiento de los nuevos agentes de IA, donde una misma tarea puede encadenar razonamiento, llamadas a herramientas, subagentes y sucesivas peticiones con un contexto que aumenta durante la sesión.

Eso cambia también las métricas que empiezan a importar en los centros de datos. El rendimiento máximo de un acelerador sigue siendo relevante, pero para los operadores que despliegan decenas o cientos de racks también cuentan los tokens obtenidos por megavatio, la latencia, el tiempo hasta el primer token y el coste de producir cada millón de tokens.

Vera Rubin llega hasta 30 veces el throughput por megavatio

AgentX forma parte de InferenceX, la suite abierta de benchmarks de SemiAnalysis. En lugar de utilizar exclusivamente secuencias artificiales con longitudes predeterminadas, reproduce sesiones de agentes de programación previamente registradas.

Las pruebas conservan elementos como el crecimiento del contexto, las longitudes variables de entrada y salida, los tiempos de razonamiento y las pausas provocadas por llamadas a herramientas. También modifican la concurrencia para observar la relación entre rendimiento agregado y capacidad de respuesta para cada usuario.

En DeepSeek V4 Pro, NVIDIA asegura que Vera Rubin NVL72 consigue hasta 30 veces más throughput por megavatio que GB300 NVL72 cuando se compara a unos 160 tokens por segundo y usuario.

No significa que Vera Rubin sea 30 veces más rápida que Blackwell en cualquier carga de trabajo. El dato corresponde a un punto concreto de la curva de rendimiento de AgentX y a una determinada combinación de modelo, concurrencia e interactividad.

Esta precisión resulta importante porque NVIDIA había comunicado anteriormente para Vera Rubin mejoras del orden de 10 veces en rendimiento por vatio y 10 veces en coste por token frente a Blackwell para otros escenarios de inferencia. Los nuevos resultados no contradicen necesariamente esas cifras: proceden de una carga agéntica diferente y de una metodología distinta.

En AgentX la plataforma también puede alcanzar niveles de interactividad superiores a los de GB300 NVL72. Los gráficos publicados por NVIDIA muestran que Vera Rubin continúa escalando a niveles donde Blackwell comienza a encontrar sus límites.

La compañía vincula esta mejora a algo más amplio que la GPU Rubin. La arquitectura Vera Rubin está diseñada alrededor del sistema completo: GPU, CPU, memoria, interconexión, redes y software trabajan conjuntamente para reducir movimientos de datos, esperas y recomputaciones.

Hasta 35 veces menos coste por millón de tokens

La otra cifra destacada tiene implicaciones económicas más directas. NVIDIA afirma que Vera Rubin NVL72 puede conseguir hasta 35 veces menos coste por millón de tokens que GB300 NVL72 en las nuevas pruebas de cargas agénticas.

De nuevo, se trata de un máximo obtenido bajo las condiciones concretas utilizadas por NVIDIA y no de una reducción automática del coste de cualquier servicio de IA que migre de Blackwell a Rubin.

Pero la métrica ayuda a entender hacia dónde se está desplazando la competencia en infraestructura de inteligencia artificial.

Durante la fase inicial de la IA generativa, buena parte de la atención se concentró en disponer del mayor número posible de GPU. Con la inferencia a gran escala, la ecuación empieza a depender también de cuánto trabajo útil puede extraerse de cada GPU y, especialmente, de cada megavatio disponible en el centro de datos.

Para un operador con una capacidad eléctrica limitada, multiplicar los tokens producidos dentro del mismo presupuesto energético permite atender más peticiones sin incrementar proporcionalmente la infraestructura eléctrica y de refrigeración.

NVIDIA está llevando este planteamiento incluso a la gestión energética del centro de datos. Su tecnología DSX MaxLPS administra la potencia a nivel de GPU, rack y carga de trabajo y, según la compañía, puede permitir instalar hasta un 40 % más de GPU dentro del mismo presupuesto de un megavatio.

La electricidad disponible se convierte así en una de las unidades con las que medir la capacidad real de una infraestructura de IA.

Blackwell también mejora frente a Hopper

Los nuevos datos no se limitan a Rubin. NVIDIA ha utilizado AgentX para medir la evolución que su actual generación Blackwell representa frente a Hopper.

Con DeepSeek V4 Pro 1.6T, GB300 NVL72 alcanza hasta 15 veces más throughput por megavatio que H200 NVL8, según los resultados publicados. El coste por millón de tokens puede ser hasta diez veces inferior.

La diferencia aumenta con modelos de mayor tamaño.

En las pruebas realizadas con Kimi K3 2.8T, NVIDIA sitúa a GB300 NVL72 alrededor de 80 veces por encima de H200 NVL8 en throughput por megavatio a niveles comparables de interactividad. Blackwell puede además extender el rendimiento interactivo hasta aproximadamente 215 tokens por segundo y usuario en este escenario.

Parte de estas mejoras procede del hardware, pero NVIDIA atribuye otra parte al software. Entre las tecnologías utilizadas aparecen SGLang, TensorRT-LLM y vLLM para distribuir modelos Mixture of Experts (MoE), además de kernels DeepGEMM, formatos de precisión reducida como MXFP4 y MXFP8 y NVIDIA Dynamo.

Dynamo puede separar las fases de prefill y decode y asignarlas a grupos diferentes de recursos. Su sistema de enrutamiento también tiene en cuenta la caché KV existente para intentar evitar que partes del contexto tengan que procesarse nuevamente.

NVLink completa esa arquitectura permitiendo que las 72 GPU de un NVL72 funcionen como un dominio de computación conectado de alta velocidad. La generación Rubin eleva el ancho de banda agregado de NVLink en NVL72 desde los 130 TB/s de Blackwell hasta 260 TB/s, según las especificaciones preliminares de NVIDIA.

Los resultados de Vera Rubin publicados ahora tampoco representan todavía todas las posibilidades de la plataforma. NVIDIA señala que estas mediciones no incluyen el rendimiento de Vera CPU para las llamadas a herramientas, una tarea especialmente relevante en los agentes que alternan generación de tokens con ejecución de código o utilización de servicios externos.

La fotografía que dejan los benchmarks es, por tanto, prometedora pero todavía preliminar. Las cifras de hasta 30 veces más throughput por megavatio y 35 veces menos coste proceden de mediciones de NVIDIA sobre AgentX y permanecen pendientes de revisión independiente por SemiAnalysis. Será esa validación, junto con los despliegues comerciales, la que permita comprobar hasta qué punto las ventajas observadas se trasladan a infraestructuras de producción.

Preguntas frecuentes

¿Cuánto mejora NVIDIA Vera Rubin frente a Blackwell?

NVIDIA ha medido hasta 30 veces más throughput por megavatio de Vera Rubin NVL72 frente a GB300 NVL72 con DeepSeek V4 Pro en AgentX. Es una cifra máxima correspondiente a unas condiciones concretas del benchmark, no una mejora general de 30 veces para cualquier aplicación.

¿Vera Rubin reduce realmente 35 veces el coste de los tokens?

NVIDIA afirma haber obtenido hasta 35 veces menos coste por millón de tokens frente a GB300 NVL72 en las nuevas pruebas agénticas. Los resultados de Vera Rubin están todavía pendientes de revisión por SemiAnalysis.

¿Qué es AgentX?

AgentX es un benchmark de SemiAnalysis integrado en InferenceX que reproduce sesiones de programación con agentes. Tiene en cuenta contexto creciente, llamadas a herramientas, diferentes longitudes de entrada y salida, caché KV, concurrencia y latencia.

¿Por qué importa el rendimiento por megavatio en IA?

Los grandes centros de datos disponen de una cantidad limitada de potencia eléctrica. Producir más tokens con cada megavatio permite aumentar la capacidad de inferencia sin que el consumo energético tenga que crecer al mismo ritmo.

vía: blogs.nvidia

encuentra artículos

newsletter

Recibe toda la actualidad del sector tech y cloud en tu email de la mano de RevistaCloud.com.

Suscripción boletín

LO ÚLTIMO