NVIDIA ha presentado los primeros resultados de rendimiento de Vera Rubin NVL72 en MLPerf Inference v6.1, con hasta 3,7 veces más rendimiento que GB300 NVL72 en determinadas pruebas. La nueva plataforma también muestra una eficiencia de escalado del 99 % al pasar de uno a cuatro racks GB300 NVL72, mientras las optimizaciones de software elevan hasta 1,6 veces el rendimiento respecto a la generación anterior del benchmark.
Las claves de NVIDIA Vera Rubin NVL72 en 30 segundos
- Vera Rubin NVL72 alcanza hasta 3,7 veces el rendimiento de GB300 NVL72 en Qwen3-VL.
- En DeepSeek-R1, la ventaja comunicada llega hasta 2,5 veces según el escenario.
- GB300 NVL72 consigue un 99 % de eficiencia de escalado con 288 GPU en cuatro racks.
- Las optimizaciones de software aportaron hasta 1,6 veces más rendimiento frente a MLPerf Inference v6.0.
- Los resultados de Vera Rubin son todavía preview, mientras que las cifras posteriores de GPT-OSS-120B y DLRMv3 siguen sin verificar.
Los resultados de MLPerf Inference v6.1 sitúan a Vera Rubin NVL72 como la nueva plataforma de NVIDIA para cargas de inferencia a escala de rack. La primera participación de Vera Rubin en este benchmark utiliza los modelos DeepSeek-R1 y Qwen3-VL, dos de las pruebas incluidas en la nueva edición del conjunto de evaluación. MLCommons publicó los resultados el 16 de septiembre de 2026 y señala que esta edición incorpora también nuevas pruebas para escenarios de IA agéntica y recuperación aumentada.
La comparación no se limita a la potencia de las GPU. NVIDIA atribuye parte de las mejoras a la combinación de arquitectura, interconexión y software de inferencia. En concreto, las pruebas de Vera Rubin utilizan técnicas como disaggregated serving, que separa las fases de prefill y decode, además de paralelismo de expertos para modelos de arquitectura mixture of experts.
Vera Rubin llega a MLPerf con hasta 3,7 veces más rendimiento
En las pruebas con Qwen3-VL, Vera Rubin NVL72 registra hasta 3,7 veces el rendimiento de GB300 NVL72 en los escenarios offline, server e interactive. NVIDIA utilizó vLLM junto con su framework de inferencia de código abierto Dynamo para estas pruebas.
Con DeepSeek-R1, la diferencia comunicada llega hasta 2,5 veces frente a GB300 NVL72. En este caso, NVIDIA utilizó TensorRT-LLM, su biblioteca para optimizar inferencia de modelos de lenguaje.
Las cifras concretas varían según el tipo de carga. En la tabla de resultados publicada por NVIDIA, Qwen3-VL muestra una mejora de 1,8 veces en el escenario offline, 1,9 veces en server y 3,7 veces en interactive. Para DeepSeek-R1, las cifras son 1,7 veces, 1,9 veces y 2,5 veces, respectivamente.
La diferencia entre escenarios es relevante porque medir únicamente el rendimiento máximo de una infraestructura no refleja necesariamente cómo responderá a peticiones reales. El escenario offline busca medir el máximo rendimiento agregado, mientras que los escenarios con interacción incorporan restricciones de latencia.
MLCommons define MLPerf Inference como un benchmark orientado a medir el rendimiento de sistemas de inferencia mediante pruebas reproducibles y con una metodología común. La edición 6.1 ha incorporado además nuevos test para cargas de trabajo más complejas, incluida la inferencia agéntica.
Las cifras de Vera Rubin deben matizarse porque se trata de resultados de preview. NVIDIA los presentó como una primera participación de la plataforma en MLPerf Inference 6.1, por lo que no deben interpretarse como una medición definitiva de todas las configuraciones posibles.
GB300 demuestra que añadir GPU también puede escalar casi linealmente
Mientras Vera Rubin protagoniza la nueva generación de resultados, NVIDIA también ha utilizado MLPerf Inference v6.1 para mostrar el comportamiento de GB300 NVL72 cuando aumenta el número de racks.
La prueba de DeepSeek-R1 compara un rack con 72 GPU frente a una configuración de cuatro racks con 288 GPU. El resultado alcanza un 99 % de eficiencia de escalado en el escenario offline. La tabla publicada muestra 679.740 unidades de rendimiento para un rack y 2.705.130 para cuatro racks.
En términos prácticos, pasar de 72 a 288 GPU cuadruplica el número de aceleradores y el rendimiento crece casi en la misma proporción. La eficiencia de escalado mide precisamente hasta qué punto el aumento de recursos se traduce en un aumento equivalente del rendimiento.
Ese comportamiento depende de varios elementos. El rendimiento de una instalación con cientos de GPU no aumenta automáticamente al añadir más aceleradores. La comunicación entre GPU, la red entre racks, la distribución de las peticiones y el software que coordina los nodos pueden introducir pérdidas.
NVIDIA atribuye parte de este resultado al sistema NVL72 y a su interconexión NVLink. La sexta generación de NVLink y NVLink Switch proporciona el enlace de alta velocidad dentro del dominio de 72 GPU, mientras que otras tecnologías de red se ocupan de la comunicación entre sistemas.
El software sigue cambiando los resultados después del hardware
Otro dato de la edición 6.1 procede de las optimizaciones realizadas sobre GB300. NVIDIA afirma que el rendimiento obtenido con Qwen3-VL mejoró hasta 1,6 veces respecto a sus resultados de MLPerf Inference v6.0.
Las mejoras proceden de diferentes cambios en la pila de software, entre ellos una menor precisión para la memoria caché KV, nuevas fusiones de kernels, optimizaciones de estos componentes y el uso de disaggregated serving con vLLM y NVIDIA Dynamo.
Esto explica por qué NVIDIA presenta el rendimiento de una plataforma de IA como una combinación de hardware y software. Una misma generación de GPU puede ofrecer resultados distintos a medida que evolucionan los compiladores, las bibliotecas, los kernels y los sistemas de gestión de las cargas.
La compañía también ha mostrado cifras posteriores a la entrega oficial de resultados de MLPerf. En las tablas facilitadas aparecen 124.552 tokens por segundo en GPT-OSS-120B sobre B300 x8 en escenario offline y 119.002 tokens por segundo en server. Para DLRMv3 sobre B200 x8, las cifras comunicadas son 16.796 consultas por segundo y 15.800 consultas por segundo, respectivamente.
Estas cifras llevan expresamente la etiqueta de resultados no verificados. NVIDIA indica que corresponden a optimizaciones realizadas después del plazo de presentación de MLPerf Inference v6.1, por lo que no tienen el mismo estatus que los resultados publicados y validados dentro del benchmark.
La evolución del software también afecta a la economía de la inferencia. Si una infraestructura produce más tokens con el mismo hardware, una organización puede repartir el coste de servidores, red y energía entre un volumen mayor de trabajo. El resultado final depende de la carga concreta, el modelo utilizado y las condiciones de servicio.
De los benchmarks tradicionales a la IA agéntica
NVIDIA también está utilizando pruebas orientadas a agentes para medir Vera Rubin. En evaluaciones preliminares de SemiAnalysis AgentX citadas por la compañía, Vera Rubin NVL72 alcanzó 30 veces el rendimiento de GB300 NVL72. Esta cifra procede de una prueba de preview distinta de MLPerf Inference y, por tanto, no debe confundirse con los resultados oficiales de MLPerf.
El cambio de enfoque responde a que los agentes de IA pueden realizar varias operaciones consecutivas para completar una tarea. Una aplicación tradicional puede necesitar una única respuesta del modelo, mientras que un agente puede razonar, consultar herramientas, recuperar información y volver a ejecutar el modelo varias veces.
MLCommons ha empezado a reflejar este cambio en sus propios benchmarks. Inference v6.1 incorpora una prueba denominada Edge Agentic Inference y prepara MLPerf Endpoints como una evolución para medir cargas de inferencia mediante APIs y escenarios más próximos al funcionamiento de los sistemas en producción.
Para NVIDIA, el objetivo es que la misma infraestructura pueda utilizarse con modelos y cargas diferentes, desde entrenamiento e inferencia hasta sistemas de recomendación, razonamiento o generación de vídeo. Esa flexibilidad permite que el hardware no quede ligado a un único modelo mientras cambian las necesidades de las aplicaciones.
Vera Rubin NVL72 combina 72 GPU Rubin, 36 CPU Vera y componentes de red y procesamiento de NVIDIA en una arquitectura de rack. La compañía la está introduciendo como una plataforma orientada a cargas de IA a gran escala y a sistemas agénticos.
Los resultados de MLPerf Inference v6.1 aportan una primera referencia pública para esa nueva generación. La comparación con GB300 muestra mejoras importantes en determinadas cargas, mientras que las pruebas de escalado demuestran que la generación anterior también puede mantener una utilización elevada al crecer de un rack a cuatro.
La cuestión que queda abierta será cómo evolucionarán estos resultados cuando Vera Rubin deje atrás la fase de preview y cuando las nuevas plataformas se midan con más modelos, configuraciones y cargas de producción.
Preguntas frecuentes
¿Cuánto más rápida es Vera Rubin NVL72 que GB300 NVL72?
En los resultados de MLPerf Inference v6.1 publicados por NVIDIA, Vera Rubin NVL72 alcanza hasta 3,7 veces el rendimiento de GB300 NVL72 con Qwen3-VL y hasta 2,5 veces con DeepSeek-R1, según el escenario.
¿Qué significa una eficiencia de escalado del 99 %?
Significa que al pasar de un rack GB300 NVL72 con 72 GPU a cuatro racks con 288 GPU, el rendimiento aumenta casi en la misma proporción que los recursos utilizados en la prueba offline.
¿Los resultados de Vera Rubin ya son definitivos?
No. NVIDIA presentó los resultados de Vera Rubin NVL72 como preview dentro de MLPerf Inference v6.1. Las cifras posteriores de GPT-OSS-120B y DLRMv3 mostradas por NVIDIA tampoco están verificadas por MLCommons.
¿Qué papel tiene el software en estas mejoras?
NVIDIA atribuye parte de los avances a optimizaciones de software, como cambios en la precisión de la caché KV, fusiones de kernels, mejores kernels y técnicas de servicio desagregado. En sus resultados de Qwen3-VL, la compañía comunica hasta 1,6 veces más rendimiento frente a sus resultados de MLPerf Inference v6.0.