---
title: "MLPerf 6.1 enfrenta a NVIDIA, AMD e Intel en la carrera por la inferencia de IA"
description: "La nueva edición de MLPerf Inference 6.1 deja una fotografía más compleja de la carrera por la infraestructura de inteligencia artificial. AMD ha llevado su Instinct MI355X hasta una configuración de..."
url: https://revistacloud.com/mlperf-6-1-enfrenta-a-nvidia-amd-e-intel-en-la-carrera-por-la-inferencia-de-ia/
date: 2026-09-18
modified: 2026-09-17
author: "Noticias Cloud"
image: https://revistacloud.com/wp-content/uploads/2024/06/amd-nvidia-war.jpeg
categories: ["Noticias"]
tags: ["AMD", "MLPerf", "NVIDIA"]
type: post
lang: es
---

# MLPerf 6.1 enfrenta a NVIDIA, AMD e Intel en la carrera por la inferencia de IA

La nueva edición de MLPerf Inference 6.1 deja una fotografía más compleja de la carrera por la infraestructura de inteligencia artificial. AMD ha llevado su Instinct MI355X hasta una configuración de 512 GPU que marca récord de escala en el benchmark, mientras NVIDIA estrena resultados preliminares de Vera Rubin y demuestra importantes mejoras de Blackwell. Intel, por su parte, amplía la presencia de Xeon y Arc Pro B70 con ganancias obtenidas en buena parte mediante software.

**Las claves de MLPerf 6.1 en 30 segundos**

- AMD alcanza 5,75 millones de tokens/s con 512 MI355X en GPT-OSS-120B y 2,90 millones en DeepSeek-R1.
- NVIDIA estrena Vera Rubin NVL72 con hasta 3,7 veces más rendimiento que GB300 NVL72 en Qwen3-VL.
- Un sistema GB300 de 288 GPU consigue un 99 % de eficiencia de escalado en DeepSeek-R1.
- En configuraciones de 8 GPU, GB300 supera a MI355X en varios modelos, aunque AMD mantiene ventaja en determinadas cargas.
- Intel mejora el rendimiento de Arc Pro B70 y Xeon 6 sin cambiar el hardware utilizado en algunas comparaciones.

MLPerf Inference 6.1 llega además con un cambio importante en los propios trabajos que se utilizan para medir las máquinas. MLCommons ha incorporado pruebas orientadas a escenarios más cercanos a las aplicaciones actuales de IA, entre ellas **End-to-End Retrieval-Augmented Generation (E2E-RAG)** y **Edge Agentic Inference**. La primera mide una cadena completa que incluye embeddings, búsqueda vectorial, reranking y generación con un modelo de lenguaje. La segunda intenta reflejar cargas agénticas de varios turnos, donde cada consulta depende del contexto anterior.

La edición ha reunido a 30 organizaciones participantes, la cifra más alta registrada hasta ahora por MLPerf Inference. También aparecen nuevos procesadores y aceleradores, entre ellos AMD Ryzen AI Max+ 395, Instinct MI350P, Intel Arc Pro B70 y las primeras plataformas Rubin de NVIDIA, estas últimas todavía en modalidad de preview.

## AMD lleva el MI355X hasta 512 GPU

La cifra más llamativa de las gráficas analizadas es la configuración de **512 AMD Instinct MI355X** presentada por Crusoe. En GPT-OSS-120B alcanza 5,75 millones de tokens por segundo en el escenario Offline y 5,39 millones en Server. En DeepSeek-R1 llega a 2,90 millones de tokens por segundo en Offline y 2,41 millones en Server. AMD describe estos resultados como los mayores rendimientos agregados de tokens registrados hasta ahora en MLPerf para esas cargas.

La comparación requiere cierta cautela porque el número de aceleradores no es igual entre todas las configuraciones. En DeepSeek-R1, por ejemplo, la configuración AMD de 512 GPU alcanza 2.901.950 tokens/s en los datos publicados, mientras una configuración NVIDIA GB300 de 288 GPU registra 2.705.130 tokens/s. En este caso, AMD obtiene un mayor rendimiento agregado con más aceleradores, por lo que no puede interpretarse como una comparación directa de eficiencia por GPU.

La situación cambia cuando se reduce la escala.

En GPT-OSS-120B, el MI355X con ocho GPU alcanza 117.804 tokens/s en Offline y 110.188 en Server según los datos recogidos en las gráficas. El GB300 de ocho GPU llega a 132.236 y 127.921 tokens/s, respectivamente. En otras palabras, el sistema de NVIDIA mantiene una ventaja en esa configuración concreta.

AMD también muestra una mejora considerable cuando aumenta el número de MI355X. La compañía señala una eficiencia de escalado del 95 % entre ocho y 72 GPU en GPT-OSS-120B, un dato que indica que una parte elevada del rendimiento teórico adicional se conserva al pasar a una configuración multinodo.

Ese comportamiento resulta más relevante para grandes infraestructuras que una cifra máxima aislada. Cuando una plataforma crece de un servidor a varios racks, las comunicaciones entre GPU, la memoria, la distribución de las peticiones y el software pueden convertirse en cuellos de botella.

## Vera Rubin aparece por primera vez en MLPerf

La otra gran novedad de esta ronda llega de NVIDIA. **Vera Rubin NVL72** aparece por primera vez en MLPerf Inference mediante resultados de preview.

En DeepSeek-R1, el sistema de 72 GPU VR200 registra 1.183.327 tokens/s en Offline, frente a 689.961 tokens/s para un sistema GB300 NVL72 de 72 GPU. En Qwen3-VL, Vera Rubin alcanza 1.307 consultas por segundo frente a 349 del GB300, aproximadamente 3,7 veces más. Los resultados de Vera Rubin están identificados como preliminares en la documentación de NVIDIA.

La comparación con Blackwell también permite ver que la escala importa. Un sistema GB300 de 72 GPU consigue 679.740 tokens/s en DeepSeek-R1, mientras una configuración de 288 GPU alcanza 2.705.130. NVIDIA afirma que el salto entre una y cuatro plataformas NVL72 mantiene un **99 % de eficiencia de escalado** en el escenario Offline.

Ese 99 % no significa que cuatro racks sean cuatro veces más rápidos en cualquier carga de trabajo. Se refiere a la eficiencia de escalado de una configuración concreta dentro del benchmark de DeepSeek-R1. Es una métrica que mide cuánto rendimiento adicional se obtiene al aumentar los recursos disponibles.

NVIDIA también atribuye parte de la evolución entre MLPerf 6.0 y 6.1 a su software. La compañía calcula mejoras de hasta 1,6 veces en determinados resultados gracias a cambios en kernels, fusión de operaciones, precisión de la caché KV y técnicas de serving distribuido.

## Intel demuestra que el software también mueve la tabla

Intel aparece en esta edición con dos frentes distintos: los procesadores Xeon 6 y las GPU Arc Pro B70.

En Xeon 6, la compañía amplía de dos a cinco modelos evaluados respecto a MLPerf 6.0. Intel afirma que un Xeon 6980P consiguió multiplicar por 2,4 el rendimiento Server en Llama 3.1 8B respecto a la edición anterior utilizando el mismo silicio y número de sockets, mientras que el rendimiento Offline aumentó un 56 %.

Con Arc Pro B70, una máquina equipada con cuatro GPU suma 128 GB de VRAM y aparece en pruebas con Llama 3.1 8B, Llama 2 70B, GPT-OSS-120B, Whisper y E2E-RAG.

En GPT-OSS-120B, Intel compara el mismo sistema de cuatro Arc Pro B70 utilizado en MLPerf 6.0 y comunica una mejora del 36 % en Server y del 27 % en Offline. Los resultados pasan de 951,67 a 1.296,87 tokens/s en Server y de 1.536,90 a 1.956,40 en Offline.

Los datos de las gráficas también sitúan a Arc Pro B70 por debajo de las grandes GPU de AMD y NVIDIA en las cargas LLM analizadas. En Llama 3.1 8B, por ejemplo, cuatro Arc Pro B70 alcanzan 4.977 tokens/s en Offline, frente a 158.458 del MI355X con ocho GPU y 171.114 del GB300 con ocho GPU.

La comparación no pretende colocar estas máquinas en la misma categoría. Precisamente uno de los aspectos interesantes de MLPerf 6.1 es que el benchmark empieza a recoger configuraciones que cubren desde grandes sistemas multinodo hasta estaciones y servidores más pequeños.

### Las cifras cambian cuando cambia el modelo

Los resultados de MLPerf 6.1 también muestran por qué no resulta suficiente utilizar una única cifra para hablar de “la GPU más rápida”.

En Llama 2 70B, un sistema GB300 de ocho GPU alcanza 132.253 tokens/s en Offline frente a 103.792 del MI355X de ocho GPU. En Llama 3.1 8B, el GB300 llega a 171.114 frente a 158.458 del MI355X. Pero en GPT-OSS-120B aparecen otras relaciones según la configuración y el escenario.

También cambia el resultado cuando se aumenta el número de aceleradores. En DeepSeek-R1, el sistema AMD de 512 GPU supera en rendimiento agregado a la configuración NVIDIA de 288 GPU mencionada en las gráficas, mientras que Vera Rubin obtiene resultados muy superiores a GB300 en determinadas pruebas con solo 72 GPU. Son comparaciones útiles para entender el comportamiento de cada plataforma, pero no equivalen a una clasificación universal.

Hay otro factor que complica todavía más la fotografía: **el software**.

MLPerf compara configuraciones concretas, versiones de software y modelos determinados. NVIDIA, AMD e Intel están optimizando continuamente sus pilas de inferencia. Por eso un resultado publicado hoy puede quedar superado por otra versión de los kernels, los compiladores, las bibliotecas de inferencia o los sistemas de serving sin que haya cambiado físicamente la GPU.

MLCommons apunta precisamente en esa dirección con la evolución del benchmark. Más de la mitad de los participantes de esta edición utilizaron el nuevo sistema de pruebas basado en API, diseñado como base para la futura familia MLPerf Endpoints y con una arquitectura cliente-servidor más próxima a determinados despliegues reales de centros de datos.

La edición 6.1 deja así una carrera dividida en varios frentes. AMD demuestra que el MI355X puede escalar hasta 512 GPU con un volumen de tokens que marca nuevos registros agregados; NVIDIA utiliza Vera Rubin para enseñar por primera vez cómo será su siguiente generación dentro de MLPerf y mantiene a Blackwell en posiciones competitivas; e Intel muestra que todavía hay margen para extraer más rendimiento de Xeon y Arc Pro mediante software.

Para quienes diseñan infraestructuras de IA, la cifra máxima de tokens por segundo es solo una parte de la ecuación. El modelo utilizado, el tamaño del sistema, la latencia, la eficiencia de escalado, la precisión, la memoria, el software y el coste de operar el conjunto determinan qué resultado tiene sentido para una carga concreta. MLPerf 6.1 deja precisamente esa idea sobre la mesa: la competencia ya no se libra únicamente por tener una GPU más rápida, sino por conseguir que todo el sistema mantenga el rendimiento cuando la inferencia pasa del laboratorio a cientos de aceleradores.
