OpenAI enfrenta Jalapeño a NVIDIA Blackwell y gana en inferencia por vatio

OpenAI ha publicado los primeros resultados de Jalapeño, su primer acelerador ASIC propio para inferencia de inteligencia artificial, y las cifras muestran una ventaja considerable frente a sistemas NVIDIA Blackwell GB200 y GB300 en las tres cargas analizadas. En GPT-OSS 120B alcanza 85.448 tokens mixtos por segundo y kilovatio, 1,9 veces el resultado del sistema de comparación, mientras que llega a 1.459 tokens por segundo por usuario en su punto de menor latencia. Son resultados medidos con el benchmark InferenceX de SemiAnalysis, aunque todavía no permiten afirmar que Jalapeño sea más rápido que Blackwell para cualquier carga de IA.

Las claves de OpenAI Jalapeño en 20 segundos

  • Jalapeño alcanza entre 1,5 y 1,9 veces más rendimiento por vatio en los tres modelos publicados.
  • Llega a 1.459 tokens/s por usuario con GPT-OSS 120B.
  • Las comparaciones utilizan NVIDIA GB200 y GB300 según el modelo.
  • OpenAI ha probado también DeepSeek R1 670B y Kimi K2.5 1T.
  • Su despliegue interno comenzará previsiblemente antes de terminar 2026.

La importancia del anuncio está tanto en los resultados como en quién los obtiene. OpenAI lleva años siendo uno de los grandes compradores de aceleradores de NVIDIA y asegura que continuará desplegándolos. Jalapeño introduce una segunda vía: diseñar silicio específicamente alrededor de sus necesidades de inferencia, integrando acelerador, memoria, interconexión, software y diseño del sistema.

Los resultados publicados proceden además de modelos con características muy diferentes: GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 con un billón de parámetros. SemiAnalysis señala que Jalapeño superó en sus pruebas a los aceleradores de NVIDIA, AMD y Google que había podido evaluar con varios grandes modelos abiertos. Esa afirmación amplía el alcance de las pruebas, pero debe distinguirse de los resultados concretos NVIDIA que OpenAI ha publicado en sus gráficas.

Hasta 1.459 tokens por segundo para un usuario

Una de las cifras más llamativas aparece al medir la velocidad máxima de decodificación por usuario.

Con GPT-OSS 120B, Jalapeño alcanza 1.459 tokens/s por usuario, frente a 535 tokens/s del sistema GB200 utilizado como referencia. Son unas 2,7 veces más.

La diferencia aumenta con DeepSeek R1: 700 frente a 169 tokens/s, unas 4,1 veces. Con Kimi K2.5 obtiene 694 tokens/s frente a los 182 del GB300, unas 3,8 veces.

ModeloJalapeñoNVIDIA comparadoVentaja
GPT-OSS 120B1.459 tokens/s/usuarioGB200: 5352,7x
DeepSeek R1 670B700GB300: 1694,1x
Kimi K2.5 1T694GB300: 1823,8x

La métrica resulta especialmente interesante para asistentes y agentes de IA, donde el tiempo necesario para generar cada respuesta condiciona la duración completa de tareas formadas por numerosos pasos consecutivos.

OpenAI sostiene precisamente que uno de los objetivos de Jalapeño era evitar el compromiso habitual entre throughput y latencia. Un sistema puede atender muchas peticiones simultáneamente mediante batching, pero hacerlo no significa necesariamente proporcionar la respuesta más rápida a cada usuario.

Jalapeño intenta mantener ambos factores en una misma arquitectura.

El resultado aparece también en la latencia de extremo a extremo. OpenAI comunica 1,03 segundos frente a 1,80 segundos con GPT-OSS, 1,65 frente a 5,99 segundos en DeepSeek R1 y 1,56 frente a 5,31 segundos en Kimi K2.5.

La batalla importante está en los tokens por kilovatio

Para un centro de datos la velocidad absoluta solo cuenta una parte de la historia. La electricidad disponible se ha convertido en una de las principales restricciones para desplegar grandes infraestructuras de IA.

OpenAI ha utilizado por ello el rendimiento por unidad de potencia como una de sus métricas principales.

Los resultados son los siguientes:

ModeloJalapeñoNVIDIADiferencia
GPT-OSS 120B85.448 tokens/s/kWGB200: 44.9601,9x
DeepSeek R1 670B19.641 tokens/s/kWGB300: 11.7811,7x
Kimi K2.5 1T18.195 tokens/s/kWGB300: 11.8621,5x

La compañía normalizó la comparación utilizando la potencia nominal publicada para cada acelerador: 700 W para Jalapeño, 1.200 W para GB200 y 1.400 W para GB300. OpenAI añade que su chip se mantuvo en las cargas probadas en un consumo sostenido igual o inferior a 550 W.

Es un matiz importante. Los 85.448 tokens/s/kW no significan que un único Jalapeño produzca 85.448 tokens cada segundo. La métrica normaliza el rendimiento de los sistemas por potencia para hacer posible una comparación de eficiencia.

También conviene evitar otra simplificación: estos datos no demuestran que Jalapeño sea un 90 % más potente que Blackwell en términos generales. Demuestran que, en GPT-OSS 120B y bajo la metodología concreta de InferenceX, obtiene aproximadamente 1,9 veces el throughput mixto por kilovatio del GB200 empleado en la comparación.

InferenceX mantiene resultados para numerosas configuraciones y muestra hasta qué punto rendimiento, coste y eficiencia pueden variar con el modelo, precisión, secuencia y nivel de interactividad seleccionado.

La cifra de 104 veces necesita una explicación

Hay un tercer resultado todavía más espectacular: 104,3 veces.

Pero sería incorrecto afirmar a partir de él que Jalapeño es 104 veces más rápido que una NVIDIA GB300.

OpenAI realiza aquí una prueba diferente. Fija para ambos sistemas la velocidad por usuario máxima alcanzada por la plataforma NVIDIA y después calcula cuánto throughput por kilovatio puede mantener cada arquitectura en ese punto.

Con GPT-OSS y una velocidad aproximada de 535 tokens/s por usuario, Jalapeño consigue 22.935 tokens mixtos/s/kW frente a 427 del GB200: 53,7 veces más.

Con DeepSeek R1, fijando aproximadamente 169 tokens/s por usuario, la comparación queda en 12.258 frente a 118, una diferencia de 104,3 veces.

Y con Kimi K2.5, a unos 182 tokens/s por usuario, son 6.744 frente a 120, 56,1 veces.

Lo que revela la prueba es el coste que puede tener llevar una arquitectura hacia su extremo de baja latencia. El sistema Blackwell de comparación pierde gran parte de su capacidad agregada cuando se le exige mantener simultáneamente esa velocidad por usuario.

Es precisamente ahí donde OpenAI quiere diferenciar su ASIC.

La inferencia de un modelo de lenguaje tampoco consiste en realizar continuamente el mismo tipo de operación. Durante el prefill, el acelerador procesa el prompt y existe una demanda elevada de cálculo. Durante el decode, genera los tokens sucesivamente y el ancho de banda de memoria adquiere mucho más peso.

Jalapeño ha sido diseñado para reducir movimientos de datos entre esas fases. OpenAI explica que puede colocar explícitamente el estado del modelo, incluido el KV cache, y mantenerlo local mientras asigna cálculo, memoria y red según las necesidades de cada etapa.

Esa diferencia resulta relevante frente a arquitecturas que separan prefill y decode entre distintos recursos. No significa que la desagregación sea intrínsecamente peor: NVIDIA y los motores de inferencia modernos están consiguiendo resultados muy competitivos precisamente mediante esas técnicas. InferenceX muestra, por ejemplo, configuraciones GB200 y GB300 que emplean inferencia desagregada para equilibrar rendimiento e interactividad.

OpenAI quiere controlar cada vez más partes de su infraestructura

Jalapeño tampoco supone una ruptura con NVIDIA.

OpenAI dice expresamente que continuará desplegando ampliamente aceleradores NVIDIA y de otros socios tanto para entrenamiento como para inferencia. Su ASIC debe entenderse por ahora como otra pieza de una infraestructura que necesita cantidades crecientes de capacidad.

La diferencia está en que OpenAI comienza a controlar una parte del silicio sobre el que ejecuta sus servicios.

SemiAnalysis indica que el desarrollo se realizó en colaboración con Broadcom y que el proyecto comenzó a mediados de 2024. Para una compañía que consume aceleradores a escala de centro de datos, mejorar los tokens obtenidos por megavatio puede tener consecuencias económicas importantes incluso sin sustituir completamente a las GPU.

Hay además una segunda particularidad: la IA también se ha utilizado para desarrollar y programar el propio acelerador.

OpenAI afirma que pasó del diseño inicial al tapeout en nueve meses y utilizó sus modelos para estudiar implementaciones, acortar los ciclos de diseño y verificación y trabajar sobre circuitos aritméticos. Posteriormente empleó Codex con GPT-Astra para adaptar tres modelos de pesos abiertos a Jalapeño en aproximadamente dos meses.

En determinados bloques de atención y Mixture of Experts de GPT-OSS, las implementaciones generadas con IA llegaron a funcionar entre 1,5 y 1,8 veces más rápido que las escritas previamente por especialistas humanos. OpenAI advierte que esta comparación afecta exclusivamente a esos bloques y no al rendimiento del modelo completo.

El siguiente examen será mucho mayor que un benchmark. OpenAI pretende comenzar a incorporar Jalapeño a su infraestructura antes de terminar 2026, mientras continúa la cualificación para producción y el desarrollo de su software. Ya trabaja además en una segunda generación y ha comenzado a definir una tercera.

Hasta que el hardware funcione a gran escala en producción seguirá faltando una pieza esencial: comprobar cómo se traducen estas cifras en disponibilidad, coste total de propiedad y rendimiento sostenido con las cargas reales de OpenAI.

Los primeros resultados sí muestran algo menos discutible: un ASIC de primera generación de OpenAI ya puede competir con Blackwell en inferencia y, en las pruebas publicadas, superar a los sistemas NVIDIA comparados tanto en latencia como en rendimiento por vatio. Para una empresa cuyo consumo de tokens continúa creciendo, esa eficiencia puede acabar siendo más importante que ganar una carrera de FLOPS.

Preguntas frecuentes

¿Es Jalapeño más rápido que NVIDIA Blackwell?

En las pruebas publicadas con GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T, Jalapeño supera a los sistemas GB200 o GB300 utilizados como referencia en rendimiento por vatio y velocidad máxima de decodificación. Los resultados no permiten extrapolar esa ventaja automáticamente a cualquier modelo o carga.

¿Cuántos tokens por segundo alcanza OpenAI Jalapeño?

Su máximo publicado por usuario es de 1.459 tokens/s con GPT-OSS 120B. Obtiene además 700 tokens/s con DeepSeek R1 y 694 tokens/s con Kimi K2.5.

¿Jalapeño sustituirá a las GPU NVIDIA de OpenAI?

No es lo anunciado. OpenAI afirma que continuará desplegando aceleradores NVIDIA y de otros fabricantes para entrenamiento e inferencia mientras incorpora progresivamente su silicio propio.

¿Cuándo comenzará OpenAI a utilizar Jalapeño?

La compañía prevé empezar a desplegarlo dentro de su infraestructura antes de finalizar 2026. Jalapeño es la primera generación de una familia que ya tiene una Gen 2 en desarrollo y una Gen 3 en preparación.

encuentra artículos

newsletter

Recibe toda la actualidad del sector tech y cloud en tu email de la mano de RevistaCloud.com.

Suscripción boletín

LO ÚLTIMO