Las TPU de Google están empezando a competir con las GPU Blackwell de NVIDIA en uno de los terrenos que más preocupa a quienes operan grandes modelos de inteligencia artificial: cuánto cuesta generar cada millón de tokens. Las primeras pruebas independientes de SemiAnalysis con TPUv7 Ironwood muestran ventajas de coste frente a B200 y B300 en numerosos escenarios, mientras Google prepara TorchTPU para eliminar una de las grandes barreras que frenaban su adopción: el soporte nativo de PyTorch.
Las claves de las TPU frente a NVIDIA en 20 segundos
- SemiAnalysis ha comparado TPUv7 Ironwood con NVIDIA B200 y B300 en inferencia de grandes modelos.
- A 100 tokens/s por usuario, Ironwood cuesta un 19 % menos que B200 y un 34 % menos que B300.
- En determinados puntos alcanza hasta un 50 % más de rendimiento por dólar.
- TorchTPU permitirá utilizar PyTorch de forma nativa sobre las TPU.
El resultado no significa que Google haya construido un acelerador que sea siempre más rápido que Blackwell. De hecho, NVIDIA mantiene ventajas importantes en determinados escenarios y TPUv7 carece de cálculo FP4 nativo. Lo relevante está en otra métrica: la relación entre rendimiento, latencia y coste, que se ha convertido en uno de los grandes campos de batalla de la infraestructura para IA.
Ironwood entra en la batalla del coste por token
SemiAnalysis ha publicado en InferenceX sus primeras pruebas independientes de inferencia con TPUv7 Ironwood, comparándola en igualdad de precisión FP8 con las NVIDIA B200 y B300.
Los resultados cambian bastante dependiendo del nivel de concurrencia y de la latencia exigida, por lo que reducir la comparativa a un único porcentaje sería engañoso.
A una velocidad de generación de 100 tokens por segundo y usuario, SemiAnalysis calcula un coste aproximado de 0,181 dólares por millón de tokens para Ironwood, frente a 0,222 dólares para B200 y 0,276 dólares para B300. Eso supone una ventaja aproximada del 19 % frente a B200 y del 34 % respecto a B300.
| Escenario analizado | TPUv7 Ironwood | NVIDIA B200 | NVIDIA B300 |
|---|---|---|---|
| 100 tokens/s/usuario | 0,181 $/M tokens | 0,222 $/M | 0,276 $/M |
| Diferencia frente a TPU | — | TPU ~19 % más barata | TPU ~34 % más barata |
| 20 s de respuesta mediana | ~0,098 $/M | ~0,106 $/M | ~0,132 $/M |
| Precisión comparada | FP8 | FP8 | FP8 |
Hay puntos de la curva donde la diferencia aumenta todavía más. A 20 tokens por segundo y usuario, SemiAnalysis obtuvo 9.364 tokens/s por chip en Ironwood, frente a 8.903 en B200 y 8.925 en B300.
Combinando ese rendimiento con su estimación del coste horario, el análisis calcula un 50,4 % más de tokens por dólar que B200 y un 96 % más que B300 en ese punto concreto. La precisión es importante: esas diferencias no pueden extrapolarse automáticamente a cualquier modelo, latencia o configuración.
También existen escenarios donde Blackwell mantiene ventaja. SemiAnalysis reconoce que B200 supera a Ironwood en parte de la curva y que las configuraciones desagregadas GB200/GB300 NVL72 siguen siendo competitivas mientras el software externo de TPU para este tipo de inferencia continúa madurando.
La primera consecuencia es que el debate ya no puede reducirse a qué acelerador ofrece más FLOPS o más tokens por segundo. Para un proveedor que sirve miles de millones de tokens, unos céntimos de diferencia por cada millón de tokens pueden terminar teniendo un efecto considerable sobre el coste total de la infraestructura.
TorchTPU ataca una de las mayores ventajas de NVIDIA
El hardware es solo una parte del problema. NVIDIA ha construido durante años una ventaja alrededor de CUDA y de un entorno de software ampliamente utilizado por desarrolladores, investigadores y proveedores de inferencia.
Google necesitaba reducir esa barrera.
Ahí entra TorchTPU, un nuevo backend que busca que las TPU se comporten ante PyTorch como un dispositivo nativo. Google explica que un desarrollador podrá trabajar con tensores normales de PyTorch sobre un dispositivo tpu, manteniendo interfaces conocidas y utilizando torch.compile cuando sea necesario.
Por debajo siguen existiendo tecnologías propias del entorno TPU, entre ellas XLA, StableHLO y kernels especializados. Por tanto, “PyTorch nativo” no significa que Google haya eliminado su arquitectura de software, sino que pretende hacerla mucho menos visible para el desarrollador.
El cambio puede tener consecuencias mayores que una simple mejora de comodidad.
vLLM y SGLang son dos de los proyectos más utilizados para servir modelos de lenguaje en producción. Si ambos pueden tratar las TPU como dispositivos PyTorch de primera clase, Google reduce el trabajo necesario para adaptar nuevos modelos abiertos a su hardware.
Google ya confirmó en abril que TorchTPU utiliza la interfaz PrivateUse1 de PyTorch y que trabaja en integraciones profundas con proyectos como vLLM. La compañía también prepara un repositorio público y mejoras para formas dinámicas, kernels personalizados y ejecución distribuida.
SemiAnalysis señala que TorchTPU continúa en beta privada y sitúa su apertura como código abierto alrededor de octubre. También apunta a Qwen3.5-397B como uno de los primeros grandes modelos utilizados para poner a punto el nuevo entorno.
TPUv8 añadirá FP4 y elevará la presión sobre Blackwell
Ironwood todavía tiene una limitación relevante frente a las GPU Blackwell: no dispone de cálculo FP4 nativo.
Eso importa porque B200 y B300 pueden utilizar FP4 para aumentar considerablemente el rendimiento de inferencia, aunque reducir la precisión desde FP8 puede afectar a la calidad del modelo. Por esa razón, SemiAnalysis realiza su comparación principal en FP8 contra FP8.
La situación cambiará con la octava generación de TPU.
Google ya ha presentado dos variantes diferentes: TPU 8t, orientada principalmente al entrenamiento, y TPU 8i, diseñada específicamente para inferencia, posentrenamiento y cargas de razonamiento. TPU 8i incorporará 288 GB de HBM, 384 MB de SRAM integrada y cálculo FP4 con un máximo anunciado de 10,1 PFLOPS.
También estrenará Boardfly, una nueva topología de interconexión que sustituye el diseño de toro 3D utilizado por Ironwood para este modelo destinado a inferencia. Google asegura que permite reducir de 16 a siete el número máximo de saltos en una configuración comparable de 1.024 chips. La compañía atribuye a TPU 8i una mejora de hasta el 80 % en rendimiento por dólar frente a Ironwood para determinados escenarios de inferencia de baja latencia.
TPU 8i todavía figura como “disponible próximamente”, así que esas cifras pertenecen a Google y no equivalen a los resultados independientes publicados ahora por SemiAnalysis para Ironwood.
La otra pieza importante es la apertura del hardware fuera de la infraestructura estrictamente interna de Google. SemiAnalysis sostiene que Ironwood marca una nueva etapa en la que las TPU pueden alquilarse y también llegar a determinados clientes mediante adquisición directa. Si esa distribución se amplía, PyTorch deja de ser una barrera y Google consigue que vLLM y SGLang funcionen de forma competitiva, NVIDIA podría encontrarse con una alternativa bastante más seria que la TPU tradicional encerrada en Google Cloud.
No sería el final del dominio de NVIDIA. Blackwell mantiene un software muy maduro, una extensa base instalada y ventajas técnicas en varios tipos de carga. Pero la economía de la inferencia está cambiando el criterio de compra: ya no basta con tener el acelerador más rápido; cada vez importa más cuántos tokens puede producir por cada euro invertido y por cada vatio consumido.
Preguntas frecuentes
¿Son las TPUv7 de Google más baratas que las NVIDIA B200 y B300?
En las pruebas publicadas por SemiAnalysis, Ironwood consigue un menor coste por millón de tokens en numerosos puntos de la curva analizada. La ventaja depende de la concurrencia, la latencia y la configuración, por lo que no existe un porcentaje único aplicable a todas las cargas.
¿Qué es TorchTPU?
TorchTPU es el nuevo entorno desarrollado para utilizar las TPU de Google como dispositivos nativos de PyTorch. Busca reducir las diferencias entre desarrollar para GPU y TPU y facilitar su integración con herramientas como vLLM.
¿Puede TPUv7 utilizar FP4?
Ironwood no dispone de cálculo FP4 nativo. SemiAnalysis utiliza por ello FP8 para realizar una comparación equivalente con B200 y B300. TPU 8i sí incorporará aceleración FP4.
¿Cuándo estará disponible TPU 8i?
Google ha anunciado TPU 8i y ha detallado su arquitectura, pero a 09/09/2026 todavía la presenta como disponible próximamente para clientes de Google Cloud.
vía: newsletter.semianalysis. Imagen de Google.