IBM y Together AI han firmado un acuerdo plurianual valorado en 240 millones de dólares para desplegar en IBM Cloud un gran clúster de infraestructura NVIDIA destinado específicamente a inferencia de inteligencia artificial. La plataforma utilizará sistemas NVIDIA HGX B300 con GPU Blackwell Ultra y redes Spectrum-X Ethernet, y su disponibilidad está prevista para el primer trimestre de 2027.
Las claves del acuerdo entre IBM y Together AI en 30 segundos
- El contrato plurianual entre IBM y Together AI alcanza los 240 millones de dólares.
- IBM desplegará un clúster de sistemas NVIDIA HGX B300 en IBM Cloud, previsto para el primer trimestre de 2027.
- Together AI utilizará la infraestructura principalmente para servir modelos abiertos en producción.
- La compañía afirma procesar actualmente unos 400 billones de tokens al mes.
- El acuerdo refleja el creciente peso de la inferencia frente al entrenamiento dentro de la infraestructura de IA.
La operación reúne tres piezas diferentes del mercado. IBM aporta la infraestructura cloud y su capacidad para operar entornos empresariales; NVIDIA suministra la plataforma acelerada y las redes que conectan las GPU; y Together AI coloca encima su plataforma de inferencia, entrenamiento, ajuste de modelos y cargas de trabajo con agentes.
El resultado será, según IBM, el primer clúster dedicado de gran escala para inferencia construido en IBM Cloud con sistemas HGX B300.
No se ha comunicado el número de servidores ni de GPU que formarán el clúster, por lo que los 240 millones de dólares del contrato no pueden traducirse directamente en una determinada cantidad de aceleradores o potencia informática.
NVIDIA B300 para una inferencia que consume cada vez más infraestructura
La elección de NVIDIA HGX B300 permite entender hacia dónde se dirige una parte importante de las inversiones en IA.
Cada sistema HGX B300 integra ocho GPU NVIDIA B300 Blackwell Ultra conectadas mediante NVLink y NVSwitch de quinta generación. La documentación técnica de NVIDIA especifica 288 GB de memoria HBM3e por GPU, lo que eleva la memoria agregada hasta aproximadamente 2,3 TB por nodo. La interconexión interna alcanza 14,4 TB/s de ancho de banda agregado.
La red también forma parte esencial de la arquitectura. NVIDIA plantea HGX B300 junto a ConnectX-8 y Spectrum-X Ethernet para construir clústeres en los que las GPU puedan intercambiar grandes cantidades de información con baja latencia.
En su arquitectura de referencia, NVIDIA contempla configuraciones de 32, 64 y 128 nodos, equivalentes a 256, 512 y 1.024 GPU B300 respectivamente. Cada GPU puede disponer de conexiones Ethernet de hasta 800 Gb/s mediante ConnectX-8.
Esto no significa que el futuro clúster de IBM y Together AI vaya a utilizar alguna de esas configuraciones concretas. Las empresas no han publicado su tamaño. Sí permite poner en contexto el tipo de infraestructura que están preparando.
La inferencia a gran escala ya no consiste únicamente en cargar un modelo en unas cuantas GPU y responder peticiones. Los modelos de razonamiento, los contextos extensos, las aplicaciones con agentes y el elevado número de usuarios simultáneos están aumentando las necesidades de memoria, comunicaciones y capacidad de cálculo.
NVIDIA sostiene que sus arquitecturas HGX actuales están diseñadas precisamente para combinar entrenamiento con inferencia de modelos medianos y grandes.
Together AI ya procesa 400 billones de tokens mensuales
Para Together AI el nuevo clúster supone aumentar capacidad en un momento de fuerte crecimiento de su servicio de inferencia.
La empresa asegura que actualmente procesa 400 trillion tokens mensuales, es decir, unos 400 billones de tokens utilizando la escala numérica empleada en español.
La compañía, fundada en 2022, se ha especializado en infraestructura y servicios para modelos abiertos. Su plataforma incluye inferencia, entrenamiento, fine-tuning y herramientas para aplicaciones basadas en agentes.
Together AI cerró recientemente una ronda Serie C de 800 millones de dólares, con una valoración de 8.300 millones de dólares, según los datos incluidos por IBM en el anuncio del acuerdo.
La infraestructura dedicada puede darle además mayor control sobre uno de los factores que más condicionan el negocio de los proveedores de inferencia: el coste de generar cada token.
Cuando millones de solicitudes terminan utilizando las mismas GPU, pequeñas mejoras en utilización, memoria, batching, redes o software pueden representar diferencias importantes en el coste final del servicio.
Together AI ya comercializa diferentes generaciones de GPU NVIDIA. En agosto de 2026 ofrece, entre otras opciones, H100, H200 y B200, mientras que las configuraciones HGX B300 aparecen disponibles mediante consulta comercial.
La infraestructura vuelve al centro de la competencia en IA
El acuerdo también muestra cómo está cambiando la inversión alrededor de la inteligencia artificial.
Durante los primeros años de la actual generación de IA generativa, buena parte de la atención se concentró en construir y entrenar modelos cada vez mayores. Ahora el despliegue masivo de esos modelos está trasladando una parte creciente del problema hacia la inferencia.
Cada consulta de un asistente, una aplicación empresarial o un agente consume capacidad informática. Cuando un servicio alcanza cientos de miles de millones de tokens, el rendimiento por GPU y el coste por token empiezan a determinar directamente su viabilidad económica.
Together AI explica precisamente su elección de IBM y NVIDIA por la necesidad de conseguir capacidad GPU al ritmo requerido por su crecimiento y reducir el coste de los tokens.
IBM también gana una carga de trabajo relevante para reforzar su posición como proveedor de infraestructura de IA. La compañía lleva años defendiendo una estrategia híbrida en la que los clientes puedan combinar centros de datos propios, cloud y software empresarial.
El acuerdo amplía además una colaboración previa entre IBM y NVIDIA. Ambas compañías anunciaron en marzo de 2026 nuevos trabajos conjuntos alrededor de analítica acelerada por GPU, procesamiento de datos no estructurados e infraestructura de IA tanto en centros de datos privados como en cloud.
Together AI añade ahora la capa especializada en ejecución de modelos abiertos.
Hay además una diferencia importante respecto a contratar simplemente GPU bajo demanda. El acuerdo plantea capacidad dedicada a gran escala y durante varios años, algo que proporciona a Together AI mayor previsibilidad para atender el crecimiento de sus servicios.
La apuesta llegará a producción, si se cumplen los plazos anunciados, durante el primer trimestre de 2027. Hasta entonces quedan por conocer algunos datos especialmente relevantes: número de sistemas HGX B300, cantidad total de GPU, localización del clúster, potencia eléctrica asociada y capacidad final de inferencia.
Preguntas frecuentes
¿Cuánto vale el acuerdo entre IBM y Together AI?
El acuerdo plurianual anunciado por ambas compañías está valorado en 240 millones de dólares. Su objetivo es desplegar infraestructura de IA en IBM Cloud para los servicios de Together AI.
¿Qué GPU utilizará el nuevo clúster?
La infraestructura estará basada en sistemas NVIDIA HGX B300, que integran ocho GPU B300 Blackwell Ultra por sistema. IBM y Together AI no han revelado cuántos nodos ni cuántas GPU tendrá el despliegue.
¿Para qué utilizará Together AI esta infraestructura?
Principalmente para ejecutar inferencia de modelos abiertos a gran escala. Together AI también dispone de servicios de entrenamiento, fine-tuning y aplicaciones basadas en agentes.
¿Cuándo estará disponible el clúster?
IBM sitúa su disponibilidad prevista en el primer trimestre de 2027. La compañía advierte de que sus declaraciones sobre planes futuros representan objetivos y pueden cambiar.
vía: newsroom.ibm