Huawei ha presentado OceanStor M900 Context Memory Storage, un sistema de almacenamiento diseñado para acelerar la inferencia de inteligencia artificial en centros de datos de gran escala. La propuesta amplía la memoria disponible para la caché KV, utilizada durante la inferencia de grandes modelos, desde la memoria de los aceleradores y la DRAM hasta unidades SSD, con una capacidad agregada que Huawei sitúa en hasta 64 PB por clúster.
Las claves de OceanStor M900 en 20 segundos
- Huawei amplía la caché KV de los SuperPoD hasta 64 PB por clúster.
- El sistema combina memoria del acelerador, DRAM y SSD mediante UnifiedBus.
- Huawei afirma que reduce la latencia de acceso de milisegundos a 60 microsegundos.
- El fabricante declara hasta 40 TB/s de ancho de banda agregado y el doble de rendimiento de tokens.
- Una tecnología de almacenamiento adaptativo busca alargar 16 veces la vida útil de los SSD.
Huawei presentó OceanStor M900 el 17 de septiembre durante HUAWEI CONNECT 2026, celebrado en Shanghái. El sistema forma parte de una estrategia en la que la compañía intenta ampliar la arquitectura de los SuperPoD más allá del cálculo y coordinar de forma estrecha computación, red y almacenamiento.
La razón está en la evolución de los modelos de IA. A medida que las ventanas de contexto crecen y los agentes mantienen conversaciones y tareas durante más tiempo, también aumenta la cantidad de datos que deben conservarse durante la inferencia. Huawei identifica la caché KV como uno de los elementos que empiezan a presionar la capacidad y el coste de la memoria disponible en los aceleradores y en la DRAM.
La compañía plantea OceanStor M900 como una capa adicional para almacenar y reutilizar esa información sin depender únicamente de la memoria situada junto a las unidades de procesamiento.
Una caché KV que llega hasta los SSD
La caché KV almacena los datos de tipo Key y Value generados durante la inferencia de un modelo. Cuando una parte del contexto puede reutilizarse, el sistema puede recuperar esos datos en lugar de volver a realizar determinados cálculos.
Este mecanismo adquiere mayor importancia con modelos capaces de trabajar con ventanas de contexto de más de un millón de tokens, según Huawei. Las conversaciones de varias rondas y las tareas complejas también generan más información que puede mantenerse disponible para posteriores operaciones.
El problema es que la memoria de los aceleradores y la DRAM tienen una capacidad limitada y un coste que aumenta cuando se necesita escalar a grandes volúmenes.
OceanStor M900 utiliza UnifiedBus, la red de interconexión de Huawei, para crear un espacio global de caché KV con almacenamiento por niveles. La información puede distribuirse entre memoria del acelerador, DRAM y SSD, de forma que la capacidad total disponible crece sin depender exclusivamente de la memoria más cercana al procesador.
Huawei afirma que un único clúster puede alcanzar 64 PB de capacidad para caché KV. También señala que la capacidad disponible por NPU pasa de gigabytes a terabytes.
La compañía sostiene que este aumento de capacidad permite almacenar, compartir y reutilizar más contexto y puede elevar la tasa de aciertos de la caché. Estas cifras y efectos son afirmaciones del fabricante y la información publicada no incluye una validación independiente.
De milisegundos a 60 microsegundos, según Huawei
La segunda parte de la propuesta está relacionada con la forma de acceder a los datos almacenados.
Huawei asegura que OceanStor M900 incorpora una arquitectura que integra CPU, unidad controladora de red y unidad controladora NAND. El diseño proporciona semántica nativa para la caché KV y permite una conexión de un salto entre las NPUs del SuperPoD y los SSD.
Según Huawei, esta arquitectura evita conversiones de protocolo y determinadas operaciones de transferencia mediante la CPU. El fabricante sitúa la reducción de latencia de acceso desde el rango de milisegundos hasta 60 microsegundos, lo que supone, según su cálculo, una reducción del 90 %.
El sistema también alcanza, de acuerdo con Huawei, hasta 40 TB/s de ancho de banda agregado por clúster, una cifra que la compañía sitúa 1,5 veces por encima de soluciones comparables.
La intención es reducir el tiempo que los aceleradores permanecen esperando datos. En cargas de trabajo de IA donde el cálculo y el acceso a contexto están estrechamente relacionados, una mayor capacidad de almacenamiento no sirve de mucho si recuperar esa información introduce una espera elevada.
Huawei afirma que, en escenarios habituales de programación de IA, OceanStor M900 puede duplicar el rendimiento de tokens del clúster de inferencia y reducir a la mitad el tiempo hasta el primer token (TTFT). Se trata igualmente de resultados comunicados por Huawei en sus propios escenarios de referencia.
El almacenamiento también debe soportar el desgaste
La gran cantidad de escrituras que puede generar una infraestructura de caché plantea otro problema: la resistencia de las unidades SSD.
Para afrontarlo, Huawei incorpora lo que denomina KV-aware adaptive storage technology, una tecnología que tiene en cuenta el comportamiento y el ciclo de vida de los datos de la caché KV para decidir cómo distribuirlos entre los distintos medios de almacenamiento.
La idea consiste en identificar el valor y la duración esperada de los datos y adaptar su ubicación. De esta forma, no todas las escrituras se concentran de la misma manera sobre los mismos dispositivos.
Huawei declara que OceanStor M900 puede alcanzar hasta 24 escrituras de unidad por día (DWPD) y que esta tecnología puede multiplicar por 16 la resistencia de los SSD. La compañía sitúa en tres años la estabilidad prevista de las unidades bajo las condiciones descritas.
El objetivo es reducir tanto la sustitución de medios como los costes de operación y mantenimiento asociados a grandes infraestructuras de inferencia.
De una infraestructura centrada en cálculo a otra basada en tres capas
La presentación del M900 se encuadra en una estrategia más amplia de Huawei para sus sistemas de IA. La compañía considera que el crecimiento de los modelos y de los agentes está haciendo que el almacenamiento de contexto tenga un peso mayor en la infraestructura.
Hasta ahora, una parte importante del diseño de los sistemas de IA se ha centrado en aumentar la capacidad de cálculo de las GPU o NPU. Huawei plantea ahora una arquitectura en la que cálculo, red y almacenamiento deben trabajar de forma coordinada.
En los SuperPoD de gran tamaño, el volumen de información que se mueve entre aceleradores y memoria puede convertirse en una limitación. Una caché KV distribuida y compartida permite, según la propuesta de Huawei, conservar más contexto y reutilizarlo desde diferentes recursos de cálculo.
Esto resulta especialmente relevante para los sistemas de inferencia que mantienen contextos extensos o atienden tareas de varios pasos. En estos escenarios, parte del trabajo consiste precisamente en recuperar información generada anteriormente y ponerla a disposición del modelo en el momento adecuado.
OceanStor M900 pretende convertir los SSD en una extensión de esa memoria de contexto, aunque con una jerarquía diferente de capacidad y acceso respecto a la memoria situada en el propio acelerador.
La propuesta forma parte de los anuncios de infraestructura realizados por Huawei en HUAWEI CONNECT 2026 junto a sus nuevas arquitecturas SuperPoD y SuperCluster. En conjunto, la compañía está planteando una infraestructura en la que el rendimiento de la IA no dependa únicamente de cuántas unidades de procesamiento pueda reunir un sistema, sino también de la rapidez con la que esas unidades puedan acceder al contexto que necesitan.
Preguntas frecuentes
¿Qué es OceanStor M900?
Es un sistema de almacenamiento de Huawei diseñado para la inferencia de IA en centros de datos de gran escala. Su función principal es ampliar y compartir la caché KV entre memoria de aceleradores, DRAM y SSD.
¿Qué capacidad puede alcanzar?
Huawei afirma que un clúster con OceanStor M900 puede proporcionar hasta 64 PB de capacidad para caché KV.
¿Qué es la caché KV?
Es una estructura que almacena datos generados durante la inferencia de un modelo para poder reutilizarlos posteriormente y evitar determinados cálculos repetidos. Su tamaño aumenta con las ventanas de contexto largas y las tareas de varias rondas.
¿Qué mejoras de rendimiento declara Huawei?
La compañía afirma que el sistema puede reducir la latencia de acceso hasta 60 microsegundos, alcanzar 40 TB/s de ancho de banda agregado, duplicar el rendimiento de tokens y reducir a la mitad el tiempo hasta el primer token en determinados escenarios.