SanDisk está intentando abrir una nueva categoría de memoria para inteligencia artificial con High Bandwidth Flash (HBF), una tecnología que busca acercar grandes cantidades de NAND a los aceleradores sin asumir el coste y las limitaciones de capacidad de la memoria HBM. Su propuesta ha ganado visibilidad tras el Investor Day celebrado el 13 de agosto, aunque algunas comparaciones utilizadas por la compañía han provocado críticas técnicas: HBF puede aportar mucha capacidad, pero sus características son muy diferentes de las de la DRAM empleada en HBM.
Las claves de HBF de SanDisk en 20 segundos
- HBF utiliza memoria NAND apilada para acercar centenares de GB a los aceleradores de IA.
- SanDisk y SK hynix trabajan en su estandarización dentro de Open Compute Project.
- El objetivo principal son los pesos de los modelos durante la inferencia, no sustituir toda la HBM.
- La NAND ofrece mucha capacidad, pero tiene mayor latencia y limitaciones de escritura.
- Las primeras muestras de HBF ya forman parte de la hoja de ruta de SanDisk.
La idea responde a un problema que empieza a condicionar el diseño de los servidores de IA: no siempre hacen falta más FLOPS. En muchas cargas de inferencia, lo que falta es memoria suficiente para mantener cerca del acelerador modelos cada vez mayores.
La High Bandwidth Memory (HBM) resuelve muy bien el problema del ancho de banda, pero resulta cara y su capacidad está limitada por el número y tamaño de los stacks que pueden integrarse alrededor del procesador.
HBF intenta ocupar un espacio diferente.
De 192 GB de HBM a varios terabytes de flash junto al acelerador
La propuesta de SanDisk consiste, simplificando, en aplicar algunas de las ideas utilizadas para construir HBM al mundo de la memoria NAND.
HBF apila numerosos dies de flash y explota un elevado paralelismo para incrementar radicalmente el ancho de banda respecto a un SSD convencional. SanDisk utiliza además tecnologías como CBA (CMOS directly Bonded to Array) para acercar la lógica de control al array NAND.
La diferencia fundamental continúa estando en las células de memoria.
HBM utiliza DRAM. HBF utiliza NAND.
La DRAM tiene mucha menos capacidad por unidad de superficie y necesita alimentación para conservar los datos, pero proporciona una latencia muy inferior. La NAND es más lenta, aunque resulta considerablemente más densa, barata y además es persistente.
Eso permite imaginar arquitecturas con centenares de gigabytes o incluso varios terabytes disponibles alrededor de un acelerador.
SanDisk ya mostraba en su Investor Day de 2025 una comparación especialmente gráfica: una configuración con ocho stacks de HBM sumaba 192 GB, mientras ocho dispositivos HBF alcanzaban 4.096 GB, es decir, 4 TB.
La compañía ha detallado posteriormente que un stack HBF de 16 dies puede proporcionar 512 GB. Sus simulaciones internas también sostienen que HBF puede acercarse al rendimiento de un sistema con HBM de capacidad ilimitada cuando se utiliza para leer los pesos preentrenados de Llama 3.1 405B.
Hay una precisión importante: se trata de simulaciones realizadas por la propia SanDisk para un caso de uso determinado, no de resultados obtenidos con productos comerciales.
La ventaja potencial resulta fácil de entender.
Un modelo cuyos pesos necesitan varios centenares de gigabytes podría mantenerse mucho más cerca del procesador sin llenar el sistema de costosos stacks HBM ni añadir aceleradores simplemente para conseguir más memoria.
HBF tiene sentido para los pesos; el KV cache plantea otro problema
Aquí aparece también uno de los matices que algunas comparaciones entre HBF y HBM pueden ocultar.
Durante la inferencia de un modelo de lenguaje existen diferentes tipos de información en memoria y no todos tienen los mismos patrones de acceso.
Por un lado están los pesos del modelo, los parámetros aprendidos durante el entrenamiento. Durante una inferencia esos pesos fundamentalmente se leen.
Es un escenario atractivo para NAND.
Por otro está el KV cache (key-value cache) generado durante la inferencia. Permite conservar información de los tokens procesados anteriormente para no tener que recalcularla continuamente y crece con el contexto y las solicitudes atendidas.
Su comportamiento implica escrituras.
Y aquí HBF tiene una desventaja inherente frente a HBM: la NAND tiene una resistencia de escritura finita y unas latencias de escritura considerablemente mayores que la DRAM.
El enorme paralelismo de HBF puede elevar mucho el ancho de banda agregado de lectura, pero no elimina las características físicas de cada célula NAND.
Por eso resulta más razonable interpretar HBF como un nuevo nivel dentro de la jerarquía de memoria que como un reemplazo universal de HBM.
La propia SK hynix ha descrito HBF como una nueva capa situada entre HBM y SSD, mientras SanDisk habla específicamente de una tecnología destinada a las necesidades de inferencia.
Una arquitectura futura podría, por ejemplo, mantener los datos que requieren accesos extremadamente rápidos y frecuentes en HBM y utilizar HBF para alojar enormes cantidades de pesos.
La separación podría resultar especialmente interesante en modelos Mixture of Experts (MoE), donde solamente una parte de los parámetros totales se activa para procesar cada token.
El ancho de banda necesita contexto
Otro motivo de discusión han sido las comparaciones de SanDisk entre HBF y HBM.
La compañía ha utilizado escenarios de referencia con 192 GB de HBM, mientras la evolución de HBM continúa elevando tanto la capacidad como el ancho de banda disponible por acelerador.
Comparar una tecnología prevista para futuras plataformas con una configuración HBM concreta puede ofrecer una imagen incompleta si no se especifica claramente la generación utilizada.
Algo parecido sucede con la precisión numérica de los modelos.
Utilizar BF16 (Brain Floating Point 16) permite ilustrar fácilmente cuánta memoria ocuparían los parámetros, pero los sistemas de inferencia modernos utilizan cada vez más formatos de menor precisión, como FP8, INT8 o FP4, dependiendo del modelo y del hardware.
Reducir la precisión reduce también la memoria necesaria para almacenar los pesos.
Un modelo de 400.000 millones de parámetros necesitaría aproximadamente 800 GB si cada parámetro ocupase dos bytes en BF16. Con cuatro bits por parámetro, el cálculo teórico baja aproximadamente a 200 GB antes de considerar escalas, metadatos y otros elementos.
Eso no elimina el problema de capacidad que HBF pretende solucionar, pero sí cambia considerablemente la magnitud del problema.
También conviene separar ancho de banda de latencia.
SanDisk y SK hynix trabajan en especificaciones HBF que contemplan configuraciones de hasta 512 GB por dispositivo y un ancho de banda que puede alcanzar varios TB/s. La especificación conocida recientemente contempla valores aproximados de entre 0,4 y 3 TB/s según la configuración.
Es muchísimo para memoria flash.
Pero alcanzar varios TB/s agregando miles de operaciones NAND en paralelo no convierte a una célula NAND en DRAM. Una aplicación sensible a la latencia puede comportarse de manera muy diferente aunque el ancho de banda agregado parezca comparable.
SanDisk y SK hynix quieren convertir HBF en un estándar
HBF tampoco es únicamente un proyecto interno de SanDisk.
SanDisk y SK hynix firmaron en agosto de 2025 un acuerdo para trabajar conjuntamente en sus especificaciones. En febrero de 2026 dieron otro paso al crear un grupo de trabajo dentro de Open Compute Project (OCP) para desarrollar su estandarización.
Esto resulta relevante porque una nueva tecnología de memoria necesita bastante más que chips.
Procesadores, aceleradores, controladores, encapsulados, firmware, sistemas operativos y frameworks de IA tienen que entender dónde se encuentran los datos y decidir cuándo moverlos.
HBF podría introducir, en la práctica, otro nivel dentro de la jerarquía de memoria de los servidores de IA:
GPU → HBM → HBF → SSD → almacenamiento distribuido.
El software tendría entonces que decidir qué información merece ocupar la memoria más rápida y cara y cuál puede permanecer en niveles de mayor capacidad.
SanDisk anunció inicialmente muestras de HBF para la segunda mitad de 2026 y dispositivos de inferencia que integrasen la tecnología a comienzos de 2027. La compañía ha insistido además en que busca capacidades entre ocho y dieciséis veces superiores a HBM con costes comparables, aunque estas son previsiones del fabricante que deberán comprobarse cuando exista hardware comercial.
El verdadero atractivo de HBF está en cambiar la economía de la inferencia
La cuestión más interesante de HBF probablemente no sea si puede derrotar a HBM en una tabla de especificaciones.
Son memorias construidas para resolver problemas diferentes.
HBM seguirá siendo especialmente valiosa donde importan la latencia, las escrituras frecuentes y un ancho de banda extremo. La NAND puede proporcionar una capacidad mucho mayor por un coste inferior, a cambio de unas características de acceso diferentes.
HBF intenta aprovechar precisamente ese intercambio.
Si los futuros aceleradores pueden mantener terabytes de pesos suficientemente cerca de la GPU, sería posible ejecutar determinados modelos grandes con menos aceleradores dedicados únicamente a proporcionar capacidad de memoria.
Ese cambio sí tendría consecuencias económicas importantes para la inferencia.
Pero todavía quedan incógnitas. Entre ellas están la latencia real bajo cargas de producción, consumo, refrigeración, rendimiento sostenido, resistencia de escritura, gestión de errores y, sobre todo, cómo repartirán los sistemas reales los datos entre HBM y HBF.
Las presentaciones para inversores pueden condensar todo eso en dos columnas con cifras de capacidad y ancho de banda. La arquitectura de memoria de un servidor de IA es bastante menos sencilla.
HBF no necesita ser más rápida que HBM para tener éxito. Necesita conseguir que almacenar enormes modelos cerca del acelerador sea suficientemente rápido y mucho más barato.
Preguntas frecuentes
¿Qué es HBF?
HBF significa High Bandwidth Flash. Es una tecnología basada en NAND que utiliza apilamiento y un elevado paralelismo para proporcionar mucha más capacidad y ancho de banda que el almacenamiento flash convencional.
¿HBF sustituirá a HBM en las GPU de IA?
No necesariamente. HBF resulta especialmente interesante para almacenar grandes cantidades de pesos durante la inferencia, mientras HBM conserva ventajas importantes en latencia y operaciones con escrituras frecuentes.
¿Qué capacidad puede ofrecer HBF?
SanDisk ha planteado dispositivos de 512 GB mediante stacks de 16 dies, lo que permitiría alcanzar varios terabytes combinando múltiples dispositivos alrededor de un acelerador.
¿Cuándo llegará HBF?
SanDisk comenzó situando las primeras muestras en la segunda mitad de 2026 y los primeros dispositivos de inferencia con HBF en 2027. Su adopción comercial dependerá posteriormente del desarrollo del estándar, los fabricantes de aceleradores y el software.