NetApp ha adquirido DataPelago, una empresa californiana especializada en acelerar el procesamiento de datos mediante unidades centrales de procesamiento (CPU) y unidades de procesamiento gráfico (GPU). La operación permitirá al fabricante incorporar estas capacidades a su infraestructura de almacenamiento y avanzar hacia un modelo en el que la información se prepara para inteligencia artificial (IA) y analítica sin tener que copiarla previamente a otro sistema.
Las claves de la compra de DataPelago en 30 segundos
- NetApp ha adquirido DataPelago, aunque no ha comunicado el importe ni las condiciones económicas de la operación.
- Su tecnología Nucleus procesa datos mediante CPU y GPU cerca del lugar donde están almacenados.
- El objetivo es reducir las copias y los movimientos de información previos a los proyectos de IA.
- DataPelago afirma que su plataforma puede multiplicar por diez el rendimiento y reducir los costes de infraestructura hasta un 80 %, cifras que dependen de cada carga de trabajo.
- La integración en los productos de NetApp todavía no tiene un calendario público de disponibilidad.
DataPelago pasará a operar como una filial propiedad de NetApp. La compañía compradora no ha detallado cuántos empleados se incorporarán, la valoración de la startup ni el impacto financiero previsto, por lo que la relevancia inmediata del acuerdo debe medirse principalmente por la tecnología adquirida.
La operación refleja un cambio que empieza a producirse en el mercado de almacenamiento empresarial. Durante años, la función principal de estos sistemas fue guardar, proteger y servir información con rapidez. La expansión de la IA añade otra exigencia: preparar grandes volúmenes de datos antes de que puedan utilizarse para entrenar modelos, ajustar sistemas, ejecutar búsquedas semánticas o construir aplicaciones de generación aumentada por recuperación, conocida como RAG por sus siglas en inglés.
Ese trabajo suele requerir extraer la información del almacenamiento de producción, copiarla a un lago de datos o un clúster de procesamiento y transformarla allí. El proceso consume tiempo, capacidad de red, espacio adicional y recursos de computación. También crea versiones duplicadas que deben protegerse, actualizarse y gobernarse.
NetApp quiere reducir esos movimientos llevando parte del procesamiento a la capa donde reside la información.
Nucleus lleva CPU y GPU cerca de los datos
La principal tecnología de DataPelago es Nucleus, un motor de procesamiento diseñado para distribuir las operaciones entre distintos tipos de hardware. Puede utilizar CPU, GPU y matrices de puertas lógicas programables, conocidas como FPGA, en función de las características de cada tarea.
Su propósito es ejecutar transformaciones sobre información estructurada, semiestructurada y no estructurada sin obligar a las empresas a trasladar previamente todos los datos a una plataforma de cálculo independiente.
DataPelago presenta Nucleus como un motor universal compatible con diferentes entornos de análisis. La plataforma se apoya en proyectos abiertos como Substrait y Apache Gluten para conectarse con motores de consultas y procesamiento distribuido, entre ellos Apache Spark y Trino.
La empresa afirma que su tecnología puede ofrecer un rendimiento hasta diez veces superior y reducir los costes de infraestructura hasta un 80 % frente a determinados enfoques convencionales. Son resultados comunicados por DataPelago y no una mejora aplicable de forma automática a cualquier entorno. El resultado final dependerá del volumen de datos, el tipo de consulta, el hardware disponible, la arquitectura y el coste de integrar la plataforma.
El interés técnico está en acercar el cálculo al almacenamiento. Mover petabytes de información para procesarlos puede resultar más caro y lento que trasladar las operaciones necesarias hasta el lugar donde ya se encuentran los datos.
Esta idea no elimina por completo las transferencias. Los modelos, las aplicaciones y los aceleradores todavía necesitan recibir información durante su ejecución. Lo que busca reducir es la creación sistemática de copias intermedias para preparar, filtrar, clasificar, fragmentar o vectorizar los conjuntos de datos.
Qué significa realmente la activación sin copias
NetApp utiliza el término zero-copy, o activación sin copias, para describir este enfoque. La expresión no implica que ningún dato vaya a copiarse en ningún momento, sino que las organizaciones podrían evitar duplicaciones completas y persistentes antes de iniciar determinados flujos de IA y analítica.
La diferencia es importante porque los datos empresariales rara vez se encuentran preparados para alimentar directamente un modelo. Pueden estar repartidos entre archivos, bases de datos, repositorios de objetos, documentos, registros históricos y aplicaciones internas.
Antes de utilizarlos suele ser necesario descubrirlos, comprobar permisos, eliminar duplicados, aplicar políticas de gobierno, extraer contenido, generar fragmentos y convertir parte de la información en representaciones vectoriales. Estas fases pueden consumir una parte considerable del tiempo y el presupuesto de un proyecto de IA.
NetApp pretende integrar la tecnología de DataPelago con su plataforma de datos, que incluye ONTAP, el almacenamiento desagregado AFX y AI Data Engine. La compañía ya defendía un modelo en el que las herramientas de IA se acercasen a la información, en vez de concentrar primero todos los datos en una nueva plataforma. La adquisición aporta un motor de ejecución acelerado para desarrollar esa idea.
Sin embargo, NetApp advierte de que las capacidades descritas forman parte de su dirección tecnológica futura. La empresa no ha confirmado qué productos incorporarán Nucleus, cuándo estarán disponibles ni bajo qué modalidad comercial se ofrecerán. Por tanto, la adquisición no supone que estas funciones estén ya activas en ONTAP, AFX o AI Data Engine.
El almacenamiento quiere asumir más funciones en la era de la IA
La compra también muestra cómo los fabricantes de almacenamiento están ampliando su campo de actuación. La presión ya no procede únicamente de la necesidad de ofrecer más capacidad o rendimiento, sino de ayudar a localizar, proteger, clasificar y preparar la información utilizada por las aplicaciones de IA.
Las empresas han invertido en GPU, pero esos aceleradores pueden permanecer infrautilizados cuando los datos tardan demasiado en llegar, no están correctamente preparados o requieren múltiples transformaciones previas. Este problema ha impulsado el desarrollo de arquitecturas que combinan almacenamiento de alto rendimiento, redes rápidas, catálogos, motores vectoriales y herramientas de gobierno.
Con DataPelago, NetApp intenta controlar una parte mayor de ese recorrido. En vez de limitarse a entregar los datos a un clúster externo, su infraestructura podría ejecutar algunas operaciones utilizando CPU y GPU asociadas a la propia capa de datos.
El movimiento también encaja con AFX, la arquitectura desagregada presentada por NetApp para separar capacidad, servicios y control, y con AI Data Engine, orientado a descubrir y preparar información empresarial para proyectos de IA.
La adquisición se suma a los acuerdos que NetApp mantiene con compañías como Cisco, Google Cloud, Red Hat y SK Telecom. No obstante, DataPelago aporta algo distinto a una alianza: tecnología propia y un equipo que la compañía podrá integrar directamente en su estrategia de producto.
La incógnita será cómo convierte NetApp ese motor en una capacidad manejable dentro de entornos empresariales heterogéneos. El rendimiento es solo una parte del problema. También deberá resolver aspectos como la gestión de permisos, el aislamiento de cargas, la compatibilidad con distintos formatos, la observabilidad, el consumo de GPU y la administración de los flujos de trabajo.
Si la integración cumple lo anunciado, NetApp podría reducir una de las tareas más costosas de la IA empresarial: mover y duplicar grandes conjuntos de datos antes de poder utilizarlos. Por ahora, la operación marca una dirección técnica clara, pero sus ventajas concretas tendrán que medirse cuando la tecnología de DataPelago llegue a productos disponibles para los clientes.
Preguntas frecuentes
¿Qué ha comprado NetApp?
NetApp ha adquirido DataPelago, una startup que desarrolla un motor para acelerar el procesamiento de datos mediante CPU, GPU y otros tipos de hardware. No se ha comunicado el precio de la operación.
¿Qué es DataPelago Nucleus?
Nucleus es un motor de procesamiento que distribuye operaciones entre diferentes aceleradores y busca trabajar sobre los datos cerca del lugar donde se almacenan. Está orientado a tareas de IA, analítica y preparación de grandes conjuntos de información.
¿Qué significa zero-copy en esta adquisición?
Significa que NetApp quiere reducir la necesidad de crear copias completas de los datos en plataformas externas antes de procesarlos. No implica que desaparezcan todas las transferencias de información durante la ejecución.
¿Ya está disponible la tecnología de DataPelago en los productos de NetApp?
NetApp no ha publicado todavía un calendario de integración ni ha confirmado en qué productos aparecerán estas funciones. Las capacidades anunciadas deben considerarse parte de la evolución prevista de su plataforma.
Fuentes:
- NetApp, anuncio oficial de la adquisición de DataPelago, 16/07/2026.
- NetApp, análisis técnico sobre Nucleus y los flujos de datos sin copias.
- DataPelago, información técnica sobre Nucleus y procesamiento heterogéneo.