Teradata ha integrado su Autonomous Knowledge Platform con Microsoft OneLake para que las empresas puedan ejecutar consultas analíticas y cargas de inteligencia artificial directamente sobre los datos almacenados en OneLake, sin copiarlos previamente a Teradata. La conexión utiliza las API abiertas de Apache Iceberg y Microsoft Entra ID para la autenticación, y ya está disponible inicialmente con acceso de lectura.
Las claves de Teradata y Microsoft OneLake en 20 segundos
- Teradata puede consultar directamente tablas almacenadas en Microsoft OneLake.
- La integración evita crear determinadas copias y canalizaciones ETL solo para llevar los datos de una plataforma a otra.
- Utiliza las API de Apache Iceberg y autenticación mediante Microsoft Entra ID.
- Permite combinar datos de Teradata y OneLake en una misma carga analítica.
- Por ahora, la integración anunciada ofrece acceso de lectura a las tablas de OneLake.
El anuncio aborda uno de los problemas menos visibles de los proyectos empresariales de inteligencia artificial: antes de utilizar los datos hay que localizarlos, copiarlos, transformarlos, gobernarlos y mantenerlos sincronizados.
Una gran organización puede tener información repartida entre bases de datos corporativas, almacenes analíticos, data lakes, aplicaciones SaaS y diferentes proveedores cloud. Cuando un nuevo sistema de IA necesita acceder a esos datos, una solución tradicional consiste en crear otra canalización de extracción, transformación y carga (ETL).
El inconveniente aparece cuando esas copias empiezan a multiplicarse.
Hay más almacenamiento que pagar, procesos que mantener y permisos que administrar. También aumenta la posibilidad de que dos sistemas estén trabajando sobre versiones diferentes de la misma información.
La integración entre Teradata y OneLake intenta eliminar parte de ese recorrido: en lugar de llevar los datos hasta el motor analítico, lleva el motor hasta los datos.
Apache Iceberg empieza a funcionar como idioma común entre plataformas
La pieza técnica que permite esta integración es Apache Iceberg, un formato abierto de tablas diseñado para trabajar con grandes conjuntos de datos analíticos.
Microsoft ha ido ampliando el soporte de Iceberg dentro de OneLake. Su arquitectura permite trabajar tanto con Delta Lake como con Apache Iceberg mediante virtualización de metadatos. Las tablas Delta pueden exponerse a lectores compatibles con Iceberg y las tablas Iceberg pueden utilizarse desde diferentes cargas de Microsoft Fabric.
Además, OneLake dispone de un endpoint REST compatible con el estándar Iceberg REST Catalog, inicialmente orientado a operaciones de metadatos de solo lectura.
Teradata aprovecha esa capa abierta para acceder a las tablas.
La consecuencia práctica es importante: una empresa que tenga información dentro de Microsoft Fabric no necesita necesariamente exportarla, transformarla y mantener una segunda copia en Teradata para poder analizarla desde esta plataforma.
Los usuarios pueden ejecutar consultas sobre las tablas de OneLake y combinar esos datos con información que ya reside en Teradata.
Eso permite, por ejemplo, realizar joins complejos, preparar características para modelos de IA o atender consultas analíticas sujetas a determinados niveles de servicio sin consolidar previamente todos los datos en un único repositorio.
La interoperabilidad tampoco significa que ambas plataformas se conviertan en una sola. Teradata y Microsoft Fabric siguen teniendo sus propios motores, servicios, costes y modelos operativos. Lo que cambia es la necesidad de duplicar físicamente determinada información para trabajar con ella.
Menos ETL puede significar menos coste y menos datos duplicados
Durante años, copiar información entre plataformas ha sido una práctica habitual en analítica empresarial.
El proceso funciona, pero tiene un coste.
Una empresa puede almacenar un conjunto de datos original en una plataforma, mantener otra copia en un data lake, generar una tercera para un sistema analítico y terminar creando nuevas versiones para proyectos de aprendizaje automático.
Cada copia consume almacenamiento y necesita mantenerse actualizada.
Las canalizaciones también fallan. Hay que controlar esquemas, credenciales, ventanas de procesamiento, dependencias y cambios realizados en los sistemas de origen.
La inteligencia artificial amplifica el problema porque puede necesitar grandes cantidades de información corporativa para construir variables, recuperar contexto o alimentar aplicaciones y agentes.
Teradata sostiene que su integración elimina ese paso para los clientes que trabajan simultáneamente con sus productos y Microsoft Fabric.
La afirmación debe entenderse con cierto cuidado: no desaparece la necesidad general de ETL o de movimiento de datos en una empresa.
Seguirán existiendo multitud de situaciones donde sea necesario limpiar, transformar, copiar, agregar o reorganizar información.
Lo que puede desaparecer es una clase concreta de movimiento: copiar datos de OneLake a Teradata únicamente porque el motor de Teradata necesita analizarlos.
Ese matiz resulta bastante más relevante que prometer el final del ETL.
La gobernanza importa tanto como ahorrar almacenamiento
La duplicación de información plantea además un problema de seguridad.
Cuando un conjunto de datos se copia a otra plataforma también hay que decidir quién puede acceder a esa nueva copia, cómo se autentican los usuarios, qué políticas se aplican y cómo se mantiene su trazabilidad.
La integración anunciada utiliza Microsoft Entra ID para gestionar la autenticación entre plataformas. Teradata asegura además que el acceso permite mantener el modelo de gobernanza asociado a los datos en lugar de reconstruirlo alrededor de cada nueva copia.
Microsoft utiliza una filosofía similar dentro del propio OneLake.
Sus shortcuts funcionan como referencias a información almacenada en otras ubicaciones. Pueden apuntar a datos dentro de OneLake y también a fuentes externas como Azure Data Lake Storage, Amazon S3, Google Cloud Storage y sistemas compatibles con Iceberg, entre otros.
En estos casos los permisos de origen siguen teniendo importancia. La documentación de Microsoft explica que el acceso a los shortcuts depende de los permisos tanto en la ubicación donde aparece la referencia como en el destino al que apunta.
La tendencia es clara: las plataformas de datos están intentando ofrecer acceso lógico a información distribuida sin convertir cada integración en una nueva copia física.
Una pieza especialmente interesante para los agentes de IA
Teradata está relacionando esta arquitectura con otro de los grandes cambios del software empresarial: los agentes de inteligencia artificial.
Un agente útil dentro de una empresa necesita algo más que un modelo de lenguaje.
Tiene que saber qué cliente está realizando una consulta, cuáles son sus pedidos, qué contratos mantiene, qué productos están disponibles o qué políticas internas debe respetar.
Gran parte de ese conocimiento está repartido entre diferentes sistemas.
Duplicar continuamente todos esos datos dentro de una plataforma específica para IA puede resultar caro y difícil de gobernar. Acceder a ellos donde ya se encuentran ofrece una alternativa.
La Autonomous Knowledge Platform de Teradata está precisamente orientada a proporcionar contexto empresarial, gobernanza y capacidad analítica para aplicaciones y agentes de IA. La conexión con OneLake amplía la cantidad de información que puede utilizar sin exigir previamente una migración.
Eso no significa que un agente pueda acceder automáticamente a todo lo almacenado en Fabric.
Los permisos siguen siendo necesarios y la arquitectura empresarial debe controlar qué información puede consultar cada aplicación.
Tampoco todos los casos de uso necesitan acceso directo en tiempo de ejecución. En determinados sistemas seguirá teniendo más sentido preparar previamente conjuntos de datos específicos.
La ventaja está en disponer de otra opción.
OneLake refuerza su papel como capa común de datos de Microsoft Fabric
Para Microsoft, la integración encaja con el planteamiento original de OneLake.
OneLake funciona como el lago de datos lógico común de Microsoft Fabric. La compañía lo presenta como una capa en la que los diferentes motores analíticos pueden trabajar sobre una misma información sin que cada uno tenga que mantener necesariamente su propia copia.
La incorporación de formatos abiertos amplía ese planteamiento fuera de los propios servicios de Microsoft.
Apache Iceberg resulta especialmente importante porque está siendo adoptado por numerosas plataformas analíticas y permite desacoplar parcialmente el formato de almacenamiento del motor utilizado para procesarlo.
Para las empresas, esa separación puede reducir uno de los riesgos históricos de las grandes plataformas de datos: que mover una carga a otro motor implique también migrar físicamente enormes cantidades de información.
La integración de Teradata es un ejemplo de cómo los formatos abiertos empiezan a utilizarse para conectar productos que anteriormente habrían necesitado mecanismos específicos de replicación.
La primera versión tiene una limitación importante: es de lectura
La disponibilidad anunciada por Teradata es inmediata, pero conviene prestar atención al alcance.
La integración proporciona actualmente acceso de lectura a las tablas de OneLake.
Teradata puede consultar y analizar la información sin modificar los datos almacenados allí.
Esto encaja además con el estado actual de las API de tablas Iceberg de OneLake, cuya documentación especifica inicialmente operaciones de metadatos de solo lectura.
Por tanto, no debe interpretarse el anuncio como una integración bidireccional completa en la que cualquier operación realizada desde Teradata pueda escribir directamente sobre las tablas de Microsoft Fabric.
Aun así, para muchas cargas analíticas el acceso de lectura puede cubrir una parte considerable de las necesidades.
Una organización podría conservar determinados datos en OneLake, mantener otros en Teradata y analizarlos conjuntamente sin iniciar un proyecto previo de consolidación.
Teradata mostrará públicamente la integración durante la European Microsoft Fabric + SQL Community Conference, que se celebrará en Barcelona entre el 28 de septiembre y el 1 de octubre de 2026.
El anuncio refleja así un cambio más amplio que está produciéndose en las arquitecturas empresariales de datos.
Durante años, integrar plataformas significaba principalmente mover información de una a otra. La combinación de almacenamiento desacoplado, formatos abiertos y catálogos estándar permite empezar a plantear otra arquitectura: mantener el dato donde tiene sentido almacenarlo y permitir que diferentes motores autorizados trabajen directamente sobre él.
En una época en la que la IA empresarial necesita consultar cada vez más información, reducir las copias puede tener efectos en coste, latencia y gobernanza.
Y probablemente esa sea la parte más interesante de la integración entre Teradata y Microsoft: Apache Iceberg empieza a convertir la ubicación física del dato en una decisión menos ligada al motor que finalmente lo analiza.
Preguntas frecuentes
¿Qué ha anunciado Teradata con Microsoft OneLake?
Teradata permite consultar y analizar directamente tablas almacenadas en Microsoft OneLake desde su Autonomous Knowledge Platform. La integración evita tener que copiar previamente esos datos a Teradata únicamente para analizarlos.
¿Es necesario crear pipelines ETL entre OneLake y Teradata?
Para el acceso anunciado, no es necesario replicar los datos de OneLake en Teradata mediante un pipeline ETL. Eso no significa que ETL deje de ser necesario para otras transformaciones o integraciones de una organización.
¿Qué papel tiene Apache Iceberg?
La integración utiliza las API estándar de Apache Iceberg para permitir que Teradata consulte las tablas almacenadas en OneLake. Microsoft también utiliza Iceberg como parte de su estrategia de interoperabilidad entre diferentes motores y plataformas de datos.
¿Puede Teradata modificar directamente los datos de OneLake?
La integración anunciada ofrece actualmente acceso de lectura. Permite consultar y utilizar las tablas desde Teradata, pero no debe confundirse con una integración completa de lectura y escritura.