Broadcom ha ampliado las capacidades de inteligencia artificial de VMware Cloud Foundation (VCF) con la validación de varios modelos de NVIDIA, Google DeepMind, NEC, Alibaba Cloud y Z.ai para ejecutarlos en infraestructura privada. El anuncio, realizado en VMware Explore 2026, busca que las empresas puedan ofrecer inferencia y modelos como servicio desde sus propios centros de datos o nubes privadas, manteniendo un mayor control sobre datos, infraestructura y costes.
Las claves de la IA privada de VMware en 20 segundos
- VCF valida modelos de NVIDIA, Google DeepMind, NEC, Alibaba Cloud y Z.ai.
- Entre ellos aparecen Nemotron 3, Gemma 4, cotomi, Qwen3.8-27B y GLM 5.2.
- vLLM permite ejecutar además más de 150 modelos abiertos, según Broadcom.
- VCF admite infraestructura basada en AMD, Intel y NVIDIA.
- El objetivo es llevar inferencia y agentes de IA a entornos privados.
La noticia refleja una tendencia que empieza a definir la siguiente fase de la IA empresarial. Después de experimentar principalmente mediante APIs y servicios públicos, algunas organizaciones están estudiando qué cargas merece la pena ejecutar dentro de infraestructura bajo su control.
Broadcom asegura en su Private Cloud Outlook 2026 que el 56 % de las empresas encuestadas ya ejecuta o planea ejecutar inferencia de IA en producción sobre nube privada. Es un dato procedente de un estudio de la propia compañía y debe interpretarse dentro de ese contexto, pero ayuda a explicar la dirección que está tomando VMware Cloud Foundation.
El objetivo de VCF es que máquinas virtuales tradicionales, Kubernetes, aplicaciones con agentes e inferencia de modelos puedan compartir una misma plataforma de infraestructura.
Cinco familias de modelos validadas para VCF
La novedad más concreta es la validación de diferentes modelos para su funcionamiento sobre VMware Cloud Foundation.
Broadcom ha anunciado compatibilidad validada con NVIDIA Nemotron 3, Google DeepMind Gemma 4, NEC cotomi, Alibaba Qwen3.8-27B y Z.ai GLM 5.2.
No todos responden al mismo tipo de necesidad.
Nemotron 3 está orientado especialmente a aplicaciones agénticas y combina, según la descripción proporcionada por Broadcom, una arquitectura híbrida Mamba-Transformer con Mixture of Experts (MoE), capacidades multimodales y una ventana de contexto de hasta un millón de tokens.
Gemma 4 representa la familia de modelos abiertos de Google DeepMind dentro de la plataforma. Broadcom destaca su orientación multimodal y su utilización para desarrollar aplicaciones y agentes que puedan ejecutarse localmente.
La presencia de cotomi, desarrollado por NEC, introduce un caso diferente. Se trata de un modelo pensado especialmente para japonés y escenarios empresariales de ese mercado. NEC sostiene que consigue una mejora del 40 % en eficiencia de tokens, una cifra atribuida al fabricante.
Alibaba aporta Qwen3.8-27B, descrito en el anuncio como un modelo denso multimodal de 27.000 millones de parámetros orientado a programación, investigación, tareas profesionales y agentes de larga duración.
Finalmente, GLM 5.2 de Z.ai, anteriormente conocida como Zhipu AI, está orientado a razonamiento, programación y procesos autónomos de varios pasos.
| Modelo | Proveedor | Orientación destacada por Broadcom |
|---|---|---|
| Nemotron 3 | NVIDIA | Agentes, multimodalidad y contextos largos |
| Gemma 4 | Google DeepMind | IA local, multimodalidad y agentes |
| cotomi | NEC | Japonés y aplicaciones empresariales |
| Qwen3.8-27B | Alibaba Cloud / Qwen | Código, visión, investigación y agentes |
| GLM 5.2 | Z.ai | Razonamiento, código y flujos autónomos |
La validación no significa que estos modelos necesiten VMware para funcionar. Son modelos que pueden desplegarse mediante otras infraestructuras y herramientas. Lo que Broadcom ofrece es un entorno probado para integrarlos dentro de VCF y gestionarlos junto al resto de cargas empresariales.
vLLM amplía el catálogo mucho más allá de cinco modelos
La lista anunciada tampoco representa el límite de modelos que pueden utilizarse.
VMware Cloud Foundation adopta vLLM como runtime predeterminado para servir modelos, lo que permite a Broadcom afirmar que sus clientes pueden ejecutar más de 150 modelos abiertos compatibles.
vLLM se ha extendido como uno de los proyectos más utilizados para servir grandes modelos de lenguaje porque incorpora técnicas destinadas a gestionar eficientemente memoria, concurrencia y generación de tokens.
Su presencia resulta importante para evitar que la infraestructura quede asociada exclusivamente a un catálogo cerrado.
Una empresa podría utilizar un modelo validado específicamente por Broadcom para determinadas aplicaciones y otros modelos compatibles con vLLM para proyectos diferentes.
La elección dependerá también del hardware disponible.
Broadcom destaca que VCF admite configuraciones de cómputo mixtas con AMD, Intel y NVIDIA, por lo que la estrategia no se limita a un único tipo de procesador para todas las cargas.
Esto puede resultar relevante en centros de datos donde ya existe una inversión considerable en infraestructura y las empresas quieren incorporar IA progresivamente, en lugar de construir una plataforma completamente separada.
La inferencia privada gana terreno frente al entrenamiento
El anuncio está especialmente orientado a inferencia, no a competir con las enormes infraestructuras utilizadas para entrenar modelos fundacionales desde cero.
La diferencia es importante.
Entrenar un modelo de frontera puede requerir miles o decenas de miles de aceleradores durante largos periodos. Es una escala que queda fuera de las necesidades de la inmensa mayoría de empresas.
Ejecutar un modelo ya entrenado para atender solicitudes internas presenta una economía diferente.
Una organización puede utilizarlo para asistentes corporativos, búsqueda documental, generación de código, análisis de información o agentes conectados a aplicaciones empresariales.
Cuando el volumen de consultas es suficientemente estable, desplegar esa inferencia sobre infraestructura propia puede convertirse en una opción a estudiar frente al pago continuado por tokens a proveedores externos.
Eso no significa que la nube privada sea automáticamente más barata.
Hay que considerar GPUs, servidores, energía, refrigeración, almacenamiento, licencias, personal, utilización efectiva del hardware y renovación tecnológica. Una GPU infrautilizada puede hacer que consumir una API externa resulte bastante más económico.
Por eso Broadcom introduce el concepto de AI tokenomics: analizar el coste real de producir y consumir tokens según dónde se ejecute el modelo.
La decisión empieza a parecerse a otros debates históricos sobre infraestructura. Algunas cargas variables encajan bien en servicios públicos; otras, estables y previsibles, pueden justificar capacidad dedicada.
Los datos son el otro argumento para llevar la IA dentro de la empresa
El coste es solamente una parte de la decisión.
La privacidad y el gobierno de los datos explican buena parte del interés por la IA privada.
Un agente empresarial resulta más útil cuando puede consultar documentación interna, bases de conocimiento, aplicaciones, código o información sobre clientes. Precisamente esos datos son los que una organización puede tener más dificultades para enviar fuera de determinados perímetros.
Ejecutar el modelo dentro de infraestructura controlada permite diseñar arquitecturas donde una parte mayor del procesamiento permanece en el entorno privado.
Eso no convierte automáticamente un despliegue local en seguro o conforme con la regulación.
La seguridad dependerá de las identidades, permisos, segmentación, aplicaciones, configuración del modelo y sistemas a los que pueda acceder. También será necesario controlar qué información termina en prompts, registros y bases vectoriales.
Pero disponer del modelo dentro del mismo entorno proporciona a la organización más opciones para definir dónde circulan esos datos.
Broadcom relaciona esta característica con soberanía y gobierno, especialmente en sectores sometidos a restricciones regulatorias.
VMware quiere ofrecer modelos como un servicio interno
Otro elemento del anuncio es el concepto de Model as a Service.
La idea consiste en evitar que cada departamento tenga que desplegar y administrar sus propios servidores de inferencia.
El equipo de infraestructura puede mantener diferentes modelos sobre VCF y ofrecerlos internamente como servicios a desarrolladores y departamentos.
Así, un equipo podría consumir Gemma para una aplicación, otro utilizar Nemotron para agentes y un tercero desplegar un modelo especializado, mientras la infraestructura permanece gestionada centralmente.
Es una evolución parecida a la que Kubernetes produjo con las aplicaciones empresariales: la plataforma intenta abstraer parte de la complejidad del hardware y proporcionar recursos bajo demanda a quienes desarrollan servicios.
En IA existe además una dificultad añadida: las GPUs son recursos caros y limitados, por lo que mejorar su utilización puede tener un efecto directo sobre el coste.
Broadcom también señala resultados obtenidos bajo MLPerf Inference v5.1 para defender que VCF puede ofrecer un rendimiento comparable al bare metal en los escenarios evaluados. La referencia debe entenderse dentro de las configuraciones concretas sometidas al benchmark y no como garantía de que cualquier carga virtualizada vaya a rendir exactamente igual que una instalación directa sobre hardware.
La nube privada intenta convertirse también en plataforma de IA
La estrategia de Broadcom con VCF empieza a ir más allá de mantener aplicaciones virtualizadas existentes.
La compañía está intentando convertir VMware Cloud Foundation en una plataforma donde convivan la infraestructura tradicional y las nuevas cargas de IA.
Para muchas empresas esta convivencia puede resultar más práctica que construir un entorno independiente exclusivamente para inteligencia artificial.
Las máquinas virtuales no van a desaparecer porque una organización incorpore agentes. Tampoco las bases de datos, aplicaciones Java, sistemas Windows o plataformas Kubernetes que ya utiliza.
La cuestión es si la infraestructura existente puede absorber también modelos, GPUs y nuevos servicios de inferencia sin crear otra isla tecnológica.
La validación de Nemotron, Gemma, cotomi, Qwen y GLM busca responder precisamente a esa necesidad.
Además, la diversidad de proveedores resulta relevante. Broadcom no está planteando una nube privada vinculada a un único modelo. Su propuesta es proporcionar una capa donde la empresa pueda cambiar de modelo según evolucione el mercado.
En un sector en el que las diferencias entre modelos pueden reducirse rápidamente y aparecen nuevas versiones cada pocos meses, evitar una dependencia excesiva de un modelo concreto puede terminar siendo tan importante como elegir el mejor disponible en un momento determinado.
VMware Cloud Foundation intenta ocupar esa capa intermedia: por debajo están servidores, CPU y GPU; por encima, modelos y aplicaciones; en medio queda una plataforma privada encargada de proporcionar recursos, Kubernetes, virtualización y servicios necesarios para operarlos.
El anuncio de VMware Explore 2026 muestra hasta qué punto la IA está entrando en el mercado tradicional de infraestructura empresarial. El siguiente debate ya no gira únicamente alrededor de qué modelo utilizar, sino también de dónde ejecutarlo, cuánto cuesta cada token y qué datos puede abandonar la infraestructura de la organización.
Preguntas frecuentes
¿Qué modelos de IA ha validado Broadcom para VMware Cloud Foundation?
Broadcom ha anunciado la validación de NVIDIA Nemotron 3, Google DeepMind Gemma 4, NEC cotomi, Qwen3.8-27B de Alibaba y GLM 5.2 de Z.ai.
¿VCF está limitado a esos cinco modelos?
No. Broadcom utiliza vLLM como runtime predeterminado y afirma que VMware Cloud Foundation puede ejecutar más de 150 modelos abiertos compatibles.
¿Para qué sirve ejecutar un modelo de IA en una nube privada?
Permite mantener un mayor control sobre infraestructura y circulación de datos y puede resultar interesante para cargas de inferencia estables. Su conveniencia económica depende del coste del hardware, utilización, energía, operación y alternativas disponibles mediante servicios externos.
¿VMware Cloud Foundation necesita exclusivamente GPU de NVIDIA?
No. Broadcom indica que VCF admite configuraciones de cómputo con tecnologías de AMD, Intel y NVIDIA, aunque la compatibilidad y rendimiento concretos dependerán de cada modelo y configuración.