OpenNebula valida su virtualización para NVIDIA GB200 NVL72

OpenNebula ha completado la validación de su plataforma dentro del programa de hipervisores de NVIDIA para sistemas GB200 NVL72, un paso dirigido a demostrar que las cargas de inteligencia artificial pueden ejecutarse en máquinas virtuales manteniendo acceso directo a las GPU. La propuesta intenta resolver una cuestión cada vez más presente en las infraestructuras de IA: cómo conservar las ventajas operativas del cloud sin obligar a ejecutar los aceleradores exclusivamente sobre bare metal.

Las claves de OpenNebula y NVIDIA GB200 NVL72 en 20 segundos

  • OpenNebula ha validado su plataforma de virtualización para sistemas NVIDIA GB200 NVL72.
  • La arquitectura utiliza PCI passthrough para asignar directamente GPU y otros dispositivos a las máquinas virtuales.
  • El objetivo es combinar aislamiento, automatización y multiinquilinidad con acceso directo al hardware acelerador.
  • OpenNebula afirma ser la única plataforma cloud europea validada actualmente dentro de este programa de NVIDIA.
  • La integración forma parte de su propuesta para AI Factories, HPC y proveedores de infraestructura GPU.

La validación tiene interés porque llega mientras las GPU están modificando algunas decisiones tradicionales de arquitectura. Durante años, las cargas de computación de alto rendimiento (HPC) y posteriormente las de inteligencia artificial han favorecido el bare metal para evitar cualquier capa que pudiera reducir prestaciones o introducir latencia.

El problema es que prescindir de la virtualización también significa renunciar a herramientas que llevan años facilitando la explotación de infraestructuras cloud: separación entre clientes, aprovisionamiento automatizado, políticas de recursos, gestión centralizada y ciclos de vida independientes para cada carga.

La evolución del hardware y tecnologías como PCI passthrough permiten reducir esa disyuntiva.

Una máquina virtual con acceso directo a la GPU

La pieza técnica más importante del planteamiento es PCI passthrough.

En una virtualización convencional, determinados dispositivos pueden quedar detrás de capas de emulación o abstracción. Con passthrough, un dispositivo PCIe físico puede asignarse directamente a una máquina virtual para que el sistema operativo invitado interactúe con él.

Aplicado a una GPU, significa que la VM continúa proporcionando la frontera de aislamiento y administración, mientras el acelerador se entrega directamente a esa carga.

Esto resulta especialmente relevante para IA y HPC, donde las aplicaciones dependen de una elevada transferencia de datos y una comunicación eficiente entre CPU, GPU, almacenamiento y red.

OpenNebula busca así mantener una ruta hacia el acelerador cercana a la que tendría un despliegue bare metal, pero sin abandonar el modelo operativo de una infraestructura virtualizada.

Para un proveedor cloud o una empresa que gestione cientos de GPU, la diferencia puede ser importante.

La cuestión ya no consiste únicamente en obtener el máximo rendimiento de cada acelerador. También hay que asignar recursos entre equipos, separar clientes, automatizar despliegues, controlar cuotas y retirar entornos cuando dejan de ser necesarios.

Es ahí donde la virtualización vuelve a adquirir interés incluso en infraestructuras construidas alrededor de GPU.

NVIDIA GB200 NVL72 lleva el problema a otra escala

La validación se ha realizado sobre NVIDIA GB200 NVL72, una arquitectura diseñada para cargas de inteligencia artificial a gran escala.

Estos sistemas integran múltiples aceleradores Blackwell y procesadores Grace dentro de una arquitectura conectada mediante NVLink. La idea es que numerosos aceleradores puedan trabajar como un gran dominio de computación para entrenamiento e inferencia de modelos de gran tamaño.

Gestionar este tipo de infraestructura como una colección de servidores tradicionales resulta cada vez menos práctico cuando debe compartirse entre diferentes proyectos o clientes.

De ahí que alrededor de las llamadas AI Factories esté apareciendo una nueva capa de software destinada a gestionar computación, GPU, redes y almacenamiento como recursos comunes.

OpenNebula sitúa su plataforma precisamente en esa capa.

La compañía describe su propuesta como una plataforma abierta y neutral respecto al proveedor para construir AI Factories multiinquilino, servicios de GPU para neoclouds, centros HPC y operadores de telecomunicaciones.

Su integración con NVIDIA va además más allá del GB200 NVL72. OpenNebula documenta compatibilidad o integración con tecnologías como NVLink y NVSwitch, las unidades de procesamiento de datos BlueField (DPU), Spectrum-X Ethernet e InfiniBand. También dispone de integración con NVIDIA Run:ai para planificación y reparto de recursos GPU sobre Kubernetes.

Virtualización y bare metal empiezan a convivir en las AI Factories

La validación también refleja cómo está cambiando la infraestructura destinada a inteligencia artificial.

En los primeros grandes clústeres GPU, obtener el máximo rendimiento podía justificar configuraciones relativamente rígidas. El servidor estaba dedicado a una carga y el software se instalaba directamente sobre el sistema operativo.

Ese modelo continúa teniendo sentido en determinados escenarios, especialmente cuando una organización necesita dedicar toda la máquina a un único entrenamiento durante largos periodos.

Pero las infraestructuras comerciales tienen otras necesidades.

Un proveedor de GPU cloud puede atender simultáneamente a empresas diferentes. Un centro de investigación puede repartir sus aceleradores entre numerosos proyectos. Una organización puede necesitar entornos independientes para entrenamiento, inferencia, desarrollo y experimentación.

La utilización de máquinas virtuales permite crear esas fronteras sin tener que dedicar necesariamente una infraestructura administrativa diferente a cada usuario.

OpenNebula añade además otras opciones para repartir aceleradores. Su plataforma contempla NVIDIA MIG (Multi-Instance GPU) y tecnologías vGPU, destinadas a dividir determinados recursos GPU cuando dedicar un acelerador completo a una única carga no resulta necesario.

Esto permite distinguir varios modelos.

Las cargas más exigentes pueden recibir GPU completas mediante passthrough. Otros servicios pueden compartir aceleradores utilizando mecanismos de partición. Y los nodos pueden continuar formando parte de una infraestructura administrada desde una capa cloud común.

Esa flexibilidad puede ser especialmente útil para mejorar la utilización de GPU, uno de los activos más caros de las nuevas plataformas de IA.

Una tecnología europea dentro del programa de NVIDIA

OpenNebula añade además una dimensión europea a la noticia.

La compañía afirma que actualmente es la única plataforma cloud europea validada dentro del NVIDIA AI Cloud-Ready ISV Program. Su documentación identifica expresamente la pila completa de infraestructura cloud de OpenNebula como validada sobre NVIDIA GB200 NVL72.

La precisión es importante: la afirmación se refiere a esta categoría y programa de validación de NVIDIA, no significa que OpenNebula sea la única tecnología europea compatible con GPU NVIDIA ni la única utilizada en infraestructuras de IA.

Para Europa, disponer de capas de gestión propias está adquiriendo además interés alrededor de los proyectos de IA soberana y AI Factories.

El hardware puede proceder de NVIDIA y otros fabricantes internacionales, pero la capa que administra usuarios, máquinas virtuales, Kubernetes, redes, almacenamiento y políticas determina también quién controla operativamente la infraestructura.

OpenNebula intenta ocupar ese espacio con una plataforma abierta que puede utilizarse en infraestructura privada, centros HPC, operadores y proveedores cloud.

La propia compañía habla de evitar dependencia tecnológica y mantener control sobre la infraestructura y el software. Son objetivos comerciales de OpenNebula, aunque encajan con el debate europeo sobre soberanía tecnológica y capacidad propia para operar infraestructuras de inteligencia artificial.

La validación con GB200 NVL72 aporta ahora una prueba técnica adicional para uno de los escenarios más exigentes que pretende cubrir.

También muestra una tendencia más amplia: bare metal y virtualización están dejando de plantearse necesariamente como alternativas excluyentes en IA.

Cuando la GPU puede entregarse directamente a una VM, la discusión pasa a centrarse en cuánto aislamiento y automatización necesita cada carga, qué recursos pueden compartirse y qué impacto real introduce cada arquitectura.

En unas AI Factories que pueden reunir miles de aceleradores y numerosos usuarios, gestionar bien esas GPU puede terminar siendo casi tan importante como disponer de ellas.

Preguntas frecuentes

¿Qué ha validado NVIDIA de OpenNebula?

OpenNebula ha completado la validación de su plataforma para infraestructura acelerada NVIDIA, incluyendo su despliegue sobre sistemas NVIDIA GB200 NVL72 dentro del programa correspondiente de NVIDIA.

¿Cómo puede una máquina virtual acceder directamente a una GPU?

Mediante PCI passthrough, el dispositivo PCIe puede asignarse directamente a una máquina virtual. El sistema operativo invitado obtiene acceso al hardware mientras la VM continúa funcionando como unidad de aislamiento y administración.

¿OpenNebula obliga a virtualizar todas las cargas de IA?

No. La plataforma está planteada para gestionar diferentes modelos de infraestructura, incluidos virtualización, bare metal y Kubernetes, además de tecnologías para particionar o compartir GPU.

¿Es OpenNebula la única plataforma europea certificada por NVIDIA?

OpenNebula afirma ser actualmente la única plataforma cloud europea validada mediante el NVIDIA AI Cloud-Ready ISV Program. Esa afirmación debe entenderse dentro del alcance concreto de ese programa y no como exclusividad general sobre tecnologías NVIDIA en Europa.

encuentra artículos

newsletter

Recibe toda la actualidad del sector tech y cloud en tu email de la mano de RevistaCloud.com.

Suscripción boletín

LO ÚLTIMO