NVIDIA ha publicado como código abierto Personal AI Router (PAIR), un proyecto que permite agrupar varios ordenadores de una red local y distribuir entre ellos peticiones independientes de inferencia de inteligencia artificial. La comparación con un pequeño “Kubernetes para la IA doméstica” ayuda a entender la idea, aunque tiene un límite importante: PAIR no suma la memoria de las GPU, no divide un modelo entre varios equipos y tampoco convierte varias tarjetas gráficas en una única GPU virtual.
Las claves de NVIDIA PAIR en 30 segundos
- PAIR distribuye peticiones independientes de inferencia entre ordenadores conectados a una misma red local.
- El proyecto es de código abierto bajo licencia Apache 2.0 y dispone de instaladores para Windows, Linux y macOS.
- Ofrece endpoints compatibles con Ollama y OpenAI para evitar cambios importantes en las aplicaciones existentes.
- Cada petición completa se ejecuta en un único nodo; PAIR no agrega VRAM ni fragmenta modelos entre máquinas.
- Su planificador actual tiene limitaciones con hardware muy heterogéneo, un área que NVIDIA reconoce que quiere mejorar.
El repositorio oficial de NVIDIA apareció públicamente a finales de agosto y ya dispone de versiones empaquetadas. La rama de lanzamientos muestra PAIR 0.1.x, lo que deja claro que se trata todavía de un proyecto joven. La propuesta, sin embargo, aborda un problema que empieza a ser habitual entre desarrolladores que ejecutan modelos localmente: disponer de varios ordenadores capaces de ejecutar IA, pero gestionarlos como recursos completamente independientes.
Un PC puede tener una GPU dedicada. Otro equipo puede disponer de bastante memoria. Un portátil permanece libre durante parte del día. Un Mac puede estar ejecutando otro modelo.
PAIR intenta colocar una capa común delante de esas máquinas.
Cómo funciona PAIR y por qué no agrega las GPU
La arquitectura es bastante más sencilla de lo que podría sugerir la comparación con Kubernetes.
Cada ordenador donde se instala PAIR se convierte en un nodo. Varios nodos emparejados forman un clúster y pueden utilizar Windows 11, Linux o macOS, además de arquitecturas x64 y arm64. Windows sobre ARM aparece actualmente como experimental.
No existe un controlador central permanente. La documentación de NVIDIA especifica que todos los nodos ejecutan el mismo software.
PAIR descubre los equipos disponibles en la red local, comprueba qué motores y modelos tienen preparados y presenta al software cliente un endpoint local. Actualmente trabaja principalmente con motores como Ollama y LM Studio, mientras la documentación aportada también contempla integración limitada con llama.cpp en determinados escenarios.
Una aplicación puede enviar una petición compatible con la API de OpenAI:
curl http://127.0.0.1:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen4:12b","messages":[{"role":"user","content":"Hello"}]}'
La aplicación no necesita decidir qué ordenador ejecutará esa inferencia.
PAIR recibe la petición, identifica los nodos que pueden atenderla, selecciona uno y reenvía allí el trabajo. La respuesta vuelve posteriormente a través del proxy.
Simplificado:
Agente / aplicación
↓
PAIR endpoint
↓
┌─────┼─────┐
↓ ↓ ↓
Nodo A Nodo B Nodo C
GPU A GPU B GPU C
Aquí aparece la diferencia que evita interpretar PAIR como una especie de GPU distribuida.
Una petición se asigna completa a un nodo.
Si existen cinco agentes realizando cinco inferencias simultáneas, PAIR puede distribuir esos trabajos entre diferentes máquinas. Pero si se intenta cargar un modelo que necesita 100 GB de memoria y ningún ordenador dispone individualmente de esa capacidad, tener cuatro equipos con 32 GB no crea automáticamente un espacio conjunto de 128 GB.
La documentación de NVIDIA es explícita: PAIR no combina GPU, no agrega memoria, no realiza sharding de un modelo entre máquinas y no divide una inferencia que ya está ejecutándose.
Por eso su utilidad aparece principalmente con cargas concurrentes.
Un entorno con varios agentes de IA constituye un buen ejemplo. En lugar de hacer que cinco subagentes esperen para utilizar una misma GPU, diferentes solicitudes pueden acabar ejecutándose simultáneamente en varios ordenadores.
Un scheduler para la IA local que todavía tiene bastante margen
La parte más interesante técnicamente está en cómo decide PAIR dónde enviar cada petición.
Un nodo solo puede convertirse en candidato cuando está accesible, dispone de un motor compatible en funcionamiento y tiene disponible el modelo solicitado.
Después entra en funcionamiento el planificador.
La documentación actual explica que el scheduler tiene en cuenta principalmente el trabajo pendiente y una señal suavizada de utilización de GPU. Además, los proxies contabilizan las solicitudes que acaban de enviar para evitar que una ráfaga de peticiones termine concentrándose sobre una sola máquina antes de que las métricas reflejen la nueva carga.
Es una primera aproximación al problema, pero NVIDIA reconoce limitaciones importantes.
El propio proyecto señala que actualmente el algoritmo no tiene en cuenta el modelo concreto de GPU, la memoria disponible, si el modelo está caliente en memoria o el coste estimado de una petición. Por eso PAIR encaja mejor inicialmente con grupos de máquinas relativamente parecidas que con clústeres formados por hardware radicalmente diferente.
La compañía plantea precisamente mejorar esa parte en futuras versiones y posiblemente permitir seleccionar diferentes políticas de planificación, aunque advierte que son ideas de desarrollo y no compromisos de producto.
Esta limitación también ayuda a contextualizar una de las primeras reacciones de la comunidad.
La publicación que ha llamado la atención sobre PAIR señala la ausencia de soporte adecuado para una máquina AMD Strix Halo utilizando ROCm 10 y explica que su autor ha encargado a un agente de programación modificar el proyecto para añadirlo.
Esa adaptación no forma parte actualmente del proyecto oficial de NVIDIA y no puede darse por soportada hasta que exista código funcional y, en su caso, sea aceptado por los mantenedores.
Pero el caso ilustra una consecuencia directa de la decisión de liberar PAIR bajo Apache License 2.0: los desarrolladores pueden estudiar el código, modificarlo y proponer cambios mediante pull requests.
La gobernanza publicada por NVIDIA establece precisamente ese procedimiento. Los mantenedores revisan las contribuciones y deciden cuáles se incorporan al proyecto.
IA local, red local y compatibilidad con aplicaciones existentes
PAIR también intenta reducir la cantidad de cambios necesarios en el software que ya utiliza modelos locales.
Expone proxies compatibles con Ollama y con APIs con formato OpenAI. Una aplicación puede seguir enviando peticiones hacia una dirección local mientras PAIR decide qué máquina termina ejecutándolas.
La documentación explica que el descubrimiento de nodos utiliza mDNS, mientras que el inventario de modelos se obtiene posteriormente desde los motores correspondientes.
El emparejamiento requiere un PIN de seis cifras. Una vez establecida la relación de confianza, el tráfico entre nodos utiliza TLS mutuo (mTLS) y los equipos que no pertenecen al clúster son rechazados.
NVIDIA advierte, aun así, que el PIN es un mecanismo temporal para establecer inicialmente la confianza y no una credencial de alta entropía. La recomendación es emparejar únicamente equipos y redes considerados fiables.
La privacidad local también necesita un matiz.
PAIR está diseñado para que las solicitudes y respuestas permanezcan en la red local cuando todos los componentes utilizados también son locales. Eso incluye cliente, modelos, motores y nodos. Instalar PAIR no convierte automáticamente en local cualquier servicio externo que pueda utilizar una aplicación.
Ese modelo puede resultar atractivo para laboratorios domésticos, desarrolladores, pequeñas estaciones de trabajo distribuidas y entornos donde varios agentes compiten por recursos de inferencia.
También cambia ligeramente la forma de pensar sobre el hardware para IA personal.
Hasta ahora la solución habitual para aumentar capacidad consistía en comprar una GPU mayor o trasladar la carga a infraestructura cloud. PAIR introduce una tercera posibilidad para determinados escenarios: utilizar mejor varios equipos que ya existen.
No sustituye al entrenamiento distribuido, al tensor parallelism ni a tecnologías capaces de fragmentar modelos gigantes entre aceleradores. Tampoco convierte tres ordenadores modestos en una gran estación de IA.
Su objetivo es más concreto: si existen varias inferencias independientes y varias máquinas capaces de ejecutarlas, evitar que todas terminen esperando detrás del mismo recurso.
Para los desarrolladores que empiezan a trabajar con sistemas multiagente, esa distinción puede ser precisamente la parte más interesante de PAIR.
Preguntas frecuentes
¿Qué es NVIDIA Personal AI Router?
PAIR es un proyecto de código abierto que distribuye peticiones independientes de inferencia entre ordenadores compatibles conectados a una misma red local. Las aplicaciones pueden acceder mediante endpoints compatibles con Ollama y OpenAI.
¿PAIR suma la memoria de varias GPU?
No. Cada petición se ejecuta completamente en un único nodo. PAIR no agrega VRAM, no crea una GPU lógica mayor y no divide un modelo entre varios ordenadores.
¿PAIR funciona con Windows, Linux y macOS?
Sí. NVIDIA ofrece soporte para Windows 11, Linux y macOS, con arquitecturas x64 y arm64. La compatibilidad efectiva para inferencia también depende del motor, la GPU, sus controladores y el modelo utilizado.
¿NVIDIA PAIR soporta AMD ROCm?
PAIR puede ejecutarse sobre diferentes sistemas, pero eso no significa automáticamente que cualquier GPU o motor de inferencia sea compatible. La adaptación mencionada para AMD Strix Halo y ROCm 10 procede de un desarrollador externo y no constituye actualmente soporte oficial del proyecto.