Qué hace

Nvidia ha publicado una beta de PAIR, el Personal AI Router, una herramienta gratuita y de código abierto que descubre los ordenadores de una red local y reparte entre ellos las peticiones de inferencia de IA, entregándoselas a los que no están ocupados. Se presentó en la feria IFA 2026 de Berlín y The New Stack lo describió el 3 de septiembre.

PAIR no ejecuta modelos por sí mismo. Utiliza la instalación de Ollama o LM Studio que ya haya en cada máquina, descubre a los demás equipos por mDNS y comprueba la carga actual de cada nodo antes de asignarle un trabajo. Una máquina en mitad de una partida queda descartada; una que está inactiva recibe la tarea.

El hardware compatible es amplio para lo habitual en el software de Nvidia: Windows, macOS y Linux, con GeForce RTX serie 20 en adelante, RTX PRO desde Turing, DGX Spark y silicio de Apple desde el M4.

La limitación que lo define

PAIR es un enrutador y un planificador, no un tejido de cómputo. No puede repartir un modelo grande entre varias GPU pequeñas, no agrupa la VRAM en un único espacio de direcciones y no puede dividir una sola petición de inferencia entre dos máquinas. Cada nodo necesita memoria suficiente para alojar el modelo por su cuenta.

Un escritorio doméstico con un ordenador todo en uno, un portátil y plantas
El hardware compatible va desde la GeForce RTX serie 20 y el Apple M4 en adelante. Fotografía de archivo. Mateusz Dach · pexels · Pexels License

Eso descarta el uso que casi todo el mundo querría primero —ejecutar un modelo demasiado grande para cualquier máquina— y deja el uso que de verdad abunda en el trabajo con agentes: muchas llamadas independientes a la vez. Un flujo multiagente que lanza cinco peticiones de subagente no necesita un acelerador enorme. Necesita cinco cosas capaces de responder en paralelo, que es exactamente lo que un hogar con dos PC de juego y un Mac ya tiene parado.

Las cifras que publicó Nvidia

Las propias cifras de Nvidia, que no han sido verificadas de forma independiente, hablan de hasta 1,9 veces más rendimiento con llama.cpp en una RTX 5090, 1,2 veces con vLLM en una RTX PRO 6000 y hasta 1,4 veces con vLLM repartido entre dos DGX Spark.

Cables de red azules conectados a los puertos de un conmutador de red
Los equipos se localizan por mDNS en la red local, y el enrutador comprueba antes la carga de cada nodo. Fotografía de archivo. Brett Sayles · pexels · Pexels License

Son mejoras de encolado, no de capacidad, y escalan con lo paralelo que sea el trabajo. Un solo turno de conversación no gana nada. Un flujo que se abre en abanico gana aproximadamente lo que permita el paralelismo, menos la red.

Por qué esto es más interesante de lo que parece

La lógica estratégica no es sutil. La inferencia local tiene un techo duro marcado por la memoria de una sola tarjeta de consumo, y ese techo es la razón por la que el trabajo serio con agentes ocurre en la nube. PAIR no eleva el techo; ensancha el suelo, y lo hace con software que no cuesta nada y funciona con los dos entornos que los aficionados ya usan.

También es, discretamente, un motivo para tener más de una tarjeta Nvidia. Una herramienta que vuelve útil una segunda máquina RTX es una herramienta que vuelve comprable una segunda máquina RTX.

Lo que conviene vigilar es si la publicación en código abierto atrae contribuciones que empujen más allá de los límites del diseño: un fork comunitario que sí repartiera modelos entre nodos sería otro producto, y Nvidia no ha dicho que pretenda construirlo.