NVIDIAs Personal AI Router sprer KI-forespørsler i huset, men slår ikke sammen GPU-ene
Ruter hver lokale KI-forespørsel til den maskinen på nettverket som er best egnet, uten å slå flere GPU-er sammen til én.
Det finnes to måter å dra nytte av flere maskiner til lokal inferens. Den ene deler én modell opp over flere GPU-er, slik at maskinene sammen kjører noe ingen av dem klarer alene. Den andre lar hver maskin gjøre hele jobben for sin egen forespørsel. NVIDIA Personal AI Router, forkortet PAIR, gjør utelukkende det siste, og README-en på GitHub er påfallende tydelig på skillet: PAIR samler ikke GPU-minne, slår ikke flere GPU-er til én logisk GPU, deler ikke én modell over flere maskiner, og splitter ikke en forespørsel som allerede er i gang.
Det PAIR gjør, er å finne deltakende noder på samme nettverk, holde styr på inferensmotorene som kjører der, og legge et lag foran dem med endepunkter som er kompatible med både Ollama og OpenAI. Applikasjonen din peker på PAIR i stedet for på en enkelt maskin. Hver uavhengig forespørsel går videre til en node som faktisk har en kompatibel motor oppe og modellen tilgjengelig, og PAIR foretrekker nodene den allerede vet har modellen. Motorene den kan installere og styre selv er Ollama og LM Studio.
Vinningen ligger i samtidighet, ikke i størrelse. En agentoppsett som fyrer av flere kall parallelt er akkurat det NVIDIA peker på som bruksområdet, mens en enslig tung modell fortsatt må få plass i minnet på én maskin. Prosjektet er dessuten ærlig om hvor grovt fordelingen skjer i dag.
«PAIR leveres i dag med én planleggingsstrategi, som kombinerer arbeid i kø med et grovt, utjevnet signal om GPU-bruk. Den tar ikke hensyn til GPU-modell, tilgjengelig minne, hvor varm modellen er, eller hvor dyr en forespørsel ser ut til å bli» — NVIDIA, i README-en til Personal AI Router
Konsekvensen står i samme avsnitt: PAIR passer bedre til maskiner som ligner på hverandre enn til en sammensatt klynge. Har du en tung arbeidsstasjon og en gammel laptop på samme nett, kan ruteren sende en forespørsel til feil sted.
For personvern er poenget at ingenting trenger å forlate huset: prompt og svar skal holde seg på det lokale nettverket så lenge klient, modellkilde, motor og node alle er lokale. Prosjektet kjører på Windows 11, Linux og macOS, på både x64 og arm64, og noder på ulike operativsystemer kan pares med hverandre. Paringen skjer med en sekssifret PIN fra Settings og Cluster på den inviterende maskinen. Lisensen er Apache 2.0.
Hva bør du gjøre?
- Kjører du flere agenter mot lokale modeller samtidig, bytt ut Ollama-URL-en i klienten med PAIR sitt endepunkt. Resten av oppsettet kan stå urørt.
- Sjekk maskinparken din først. Er nodene svært ulike i ytelse, vil den grove planleggingsstrategien gi deg skuffende fordeling inntil NVIDIA utvider den.
- Les SECURITY.md før du setter PAIR på et nett du deler med andre. Ruteren åpner lokale HTTP-endepunkter, oppdagelse over LAN og klyngetrafikk mellom maskinene.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.