Tailscale gjør den lokale 320B-modellen tilgjengelig fra andre siden av jorda
Legg LLM-serveren din på et Tailscale-nett, så når du den fra mobil og laptop hvor som helst uten å åpne en eneste port mot internett.
På en tur til Portugal transkriberte en skribent i XDA Developers lyd med sin lokale Whisper-installasjon og lot språkmodellen hjemme i Irland rydde opp i teksten. I Taiwan var forsinkelsen merkbar før første token, men når strømmingen først var i gang, gikk den jevnt. Hele oppsettet hviler på Tailscale.
Hovedmodellen er GLM-5.3 Flash, en modell med 320 milliarder parametere som kjøres som 4bpw EXL3-kvant i vLLM på en klynge av to DGX Spark, eksponert som et OpenAI-kompatibelt endepunkt. Skribenten skriver at det samme fungerer med Qwen 3.8 27B på en vanlig hjemmeserver. På mobilen brukes RikkaHub, på Mac-en Pi, og begge behandler modellen som en hvilken som helst annen leverandør.
Tailscale er et mesh-VPN bygget på WireGuard. Hver enhet får en privat adresse som bare svarer andre enheter i samme tailnet, og nettverket ligger som et overlegg: bare trafikk til enheter i meshen går gjennom VPN-et. Skribenten bruker subnet routing for å dele hovednoden, slik at samme LAN-adresse virker både hjemme og ute, og Tailscale kan skrus av på hjemmenettet.
Poenget er sikkerhetsmodellen. vLLM-instansen har verken autentisering eller API-token, noe som ville vært hensynsløst mot åpent internett. Med Tailscale er det medlemskapet i tailnettet som fungerer som autentisering, ikke en API-nøkkel.
Ulempene er konkrete. De to Spark-maskinene må stå på hele tiden og trekker strøm, og Android tillater bare én VPN-tilkobling om gangen, så du må velge mellom Tailscale og et annet VPN.
Hva bør du gjøre?
- Installer Tailscale på inferensserveren og klientene, og pek chat-appen mot tailnet-adressen eller et MagicDNS-navn i stedet for å åpne porter i ruteren.
- Bruk subnet routing hvis du vil ha samme adresse hjemme og ute, slik at du kan skru av Tailscale hjemme uten å endre klientkonfigurasjonen.
- Legg likevel på en API-nøkkel i vLLM hvis du deler tailnettet med andre, siden medlemskapet da er eneste sperre.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.