Raspberry Pi 5 kjører Qwen3.6-35B i bilen uten internett
Kjører Qwen3.6-35B lokalt på en Raspberry Pi 5 i bilen og svarer fra instruksjonsbokas 745 sider med sidehenvisning, uten internett.
Seks av ni funksjoner i CarWatch er merket «proven» i prosjektets egen statustabell, som betyr at de har kjørt på en ekte bil. Én er testet mot en simulert OBD-gateway og fortsatt uverifisert mot bilen, uthenting av dashcam-klipp er bare sondert, og MBUX-visningen er ren plan. Det skillet bør du lese før du bestiller maskinvare, for det som faktisk kjører er interessant nok: en Raspberry Pi 5 med 16 GB minne til rundt 300 euro, plassert i en Mercedes, som kjører en modell på 35 milliarder parametere uten internett.
Petrus Pennanen la CarWatch ut på GitHub 9. august under ThinkOff, og merket versjon 0.1.0 den 24. august. Modellen er Qwen3.6-35B-A3B i Unsloths UD-Q3_K_S-kvantisering, 14,3 GB på SD-kortet, servert av llama.cpp. Fra bilen måler prosjektet 3,5 tokens i sekundet på generering og over 25 på prompt-behandling, ved 65 grader vedvarende. Bare 3 milliarder parametere er aktive per token, og det er hele grunnen til at en modell i denne klassen lar seg kjøre på en enkortsmaskin.
Kommentarfeltet på Hacker News, der prosjektet samlet 72 poeng, gikk rett på modellvalget.
«Problemet er ikke RAM-størrelsen. Det er minnebåndbredden» — dofm, kommentar på Hacker News
Samme kommentar anslår at Pi 5 klarer 17 GB/s, og foreslår en mindre resonneringsmodell i stedet. Innvendingen treffer et reelt tak: en MoE-modell med få aktive parametere er nettopp måten å komme rundt båndbredden på, men 3,5 tokens i sekundet er lesehastighet, ikke samtalehastighet.
Den mer interessante innvendingen handlet om nøyaktighet.
«Jeg har erfart at både lokale modeller og frontier-modeller er svært dårlige på detaljene når det gjelder biler» — ehnto, kommentar på Hacker News
Det er nettopp den innvendingen arkitekturen svarer på. Instruksjonsboka ligger som leksikalsk RAG på SD-kortet, svarene kommer med sidehenvisning, og modellen nekter å svare på det boka ikke dekker. Samme prinsipp gjelder maskinen selv: temperatur, throttling, vifte, minne, disk, nett og hvilken modell som er lastet leses live per spørsmål, og systemprompten er bygget slik at noe ukjent aldri kan gli gjennom som et faktum. Stemmestyringen kjører energibasert VAD og whisper.cpp på samme Pi, uten skybasert tale-til-tekst.
Resten av riggen er driftsdesign mer enn KI-design. Systemd-tjenester starter hele stacken ved boot, bilen henter oppdateringer fra repoet hver time, og en utgående tunnel gjør den nåbar bak NAT-en til en mobil hotspot. Tilkoblingen faller tilbake i tre trinn: mobil hotspot, hjemmewifi, og til slutt Pi-ens eget aksesspunkt. Alt som ikke kommer fram legges i en utboks på disk og leveres sent i stedet for å gå tapt. Koden er AGPL-3.0.
Hva bør du gjøre?
- Regn minnebåndbredde før RAM når du dimensjonerer lokal inferens. En MoE med 3B aktive parametere gir deg 35B-kvalitet på en maskin som aldri kunne kjørt en tett 35B.
- Kopier RAG-mønsteret uansett maskinvare: sidehenvisning i svaret og eksplisitt nekt når kilden ikke dekker spørsmålet er billigere enn å finjustere bort hallusinasjoner.
- Les statustabellen i repoet før du kjøper dashcam eller OBD-kabel. Dashcam-uthentingen er ikke koblet opp, og OBD-lesingen over DoIP er ikke verifisert mot en ekte bil ennå.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.