Gemma-4-E2B på en NAS: 10,5 tokens i sekundet på 8 GB RAM
Kjører Gemma-4-E2B døgnet rundt på en TrueNAS-boks uten grafikkort, med 8 GB tildelt minne og rundt 10,5 tokens i sekundet.
En TerraMaster F4-424 Max er en lagringsboks, ikke en arbeidsstasjon. Den har ingen dedikert GPU, ZFS krever rikelig med minne, og en stabel selvhostede tjenester tar sitt. Etter en oppgradering til 32 GB var det 8 GB igjen å eksperimentere med, skriver XDA Developers i en gjennomgang publisert 7. august 2026. Det holdt.
Veien dit gikk gjennom to blindveier. llama.cpp finnes ikke som app-mal i TrueNAS, så det måtte settes opp som en egen Docker-container eller inne i en LXC. Intel-variantene, deployert med YAML, feilet fordi containeren ikke klarte å oppdage prosessoren. vLLM frøs på Deploying-status og kom aldri videre. LocalAI derimot startet umiddelbart da den fikk 8 GB RAM og fire CPU-kjerner.
«Det er ikke like optimalisert som å kjøre llama.cpp, men jeg kan bruke web-grensesnittet til å bla gjennom hundrevis av modeller i stedet for å famle rundt med ulike terminalkommandoer» — XDA Developers
Modellvalget er det som får regnestykket til å gå opp. Gemma-4-E2B bruker per-lag embedding-tabeller, som utgjør en stor del av parametrene, og bare de som trengs for selve inferansen lastes inn i minnet. Kunnskapsbasen tilsvarer 5,1 milliarder parametere, mens de effektive ligger rundt 2,5 milliarder. På en i5-1235U gir det 10,5 tokens i sekundet på tekstprompter og enkel dokumentinferens, nesten dobbelt så raskt som en Raspberry Pi, og hele oppsettet bruker 6,2 GB minne under aktiv bruk. Laster du inn MMPROJ-fila for bildeforståelse, faller ytelsen litt, men OCR-skanning og bildegjenkjenning er fortsatt brukbart.
Ved siden av kjører nomic-embed-text-v1.5, som ikke er en språkmodell i vanlig forstand. Den gjør tekst og bilder om til vektorer i en vektordatabase, slik at selvhostede apper med RAG-støtte kan hente relevante tekstbiter og gi dem til Gemma-4-E2B før den svarer. I praksis er det Paperless AI, Open Notebook og Blinko som får nytte av det på denne maskinen.
Poenget er strømregningen mer enn ytelsen. En separat GPU-arbeidsstasjon som står og venter på lette produktivitetsoppgaver koster watt hele døgnet. En NAS som allerede står på gjør det ikke.
«Ingen bruddendringer. Dette er en bakoverkompatibel patch-utgivelse» — AppSelfHost, om LocalAI v4.8.1
Er du på vei til å prøve det samme, er versjonen å hente v4.8.1 fra 6. august, som blant annet retter en ABI-feil i den CPU-baserte vLLM-backenden.
Hva bør du gjøre?
- Regn på minnet før du velger modell. 8 GB tildelt gir deg rundt 6,2 GB reelt forbruk med en E2B-klasse modell, og ZFS skal ikke sultes.
- Start med LocalAI hvis NAS-en din kjører TrueNAS. App-malen fungerer der llama.cpp og vLLM krever manuelt containerarbeid.
- Legg til en embedding-modell med én gang hvis du har Paperless, notatapper eller annet som støtter RAG. Det er der en liten modell faktisk blir nyttig.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.