Hopp til hovedinnhold
Tilbake
Hjemmelab 3 min · Kilde: XDA Developers

Gammelt GTX 1080 kjører Gemma 4 E4B i 45 tokens per sekund for Home Assistant

KI Takeaway KI-generert · kan inneholde feil

Sett et gammelt Nvidia-kort inn i Proxmox-noden og kjør Gemma 4 E4B via llama.cpp, så får Home Assistant en lokal samtaleagent, stemmeassistent og kamerasammendrag uten sky-API.

I garasjen til Ayush Pande, maskinvareskribent i XDA Developers, lå et GTX 1080 fra Pascal-generasjonen som ikke lenger holder mål i nye spill. Nå er kortet ryggraden i flere Home Assistant-pipelines, skriver han. Det sitter i en førstegenerasjons Ryzen-maskin med Proxmox, sendt videre til en llama.cpp-container (LXC), og kjører Gemma 4 E4B i over 45 tokens i sekundet, av og til forbi 50. Å få GPU-en til å virke i Proxmox VE 9.2 krevde mer arbeid enn han hadde regnet med.

Koblingen mot Home Assistant går gjennom Home Agent-integrasjonen fra Home Assistant Community Store (HACS), fordi den innebygde Ollama-integrasjonen ikke støtter llama.cpp som LLM-leverandør, ifølge Pande. Den samme containeren kjører nomic-embed-text-1.5 som embedding-modell for Home Agent. Resultatet er bedre enn andre modeller under 9B han har testet mot Home Assistant, men det har en tydelig grense:

«Gemma-4-E4B-modellen min er fortsatt utsatt for å gi feil hvis jeg gir den komplekse instruksjoner som involverer flere enheter.» — Ayush Pande, XDA Developers

Stemmedelen bruker voice satellite-funksjonen som Home Assistant har lagt inn i Companion-appen for Android. Et gammelt nettbrett lytter etter wake word, Whisper (tale til tekst) og Piper (tekst til tale) kjører direkte på Home Assistant-VM-en, og Gemma tar selve samtalen. Kamerasiden er delt: objektdeteksjonen i Frigate er flyttet til en Raspberry Pi med AI Kit, men når Frigate-integrasjonen varsler om uventede objekter, bruker en automasjon Gemmas bildeforståelse til å skrive et sammendrag av opptaket og sende det til nettbrettet.

Ett tall i artikkelen stemmer ikke. Pande skriver at E4B har 5,1 milliarder effektive parametere, men ifølge Google DeepMinds modellkort på Hugging Face har E4B 4,5 milliarder effektive parametere og 8 milliarder medregnet embeddings. Tallet 5,1 milliarder hører til den mindre E2B, medregnet embeddings. Forskjellen skyldes Per-Layer Embeddings, der hvert decoder-lag får sin egen embedding-tabell:

«Disse embedding-tabellene er store, men brukes bare til raske oppslag, og derfor er det effektive parameterantallet mye mindre enn totalen.» — Google DeepMind, modellkortet for Gemma 4 E4B

For deg som planlegger VRAM betyr det at vektene er større enn «4B» i navnet antyder. E4B har 128K kontekst, Apache 2.0-lisens, og tar tekst, bilde og lyd som input.

Hva bør du gjøre?

  1. Test Gemma 4 E4B i llama.cpp på det eldste Nvidia-kortet du har før du kjøper nytt, og mål tokens/s i din egen Proxmox-container.
  2. Velg en HACS-integrasjon som snakker med llama.cpp hvis du ikke vil kjøre Ollama, og legg embedding-modellen i samme container så du slipper en ekstra tjeneste.
  3. Start med kommandoer til én enhet om gangen, siden instruksjoner som gjelder flere enheter er der modellen feiler i Pandes oppsett.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter