Gemma 4 E2B svarer på ett sekund der Qwen 3.5 4B bruker fem i Home Assistant
Kjører Gemma 4 E2B stemmestyring i Home Assistant på rundt ett sekund, der Qwen 3.5 4B bruker fem og bommer på oppgaven.
Hva skiller en lokal modell som duger til stemmestyring fra en som ikke gjør det? How-To Geek satte fem små modeller til samme jobb i Home Assistant og målte to ting: hvor lang tid det tok før lyset faktisk gjorde noe, og om modellen forsto hva «den dimmeste av de du nettopp skrudde på» viste til. Qwen 3.5 4B brukte fem sekunder og slo av feil lampe. Gemma 4 E2B svarte på rundt ett sekund og traff gjennom hele kjeden.
Bakgrunnen er en kjent begrensning i Assist, Home Assistants egen stemmeassistent. Den matcher tale mot et forhåndsdefinert sett av setninger og intents, så «skru på leselyset» utløser riktig handling på under ett sekund. Følger du opp med «skru den av igjen», feiler den, fordi det ikke finnes noen entitet som heter «den». Løsningen er å sende alt Assist ikke forstår videre til en språkmodell. Med en skytjeneste virker det godt, men da havner kommandoene og dataene dine hos en tredjepart.
Testen besto av åtte kommandoer på rad, der hver bygger på hva som skjedde i de forrige: sett den første lampen du skrudde på til 40 prosent, den andre til 70, slå av den dimmeste av dem, skru den sist avslåtte på igjen. Det er referansene bakover som knekker de små modellene, ikke selve handlingene. Llama 3.2 3B røk på den første sammensatte kommandoen og måtte spørre hvilken lampe det gjaldt. Nemotron Mini 4B fra NVIDIA, som er optimalisert for funksjonskall, var rask, men påsto at lampen den nettopp hadde skrudd på ikke kunne styres. Granite 4 3B fra IBM svarte på rundt ett sekund og gjorde riktig type handling, men på feil lampe.
E2B står for «Effective 2 Billion» og er den minste modellen i Googles Gemma 4-familie. Den er større enn to milliarder parametere, men designet gjør at den kjører mer effektivt enn totalstørrelsen skulle tilsi. Forfatteren understreker at oppsettet fortsatt ikke matcher en sky-LLM i fart eller kapasitet, og at Assist «som regel» treffer riktig handling, ikke alltid.
Hva bør du gjøre?
- Test med kjeder av kommandoer, ikke enkeltkommandoer. Alle fem modellene klarte «skru den av igjen»; det var referansene bakover som skilte dem.
- Sett en grense på rundt to sekunder til første handling før du vurderer en modell som brukbar til stemme. Fem sekunder oppleves som ødelagt, uansett hvor riktig svaret er.
- Behold Assists innebygde intents som førstelinje og send bare det den ikke forstår videre til modellen. Da betaler du ventetiden bare på de vanskelige kommandoene.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.