Hopp til hovedinnhold
Tilbake
Modell 3 min · Kilde: XDA Developers

Gemma 4 E2B gir 6 tokens i sekundet på Raspberry Pi 5. Agentjobben krevde E4B

KI Takeaway KI-generert · kan inneholde feil

Genererer 5,8 til 6,5 tokens i sekundet på en Raspberry Pi 5, nok til oppsummering og notater, men ikke til agentarbeid som krever presisjon.

5,8 til 6,5 tokens i sekundet. Det er farten Ayush Pande måler for Gemma 4 E2B på en Raspberry Pi 5 i en gjennomgang publisert hos XDA Developers 2. august. Den større E4B-varianten faller til 2,5 til 3 tokens i sekundet på samme maskin med 8 GB minne.

Poenget er ikke farten alene, men hvorfor modellen i det hele tatt får plass. Gemma 4 E2B har 5,1 milliarder parametere på papiret, men Google DeepMind oppgir en effektiv størrelse på 2,3 milliarder. Forskjellen ligger i Per-Layer Embeddings: hvert dekoderlag får sin egen lille embedding-tabell per token, og tabellene blir liggende på lagringsmediet. Bare de skivene inferensen faktisk trenger, mappes inn i minnet.

«E-en i E2B og E4B står for effektive parametere. Embedding-tabellene er store, men brukes bare til raske oppslag, og derfor er det effektive parametertallet mye lavere enn totalen» — Google DeepMind, modellkortet for Gemma 4

Pande koblet E2B til Karakeep og Paperless-GPT og fikk brukbar automatisk oppsummering av artikler, videoer og dokumenter. Modellen tar også bilde og lyd som inndata, og treffer greit på objektgjenkjenning, men bommer oftere når skjermbilder inneholder ukjente apper.

Grensen går ved agentarbeid. Da Pande kjørte agentrammeverket Pi på maskinen, klarte verken Qwen 3.5 2B eller E2B å skrive en fungerende utvidelse til rammeverket. E4B var den eneste som fikk det til, med 4,5 milliarder effektive parametere og 8 milliarder totalt. Prisen er halvert hastighet.

«Den er god nok til lette produktivitetsoppgaver. Men til alt som krever mer presisjon, holder jeg meg til Gemma 4 E4B» — Ayush Pande, XDA Developers

For deg som bygger på en Pi betyr det at valget står mellom to ulike jobber, ikke mellom to hastigheter. E2B er en oppsummeringsmotor du kan la stå og tygge i bakgrunnen. E4B er en agentmotor du må vente på. Begge har 128K kontekstvindu og Apache 2.0-lisens, så du kan bytte uten å røre resten av oppsettet.

Hva bør du gjøre?

  1. Sjekk minnet først. E4B trenger en Raspberry Pi 5 med 8 GB, mens E2B kjører på svakere kort.
  2. Legg E2B på bakgrunnsjobber uten tidskrav, som Karakeep, Paperless-GPT eller notatoppsummering.
  3. Flytt agentoppgavene til en gammel laptop med E4B i stedet for å presse dem inn på kortet.

Bakgrunn

Gemma 4 kom i fem størrelser, fra E2B til 31B dense, alle under Apache 2.0. De to minste er bygget spesifikt for enheter uten GPU, og de er sammen med 12B-varianten de eneste i serien som tar lyd som inndata.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter