Hopp til hovedinnhold
Tilbake
Modell 3 min · Kilde: The Decoder

Gemma 4 ble diffusjonsmodell for under ti prosent av treningen

KI Takeaway KI-generert · kan inneholde feil

Bygger Google DeepMind om Gemma-4-26B-A4B til diffusjonsmodellen DiffusionGemma med under ti prosent av det opprinnelige token-budsjettet.

Den tekniske rapporten Google DeepMind nå har lagt fram, og som the-decoder.com har gjennomgått, beskriver ombyggingen i to trinn: først lærer modellen å rekonstruere støyete tekstblokker fra eksempeldata, deretter følger en kombinert fase av forsterkningslæring og sampler-destillasjon som Google kaller SD·RL.

Forskjellen fra en vanlig språkmodell ligger i hvordan teksten blir til. DiffusionGemma foredler blokker på 256 tokens parallelt, slik bildemodeller trekker et motiv ut av støy, i stedet for å produsere ett token av gangen. På en Nvidia H100 gir det rundt 1 500 tokens i sekundet. Den kombinerte SD·RL-fasen løfter resonnement-benchmarks med ti poeng i snitt og nesten firedobler antall tokens per beregningssteg, og som bieffekt blir svarene rundt 50 prosent kortere.

Toveis resonnement er det arkitekturen egentlig kjøper deg. En vanlig språkmodell må binde seg til det første sifferet i svaret før den har regnet ferdig. I et regnestykke fra rapporten starter Gemma 4 svaret med «-1», oppdager underveis at «-25» er riktig, og legger på en korreksjon etterpå. DiffusionGemma utvikler svar og utledning parallelt, og kan rette feilen før utdataene låses. Etter minimal finjustering løser modellen nær 85 prosent av sudoku-oppgavene, mens basismodellen ikke klarer oppgaven i det hele tatt.

Rapporten er tydelig på hva som ikke virker. Absolutt ytelse ligger under den autoregressive basismodellen, og Google peker på at modellen ble bygget om i etterkant, at treningsfasen var kort, og at SD·RL prioriterte hastighet framfor topp kvalitet. Modellen setter seg av og til fast i repetisjonsløkker, et artefakt av aggressivt kuttede beregningssteg. På multimodale oppgaver glemmer den iblant å lukke resonnement-seksjonen, noe som trekker benchmark-tallene kunstig ned.

For deg som bygger er den siste begrensningen den viktigste: fartsfordelen gjelder i hovedsak én bruker av gangen. Ved rundt 32 samtidige forespørsler tar vanlige språkmodeller igjen gjennomstrømningen. En modell som er rask for én bruker, men mister forspranget ved 32 parallelle kall, hører hjemme i lokale verktøy og enkeltbruker-agenter, ikke bak et delt API-endepunkt.

Hva bør du gjøre?

  1. Vurder DiffusionGemma der du styrer én forespørsel av gangen, som lokal kodefiksing eller JSON-generering. Strukturerte utdata er ferdige etter to til tre foredlingssteg, fordi inndataene allerede låser de fleste tokens.
  2. Mål gjennomstrømningen ved reell samtidighet før du bytter. Fordelen forsvinner rundt 32 parallelle kall.
  3. Legg inn deteksjon av gjentatte ord hvis modellen skal kjøre uten tilsyn, siden repetisjonsløkker er et kjent artefakt.

Bakgrunn

Google slapp DiffusionGemma som modell i midten av juni, under Apache 2.0 på Hugging Face, og har nå fulgt opp med den tekniske rapporten. Forgjengeren er Gemini Diffusion, som Google demonstrerte i mai 2025. Google omtaler selv DiffusionGemma som en eksperimentell modell, og sier utgivelsen skal framskynde forskning på tekstdiffusjon. Oppstarten Interfaze bruker den allerede til flerspråklig talegjenkjenning, og et forskningsprosjekt bruker den til interaktive radiologirapporter. Modellen beholder også evnen til å generere tekst ord for ord, så du kan veksle mellom de to modusene.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter