Hopp til hovedinnhold

Onsdag 7. oktober

 Tilbake Forskning 2 min 14.20

He Kaiming slipper ELF: 105M-modell unngår GPT-autoregresjon med kontinuerlig diffusjon

onsdag 13. mai · KI-generert · Kilde: 36Kr

Innholdet er KI-generert og kan inneholde feil. Sjekk originalkilden.

Bytt mentalt modell: kontinuerlig diffusjon for tekst er ikke lenger en vakker idé som svikter i praksis, og He Kaimings ELF slår diskrete diffusjons­modeller med en tiendedel så mye trenings­data.

105 millioner parametere. 45 milliarder trenings-tokens. 32 sampling-steg. Det er hele oppskriften til ELF (Embedded Language Flows), som He Kaimings team ved MIT slapp i forrige uke. Hovedtallet de viser fram: generativ perplexity på 24 på OpenWebText. Mainstream-diskrete diffusjons­modeller som MDLM, LLaDA og Dream 7B trenger typisk 1 024 sampling-steg og over 500 milliarder trenings-tokens for å nærme seg samme nivå.

Det interessante er ikke størrelsen. Det er at ELF er det første beviset på at den kontinuerlige diffusjons­tilnærmingen til tekst faktisk fungerer. Tidligere kontinuerlige modeller, som Diffusion-LM, CDCD og DiffuSeq, beregnet token-nivå cross-entropy ved hvert steg, og det bandt den kontinuerlige banen tilbake til vokabularet. ELF holder all denoising i embedding-rommet og diskretiserer kun ved siste steg t=1. Decoder og denoiser deler vekter; ingen ekstra modul.

«ELF oppnår en sterk balanse mellom generering­skvalitet, sampling-effektivitet og trenings­kostnad.» — Hu Keya et al., MIT, ELF-paperet

Hu Keya er førsteårs PhD-student ved MIT EECS og en av He Kaimings første doktorander der. Et signal som dette betyr at billigere, mer kontrollerbar tekst­generering med færre sampling-steg blir et reelt forsknings­spor utenfor de største produksjons­labbene. Vekter og kode er ikke åpne ennå, men paperet er publisert.

Hva bør du gjøre?

  1. Les paperet hvis du jobber med generative modeller, særlig hvis du har eksperimentert med diffusjons-LM tidligere og gitt opp.
  2. Følg Cactus, Mistral og andre som har eksperimentert med diffusjon. De neste 6 månedene viser om kontinuerlige diffusjons­modeller skalerer til 7B+ parametere.

Pulsen · norske KI-nyheter for deg som bygger. Sakene er KI-generert fra originalkilden, som alltid lenkes.