Explorative Modeling gir 6,2 ganger mindre data for samme bildekvalitet
Legger til en tredje skaleringsakse i pretrening ved å la modellen gjette K ganger per treningssteg og bare oppdatere på den beste.
«Frontier-kjøringer bruker rundt 10 000 ganger mer regnekraft enn våre største eksperimenter, så holder trendene, er tallene her sannsynligvis en nedre grense.» Slik rammer Alexi Gladstone inn «Explorative Modeling», artikkelen han la ut på arXiv 29. juli sammen med Heng Ji og Yilun Du. Grepet er en for-løkke: la modellen produsere K forskjellige gjetninger per treningssteg, og send gradient bare gjennom den som treffer best.
Et treningsmål med én gjetning per eksempel presser modellen mot gjennomsnittet av alle gyldige svar, og gjennomsnittet av tusenvis av hunder er en brun uskarphet. Dagens modeller omgår det ved å dele opp selve genereringen: språkmodeller gjetter ett token av gangen, diffusjonsmodeller tar hundrevis av små steg fra støy mot data. Prisen er at modellen trenes på ett steg, men kjøres i hundrevis ved inferens, så egne feil mates tilbake som input.
Målingene peker samme vei i tre domener. På ImageNet-oppskriften RAE når utforskning samme resultat med 6,2 ganger mindre data og 4,1 ganger færre FLOPs, og lander på 1,43 FID uten guidance. Enkelte videomodeller får over 20 prosent forbedring. Viktigst er at gevinsten vokser med skala: fra 7 til 36 prosent når datamengden økes, og fra 13 til 23 prosent når modellen vokser.
«Vi skalerer størrelsen på generative modeller og hvor mye data vi trener dem på, så hvorfor har vi ikke skalert hva de kan generere?» — Alexi Gladstone, førsteforfatter
Kapasiteten forfatterne mener har stått stille, kaller de generative expressivity: hvor mange distinkte svar en modell kan forplikte seg til. Ett unntak stikker seg ut. Autoregressive språkmodeller har så langt ikke gitt umiddelbar gevinst, fordi neste-token-prediksjon med lang kontekst allerede er nær ett riktig svar og modellen mangler en latent variabel å utforske over. Forfatterne peker på multi-token-prediksjon som neste forsøk.
For deg som trener egne generative modeller er terskelen lav: implementasjonen krever ingen endringer i arkitektur eller hyperparametre, bare K genereringer der det minste tapet får gradient. Koden ligger på GitHub under alexiglad/XM.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.