Hopp til hovedinnhold
Tilbake
Llm 2 min · Kilde: qlabs

Dust trener transformere uten backpropagation og slår backprop ved små tokenbudsjetter

KI Takeaway KI-generert · kan inneholde feil

Les Dust som et forskningsfunn og ikke et verktøy: metoden trener små transformere uten backward pass og matcher backprop, men krever langt mer regnekraft.

Ved 1 million tokens trening ender Dust med lavere testtap enn backpropagation fra rundt 1000 trekk per oppdatering, skriver Q Labs i artikkelen om metoden. Dust er en nullte-ordens metode: den legger gaussisk støy på utgangen av hvert lineære lag, uavhengig for hvert token, kjører et vanlig forward pass og belønner støyen etter hvor mye den senket tapet på akkurat det tokenet. Hvert token blir dermed et virtuelt populasjonsmedlem, og ett forward pass evaluerer tusenvis av medlemmer per sekvens.

Forsøkene er små. Basismodellen har 8 lag og bredde 512, trent på FineWeb med budsjetter fra 100 000 til 20 millioner tokens. Ved 100 000 og 1 million tokens slår Dust backprop. Ved 10 og 20 millioner krymper avstanden jo større populasjonen blir, men ved 20 millioner er Dusts lavere tap bare en ekstrapolasjon. Den vektbaserte evolusjonsmetoden EGGROLL når ikke Dust med 64 trekk selv med 256 ganger så stor populasjon, og Q Labs anslår at Dust er 10³ til 10⁴ ganger mer effektiv.

Det mest overraskende funnet går mot vanlig oppfatning: større modeller er mer populasjonseffektive, ikke mindre. En modell på 243 millioner parametre slår en 120 ganger mindre modell ved de fleste populasjonsstørrelser.

«Vi må ha flere størrelsesordener bedre regneeffektivitet før Dust blir et praktisk alternativ til backprop på dagens regnenivå» — Q Labs, i konklusjonen

Hacker News-tråden med 236 poeng er delt. Flere påpeker at gradienten finnes og er nyttig nettopp fordi den peker riktig vei.

«Med noen års mellomrom får en derivatfri optimeringsalgoritme for nevrale nett litt hype. Jeg ville satset alle sparepengene mine på at ingen av dem noen gang får betydning» — blt, på Hacker News

Koden ligger MIT-lisensiert på GitHub, så du kan gjenskape de små forsøkene selv. Interessen ligger i at Dust ikke krever et deriverbart nettverk. Det åpner for arkitekturer backprop sliter med, som nett med et eksternt program i løkken eller transformere som looper over mange steg.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter