Hopp til hovedinnhold
Tilbake
Forskning 2 min · Kilde: Hugging Face - Blog

Fire GPU-noder ble til én: Multiverse kutter minnebruken i destillasjon

KI Takeaway KI-generert · kan inneholde feil

Cache lærermodellens hundre mest sannsynlige tokens én gang, så faller toppminnet i destillasjon fra 85,2 til 5,45 GiB ved 32 000 tokens.

250 gigabyte toppminne for én eneste treningsiterasjon: det er regnestykket Multiverse Computing legger fram i en artikkel på Hugging Face for å forklare hvorfor destillasjon av store språkmodeller vanligvis krever hundrevis av GPU-er. Med vokabularet på 201 088 tokens i gpt-oss-120b blir lærermodellens sannsynlighetstensor alene rundt 50 GB i bfloat16 ved 32K kontekst og batch 4, før gradienter, vekter og optimizer-tilstand er regnet med.

De to endringene er systemiske, ikke matematiske. Først kjøres lærermodellen én gang og de hundre mest sannsynlige tokenene per posisjon lagres i en cache, slik at læreren aldri må ligge i minnet ved siden av studenten og kan gjenbrukes på tvers av forsøk. Deretter fusjoneres modellens utgangsprojeksjon inn i selve tapsfunksjonen, som behandler én bit av sekvensen om gangen og kaster den før neste. Bakoverpasset regner hver bit på nytt i stedet for å lagre den. Prisen er én ekstra projeksjon, gevinsten er at toppminnet vokser lineært med sekvenslengden i stedet for å eksplodere med vokabular ganger sekvens.

På en enkelt H200 med Llama 3.1 8B som lærer og en student på 3,2 milliarder parametere havner alle variantene på nesten identisk treningstap, ifølge tallene i artikkelen. Det tette tapet feiler helt fra 64 000 tokens og oppover. For en destillasjon av GPT-OSS 20B ved 32 768 tokens kontekst betydde det frigjorte minnet at oppsettet krympet fra fire GPU-noder til én, med steg-tid ned fra 57 til 12,23 sekunder.

Nøkkeltall
250 GB
Toppminne for én treningsiterasjon med tett KL-tap, mer enn en H200 på 141 GB har
50 GB
Bare lærermodellens sannsynlighetstensor for gpt-oss-120b ved 32K kontekst og batch 4
5,45 GiB
Toppminne med det chunkede tapet ved 32 000 tokens, mot 85,2 GiB for det tette
11,6 GiB
Toppminne ved 256 000 tokens, der nest beste variant bruker 134,2 GiB

Studenten på 3,2 milliarder parametere beholder mesteparten av lærerens treffsikkerhet på BoolQ og HellaSwag og ligger rundt ni poeng bak på MMLU, med under halvparten så mange parametere. Implementasjonen av det chunkede tapet er lagt ut som åpen kildekode under navnet Full-Chunked-KL-Loss, så terskelen for å prøve teknikken på egne modeller er én GPU i stedet for en klynge.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter