Multiverse kutter halve dybden av Llama-3.3-70B og holder MMLU rundt 77
Behandle blokkfjerning som et koblet spinnsystem: Multiverse Computing kutter halve dybden av Llama-3.3-70B-Instruct og holder MMLU rundt 77, der den sterkeste konkurrerende metoden faller til midten av 50-tallet.
Vanlige metoder for å fjerne transformerblokker gir hver blokk en score for seg selv og kaster de minst viktige. I et nytt arbeid, presentert på Hugging Face-bloggen, argumenterer Multiverse Computing for at premisset er feil: om det skader å fjerne blokk 20 avhenger av om du også fjernet blokk 19 eller 24. I fysikkens språk er scoring blokk for blokk en middelfeltmetode, mens det egentlige problemet har koblinger mellom alle valgene.
Grepet er å gi hver blokk en binær variabel, gjøre en andreordens Taylor-utvikling av tapet og lese av Hessian-matrisen. Diagonalen sier hvor mye hver blokk betyr alene, og elementene utenfor diagonalen er nettopp koblingene mellom dem. Å velge hvilke M av N blokker som skal bort blir dermed å finne lavenergitilstander i et Ising-glass. Hessianen regnes ut én gang fra et lite kalibreringssett, og deretter koster det bare én energiberegning å rangere en kandidat, uten å kjøre modellen i det hele tatt. Å fjerne 8 av Llama-3.3-70Bs 80 blokker gir rundt 29 milliarder kombinasjoner, og den uttømmende søkingen tok omtrent to døgn på én GPU. En åpen tabu-løser fant de samme lavenergitilstandene på sekunder.
Det mest interessante funnet er at den laveste energitilstanden ikke alltid gir den beste modellen. For Llama-3.1-8B-Instruct med 16 av 32 blokker fjernet foreslår den 17. eksiterte tilstanden som den første å kutte en blokk tidlig i modellen, og etter lett etter-trening slår den grunntilstanden på flere benchmarks. Metoden holder også på NVIDIA-Nemotron-3-Nano-30B-A3B-FP8, som blander Mamba2-, attention- og MoE-lag i et ujevnt mønster, fordi en kobling er en kobling uansett hva slags lag som sitter der.
Koden ligger åpent hos CompactifAI under navnet Block_removal_through_constrained_binary_optimization. For deg som kjører store modeller på egen maskinvare er det verdt å merke seg at gevinsten først kommer i dyp kompresjon: ved lette kutt er metodene omtrent likeverdige, og det er når du vil fjerne mange blokker at koblingene begynner å bety noe.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.