AirLLM kjører Kimi K3 sine 2,8 billioner parametere på 3,72 GB VRAM
Kjører Kimi K3 med 2,8 billioner parametere på 3,72 GB VRAM ved å strømme ett ekspertlag om gangen fra disk.
AirLLM la i juli til støtte for Kimi K3, den største åpne modellen som er sluppet, og oppgir 3,72 GB VRAM målt ende til ende på ett RTX 6000 Ada-kort. Biblioteket er Apache-lisensiert, har 26 764 stjerner på GitHub og installeres med pip.
Mekanismen er enkel nok til at den er lett å overse. Transformer-lag kjøres strengt sekvensielt: utdata fra lag k er inndata til lag k+1, og ingen andre lag trenger å være i minnet mens k regnes ut. AirLLM sharder derfor vektene til én fil per lag, laster laget som skal kjøres, frigjør det og henter neste. Toppforbruket blir det største enkeltlaget pluss aktiveringene, ikke modellens totale størrelse. For MoE-modeller går det ett hakk lenger, ned på ekspertnivå, slik at bare de ekspertene et token faktisk rutes til lastes inn.
«AirLLM reduserer minnebruken ved inferens dramatisk, og lar modeller på 70 milliarder parametere kjøre på ett 4 GB-skjermkort, uten kvantisering, distillering eller beskjæring» — AirLLM, prosjektets readme
Den siste presiseringen er poenget. Kvantisering, distillering og beskjæring endrer alle modellen du kjører. AirLLM endrer bare hvordan den lastes.
Prisen er hastighet. Hvert lag må leses fra disk for hvert token, så gjennomstrømningen ligger langt under en modell som får ligge i minnet. Prosjektet har lagt inn forhåndslasting som overlapper lasting og beregning, og valgfri blokkvis komprimering i 4 eller 8 bit som de oppgir gir omtrent tre ganger raskere kjøring. Det flytter ikke bruksområdet fra batch til samtale.
K3-støtten kommer med tre krav som er verdt å lese før du taper en kveld på dem. Modellkoden krever flash attention uansett hva du ber om, så compressed-tensors og flash-attn må installeres. Du trenger et CUDA 12-bygg av torch, siden det ennå ikke finnes ferdigbygde flash-attn-hjul for CUDA 13. Og transformers må være 4.56.x, fordi fjernkoden i modellen ikke laster på 5.x.
Bakgrunn
AirLLM kom først i november 2023 med lagvis inferens for 70B-modeller på 4 GB. Versjon 2.0 la til komprimering samme desember, macOS-støtte fulgte, og CPU-inferens kom i 2024. Versjon 3.0 i juni 2026 la til FP8 og fikk DeepSeek-V3 ned på rundt 12 GB og Qwen3-235B på rundt 3 GB, alt gjennom én AutoModel-klasse som selv finner modelltypen.
Hva bør du gjøre?
- Bruk det til jobber som tåler å ta tid: evaluering, batch-generering, syntetiske datasett. Interaktiv bruk blir frustrerende.
- Lås transformers til 4.56.x og bruk et CUDA 12-bygg av torch før du forsøker K3 i det hele tatt.
- Legg vektene på NVMe, ikke på en nettverksdisk. Disklesingen er flaskehalsen, og den treffer per lag per token.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.