Hopp til hovedinnhold
Tilbake
Modell 3 min · Kilde: Hugging Face

Ling-3.0-tiny aktiverer 1,3 av 7,9 milliarder parametere og kjører på 8,3 GiB

KI Takeaway KI-generert · kan inneholde feil

Kjører Ling-3.0-tiny agentoppgaver på under 9 GiB minne fordi bare 1,3 av 7,9 milliarder parametere er aktive per token.

Forskjellen mellom 7,9 milliarder og 1,3 milliarder er hele poenget med Ling-3.0-tiny. InclusionAI oppgir at modellen har 7,9 milliarder parametere totalt, men aktiverer bare 1,3 milliarder per token gjennom en sparsom MoE-blokk med 128 rutede eksperter, der åtte rutede og én delt ekspert er i bruk om gangen. Vektene er publisert i BF16, FP8 og INT4.

Arkitekturen er arvet fra Ling-3.0-serien: tre lag Kimi Delta Attention etterfulgt av ett lag Multi-Head Latent Attention, gjentatt gjennom hele modellen. Kombinasjonen skal gi billigere behandling av lang kontekst enn full oppmerksomhet i hvert lag. Modellen har hybrid resonnering innebygd, og du slår tenkemodus av og på per forespørsel med enable_thinking i stedet for å bytte modell.

Tallene InclusionAI oppgir for lokal kjøring er grunnen til at modellen er interessant for et hjemmeoppsett. I FP8 måler de rundt 100 til 105 tokens i sekundet på en NVIDIA DGX Spark og 86 til 90 tokens i sekundet på en MacBook med M4 Pro, med om lag 8,34 GiB toppminne ved 8K kontekst. Modellen er validert på DGX Spark, Apple Silicon-MacBook og Mac mini.

På kvalitetssiden er tallene mer beskjedne. Modellen får 25 på Artificial Analysis sin Intelligence Index v4.1.1 og 16 på den tilhørende Agentic Index. I de samme testene måles over 160 tokens i sekundet i utdata og rundt 18 sekunder ende til ende for et svar på 500 tokens, resonneringstiden inkludert. Terminal-Bench-tallene er kjørt under Artificial Analysis-protokollen med Terminus 2 som testoppsett, to timers tidsavbrudd og tre kjøringer per oppgave.

Kjøreveien er SGLang eller vLLM. SGLang har et ferdig Docker-image som følger Ling-3.0-kjøretiden, og InclusionAI oppgir en anbefalt lavlatens-oppskrift med 256K kontekst via YaRN på ett GPU-kort i 141 GB-klassen. For vLLM må du bygge fra en egen gren, siden støtten ennå ikke ligger i hovedgrenen. Anbefalte samplingsparametere er temperatur 1,0, top_p 0,95 og top_k 20.

Ligger du på 16 GB delt minne på en Mac, er dette en av få modeller med både verktøykall og resonnering som får plass med romslig margin. Prisen er kvalitetsnivået: en Intelligence Index på 25 plasserer modellen godt under det du får fra en API-modell, og valget står mellom lokal kontroll og svarkvalitet.

Hva bør du gjøre?

  1. Start med FP8-vektene hvis maskinen din støtter formatet: det er konfigurasjonen InclusionAI faktisk har målt, og INT4 endrer både minnebruk og kvalitet.
  2. Slå av tenkemodus per forespørsel for rutineoppgaver, siden den er på som standard og koster både tokens og ventetid.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter