Ling-3.0-Flash aktiverer 5,1 milliarder parametere, men vektene ligger ikke ute ennå
Slipper Ant Group en MoE-modell på 124 milliarder parametere som aktiverer bare 5,1 milliarder per token, uten at vektene foreløpig er tilgjengelige.
Avstanden mellom 124 milliarder og 5,1 milliarder er hele poenget med Ling-3.0-Flash. Ant Groups laboratorium inclusionAI kunngjorde modellen 23. juli, og Business Wire distribuerte pressemeldingen fire dager senere. Ant Group beskriver den som en hybrid resonneringsmodell bygget for agent-arbeidsflyter i produksjon, der responstid og kostnad per kall betyr mer enn maksimal kapasitet.
Arkitekturen er der effekten ligger. Modellen stabler KDA-lag (Kimi Delta Attention) og MLA-lag i forholdet 5:1, og MoE-laget aktiverer én av 64 eksperter per token. Kontekstvinduet er 262 144 tokens nativt, som Ant Group oppgir kan strekkes til én million. Sammenlignet med selskapets egen Ring-2.6-1T er det 87,6 prosent færre totale parametere og 91,9 prosent færre aktive. Ant Group opplyser også at modellen er trent i over 10 000 reelle interaksjonsmiljøer for å tåle lange agent-løp uten å spore av.
Alle ytelsestallene kommer foreløpig fra Ant Group selv. Modellen er annonsert som open weight, men repoet inclusionAI/Ling-3.0-Flash på Hugging Face svarer fortsatt 401, så påstanden om paritet med billionmodellen kan ikke etterprøves av utenforstående ennå. Det du kan teste, er API-et: modellen er gratis via OpenRouter, Novita, Vercel AI Gateway og ZenMux fram til 3. august.
For deg som kjører agenter i volum er regnestykket interessant uansett om benchmarkene holder: 5,1 milliarder aktive parametere er inferenskostnad i klassen til en liten modell, med et kontekstvindu i klassen til en stor.
Hva bør du gjøre?
- Kjør dine egne agent-løp mot gratis-API-et før 3. august, og mål latens og kostnad per fullført oppgave mot modellen du bruker i dag.
- Vent med å planlegge selvhosting til vektene faktisk ligger på Hugging Face. Ant Group har levert MIT-lisensierte vekter før, men denne gangen er de ikke ute.
- Test spesifikt lange løp. Påstanden om 10 000 treningsmiljøer handler om selvkorreksjon over tid, ikke om enkeltsvar.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.