Hopp til hovedinnhold
Tilbake
Modell 3 min · Kilde: The Decoder

Ling 3.0 Flash kuttet hallusinasjonsraten fra 97 til 44 prosent

KI Takeaway KI-generert · kan inneholde feil

Faller hallusinasjonsraten til Ling 3.0 Flash fra 97 til 44 prosent på AA Omniscience sammenlignet med forgjengeren.

97 til 44 prosent. Det er fallet Artificial Analysis måler i hallusinasjonsrate for Ling 3.0 Flash på Omniscience-testen, målt mot forrige versjon av modellen, skriver the-decoder. Forbedringen kommer i hovedsak av at modellen nå nekter å svare langt oftere på spørsmål den ikke har et pålitelig svar på.

Modellen kommer fra inclusionAI, forskningsmiljøet til Ant Group, og er sluppet under MIT-lisens på inclusionAIs eget API og gjennom DeepInfra. Vektene ligger direkte på Hugging Face. På Artificial Analysis Intelligence Index scorer den 38 poeng, på nivå med Qwen3.6 27B, men med langt færre aktive parametere. Lederen i klassen, DeepSeek V4 Flash, ligger fortsatt på 52.

Arkitekturen forklarer regnestykket. Modellkortet på Hugging Face oppgir 124 milliarder parametere totalt og 5,1 milliarder aktive per token, altså rundt 12 prosent og 8 prosent av inclusionAIs forrige flaggskip Ring-2.6-1T. Modellen stabler 35 lag Kimi Delta Attention og 7 lag Gated MLA i forholdet 5:1, en hybrid-lineær oppmerksomhet som er lagt inn fra starten av førtreningen i stedet for å bygges på i ettertid. MoE-blokken er tynn: 512 rutede eksperter, én delt, og åtte aktive om gangen.

Agentbruk er der inclusionAI har lagt arbeidet. Modellkortet oppgir over 10 000 interaktive treningsmiljøer for koding, generelle oppgaver og dyp research, og modellen er trent opp i kontekst gjennom 8K, 32K og til slutt 256K. Den integrerer SGLangs HiCache sammen med Mooncake-hurtigbufferen, som ifølge kortet kutter tiden til første token med 60 til over 80 prosent når inndataene er lange. Ifølge the-decoder er fremgangen på agentoppgaver tydelig, blant annet på t3-Bench Banking.

Modellkortet lister også resultater på SWE-Bench Pro, SWE-Bench Multilingual, Tau3-banking-AA, MCP-Atlas og SkillsBench, og oppgir at modellen fungerer i agentmiljøer som Claude Code, Kilo Code, Qwen Code og OpenClaw. Tenkemodus står på som standard, med temperature 0,6, top_p 0,95 og top_k 20 som anbefalte verdier.

Prisen er selve argumentet. Per token slår Ling 3.0 Flash alle modeller på tilsvarende nivå, ifølge the-decoder. Forbeholdet er at den bruker flere tokens enn like sterke alternativer på kompliserte oppgaver, men selv regnet per fullført oppgave lander den billigere enn Qwen3.6 27B.

Hva bør du gjøre?

  1. Test den mot dine egne agentoppgaver via DeepInfra eller inclusionAIs API før du regner på selvhosting. 124 milliarder parametere krever langt mer enn en arbeidsstasjon.
  2. Mål tokenbruk per fullført oppgave, ikke per kall. Modellen er billig per token, men bruker flere av dem.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter