Hopp til hovedinnhold
Tilbake
Modell 3 min · Kilde: TechNode

Kimi K3 lover åpne vekter i dag, men Moonshot anbefaler 64 akseleratorer for å kjøre den

KI Takeaway KI-generert · kan inneholde feil

Slipper Kimi K3 med 2,8 billioner parametere som åpne vekter, men modellen forutsetter maskinvare de færreste har stående.

57 mot 60 og 59: på intelligensindeksen til Artificial Analysis ligger Kimi K3 tre poeng bak Claude Fable 5 og to bak GPT-5.6 Sol, ifølge gjennomgangen til DeepLearning.AI. Nærmeste åpne modell, GLM-5.2 fra Zhipu, står på 51. Moonshot AI lanserte K3 på API-et 16. juli og lovet i lanseringsbloggen at fulle vekter kommer innen 27. juli. Da denne saken ble skrevet lå ingen K3-vekter ute under moonshotai-organisasjonen på Hugging Face, der både K2 og K2.6 kom.

Effektiviteten ligger i arkitekturen. K3 aktiverer 16 av 896 eksperter per token, anslagsvis 50 milliarder parametere, og bruker Kimi Delta Attention i tre av fire attention-lag. Moonshot oppgir 2,5 ganger bedre skaleringseffektivitet enn Kimi K2, altså mer modellkvalitet per compute-krone. Kontekstvinduet er på én million tokens, og modellen tar imot bilder og video i samme arkitektur.

Selskapet viser fram tre kjøringer som argument for at modellen holder over lange horisonter. K3 bygde MiniTriton, en kompakt Triton-lignende kompilator med eget tile-nivå IR over MLIR og PTX-kodegenerering, som ifølge Moonshot holder tritt med Triton og torch.compile på roofline-testene. I en autonom kjøring på 48 timer designet, optimerte og verifiserte modellen en brikke på 4 mm² med åpne EDA-verktøy, som i simulering leverer over 8 700 tokens i sekundet. Alle tallene er Moonshots egne og ikke etterprøvd av tredjepart.

«K3 viser likevel et merkbart gap i brukeropplevelse sammenlignet med Claude Fable 5 og GPT 5.6 Sol» — Moonshot AI, i begrensningene i egen lanseringsblogg

Åpne vekter betyr ikke at du kan kjøre modellen. Moonshot anbefaler selv supernode-oppsett med 64 akseleratorer eller flere, fordi ekspertparallellitet på dette nivået krever store høybåndbredde-domener. Kvantiseringstrening med MXFP4-vekter og MXFP8-aktiveringer utvider maskinvarestøtten, men gjør ikke kravet lite. Moonshot sier de har bidratt med prefiks-caching for KDA til vLLM, som slippes sammen med vektene, så realistisk tilgang for de fleste går via hostere.

«Den som eier vektene, setter reglene for bruk. Mange forespørsler Claude Fable 5 avviser, går uten friksjon for Kimi K3-brukere» — The Batch, DeepLearning.AI

Lisensen er fortsatt uoppgitt. DeepLearning.AI lister både aktiv parametertelling, treningsdata og lisensen for de kommende vektene som ukjent, og nettopp lisensen avgjør om du kan finjustere, destillere eller bruke modellen kommersielt. På API-et koster K3 3,00 dollar per million tokens inn, 0,30 ved cache-treff og 15,00 ut.

Hva bør du gjøre?

  1. Test K3 mot din egen oppgave via API-et før du planlegger for lokale vekter. Modellen kjørte gjennom intelligensindeksen for 0,95 dollar per oppgave, nær GPT-5.6 Sol (1,04) og under Claude Fable 5 (2,75).
  2. Les lisensen før du bygger på vektene. Moonshot har ikke oppgitt hvilken som gjelder, og «åpne vekter» dekker alt fra Apache 2.0 til klare bruksbegrensninger.
  3. Ikke bytt til K3 midt i en agentsesjon. Moonshot advarer selv om at modellen er trent med bevart tenkehistorikk og blir ustabil hvis historikken ikke sendes tilbake i hvert kall.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter