Hopp til hovedinnhold
Tilbake
Kimi 2 min · Kilde: Fireworks AI

Ember-1 fra Fireworks skal gi Kimi K3-kvalitet med 40 prosent færre tokens

KI Takeaway KI-generert · kan inneholde feil

Forvent Kimi K3-kvalitet med omtrent 40 prosent færre tokens fra Ember-1, men foreløpig bare som tidsbegrenset forhåndsversjon i Fireworks AIs API.

«Den mest kostnadseffektive måten å kjøre K3 på er ikke lenger å få den til å tenke mindre», skriver Fireworks Research i kunngjøringen av Ember-1 fra 23. september. Modellen er Kimi K3 ettertrent til å kutte unødvendig resonnering: en Mixture-of-Experts-modell på 2,78 billioner parametere med 1040k tokens kontekst, ifølge modellsiden hos Fireworks AI.

Ifølge Fireworks bruker resonneringsmodeller som K3 flertallet av genererte tokens, noen ganger over 90 prosent, på intern tenking. I agentiske flertrinnsløp leses tidligere resonnering inn igjen hver runde, så konteksten vokser omtrent kvadratisk med antall runder. Å skru ned reasoning effort hjalp ikke, fordi lavere innstillinger ga fra seg for mye kvalitet. Teamet kjørte over 50 treningseksperimenter og over 200 evalueringer på egne data, uten kundedata.

Resultatene er blandede i detaljene. Mot K3 på maks resonnering slår Ember-1 originalen på Terminal Bench 2.1 (82,0 mot 80,9 prosent) og DeepSWE 1.1 (75,2 mot 66,4), men ligger litt under på SWE-bench Verified (92,2 mot 93,2) og SWE-Interact (20,0 mot 21,3). I A/B-tester på to kunders produksjonstrafikk for koding ble det rundt 35 prosent færre tokens per oppgave, og én av kundene kjører nå modellen i produksjon.

Alle tallene er Fireworks' egne. Prisen er identisk med K3s offentlige API: 3 dollar per million input-tokens og 15 dollar per million output-tokens, så besparelsen kommer bare fra kortere resonnering. Fireworks omtaler Ember-1 som selskapets egen modell, og den rulles ut som Research Preview på Fireworks Serverless med to ukers tilgang. Den blir permanent bare hvis etterspørselen er der. Flere i Hacker News-tråden reagerte på at Fireworks trente videre på Kimi K3s vekter uten å slippe vektene til Ember-1.

«Hvilken evne, om noen, går tapt med tokenreduksjonen?» — tomrod, Hacker News

Kunngjøringen viser bare benchmark- og A/B-tall, ikke hvilke oppgavetyper som eventuelt ble svakere. I samme tråd ba to kommentatorer om samme behandling av DeepSeek 4.1 Flash og GLM 5.3 Flash. For deg som betaler per token for agentisk koding er det nye at resonneringslengde kan trenes bort, ikke bare skrus ned.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter