Hopp til hovedinnhold
Tilbake
Lokale-modeller 2 min · Kilde: SparkLLM

Spark X2.5-4B og 1.7B kjører én million tokens kontekst på enheten

KI Takeaway KI-generert · kan inneholde feil

Åpner SparkLLM vektene til Spark X2.5-4B og 1.7B, to on-device-modeller som håndterer én million tokens kontekst uten triksing.

Én million tokens kontekst i en modell på 1,7 milliarder parametere: det er tallet SparkLLM setter på Spark X2.5-1.7B og den større X2.5-4B, som selskapet slapp med åpne vekter denne uken. Begge er trent på rundt 20 billioner tokens, med flere hundre milliarder tokens høykvalitets langdokument-data spesifikt for å strekke kontekstvinduet.

Poenget er at små modeller til nå har måttet kutte lange dokumenter i biter og spørre om hver bit for seg. SparkLLM skriver at det mister sammenhengen og taper informasjon underveis. Med hele konteksten inne kan modellen lese en komplett ettersalgsmanual, et møtearkiv eller et helt kodelager i én omgang og holde på oversikten gjennom flere steg.

På kodeoppgaver hevder SparkLLM at 4B-varianten måler seg med skymodeller to til tre ganger så store, og at den kobles rett inn i åpne agent-oppsett som OpenCode, Codex og Pi. På Domux-testsettet for smarthus treffer 1.7B-varianten 90,3 prosent nøyaktighet fra ende til ende med 0,85 sekunders snittlatens. Begge størrelsene er ment å tåle kontinuerlig persepsjon og styring om bord på en robot eller på kanten av nettet.

For deg som bygger lokalt er distribusjonen det interessante. Modellene kjører på maskinvare fra NVIDIA, Huawei, Hygon og Houmo, og de er kompatible med vLLM, SGLang og llama.cpp. SparkLLM har lagt ut GGUF-bygg på Hugging Face, så veien via Ollama eller LM Studio er kort, og videretrening støttes gjennom LLaMA-Factory. Treningen er kjørt fra ende til ende på en helt kinesisk beregningsplattform.

Det åpner en konkret mulighet: å la en modell lese hele repoet ditt uten et lag med chunking og vektorsøk foran seg. Om kvaliteten holder over hele det vinduet er ikke dokumentert utover selskapets egne tall, og tallene i innlegget er oppgitt av SparkLLM selv.

Hva bør du gjøre?

  1. Hent GGUF-byggene fra XHToken-samlingen på Hugging Face. 1.7B er den realistiske starten på en laptop, 4B hvis du har GPU å avse.
  2. Mål kvaliteten selv på din egen lange kontekst før du river ut RAG-laget. Et vindu på én million tokens er en påstand om kapasitet, ikke om presisjon.
  3. Noter 7. september. Da kommer Spark X2.5-293B, som ifølge SparkLLM løfter kode- og agentferdighetene ytterligere.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter