NaiveAI fjerner full attention fra MiMo-V2.5 og slipper 309B-modell under MIT
Regn med datasenter-GPU-er for å kjøre Naive-N0.5-Flash, NaiveAIs åpne 309B-modell med 1M kontekst og MIT-lisens.
Der Xiaomis MiMo-V2.5 fortsatt har noen globale attention-lag for å holde på lang kontekst, har Naive-N0.5-Flash ingen. NaiveAI har byttet dem ut med DeepSeek Sparse Attention (DSA), ifølge modellkortet på Hugging Face, der vektene ble lagt ut 27. september. Resultatet er 48 lag: 39 med Sliding-Window Attention over et vindu på 128 tokens og 9 DSA-lag som velger ut de 2 048 viktigste tokenene fra hele historikken. Modellen har 309 milliarder parametere i MoE, hvorav 15,5 milliarder er aktive.
Poenget er dekodingskostnaden. Ved millioner av tokens står de globale lagene for mye av overheaden, skriver NaiveAI. DSA regner bare attention over et utvalg, selv om en lett indekser fortsatt skanner hele historikken og hele KV-cachen beholdes. Modellen er trent videre på 3,25 billioner tokens, hele veien med 1M kontekst. Evalueringene er kjørt i Claude Code 2.1.207 med bare fil-I/O og Bash tilgjengelig, og alle benchmark-resultater er NaiveAIs egne.
Den mest konkrete delen er inferensmotoren NaiveRT. NaiveAI oppgir 50 tokens/s per bruker i standardmodus og opptil 2 000 tokens/s i Ultrafast-modus, med en målt topp på 2 122 tokens/s for én strøm på 8 GPU-er. En full runde med spekulativ dekoding tar 3,4 ms, mot 12,3 ms i SGLang på samme system.
«NaiveRT ble bygget på seks dager av menneskelige forskere som jobbet sammen med KI-modeller, over 151 dokumenterte optimaliseringsforsøk.» — NaiveAI, teknisk blogg
Av de 151 forsøkene ble 63 tatt i bruk, mens 71 feilet validering eller ble rullet tilbake. Kildekoden og benchmark-skriptene skal ligge i NaiveRT-repoet på GitHub innen 12. oktober.
Vektene tar rundt 315 GB og krever NVIDIA-GPU-er med FP8-støtte, så dette er ingen modell for hjemmelaben. NaiveAI varsler også API-tilgang til 0,10 dollar per million input-tokens, 0,40 dollar for output og 0,01 dollar for cache-lesing.
For deg som bygger agenter med lang kontekst er arkitekturen det interessante: den viser en vei til 1M kontekst uten ett eneste full-attention-lag, og NaiveRT-koden skal gjøre optimaliseringene etterprøvbare.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.