Xiaohongshu slipper dots3-note under Apache 2.0: 280 milliarder parametere, 16 aktive
Sett av en node med åtte GPU-er hvis du vil kjøre dots3-note preview selv, for vektene er åpne, men de 280 milliarder parameterne må fortsatt ligge i minnet.
dots studio, KI-laben til kinesiske Xiaohongshu, publiserte GitHub-repoet for dots3-note preview 12. august, og vektene har ligget på Hugging Face siden 9. august. Modellen er den første med åpne vekter i dots3-familien, og Apache 2.0 dekker både vekter, dokumentasjon og assets i repoet.
Arkitekturen er Mixture-of-Experts med 280 milliarder parametere totalt og 16 milliarder aktive per token, fordelt på ett tett lag og 45 MoE-lag med 256 rutede eksperter pluss én delt, der åtte velges om gangen. Kontekstvinduet er 512K tokener. Modellen tar inn tekst, bilder, video og lyd og svarer med tekst, gjennom en MoE-basert bildeenkoder på 7 milliarder parametere (1,2 milliarder aktive) og en tett lydenkoder på 800 millioner.
«dots3-note preview er det letteste medlemmet i familien» — dots studio, i README-en for dots3-note-prev
Regnestykket for deg som vurderer å kjøre den lokalt: 16 milliarder aktive parametere gir en inferenskostnad nærmere en liten modell, mens minnebehovet følger de 280 milliardene. dots studio anbefaler FP8-utgaven på én node med åtte GPU-er, og oppgir at BF16 krever mer. vLLM har støtte i main-grenen, mens Transformers-støtten ligger i pull request 47844 og SGLang-støtten i 33829, begge fortsatt til vurdering. Inntil de er merget må du installere fra PR-revisjonene eller bruke release-imaget lmsysorg/sglang:dev-dots3-note.
Spekulativ dekoding med MTP (NEXTN) er valgfritt og kan ifølge repoet kutte tid per token med over 50 prosent. Verktøykalling går gjennom flagget --tool-call-parser dots, og trenger du ikke multimodaliteten, laster --language-only bare språkmodellen.
Benchmark-tallene bør du vente med å stole på. Evalueringsresultatene er publisert som to bilder i README-en, og den fulle rapporten står oppført som «coming soon».
Hva bør du gjøre?
- Start med FP8-sjekkpunktet dots-studio/dots3-note-prev-fp8 på vLLM main, som foreløpig er den eneste ferdig merget veien inn.
- Test lyd og video tidlig hvis du planlegger rundt dem, siden torchcodec og FFmpeg må installeres separat og videoinput tar med lydsporet når det finnes.
- Vent med å sammenligne mot Qwen eller DeepSeek til den fulle rapporten kommer, siden evalueringen så langt bare finnes som grafikk.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.