Poolside slipper Laguna S 2.1: 118B kodemodell med åpne vekter som kjører på én DGX Spark
Lanserer Laguna S 2.1, en 118B MoE-kodemodell med 8B aktive parametere, 1M kontekst og åpne vekter som kjører i 4-bit på én NVIDIA DGX Spark.
Kappløpet i åpne kodemodeller har lenge handlet om størrelse, der modeller på over en billion parametere har toppet SWE-benchene. Poolside vrir på den logikken: 21. juli slapp selskapet Laguna S 2.1, en Mixture-of-Experts-modell med 118 milliarder parametere totalt, men bare 8 milliarder aktive per token. Vektene ligger åpent på Hugging Face under OpenMDW-1.1-lisens, og modellen er liten nok til å kjøre på én NVIDIA DGX Spark.
På Terminal-Bench 2.1 scorer modellen 70,2 % med resonnering slått på, og 78,5 % på SWE-Bench Multilingual, som ifølge Poolside topper tabellen blant åpne modeller med oppgitt størrelse. Det tydeligste signalet er DeepSWE v1.1, en tøffere langhorisont-bench: der scorer Laguna S 2.1 40,4 % mot DeepSeek-V4-Pro-Max sine 9,0 %, med rundt en sjettedel så mange aktive parametere.
«Laguna S 2.1 er, så langt vi kan måle, den mest kapable agentiske kodemodellen i sin vektklasse, med god margin.» — Poolside, lanseringsbloggen
Lukkede frontmodeller som Claude Fable 5 og Kimi K3 leder fortsatt på flere av benchene, og Poolsides poeng er ikke å slå dem totalt. Alle benchmark-tallene bør uansett behandles som selskapets egne, målt i deres agent-oppsett «pool»: verifiser mot dine egne oppgaver.
«Poolsides påstand handler om vektklassen, ikke om å være best totalt.» — MarkTechPost
Modellen har to moduser, «off» og «max», med max som standard. Der setter modellen sitt eget test-time-budsjett. Max-modus løfter Terminal-Bench fra 60,4 til 70,2 % og DeepSWE fra 16,5 til 40,4 %, men koster tokens: en DeepSWE-kjøring bruker rundt 249 000 tokens med resonnering mot 99 000 uten.
For deg som vil kjøre lokalt er minneprofilen det avgjørende. Alle 118 milliarder parametere ligger residente i minnet selv om bare 8 milliarder rutes per steg. Poolside slipper vektene i BF16, FP8, INT4 og NVFP4, med offisielle GGUF- og MLX-konverteringer og dag-én-støtte for vLLM, SGLang og Ollama.
Modellen er Poolsides tredje på under tre måneder. Pre-treningen startet 22. mai på 4 096 NVIDIA H200-GPUer, og hele løpet fra trening til lansering tok under ni uker. Vil du teste uten egen maskinvare, kjører hostet tilgang gjennom OpenRouter, gratis på 256K kontekst og betalt på full 1M kontekst til 0,10 / 0,20 / 0,01 dollar per million input-, output- og cache-read-tokens.
Hva bør du gjøre?
- Vil du kjøre lokalt: hent 4-bit-vektene (NVFP4 eller INT4) fra Hugging Face og server via Ollama, vLLM eller SGLang på én DGX Spark eller H200.
- Vil du bare vurdere kvaliteten først: bruk OpenRouter gratis på 256K kontekst før du forplikter maskinvare.
- Sett «max»-modus opp mot token-kostnaden: den løfter DeepSWE fra 16,5 til 40,4 %, men rundt dobler token-forbruket per kjøring.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.