Poolside Laguna S 2.1: åpen kodemodell med 8B aktive parametere slår større rivaler
Poolside slapp Laguna S 2.1, en åpen kodemodell med bare 8 milliarder aktive parametere som holder følge med modeller mange ganger større på agentiske kodeoppgaver.
Laguna S 2.1 har 8 milliarder aktive parametere per token. Kimi K3, som slår den klart på enkelte benchmarks, aktiverer rundt 50 milliarder og er totalt over tjue ganger så stor. Det er kontrasten Poolside bygger hele lanseringen rundt: modellen er en Mixture-of-Experts på 118 milliarder parametere totalt, men aktiverer bare 8 milliarder om gangen, og støtter opptil 1 million tokens kontekst i både tenke- og ikke-tenke-modus.
På Terminal-Bench 2.1, som måler langhorisont-oppgaver der agenten jobber mot et miljø via terminalen, scorer Laguna S 2.1 70,2 % med tenkemodus på. Poolside oppgir 78,5 % på SWE-Bench Multilingual og 59,4 % på SWE-Bench Pro. Selskapet er tydelig på at toppscorene på modne benchmarks klumper seg sammen i 70-90-området, så det trekker fram DeepSWE som en hardere test der spredningen er reell: der lander modellen på 40,4 i tenkemodus, mens enkelte åpne modeller på over tusen milliarder parametere faller under 10.
«Så langt vi kan måle er Laguna S 2.1 den mest kapable agentiske kodemodellen i sin vektklasse, med god margin.» — Poolside
For deg som bygger lokalt, er størrelsen poenget. Poolside beskriver modellen som «unikt egnet» for komplekst arbeid på lokale maskiner nettopp fordi bare 8 milliarder parametere er aktive per token. En modell som kjører agentiske kodeøkter over lang tid uten å kreve et datasenter, endrer regnestykket for selvhostede oppsett.
Poolside oppgir også at modellen gikk fra treningsstart til lansering på under ni uker, og at selskapet slipper fulle trajektorier for hver kjøring i det endelige evalueringssettet på trajectories.poolside.ai. Det siste er et svar på et kjent problem: reward hacking gjør agent-benchmarks vanskelige å stole på, og åpne trajektorier lar andre etterprøve hvordan tallene ble til.
Tallene kommer fra Poolsides eget agent-oppsett, «pool», ikke fra standardoppsettet benchmarkene ofte rapporteres med. Det gjør direkte sammenligning med ledertavlene mindre presis, noe selskapet selv påpeker. Behandle scorene som Poolsides egne målinger inntil uavhengige tester foreligger.
Hva bør du gjøre?
- Vil du teste agentisk koding lokalt, er en 8B-aktiv MoE et realistisk startpunkt på en maskin med nok minne til de 118 milliardene totalt.
- Sammenlign mot din egen kodebase, ikke mot benchmarktallene. Åpne trajektorier viser hvordan modellen jobber, men reward hacking betyr at tallene ikke oversettes direkte til din arbeidsflyt.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.