Strands Decider 2B: åpen beslutningsmodell for agenter tar valg på 115 ms lokalt
Kjør Strands Decider 2B lokalt som portvakt for rutinevalg i agenten din, og la den store språkmodellen ta de vanskelige beslutningene.
115 millisekunder i median: så lang tid bruker Strands Decider 2B på å svare på et spørsmål på et Nvidia RTX 3090, ifølge Strands Agents-teamet, som står bak det åpne agent-SDK-et AWS lanserte i mai 2025. Modellen ble lansert 1. oktober med Apache-2.0-lisens, og vekter, treningsdata og skript ligger åpent på Hugging Face og GitHub. På en M3 Pro-Mac er median-latensen for små oppgaver 153 ms.
Strands Decider er en beslutningsmodell, også kalt «system one»-modell. Den kan ikke skrive tekst. I stedet velger den mellom alternativer du gir den, og hvert svar får en kalibrert konfidens. Teamet har tatt Qwen3.5-2B-Base, fjernet språkmodell-hodet og erstattet det med et pekerhode på rundt én million parametere, som scorer hvert alternativ mot posisjonen der svaret skal stå. Resten av modellen er finjustert med en rank-16 LoRA-adapter. Spørsmålene kommer i tre typer: noul (ja/nei), choice (ett av N alternativer) og score (et nivå på en ordnet skala).
Teamet oppgir at modellen ligger på tredjeplass av 33 modeller i 2B-klassen på JevBench, og først av 30 når modeller som er litt over 2B holdes utenfor. Forfatterne Marc Brooker, Mike Chambers og Fabio Nonato de Paula legger ikke skjul på hvor grensen går.
«Ulempen er at denne tilnærmingen, der alle svarene genereres i én parallell passering, gjør den betydelig dårligere enn resonneringsmodeller til å løse komplekse problemer.» — Strands Agents-teamet, i lanseringsinnlegget
Eksempelet i repoet viser bruken teamet sikter mot. En Strands-agent med et get_weather-verktøy gjetter en by når du spør om været uten å si hvor. Før kallet kjøres, svarer Decider på to ja/nei-spørsmål: om argumentene er forankret i noe brukeren faktisk sa, og om det er for tidlig å kalle verktøyet. Intervensjonssystemet i Strands, med InterventionHandler, kan så returnere Proceed, Deny, Confirm eller Guide, og agenten spør heller hvilken by du mente.
«Lange dokumenter i flere steg er det svake punktet» — modellkortet på Hugging Face
README-en advarer også mot å lese for mye ut av små forskjeller. Seks gjentatte treninger med v17-oppskriften ga et standardavvik på 3,2 oppgaver, så forskjeller under rundt ti oppgaver mellom to enkeltkjøringer regnes som uavklart.
Hva bør du gjøre?
- Installer med
pip install strands-deciderog test medstrands-decider ask StrandsAgents/strands-decider-2B-hobson-v19, der du gir en tilstand med--stateog spørsmål med--noul,--choiceeller--score. - Hold
strands-decider servepå din egen maskin. Serveren binder seg til 127.0.0.1 og har ingen autentisering, så ikke eksponer porten i hjemmelabben. - Mål konfidensen på din egen trafikk før du setter en terskel. Kalibreringen er bare fastsatt på korte klassifiseringsoppgaver.
- Vil du tilpasse modellen, tar hele oppskriften rundt 11 timer på ett RTX 3090.
Bakgrunn
Beslutningsmodeller har fått mye oppmerksomhet siden TypeSafe AI lanserte Jev, og JevBench er en tredjeparts test for denne klassen modeller. Strands Agents er AWS' åpne SDK for KI-agenter, og ifølge AWS brukte blant andre Amazon Q Developer og AWS Glue det allerede i produksjon ved lanseringen.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.