Microsoft-Decision-1 scorer agentvalg 35 ganger raskere enn GPT-6 Sol, ifølge Microsofts egne tester
lørdag 10. oktober · KI-generert · Kilde: Microsoft Command Line
Test Microsoft-Decision-1 der agenten din tar mange små valg, for modellen gir en kalibrert sannsynlighet per svaralternativ, koster 0,042 dollar per million inntokens og tar ikke betalt for output.
Microsoft lanserte 9. oktober Microsoft-Decision-1 i Microsoft Foundry, med OpenRouter som neste kanal. Modellen skriver ikke tekst. Du gir den et fast sett alternativer, og den returnerer en sannsynlighet for hvert av dem: ja/nei, flervalg, rangering eller rubrikkbasert vurdering av et KI-svar eller en agenthandling. Ifølge Microsofts kunngjøring er den en ettertrent Qwen3.5-9B, og P50-latensen er omtrent 35 ganger lavere enn GPT-6 Sol. Microsoft lover å bygge senere versjoner på andre grunnmodeller, blant dem egne MAI-modeller og modeller fra OpenAI.
Begrunnelsen er latens som hoper seg opp i agentkjeder:
«Bare 100 millisekunder ekstra på hver av 20 sekvensielle beslutninger legger to sekunder til hele arbeidsflyten.» — Microsoft
Microsoft oppgir at modellen fikk høyest treffsikkerhet i en sammenligning over 36 benchmarks med nesten 150 000 spørsmål som ble holdt utenfor treningen, og at den var 4,5 ganger raskere enn nummer to, Quyet-1.0-Large. Robusthet er målt ved å omformulere samme forespørsel på åtte måter: Beslutningen endret seg i 1,3 prosent av tilfellene, og aldri når alternativene ble stokket om. Internt brukte Xbox Research modellen til å sortere over 10 000 tilbakemeldinger fra spørreundersøkelser, Steam og X i faste temaer, med kvalitet på høyde med GPT-6 Sol, mer enn 14 ganger raskere og 200 ganger billigere.
Alle disse tallene er Microsofts egne. Ingen uavhengig evaluering er publisert ennå, og vektene er ikke lagt ut, selv om grunnmodellen Qwen3.5-9B er åpen under Apache 2.0. Du kan altså ikke kjøre Microsoft-Decision-1 lokalt, bare via API.
Bakgrunn
Beslutningsmodeller er i ferd med å bli en egen kategori. OpenAI har allerede et Decisions API i offentlig beta, der gpt-6-luna foreløpig er eneste modell. OpenAI lover det samme som Microsoft, bare med et annet referansepunkt:
«returnerer typede svar omtrent 10 ganger raskere enn Responses API» — OpenAIs dokumentasjon for Decisions API
For deg som bygger agenter er bruksområdet konkret. Mange agentsteg er i praksis klassifisering: om agenten skal fortsette, stoppe, prøve igjen eller gi fra seg oppgaven, hvilken modell som skal få forespørselen, eller om svaret består rubrikken. I dag går mange av disse valgene gjennom en full språkmodell som genererer tekst du parser etterpå. En kalibrert sannsynlighet gir deg i tillegg en terskel å styre etter: Microsoft skriver at en prediksjon på 90 prosent skal være riktig omtrent ni av ti ganger.
Hva bør du gjøre?
- Finn stegene i agenten din der en stor modell bare svarer ja/nei eller velger mellom faste alternativer, som ruting, guardrail-sjekker og LLM-as-judge. Det er der en beslutningsmodell kan erstatte et fullt modellkall.
- Kjør dine egne eksempler mot både Microsoft-Decision-1 og OpenAIs Decisions API før du bytter, siden begge leverandørenes tall er egne målinger.
- Bruk sannsynligheten aktivt: La agenten handle selv over en terskel, og send tilfellene under terskelen til et menneske eller en større modell.