Hopp til hovedinnhold
Tilbake
Forskning 3 min · Kilde: Microsoft Research

Microsoft åpner Orchard, treningsrammeverket bak en 3B-agent på 69,7 prosent SWE-bench

KI Takeaway KI-generert · kan inneholde feil

Slipper Microsoft Research hele treningsstacken bak Orchard, der en agent med rundt 3 milliarder aktive parametere løser 69,7 prosent av SWE-bench Verified.

Å trene en kodeagent har krevd infrastruktur de færreste utenfor de store labene har: egne sandkasser, lukkede treningsløyper og datasett ingen utenfra får se. Microsoft Research peker på nettopp dette som flaskehalsen i forskningsbloggen som 3. august presenterte Orchard, et rammeverk selskapet legger ut under MIT-lisens på github.com/microsoft/Orchard.

Kjernen heter Orchard Env. Det er en Kubernetes-basert tjeneste som oppretter, styrer og river tusenvis av isolerte komponenter parallelt, og den er bygd for å betjene ulike agenttyper uten endringer: kodeagenter, nettleseragenter og assistentagenter kjører mot samme miljølag. Tanken er at kjøremiljøet skal være en frittstående tjeneste i stedet for infrastruktur støpt inn i ett bestemt treningsrammeverk.

Den mest uvanlige delen er at Orchard trener agenter inne i den kjørerammen de faktisk skal brukes i. Dagens agenter kjører sjelden som en naken modell, de opererer gjennom kjørerammer som Codex, OpenClaw og ZeroClaw, som håndterer flerturs resonnering og verktøybruk. Åpne treningsverktøy klarer vanligvis ikke disse tilstandsfulle flerprosess-oppsettene, så forskere trener mot en forenklet erstatning og ruller ut i den ekte. Orchard logger i stedet kjørerammens egne modellkall gjennom en lettvekts proxy, mens hver rollout kjører i sin egen container.

«Miljølaget betyr noe. Ved å gjøre den underliggende infrastrukturen åpen, lett og gjenbrukbar senker Orchard kostnaden ved agentisk KI-forskning.» — Microsoft Research, Orchard-bloggen

Tre ferdige oppskrifter følger med, og det er tallene som gjør dem verdt å se på:

  1. Orchard-SWE går fra 61,4 prosent på SWE-bench Verified til 69,1 med Balanced Adaptive Rollout og 69,7 med tettere belønningssignaler. Legger du på en verdimodell med 4 milliarder parametere som rangerer kandidatløsninger på nytt, ender den på 73,0 prosent. Treningsgrunnlaget er 107 000 agent-interaksjoner destillert fra MiniMax-M2.5 og Qwen3.5-397B.
  2. Orchard-GUI trener en vision-language-modell på 4 milliarder parametere med bare 400 demonstrasjoner og 2 200 åpne oppgaver, og lander på 74,1 prosent på WebVoyager, 67,0 på Online-Mind2Web og 64,0 på DeepShop.
  3. Orchard-Claw trenes på 200 syntetiske assistentoppgaver. Effekten av å trene inne i kjørerammen er tydeligst her: under Codex stiger suksessraten fra 18,6 prosent for den utrente modellen til 51,5 prosent etter Orchard-trening.

For deg som bygger agenter er poenget størrelsen. Resultatene kommer fra modeller med 3 til 4 milliarder aktive parametere, altså modeller som lar seg kjøre utenfor et datasenter, og Microsoft Research oppgir at Orchard-SWE nærmer seg systemer over ti ganger større. Prisen er at du må ha Kubernetes for å bruke miljølaget slik det er ment. Repoet er ferskt, 158 stjerner så langt, men hvis miljølaget virkelig er det som har skilt åpne agenter fra lukkede, er det nå den billigste delen å skaffe seg.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter