Kodeagenter slo alle publiserte metoder uten Microsofts nye skill
Måler Microsofts Agent Lightning-skill til 94,9 prosent på ALFWorld for kodeagenter, mot 88,6 prosent uten den.
Kodeagentene som fikk i oppgave å forbedre en underpresterende KI-agent, traff 62,9 prosent på SpreadsheetBench uten noen skill i det hele tatt. Den sterkeste publiserte metoden i Microsofts egen sammenligningstabell, SkillOpt, kom til 47,5 prosent på samme benchmark. Det er utgangspunktet for Agent Lightning, skillen Microsoft nå har lagt ut for Claude Code, Codex og GitHub Copilot.
Installasjonen går via gh skill install microsoft/agent-lightning agent-lightning --agent claude-code. Utgivelsesnotatet på github.com daterer den første offisielle versjonen til 24. august, i Agent Lightning 1.0.1.
Gevinsten av selve skillen er ujevn. Med den traff kodeagentene 66,7 prosent på SpreadsheetBench mot 62,9 uten, 54,5 mot 54,1 på OfficeQA, og 94,9 mot 88,6 på ALFWorld. ALFWorld flyttet seg altså tydelig, OfficeQA nesten ikke.
Oppsettet forklarer noe av spredningen. Agentene som ble forbedret kjørte på GPT-5.4-mini. Claude Code optimaliserte med Opus 4.8, mens Codex og GitHub Copilot brukte GPT-5.6 Sol. Hver optimalisering fikk 5, 10 eller 25 dollar i API-kreditt, og hver kombinasjon av benchmark, kodeagent, budsjett og skill-innstilling ble kjørt tre ganger.
Skillen er prosess, ikke kode. Den foreslår hvilke endringer som er verdt å teste, forklarer hvordan støyete resultater skal leses, og krever at hver endring måles. Den skiller også engangskostnaden ved optimalisering fra hva den ferdige agenten skal koste per kjøring, en forveksling som er lett å gjøre når man jakter på score.
Hva bør du gjøre?
- Har du allerede en benchmark du stoler på: installer skillen og la kodeagenten kjøre en runde mot den før du selv gjetter på hva som bør endres.
- Mangler du benchmarken: bygg den først. Uten et målbart evalueringssett har skillen ingenting å optimalisere mot, og tallene over sier ingenting om din agent.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.