Microsofts ThinkingBox: Kimi-K3 løser 476 av 507 agentoppgaver, men bare 68 hver gang
Regn med at en agent som lykkes én gang, kan feile neste gang: i Microsofts nye ThinkingBox-benchmark består selv Claude Opus 5.5 bare 241 av 507 forretningsoppgaver i alle 20 forsøk.
79 853 av 121 680 gyldige agentforsøk feilet de kjørbare sjekkene i ThinkingBox, en sandkasse og benchmark som Microsofts Copilot Studio-team og Hugging Face presenterte i et felles blogginnlegg 3. oktober. Det ubehagelige er hvordan de feilet: 67,24 prosent av de mislykkede forsøkene avsluttet pent, kalte et verktøy som endret tilstand og rapporterte ingen feil. Først da sjekkene leste databasen etterpå, dukket feil feltverdier opp i 77,61 prosent av dem.
ThinkingBox-Bench består av 507 syntetiske arbeidsflyter innen detaljhandel, bilforsikring, reise, nettbank og konsulent-IT, laget i samarbeid med Toloka. Hver oppgave har en starttilstand, en simulert kunde som holder tilbake informasjon til den blir spurt, MCP-verktøy i isolerte økter og en fasit over sluttilstanden. 477 av oppgavene vurderes bare på hva som ligger i databasen til slutt. Alle de 18 modellene kjører hver oppgave 20 ganger fra en helt ren backend.
«Et forløp er en påstand. Databasetilstanden er beviset. Gjentakelse er tillitstesten.» — Microsoft og Hugging Face i blogginnlegget
På vanlig pass@1 leder Claude Opus 5.5 med 67,16 prosent, foran Claude Opus 5 (66,50) og GPT-5.4 (65,36). Kimi-K3 er beste modell med åpne vekter på 57,37 prosent. Rekkefølgen endrer seg når du teller hvor mange oppgaver en modell klarer hver eneste gang. Kimi-K3 løser 476 av 507 oppgaver minst én gang, flest av alle, men bare 68 i alle 20 forsøk. Opus 5 og Opus 5.5 lander begge på 241, så et halvt prosentpoeng høyere snitt ga ingen ekstra pålitelighet. GLM-5.1, Kimi-K2.6 og DeepSeek-V4-Pro beholder rundt 8 prosent av enkeltforsøk-scoren sin når kravet er 20 av 20.
Forfatterne beskriver hovedfunnet slik i artikkelen på arXiv, som først ble lagt ut 20. august:
«Thinkingbox-bench avdekker et stort gap mellom av og til å finne et vellykket forløp og pålitelig å fullføre forretningsoppgaver med tilstand.» — Zhuochun Li og medforfattere, arXiv
Bloggen regner også ut prisen per oppgave en modell består i alle 20 forsøk, basert på listepriser. Opus 5 når de samme 241 oppgavene som Opus 5.5, men til 13,30 dollar per oppgave mot 7,80, så den nyere modellen vinner på både pris og treff.
Feilmønsteret er det mest brukbare funnet. 79,9 prosent av feilene klassifiseres som verktøyhåndtering, ikke resonnering: agenten kommer langt nok til å prøve arbeidsflyten, men tar seg ikke inn igjen etter verktøyfeil, brutte forutsetninger eller tomme oppslag. Teamet anbefaler å sjekke sluttilstanden før du committer, sortere feil slik at retry bare treffer dem som kan gjenopprettes, kutte verktøyflaten og kreve menneskelig godkjenning for endringer som er dyre å rulle tilbake. De skriver samtidig at effekten av tiltakene ikke er målt.
Hva bør du gjøre?
- Kjør dine egne agent-evals flere ganger per oppgave, og rapporter hvor mange oppgaver som består hver gang, ikke bare snittet.
- Legg inn en sjekk som leser databasen etter at agenten sier den er ferdig, før svaret går til brukeren.
- Prøv en oppgave selv: ThinkingBox ligger på GitHub under MIT-lisens og kjøres via Hugging Faces OpenEnv på Linux eller WSL med Python 3.11+, uv, Docker og Typesense 30.1.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.