Hopp til hovedinnhold
Tilbake
Verktøy 2 min · Kilde: GitHub - dynobox/dynobox

Dynobox kjører samme test mot Claude Code, Codex og OpenCode

KI Takeaway KI-generert · kan inneholde feil

Kjører Dynobox samme testscenario gjennom Claude Code, Codex og OpenCode og måler hva agenten faktisk gjorde, ikke hva en dommermodell mener om svaret.

Modellgraderte evaler spør en modell om svaret var godt nok. Dynobox spør i stedet om agenten kalte cat, om den lot være å redigere filen, og om package.json fortsatt inneholder linjen den skulle. Prosjektet ligger på GitHub under Apache 2.0 og beskriver seg selv som nærmere enhetstesting enn evaluering.

En dyno samler prompt, oppsett av testdata, hvilke agentmiljøer som skal kjøre og akseptkriteriene i én fil, skrevet som YAML, JavaScript eller TypeScript. Påstandene måler observerbar oppførsel: om et verktøy ble kalt eller ikke kalt, om en kommando kjørte, om en fil finnes, endres eller står urørt, om en skill ble referert, om et HTTP-kall gikk ut, og om sluttsvaret inneholder det du krever. Hver kjøring skjer i en fersk midlertidig arbeidsmappe, og med flagget for gjentakelser får du pass-rater rendret som kompakte rader av punktum og F-er, slik at flakete oppførsel blir synlig i stedet for å slippe unna som en enkeltkjøring.

Poenget med å kjøre samme scenario gjennom tre agentmiljøer er å finne oppførsel som varierer mellom miljøene. Du trenger Node.js 22 eller nyere og minst ett av agentmiljøene installert, autentisert og tilgjengelig på PATH. Uten konto fungerer alt lokalt; innlogging trengs bare for å laste opp kjøringssammendrag til dashbordet.

To forbehold er verdt å ta med. De midlertidige mappene skiller filer, men er ikke sikkerhetssandkasser: både JavaScript-konfigurasjonene og oppsettskommandoene kjører på maskinen din med dine rettigheter, så kjør bare dynoer du stoler på. Og opplastede kjøringer er lengdekappet, ikke sladdet. De kan inneholde git-identitet, endepunkt-URL-er og kommandoene som ble kjørt. Verktøyet er dessuten merket som tidlig tilgang, og formatene kan endre seg før versjon 1.0.

Hva bør du gjøre?

  1. Start med den arbeidsflyten du er mest redd for at agenten roter til, og skriv én dyno som fester akkurat de filene og kommandoene som må stemme.
  2. Kjør scenarioet med gjentakelser før du konkluderer. En agent som består én gang av fem er ikke i mål, og det ser du bare når du måler pass-raten.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter