Hopp til hovedinnhold
Tilbake
Verktøy 3 min · Kilde: Claude

Warps improver-skill retter kodeagenten mellom kjøringene

KI Takeaway KI-generert · kan inneholde feil

Del agenten din i to skill-filer hvis den gjentar de samme feilene fra økt til økt.

Warp er en KI-drevet terminal og et agentisk utviklingsmiljø bygget på Claude-plattformen, med nesten én million utviklere. Internt kjørte selskapet en kodegjennomgangsagent som ingeniørene mislikte: den la igjen unyttige kommentarer og leverte innhold av lav kvalitet. Et førsteutkast som treffer 80 prosent av oppgaven holder ikke, skriver Anthropic på Claude-bloggen, det skaper bare en støyende opplevelse.

Teamet forsøkte først det nærliggende. De skrev om prompten manuelt hver gang de så en dårlig gjennomgang, og de forbedret kontekstfiler som AGENTS.md. Begge deler hjalp, ingen av dem skalerte. Diagnosen de landet på er lett å kjenne igjen: tilbakemelding til en agent forsvinner når økten avsluttes, og konteksten forlater agentloopen sammen med den.

Løsningen er to skills med et menneske imellom. Den indre skillen bærer domenekunnskapen og kjører per oppgave, for eksempel når en PR åpnes. Den ytre improver-skillen kjører på timeplan i stedet for per oppgave. Den henter oppsamlet menneskelig tilbakemelding, sammenligner hva agenten foreslo med hvordan menneskene faktisk svarte, og foreslår én liten, avgrenset endring i den indre skillen.

«The framework is really simple actually: there's the base domain-specific skill and then there's the improver skill that refines that domain-specific skill.» — Zach Lloyd, grunnlegger av Warp

Fordi skills er vanlige filer, går forbedringen gjennom helt ordinær PR-flyt. Den kan leses, godkjennes og merges, og neste kjøring av den indre skillen arver endringen. Det menneskelige godkjenningssteget er samtidig bremsen som hindrer at agenten skriver om sine egne instrukser uten tilsyn.

I triage-eksemplet kjører improveren i Oz, Warps egen orkestreringsplattform, som en planlagt «update triage»-agent. Den autentiserer mot GitHub og kjører et Python-skript som følger med selve skillen for å hente inn saker med tilbakemelding. Anthropic trekker frem nettopp det som god praksis: en skill kan peke på ferdige ressursfiler i stedet for at agenten skriver ny kode ved hver kjøring.

Bakgrunn

Warp har åpnet kildekoden, og mønsteret ligger synlig i repoet på GitHub. Katalogen .agents/skills inneholder 21 SKILL.md-filer, blant dem review-pr-local og triage-issue-local, altså de to agenttypene artikkelen beskriver. Triage-fila viser hvordan spesialisering fungerer i praksis: den arver fra en felles triage-skill i et annet repo og overstyrer bare kategoriene forelderen tillater. Etikettene den vurderer, deriblant ready-to-spec, står i klartekst i fila.

Innvendingen i Hacker News-tråden om artikkelen treffer den åpenbare svakheten i loopen.

«feedback can be wrong, so improver should check criticism against domain instead of writing it straight into skill, otherwise one reviewer bad taste becomes permanent rule for everybody» — artyomsv, Hacker News

Uten en validering mellom tilbakemelding og skill-fil blir smaken til én anmelder til en permanent regel for alle.

Hva bør du gjøre?

  1. Del skill-filene dine i to: én som gjør jobben, og én som bare foreslår endringer i den første.
  2. Be om begrunnet tilbakemelding i stedet for tommel opp. Warp fremhever forklaringer av typen «du foreslo å døpe om denne variabelen, men konvensjonen vår er en annen».
  3. Legg improver-skillen bak PR-review, slik at ingen endring i agentens instrukser når produksjon uten at et menneske har godkjent den.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter