Hopp til hovedinnhold
Tilbake
Verktøy 3 min · Kilde: Latent.Space

23,8 poeng skiller samme modell fra seg selv når du bytter agent-rammeverk

KI Takeaway KI-generert · kan inneholde feil

Måler agent-rammeverket til å stå for rundt halve forskjellen mellom en god og en dårlig agent, og spår at modellene nå spiser rammeverket innenfra.

23,8 poeng. Det er spennet en egen benchmark for agent-rammeverk fant da den kjørte samme modell gjennom 106 oppgaver i ulike oppsett: fra 52,4 til 76,2, uten å røre en eneste vekt. OpenAI fikk samme type utslag på ARC-AGI-3, der GPT-5.6 Sol gikk fra 13,3 til 38,3 prosent bare ved å beholde resonnering mellom steg og komprimere kontekst. Dan McAteer bruker tallene i et essay på Latent Space til å forklare hvorfor agenter plutselig begynte å virke rundt juletider i fjor.

«Endringen sist vinter, sist jul, er litt vanskelig å sette fingeren på. Rammeverket endret seg, litt post-trening endret seg, og så kom nye pre-trente modeller. Men det føltes som et stort sprang som ikke er så lett å forklare.» — Lukasz Kaiser, en av oppfinnerne bak Transformer-arkitekturen

Rammeverket er alt som ikke er modellvekter: miljøet, verktøyene, konteksten og sperrene rundt modellen. Uten det er modellen en hjerne i et kar, skriver McAteer: den kan ta en beslutning, men ikke gjøre noe med den.

Historien hans går i fire trinn. ReAct beskrev agent-løkka som ren prompting i oktober 2022. AutoGPT og BabyAGI ga modellene full autonomi våren 2023, lenge før modellene tålte det: med 95 prosent pålitelighet per steg havner en oppgave på 20 steg rundt 36 prosent. Cursor og Copilot trakk løkka tilbake til mennesket gjennom 2023 og 2024, og en test fra Answer.AI ga første Devin-versjon rundt 15 prosent. Så krysset kurvene hverandre: Claude Code kom i februar 2025 med terminal, bash-tilgang og tillatelsesregler i stedet for godkjenning av hver endring, og nådde rundt 1 milliard dollar i årlig omsetning på et halvår.

Det nye er at treningen har flyttet inn i rammeverket. OpenAI skrev om codex-1 i mai 2025 at modellen ble trent med forsterkningslæring på ekte kodeoppgaver i varierte miljøer, og GPT-5.1-Codex-Max ble lansert som den første modellen trent til å jobbe på tvers av flere kontekstvinduer gjennom komprimering. Når modellen lærer det rammeverket gjorde for den, kan stillaset rives. Thariq Shihipar i Anthropic har fortalt at teamet nylig slettet 80 prosent av systemprompten i Claude Code.

McAteers måleenhet for fremdrift er derfor uvant: hvor mye av rammeverket du får slette uten å miste evner. Løkka er tren, absorber, riv, gjenta.

Spørsmålet han lander på er hva som blir igjen når alt det maskinvendte er absorbert. Svaret hans er tillatelser, identitet, tillit og etterprøvbarhet. Rammeverket slutter ikke å finnes, det snur: fra å være menneskets grensesnitt mot modellen blir det modellens grensesnitt mot oppmerksomheten din.

«Det eneste fundamentalt knappe godet er den synkrone menneskelige oppmerksomheten til teamet mitt.» — Ryan Lopopolo, i en episode av Latent Space

Konkret spår McAteer at alle som bygger agentisk KI sender med en policy for menneskelig oppmerksomhet innen et år, slik alle endte opp med en AGENTS.md. Der AGENTS.md forteller agenten hvordan den jobber med kodebasen din, skal denne styre når den får avbryte deg og hvilke avgjørelser den tar alene.

Hva bør du gjøre?

  1. Mål oppsettet ditt før du bytter modell. Et sprik på 23,8 poeng på uendrede vekter gjør rammeverket til den billigste oppgraderingen du har liggende.
  2. Gå gjennom systemprompt og verktøybeskrivelser hver gang du oppgraderer modell, og slett det den nye modellen klarer på egen hånd.
  3. Skriv ned når agenten din får avbryte deg og hvilke avgjørelser den kan ta alene. Legg filen ved siden av AGENTS.md.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter