Output koster fem ganger så mye som input i Claude Code, cache-lesing en tiendedel
Rydd konteksten mellom oppgaver, for alt som havner i samtalen sendes på nytt hver eneste tur resten av økten.
Fem ganger. Det er omtrent forholdet mellom prisen på en output-token og en input-token i Claude Code, skriver Anthropic i et nytt blogginnlegg om hvordan økter bør kjøres. Årsaken ligger i maskinvaren: dekoding skriver én token av gangen, så et svar på 200 tokener er 200 gjennomkjøringer av modellen etter hverandre, mens prefill leser hele forespørselen i én omgang.
Motvekten er prompt-cachen. Tokener som leses fra cachen koster 0,1 ganger inputprisen, fordi serveren laster ferdig tilstand i stedet for å regne den ut på nytt. Å skrive til cachen koster litt mer enn vanlig input, opptil det dobbelte, men skrivingen skjer én gang per token mens lesingene skjer på hver tur etterpå.
Cachen må matche fra starten av forespørselen og framover, og rekkefølgen er alltid den samme: verktøydefinisjoner, systemprompt, deretter samtalen med CLAUDE.md fremst. Bytter du /model eller /effort midt i en samtale, prefilles alt på nytt til full pris, fordi hver modell har sin egen cache og effort-nivået inngår i cache-nøkkelen. Det samme gjelder opusplan, som veksler modell hver gang du går inn og ut av plan-modus.
«En lang økt koster mer enn det samme arbeidet fordelt over noen korte, og mer enn du skulle tro, fordi tur 40 også leser om igjen de 39 turene før den.» — Anthropic, i blogginnlegget om Claude Code-økter
Den andre kostnadsdriveren er hva som fyller konteksten. Bash-output over 30 000 tegn skrives til fil, og bare en kort forhåndsvisning og filstien havner i samtalen. Problemet er alt som ligger under grensen: en testkjører som skriver 400 linjer, én per test, havner i sin helhet i hver eneste gjenværende tur.
Hva bør du gjøre?
- Kjør /context i en fersk økt for å se hva som lastes før du har skrevet noe, og slå av MCP-servere du ikke trenger i denne økten med /mcp.
- @-nevn filer i stedet for å skrive stien. Filen legges ved meldingen din før noe sendes, så du sparer et helt Read-kall, og du trenger bare nevne den én gang per samtale.
- Bruk /rewind når de siste turene gikk feil vei. Den kutter bare turene av enden og lar resten ligge i cachen, mens /compact skriver om hele samtalen og alltid koster noe.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.