claude-thermos holder promptcachen varm mens subagentene jobber
Holder promptcachen i Claude Code i live mens en subagent jobber, slik at hovedagenten slipper å re-kode hele historikken når den våkner.
Rundt 22 prosent av regningen gikk til å re-kode innhold som allerede lå i cachen. Det er tallet utvikleren Iaroslav Zeigerman oppgir etter å ha målt cirka 185 lokale Claude Code-økter, og det er begrunnelsen for verktøyet claude-thermos.
Mekanismen er verdt å forstå selv om du ikke tar i bruk verktøyet. Claude Codes promptcache har fem minutters levetid, og hele samtalehistorikken serveres derfra til en tidel av full inn-pris så lenge cachen lever. Den vanligste grunnen til at det går mer enn fem minutter mellom to kall er ikke at du tenker: det er at hovedagenten står og venter på en subagent. Subagenten har egen systemprompt og eget verktøysett, altså et annet cache-prefiks, så trafikken dens friskner aldri opp hovedagentens cache. Når subagenten er ferdig, møter hovedagenten en tom cache og må skrive hele historikken på nytt til 1,25 ganger prisen. På det tidspunktet er historikken stor, og enkeltkollapser oppgis å skrive om mellom 200 000 og 500 000 tokens.
Løsningen er en lokal reversproxy: verktøyet peker ANTHROPIC_BASE_URL mot en loopback-port, følger med på trafikken og grupperer den i cache-linjer. Når hovedlinjen står stille mens en subagent kjører, sender den hovedagentens siste ekte forespørsel på nytt med «max_tokens: 1». Det ene tokenet kastes. Poenget er prefill-en, som leser og fornyer prefikset. Standardverdiene ligger på 270 sekunder for både ventetid og intervall, godt under grensen på fem minutter.
Regnestykket er utviklerens eget, målt på egne økter, og både innsparing og cache-oppførsel avhenger av hvor lange subagentkjøringene dine faktisk er.
Hva bør du gjøre?
- Sjekk premisset før verktøyet. Tar subagentene dine under fem minutter, finnes ikke problemet hos deg.
- Kjør «uvx claude-thermos» i stedet for «claude» i en økt, og les summary.json i ~/.claude-thermos/logs. Der står warm_cost mot rewrite_avoided_cost, så du ser netto for dine egne økter.
- Ta stilling til proxyen bevisst. All API-trafikk går gjennom en lokal port du selv må stole på, selv om varmekallene sendes utenom.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.