Hopp til hovedinnhold
Tilbake
Verktøy 2 min · Kilde: Release notes from ollama

Ollama slår av Claude Codes token-nedtelling fordi den brøt KV-cachen hver gang

KI Takeaway KI-generert · kan inneholde feil

Slår av nedtellingen Claude Code sender etter hvert verktøykall, som veltet Ollamas KV-cache på hver eneste forespørsel.

Ollama la ut v0.33.0-rc3 med en rettelse som er verdt å forstå selv om du aldri oppgraderer: to systemer som hver for seg gjorde noe fornuftig, ødela cachen når de møttes. Claude Code legger inn en systemmelding om hvor mange tokens du har igjen etter hvert verktøyresultat. Ollama flytter systemmeldinger fremst i prompten. Resultatet er at prefikset endret seg for hver tur, og KV-cachen kunne aldri gjenbrukes.

«Claude Code legger til en systemmelding om gjenværende tokens etter hvert verktøyresultat. Siden Ollama flytter systemmeldinger fremst i prompten, ødelegger dette KV-cachen på hver forespørsel.» - beskrivelsen av PR 17918 i ollama/ollama

Konsekvensen er den samme som når prompt-caching ikke er slått på i det hele tatt: hver tur betaler full pris i prefill. På en agent-økt der konteksten vokser mot titusenvis av tokens, og der Claude Code kaller verktøy titt og ofte, er det forskjellen mellom å vente et sekund og å vente et minutt. Fiksen selv er to linjer fordelt på to filer, flettet inn 22. august.

Verdt å merke seg at feilen ikke lå i Claude Code. Nedtellingen er nyttig informasjon, og å legge den etter verktøyresultatet er riktig plassering. Det er Ollamas omstokking av systemmeldinger som gjør plasseringen dyr, og det er derfor rettelsen ligger i Ollama og ikke hos Anthropic. Kjører du et annet oppsett som injiserer systemmeldinger midt i en samtale mot Ollama, har du sannsynligvis samme problem uten å vite om det.

Resten av rc3 er mindre dramatisk. Starteren for DeepSeek faller nå tilbake til npx når global npm-installasjon feiler, og en pakkefeil som antok macOS og dermed brakk standardbygg for Linux og Windows er rettet.

Hva bør du gjøre?

  1. Kjører du Claude Code mot lokale Ollama-modeller: mål tid til første token på tur fem eller ti i en økt med verktøykall, før og etter oppgradering. Det er der gevinsten synes.
  2. Behold 0.32.15 i produksjon inntil videre. Dette er fortsatt en release candidate.
  3. Sjekk dine egne mellomlag. Injiserer proxyen eller agent-rammeverket ditt en systemmelding per tur mot Ollama, betaler du samme pris uavhengig av denne rettelsen.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter