Claude Fable 5.1 kutter prisen på cache-treff med 75 prosent
Betal 0,25 dollar per million tokens for cache-treff på Claude Fable 5.1, en firedel av det samme kostet på Fable 5.
Anthropics prisdokumentasjon fører opp Claude Fable 5.1 og Claude Mythos 5.1 til 10 dollar per million inn-tokens, 50 dollar per million ut-tokens, 12,50 dollar for cache-skriving med fem minutters levetid og 20 dollar for én time. Alle disse tallene er identiske med Claude Fable 5. Den ene raden som er endret, er cache-treff og oppfriskninger: 0,25 dollar mot 1 dollar.
Kuttet er ikke en kampanje, men en endret regnemåte. Anthropic har gitt de to nye modellene en egen multiplikator som ingen andre Claude-modeller har.
«Cache hits and refreshes on Claude Fable 5.1 and Claude Mythos 5.1 are priced at 0.025x the base input price. All other models use the standard 0.1x multiplier.» — Anthropics prisdokumentasjon
Det er der pengene dine faktisk ligger hvis du kjører agenter. En lang kodeøkt sender den samme systemprompten, de samme filene og den samme historikken inn igjen ved hvert steg, og nesten alt av det leses fra cache. Med Fable 5 kostet den re-lesingen en tidel av inn-prisen. Nå koster den en firtiendedel.
Sammenligningen med Opus 5 er verdt et blikk, for den snur på hodet. Opus 5 er den billigere modellen per token, med 5 dollar inn og 25 dollar ut mot Fable 5.1 sine 10 og 50. Men på cache-treff er forholdet motsatt: Opus 5 ligger på 0,50 dollar, altså det dobbelte av Fable 5.1. Jo mer av arbeidsmengden din som er gjenlesing av en stor, stabil kontekst, jo mer spiser Fable 5.1 inn på prisforspranget til Opus 5.
Kuttet kommer ikke alene. Artificial Analysis, som måler modeller uavhengig, rapporterte etter lanseringen at Fable 5.1 bruker rundt 1,7 ganger så mange ut-tokens som Fable 5 på de samme oppgavene. Cache-kuttet sparer omtrent 1,40 dollar per oppgave i deres målinger, men den økte ut-token-bruken gjør at nettoregningen per oppgave likevel går opp med rundt 20 prosent. Rabatten er altså reell, men den treffer bare den delen av regningen som er gjenlesing.
En detalj til, som gjelder deg som må holde data innenfor et bestemt område: Anthropic tar betalt for datalokalitet.
«For Claude 4.6 and later models, using inference_geo: "us" applies a 1.1x pricing multiplier.» — Anthropics prisdokumentasjon
Standardverdien er «global», som gir ordinær pris.
Bakgrunn
Prompt caching lar deg merke deler av forespørselen som gjenbrukbar. Du betaler en forhøyet pris første gang innholdet skrives til cachen, og en kraftig redusert pris hver gang det leses derfra igjen. For korte, engangs kall betyr det lite. For agenter, lange samtaler og verktøytunge økter er cache-lesing ofte den største enkeltposten på fakturaen, fordi konteksten vokser og sendes på nytt for hvert eneste steg.
Hva bør du gjøre?
- Sjekk om du faktisk bruker prompt caching. Rabatten er verdiløs hvis systemprompten din ikke er merket som cachebar.
- Legg det stabile først i prompten. Cachen treffer på prefiks, så systemprompt og faste filer bør ligge foran det som endrer seg mellom kallene.
- Mål ut-tokens, ikke bare inn-tokens, når du sammenligner mot Fable 5. Det er der den nye modellen tar tilbake noe av det cachen ga deg.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.