Simon Willisons ttok 1.0 bytter standard-tokenizer fra GPT-4 til GPT-5 og GPT-6
fredag 9. oktober · KI-generert · Kilde: Simon Willison's Weblog
Oppdater ttok til 1.0 hvis du budsjetterer prompter for GPT-5 eller GPT-6, for standard-tokenizeren er byttet fra GPT-4s cl100k_base til o200k_base.
Simon Willison slapp ttok 1.0 natt til 9. oktober, omtrent én time etter versjon 0.4, viser GitHub-releasene. ttok er et lite kommandolinjeverktøy som teller og kutter tekst etter antall tokens, bygget på OpenAIs open source-bibliotek tiktoken. Etter å ha oppgradert oppdaget Willison, ifølge bloggposten, at 0.4 fortsatt brukte GPT-4-tokenizeren som standard. Et bytte av standard er en «breaking change», så han hoppet rett til 1.0 i stedet for 0.5.
Konsekvensen er konkret: token-tall, kutt med -t og token-ID-er fra --encode kan bli annerledes enn før, ifølge README-en. Trenger du de gamle cl100k_base-tallene, legger du til --model gpt-3.5-turbo. Versjon 1.0 utvider også --list-models til å vise hvordan prefikser som gpt-5* håndteres av tiktoken. Endringene fra 0.4 er også med: blant annet virker --allow-special nå ved telling, slik at files-to-prompt . | ttok --allow-special går gjennom, og verktøyet krever Python 3.10 eller nyere.
Det finnes et forbehold. OpenAI har ikke bekreftet at GPT-6 bruker samme tokenizer som GPT-5-familien, og et åpent issue i tiktoken-repoet fra 24. september klager på at versjon 0.14.0 ikke støtter GPT-6-modellene. Willison lener seg i stedet på en måling fra William Liu:
«All seven GPT models (5.5, 5.6 Sol/Terra/Luna, 6 Astra/Sol/Luna) report 44,794 tokens and match each other on every one of the 31 fixtures.» — William Liu, i commit-meldingen Willison siterer
Samme kjøring, datert 26. september, viser hvor lite tallet sier om andre leverandører. Claude Opus 5.5 talte 68 940 tokens på de samme 31 testfilene, 53,9 prosent mer enn GPT-modellene. ttok måler bare OpenAI-tokenizere.
Hva bør du gjøre?
- Kjør
uv tool upgrade ttok, eller test uten installasjon medcat fil.txt | uvx ttok. - Gå gjennom skript som lagrer token-tall eller kutter med
-t, og legg til--model gpt-3.5-turboder du må beholde de gamle tallene. - Bruk ikke ttok-tallet som budsjett for Claude, siden samme tekst ga rundt 54 prosent flere tokens hos Opus 5.5 i Lius måling.