Hopp til hovedinnhold

Onsdag 7. oktober

 Tilbake Anthropic 2 min 22.11

Anonym blindtest av Claude Opus 4.6 mot 4.7: brukerne velger 4.7, men tokenforbruket vekker debatt

søndag 19. april · KI-generert · Kilde: Hacker News

Innholdet er KI-generert og kan inneholde feil. Sjekk originalkilden.

Resultatene på tokens.billchambers.me peker i retning av at Opus 4.7 foretrekkes i blindtester, men HN-kommentarene hevder 4.7 bruker rundt 45 prosent flere tokens på samme oppgave, som endrer regnestykket.

Eksperimentet er enkelt bygget: brukeren sender samme prompt til begge modellene, får to anonyme svar, og stemmer på det beste. Dataene er åpne og lagrer kun anonyme innsendings-ID-er, ifølge Chambers. Tråden på Hacker News (594 poeng, 557 kommentarer) gir et bredere praktisk perspektiv enn rangeringen alene, og kommentarfeltet er der de nyttige innsiktene ligger.

«Jeg ville forstå effekten av tokenizer-endringen fra 4.6 til 4.7. Jeg er overrasket over at det er 45 prosent. Det kan gå ned med lengre kontekst, men det er fortsatt overraskende. Det kan være mer enn 2x for korte prompts.» — anabranch, øverste kommentar på HN

Tokenforbruket er det praktiske poenget for deg som betaler per token. Hvis samme svar koster 45 prosent mer i 4.7 enn i 4.6, må kvalitetsforbedringen være minst tilsvarende før byttet lønner seg rent økonomisk. Blind preferanse på en leaderboard fanger ikke opp dette, og det er verdt å lese kommentarer som justindotdev sine før du oppgraderer standard-modellen i produksjonskode.

På den andre siden fra Anthropic: Boris fra Claude Code-teamet svarer i tråden at eldre Claude Code-versjoner trigget ekstra cybersecurity-advarsler i 4.7 fordi modellen var finjustert til å ikke lenger trenge de påminnelsene. Løsningen er å kjøre claude update for å oppdatere klienten. Det er verdt å vite hvis du har sett «safety»-nekt i 4.7 som ikke ga mening.

Nøkkeltall
594 poeng
sakens score på Hacker News før publisering
557 kommentarer
antall diskusjonsinnlegg, et uvanlig høyt forhold som peker på bred uenighet
45 prosent flere tokens
omtrentlig forskjell i output-lengde som HN-brukere rapporterer mellom 4.6 og 4.7 på samme prompt

Hva bør du gjøre?

  1. Kjør din egen blindtest på promptene dine som faktisk koster penger. Send 10 reelle prompts til begge modeller via API og sammenlign både kvalitet og faktisk token-forbruk.
  2. Oppdater Claude Code med claude update hvis du har sett rare sikkerhetsnekt i 4.7. Det løser Boris fra Anthropic-teamet bekrefter stammer fra utdaterte klient-prompts.
  3. Ikke bytt standard-modell i produksjonskode basert på leaderboard-stemmer alene. Mål kostnad per løste oppgave, ikke kostnad per token eller preferanse per svar.

Pulsen · norske KI-nyheter for deg som bygger. Sakene er KI-generert fra originalkilden, som alltid lenkes.