Hopp til hovedinnhold
Tilbake

Gruber: Claudes vannmerke velger dårligere ord med vilje

KI Takeaway KI-generert · kan inneholde feil

Regn med at all Claude-tekst over 200 tokener får ordvalgene vridd, og at bare Anthropic sitter på nøkkelen som leser merket.

200 tokener, rundt 150 ord, er terskelen. Over den lengden vil alle nye Claude-modeller gjøre tokenvalg som Anthropic senere kan kjenne igjen, og John Gruber i Daring Fireball kaller grepet en fordervelse av det å skrive. Han innrømmer at han opprinnelig gjettet på skjulte, ikke-synlige Unicode-tegn, fordi han tok Anthropics egen formulering om et «umerkelig» vannmerke bokstavelig.

Mekanismen er steganografi. Ved hvert tokenvalg sorteres ordkandidatene deterministisk i en grønn og en rød liste, og modellen gjøres litt mer tilbøyelig til å velge fra den grønne. Sorteringen styres av en hemmelig nøkkel, så det finnes ingen fast liste over ord Claude foretrekker. Jo lengre teksten er, desto sikrere blir analysen, på samme måte som flere myntkast avslører en skjev mynt. Anthropic skriver selv at dyttet ikke brukes der det finnes ett åpenbart riktig neste token, og at kode derfor får mindre vannmerking enn prosa, med unntak av kommentarer.

«Mitt grunnleggende problem med dette er at ingen to synonymer bærer nøyaktig samme betydning.» — John Gruber, Daring Fireball

Gruber går også løs på kvalitetsdokumentasjonen. Google DeepMind målte tommel opp og tommel ned på rundt 20 millioner Gemini-svar og fant forskjeller på 0,01 og 0,02 prosentpoeng mellom vannmerket og umerket modell. Gruber mener det bare viser at forringelsen ikke er stor nok til at folk klikker tommel ned. James Padolsey, som står bak den interaktive forklaringen Gruber viser til, skriver at Anthropic har valgt en implementasjon på modellnivå som er bredere enn lovens minstekrav, og som derfor rammer ufarlig og assisterende bruk hardere enn bevisst juks.

Bakgrunnen er EUs Code of Practice on Transparency of AI-Generated Content, som Anthropic og rundt 190 andre signerte i juli 2026. Anthropic oppgir at vannmerkingen rulles ut globalt fordi selskapet ennå ikke har en holdbar måte å avgrense den til én region på.

Hva bør du gjøre?

  1. Ikke bruk Claude til korrektur av tekst du senere må kunne forsvare som ditt eget arbeid. Anthropic skriver selv at jo mer modellen redigerer, desto mer plass får merket.
  2. Regn med at kode i praksis påvirkes lite, men at kommentarene i den kan bære merket.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter