Vannmerket i Claude-tekst sitter i sampling-steget, ikke i modellen
Bytter ut kilden til tilfeldighet i Claudes ordvalg med en hemmelig nøkkel, uten at modellen trenes på nytt.
«Vannmerkingen er ikke noe annet for sluttbrukeren enn å låse en tilfeldig frøverdi og gjøre samplingen deterministisk», sier Sebastian Raschka i en gjennomgang av mekanismen bak Claudes tekstvannmerke. Raschka, forfatteren bak «Build a Large Language Model From Scratch», planla ti lysbilder og ti minutter da han skulle forklare det. Det endte med over 50 lysbilder og 48 minutter video.
Kjernen er hvor vannmerket ligger. En språkmodell regner ut en score for hvert mulige neste token og trekker så ett av dem tilfeldig. Vannmerket griper inn nøyaktig der, i sampling-steget utenfor selve modellen. Anthropic slipper dermed å trene noe på nytt for å slå det på.
Trekningen styres av en hemmelig nøkkel kombinert med de nærmeste foregående ordene. I stedet for vanlig tilfeldig trekning brukes turneringssampling, en teknikk fra SynthID-Text som Google publiserte i Nature. Hvert kandidatord får en signatur av nuller og enere fra et sett tilfeldige vannmerkefunksjoner. Raschka bruker tre funksjoner i eksempelet sitt og anslår at et reelt oppsett har 30, 50 eller flere. Ordene settes opp mot hverandre parvis, som i en cupturnering, og signaturbitene avgjør hvem som går videre. Står det likt, avgjør nøkkelen.
Teksten varierer altså fortsatt, men på en måte som er reproduserbar for den som har nøkkelen. Deteksjonen blir dermed asymmetrisk:
«Det er umulig å vite. For å vite det trenger du vannmerkenøkkelen» — Sebastian Raschka, om å sjekke en tilfeldig tekst du finner på nettet
Anthropic skriver i sin egen forklaring at et deteksjons-API er under arbeid, og at vannmerkingen innføres for å oppfylle EU-forordningen om KI. Samme sted står det at vannmerket er tynnere i kode og i faktatunge avsnitt, der ordvalget er låst av at svaret må være riktig.
Å fjerne vannmerket er mulig, men blindt. Posisjonene det sitter i er usynlige for den som ikke har generert teksten, så du må endre nok ord til å treffe nok av dem. Lett korrekturbearbeiding holder neppe, en full omskriving gjør det.
Hva bør du gjøre?
- Regn med at lengre Claude-tekster bærer et vannmerke, og at korte utdrag gir for lite signal til at det kan leses ut.
- Ikke bygg egen deteksjon på gjetting om ordvalg. Uten nøkkelen er scoringen ikke mulig, og kommersielle KI-detektorer bruker en helt annen metode.
- Behandle et treff som et sannsynlighetsutsagn om at Claude var involvert, ikke som bevis på hvem som skrev hva.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.