Ettertrening, ikke treningsdata, gjør KI-tekst mulig å oppdage
Legg merke til at det er ettertreningen, ikke treningsdataene, som gir språkmodeller en gjenkjennelig stemme.
«Hvert eneste tekstmønster i en språkmodell er til syvende og sist et produkt av menneskelig tekstproduksjon. Selve naturen til en språkmodell er å modellere menneskelig tekst basert på menneskelig tekst» — Freddie DeBoer, sitert av Bradley Emi
Fra det trekker DeBoer konklusjonen at en KI-detektor med svært lav rate av falske positiver er umulig å bygge. Bradley Emi, medgrunnlegger og teknisk sjef i deteksjonsselskapet Pangram, godtar premisset og avviser konklusjonen. I et essay publisert 20. august argumenterer han for at moderne språkmodeller trenes til langt mer enn å treffe fordelingen av menneskelig tekst, og at det er stegene etter pre-treningen som gjør dem gjenkjennelige.
Han sporer det tilbake til InstructGPT i mars 2022, der OpenAI viste at en basmodell kunne formes til en instruksjonsfølgende assistent gjennom menneskelige eksempler, en belønningsmodell og trening mot den belønningen. Prisen er innsnevring. Ettertrening gir det som kalles flate logits, der modellen deterministisk velger ett bestemt neste ord i stedet for å fordele sannsynligheten over flere måter å si det samme på. Resultatet er mode collapse: modellen slutter å produsere et rikt utvalg av uttrykk og gjentar de samme få valgene.
Emi viser til artikkelen «Creativity has Left the Chat» fra 2024, som sammenlignet instruct- og basversjonen av Metas Llama 2 og fant vesentlig mindre semantisk og stilistisk variasjon hos instruct-modellen. Da den skulle finne på figurer til historier, valgte den konsekvent samme alder, nasjonalitet og personlighetstype, og ga dem til og med de samme navnene.
Innsnevringen kommer altså fra ettertreningen, ikke fra råmaterialet. Basmodellene har aldri vært gjennom den, og Emi bruker dem som sitt eget motbevis: det finnes allerede språkmodeller som er nokså varierte, og det er nettopp basmodellene. Effekten forsterker seg selv i tillegg. Emi anslår at over en tredjedel av nye internettartikler var KI-genererte allerede sent i 2024, og at nyere modeller derfor arver personligheten til eldre modeller på tvers av selskaper. Det spekuleres bredt i at kinesiske labber destillerer fra amerikanske frontmodeller som Claude ved å trene på output derfra, og at modellene deres får en Claude-aktig personlighet av det.
Emi tror mode collapse kan løses teknisk, men at ettertrening som paradigme ikke går noe sted: labbene har preferanser for hvordan modellene skal oppføre seg, og de preferansene setter spor. Bygger du noe der output skal passere som menneskeskrevet, er det ettertreningen du kjemper mot, ikke råmaterialet. Vil du ha variasjonen tilbake, ligger den i basmodellene.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.