Digitale tvillinger av 1 000 amerikanere treffer 85 prosent
Viser at digitale tvillinger bygget på to timers intervju gjengir folks svar 85 prosent så treffsikkert som folk gjengir sine egne.
1 000 representativt utvalgte amerikanere satt to timer hver i et virtuelt laboratorium og fortalte livshistorien sin, etter et intervjuskript hentet fra American Voices Project. Ut av det bygget forskerne én digital tvilling per person. Det er grunnlaget Joon Sung Park, medgrunnlegger og daglig leder i Simile, går gjennom i en samtale med Latent.Space.
Tallet alle siterer er 85 prosent, men det måler noe mer presist enn det høres ut som. Tvillingene gjenga deltakernes holdninger og atferd 85 prosent så treffsikkert som deltakerne selv gjorde da de svarte på de samme spørsmålene på nytt. Fasiten er altså ikke en objektiv sannhet om personen, men hvor konsistent et menneske er med seg selv.
«Hovedtallet er 85 prosent treffsikkerhet, noe som er en stor forbedring over alle de andre metodene du viste.» - swyx, Latent.Space
Kontrasten til å bare spørre en toppmodell er hele poenget.
«Ytelsen til frontier-modellene går helt ned til 20, 30 prosent, særlig hvis du går inn i den smalere befolkningen på temaer kundene våre bryr seg om. På mer generell befolkning kan det ligge rundt 50 til 60 prosent. Det er ikke særlig robust. Du ville ikke tatt beslutningene dine på grunnlag av de funnene.» - Joon Sung Park, medgrunnlegger og daglig leder i Simile
Park mener årsaken ligger i hva modellene trenes for. Frontier-labbene kjøper data fra leverandører som Mercor og Scale, snakker med profesjonelle programmerere og forskere, og optimaliserer for resonnering. Simile trener for det motsatte: mennesker som gjør ting som ikke er rasjonelle. Han bruker sin egen gåtur hjem fra Stanford som eksempel, rundt 40 minutter til Palo Alto. Modellen ville bestilt Uber eller slått opp busstidene. Park gikk fordi turen hjalp ham å tenke.
Datagrunnlaget deles i tre. Intervjuene gir tekstur, ned til barndomsminner og første kjærlighet. Transaksjons- og observasjonsdata viser hva folk faktisk gjør, ikke hva de sier på nett. Den tredje bunken mener Park er viktigst: randomiserte kontrollerte forsøk hentet fra Open Science Framework, som beskriver årsaksmekanismene bak valg. Det datasettet finnes bare fordi samfunnsvitenskapen har brukt de siste årene på å forhåndsregistrere studier etter replikasjonskrisen. Simile trener alltid to modeller på dette, én på befolkningsnivå og én på individnivå.
«Det vi ser er det tidlige glimtet av en skaleringslov i simulering. Jo mer data om mennesker og jo mer regnekraft du tar inn, jo mer forutsigbare gevinster får du i hvor godt modellen simulerer folk.» - Joon Sung Park
Bakgrunn
Park står bak Smallville, artikkelen om generative agenter fra 2023 der KI-karakterer husket, planla, sosialiserte og utviklet atferd ingen hadde programmert inn. Simile er forsøket på å gjøre det om til grunnmodeller for menneskelig atferd, med GreenOaks og Index Ventures på eiersiden og Fei-Fei Li og Andrej Karpathy blant investorene. I dag opererer selskapet på titusener til hundretusener av simulerte personer. Ambisjonen Park beskriver er alle 8 milliarder mennesker på jorda.
For deg som lager syntetiske persona ved å prompte en toppmodell med yrke, alder og personlighetstrekk, er Parks innvending kort og ubehagelig: da henter du bare ut kunnskapen som allerede ligger i modellparametrene.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.