Hopp til hovedinnhold
Tilbake
Forskning 3 min · Kilde: The Decoder

Én setning om turgåing løftet Garmin-valget 75 prosentpoeng

KI Takeaway KI-generert · kan inneholde feil

Regn med at en KI-handleagent gir deg ulikt svar på samme spørsmål, for både kilderekkefølge og en enkelt minnesetning flyttet valget kraftig i en ny Wharton-studie.

En smartklokke med Alexa til 29,99 dollar, 5,0 av 5,0 i vurdering og 430 anmeldelser, mot et felt der alt annet kostet minst 359 dollar og hadde færre anmeldelser. Rutenettet var rigget slik at ett produkt var objektivt best på hver målbare dimensjon. Så la forskerne ved Wharton School på University of Pennsylvania inn korte minnesetninger av typen «Jeg elsker å gå på tur», og flere av modellene forlot det beste kjøpet, skriver The Decoder.

Studien testet seks modeller, både mini-varianter og frontier-modeller, i rollen som personlig handleassistent som skulle velge en treningsklokke. Verktøyet er ACES, en simulator for agentisk netthandel som viser agenten et skjermbilde av en produktside. Agenten analyserer bildet, henter eventuelt inn anbefalingskilder, og velger. Fire eksperimenter, fire måter å velte valget på:

  1. Én Wirecutter-anmeldelse av Fitbit Inspire 3 løftet sannsynligheten for å velge nettopp den klokken med 90 prosentpoeng for Claude Opus 4.8 og 99 prosentpoeng for Gemini 3.5 Flash, målt mot kontrollbetingelsen. En Reddit-tråd om Garmin Forerunner 55 og en Strategist-artikkel om WHOOP 5.0 dro svakere.
  2. To eller tre kilder samtidig jevnet ikke ut effekten. Wirecutter dominerte som regel når den var med i blandingen, og flere kilder ga mer variasjon, ikke mindre.
  3. De samme tre kildene i ulik rekkefølge fikk Gemini 3.1 Flash Lite til å svinge mellom 2 og 56 prosentpoeng over kontrollen, mens Claude Haiku 4.5 lå stabilt på 41 til 42. Om kildene kom samlet eller én om gangen betydde like mye: GPT-5.5 valgte Fitbit Inspire 3 i 53 prosentpoeng flere tilfeller ved samlet levering, mot 6 ved sekvensiell.
  4. Turgåing-setningen løftet valgraten for Garmin Vivoactive 5 med 75 prosentpoeng for Claude Opus 4.8, 37 for GPT-5.5 og 36 for Gemini 3.1 Flash Lite. Gemini 3.5 Flash var mest motstandsdyktig og traff det objektivt beste produktet i 86 til 92 prosent av kjøringene uansett.

GPT-5 Mini oppførte seg omvendt av det ventede. Den positive turgåing-setningen ga ingen signifikant dreining mot Garmin, mens den negative varianten «Jeg liker ikke å gå på tur» løftet Fitbit Versa 4.

For deg som bygger er poenget mindre at agentene handler dårlig, og mer at de ikke er determinerte. To brukere med samme spørsmål, eller samme bruker på en annen dag, kan få ulike anbefalinger uten synlig grunn, og skal du selge inn i den trafikken vet du hverken hvilken modell som handler, hva den leste på forhånd, eller hvordan oppsettet mater den informasjonen.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter