Hopp til hovedinnhold
Tilbake
Forskning 2 min · Kilde: MIT Technology Review

KI-modeller løser Connections nesten feilfritt, men bommer på mental rotasjon

KI Takeaway KI-generert · kan inneholde feil

Går fra 18 prosent til nesten feilfritt på ordgåter, men svikter fortsatt på romlig resonnering og abstrakte mønstre.

Sent i 2024 klarte de beste modellene bare 18 prosent av New York Times-gåten Connections, ifølge et forskerteam ved Columbia University. Tidlig i 2025 løste flere av dem den nærmest perfekt hver gang. De samme modellene feiler fremdeles stygt på mental rotasjon, oppgaven der du skal avgjøre om to bilder viser det samme objektet sett fra ulike vinkler, skriver MIT Technology Review.

MIT Technology Review har satt sammen sju testtyper som hver peker på en konkret forskjell mellom maskin- og menneskekognisjon. Mønsteret er at modellene taper der oppgaven krever at de snur noe romlig eller utleder en regel visuelt, og vinner der den belønner hukommelse.

Fire av funnene sier noe om hvor grensen faktisk går:

  1. Mental rotasjon er den tydeligste svakheten. Språkmodeller analyserer visuelle inndata, men manipulerer ikke 3D-objekter slik arkitekter og maskiningeniører gjør.
  2. Memorerte varianter feller dem. I en studie fra 2024 trente og testet forskere ved Google og University of Illinois Urbana-Champaign modeller på små variasjoner av gåtetypen Knights and Knaves. Ligner oppgaven på noe modellen så under trening, svarer den med det den husker og glir forbi forskjellen. Samme mekanisme rammer testsettet SimpleBench.
  3. ARC-AGI går bedre når rutenettet leveres som en tallstreng som koder fargen i hver celle, enn som bilde. Selv når svaret blir riktig, viser forskning at modellene kommer dit via kronglete regler som ikke generaliserer, mens mennesker bruker enkle visuelle begreper.
  4. Skala avgjør. En studie fra Apple fant at modeller løser enkle utgaver av Tower of Hanoi og elvekryssing greit, men begynner å svikte når antallet skiver eller personer passerer seks. Forskere ved University of Washington, Stanford University og Allen Institute for AI fant det samme i logikkrutenett.

Testene går også andre veien. Psykologer har laget oppgavesett der mennesker svarer refleksivt og bommer, mens modellene resonnerer seg fram til riktig svar.

Apple-studien gikk viralt, men kommentatorer stilte spørsmål ved om resultatet viser en egen begrensning ved språkmodeller, eller bare at feil hoper seg opp når kompleksiteten øker. For deg som bygger ligger verdien i å vite hvilken feilmodus hvert testsett faktisk måler, før du velger benchmark for din egen modell.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter