Hopp til hovedinnhold
Tilbake
Llm 2 min · Kilde: The Decoder

KAIST: resonneringsstegene har egne mønstre i modellens mellomlag

KI Takeaway KI-generert · kan inneholde feil

Viser en ny studie fra KAIST og Naver AI Lab at åtte typer resonneringssteg lar seg skille fra hverandre i modellens interne representasjoner, sterkest i mellomlagene.

Når en resonneringsmodell løser en oppgave steg for steg, gjør den ulike ting underveis: leser data, bryter ned problemet, henter fram en formel, regner. Spørsmålet forskere ved sørkoreanske KAIST og Naver AI Lab stilte, var om de stegene også lar seg skille fra hverandre inne i modellens tallrepresentasjoner. Det gjør de, skriver The Decoder om studien.

Teamet definerte åtte tilbakevendende resonneringsoperasjoner, blant annet uttrekking, nedbryting, formelhenting, deduksjon og beregning. Tre modeller, Qwen2.5-7B, Qwen3-8B og Gemma4-31B, løste matematikkoppgaver, løsningsstiene ble delt i segmenter, og GPT-5 merket hvert segment med en av operasjonene.

Tre funn peker i samme retning:

  1. Operasjonene lar seg skille fra hverandre i alle tre modellene, og separasjonen topper seg i mellomlagene. En klassifiserer som bare så på hvilke tokens som ble brukt, gjorde det dårligere enn en som leste de interne representasjonene.
  2. Vanlige funksjonsord som «a», «is» og «the» har sammenblandede representasjoner i de tidlige lagene, men skiller lag etter hvilken operasjon de tilhører i midtre og senere lag. Samme ord får altså ulik intern representasjon avhengig av hvilket resonneringssteg det står i.
  3. Stegene oppstår ikke isolert. Da forskerne blokkerte oppmerksomheten mot de foregående 30 tokenene, ble signalet for operasjonen svakere.

Typen steg holdt seg identifiserbar også når modellen svarte feil: et mislykket regnesteg så fortsatt ut som et regnesteg innvendig. Resultatet gjentok seg med Llama-3-8B, og for Qwen3-8B overførte de trente klassifisererne seg til GPQA-Diamond og MATH-500.

Forbeholdene er reelle. Eksperimentene dekker bare matematikkoppgaver og en håndfull modeller, og om funnene kan brukes til å fange feil eller styre en modell midt i genereringen er et åpent spørsmål. Relevansen ligger et annet sted: å lese tankerekken er et av de få tilsynsverktøyene som finnes, og Anthropic har vist at modeller bare oppgir hintene de faktisk brukte i 25 til 39 prosent av tilfellene.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter