TutorMoments måler når KI-lærere bør holde igjen: 462 ekte samtaler
Slipper Ai2 et datasett og en evalueringspipeline som måler om språkmodeller vet når de skal hjelpe en elev og når de skal holde igjen.
462 avidentifiserte transkripsjoner fra ekte en-til-en-matematikkundervisning er grunnlaget for TutorMoments, en forhåndsversjon Ai2 presenterer på Hugging Face. Erfarne matematikklærere har gått gjennom samtalene og markert over 1 500 nøkkeløyeblikk der læreren måtte velge mellom å gjøre oppgaven lettere å komme i gang med, og å presse eleven til å gjøre mer av tenkningen selv. 27 amerikanske lærere står bak annoteringene, og elevene går i andre til sjuende klasse.
Evalueringen fungerer som en reprise. Transkripsjonen stoppes ved et slikt øyeblikk, en språkmodell overtar som lærer i fem replikker, og eleven spilles av en annen modell. En scoringspipeline vurderer så om modellen ga støtte når eleven trengte det, presset når eleven var klar for mer, og unngikk å senke vanskegraden mer enn øyeblikket krevde.
Funnet som betyr noe utenfor undervisning handler om prompten. Sju modeller ble kjørt med to varianter: en enkel som bare ber modellen undervise godt, og en som staver ut avveiningen eksplisitt. Alle sju scoret høyere med den eksplisitte prompten. Modellenes standardoppførsel som hjelpsom assistent er altså ikke nok i seg selv, og forskjellen mellom modellene i hvordan de tolker den utvidede instruksen er stor.
«Godt undervisningsarbeid er ikke én fast oppførsel du kan kjenne igjen på tvers. Det er en skjønnsvurdering» — Ai2
Tallene bør leses forsiktig. Menneskelige lærere scoret 0,458 på passende støtte og 0,182 på passende press, målt på samme måte og i samme øyeblikk som modellene. Ai2 er selv tydelig på at dette ikke betyr at KI underviser bedre enn lærere: annotørene lette spesifikt etter øyeblikk der undervisningen kunne gått bedre, så datasettet består av tapte muligheter framfor mønsterpraksis. Eleven i reprisene er dessuten simulert, så tallene måler oppførsel, ikke læring. Deteksjonen av press er også mer støyete enn deteksjonen av støtte, med 260 slike øyeblikk mot 738.
Ai2 slipper datasettet, koden for repriser og modellenes egne repriser. Bygger du noe der modellen skal veilede framfor å levere svaret, er det en ferdig målestokk for en oppførsel som ellers er vanskelig å teste.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.