Elevkopier trent på Qwen3-4B slår GPT-5.4 som testelev for KI-lærere
Microsoft og University of Illinois har bygd StudentSim, som lager en digital kopi av hver enkelt elev fra en håndfull besvarelser og lar KI-lærere øve mot kopien i stedet for mot ekte elever.
«uoverkommelig dyrt og tidkrevende» > — forskerne bak StudentSim, om å trene en KI-lærer mot en stor og variert gruppe ekte elever
En KI-lærer blir først god når den tilpasser seg den enkelte, og å finne ut hvilken veiledning som virker for hvem krever ekte elever, tid og penger. StudentSim gjør to krav målbare samtidig: kopien skal treffe elevens svar inkludert de typiske feilene, og den skal faktisk revidere svaret når læreren gir et hint. Eksisterende metoder klarer bare det ene.
Datamangelen er den største hindringen. I datasettet for engelsk skriving har medianeleven levert tre stiler, og over to tredjedeler har levert fem eller færre. Trener du en kopi direkte på så få eksempler, overtilpasser modellen seg dem. Løsningen er to trinn: en basismodell lærer først av samlede data fra alle elevene i faget, deretter tilpasses den til enkelteleven med de få journalene som finnes. Basismodellen er Alibabas Qwen3-4B-Instruct i alle fagene.
Metoden ble testet på 60 elever i sjakk, engelsk som fremmedspråk og matematikk. StudentSim slår den langt større GPT-5.4 i alle tre fag når GPT-5.4 blir bedt om å spille elev, og treffer spillerens neste sjakktrekk omtrent dobbelt så ofte. I én stilling valgte tre ekte spillere tre ulike trekk: StudentSim gjenskapte hver av dem, en spesialisert sjakkmodell spådde samme trekk for alle tre, og GPT-5.4 bommet på alle.
Effekten på selve læreren er poenget. Profesjonelle sjakkspillere vurderte tre versjoner av en sjakklærer, og den som var trent mot StudentSim scoret høyest på alle tre målene: færrest alvorlige faktafeil, best forklaringskvalitet og best tilpasning. Læreren trent mot GPT-5.4 i elevrollen scoret dårligere på faktapresisjon enn den som ikke fikk ekstra trening i det hele tatt.
Forskerne kaller dette et konseptbevis, og påpeker at sjakk er lett å måle fordi en motor kan dømme et trekk objektivt, mens stiler og åpen matematikk mangler tilsvarende skårfunksjoner. Den generelle lærdommen for deg som bygger agenter mot mennesker ligger i oppskriften: to-trinns finjustering med samlede data først og individuelle data etterpå er en billig vei rundt at du nesten aldri har nok data om én enkelt bruker. Koden ligger på GitHub.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.