LittleLearner ble trent på 88 milliarder tokener femteklassepensum
Se på LittleLearner som et kontrollert eksperiment der treningsdataens grense er kjent på forhånd, slik at man kan skille mellom ferdigheter som er lært og ferdigheter som bare hentes fram.
Moderne språkmodeller trenes på alt samtidig, og derfor er det nesten umulig å avgjøre om en ny ferdighet faktisk ble tilegnet eller bare framkalt av riktig prompt. Forskergruppen bak LittleLearner snudde på problemet og begrenset selve treningsfordelingen i stedet for å måle på utsiden. De bygde LittleCurriculum, et korpus på 88 milliarder tokener destillert fra FineWeb-Edu gjennom en femtrinns filtreringsprosess knyttet til Common Core-standardene for barnetrinnet. Begreper, fakta og vokabular som undervises over femte klasse er eksplisitt utelatt.
På det korpuset trente de modeller fra bunnen i tre størrelser, 0,6, 1,3 og 5 milliarder parametere, og for hver av dem en matchet kontrollmodell trent på ufiltrerte data med samme arkitektur, samme antall tokener og samme oppskrift. Det er sammenligningen som gjør oppsettet interessant: kontrollmodellen isolerer effekten av filteret alene.
Deretter prøvde de å presse modellene forbi pensum med tre standardgrep. Skalering av modellstørrelse. Ettertrening med SFT og GRPO, inkludert trening på data som lå utenfor pensum. Og in-context learning med eksempler i prompten. Alle tre løftet ytelsen innenfor pensum, og skalering strakk seg noe til oppgaver på samme læringsbane.
«Ingen av dem forbedrer ytelsen utenfor pensum nevneverdig, noe som tyder på at filteret i førtreningen setter det effektive kapasitetstaket» — LittleLearner-teamet
Funnene gjelder de oppsettene forskerne testet, og et 5-milliardersmodell er langt fra frontmodellene. Men retningen er verdt å ta med seg for deg som fintuner: hvis kapasitetstaket settes i førtreningen, er ettertrening et forsterkningsverktøy, ikke et utvidelsesverktøy. GRPO gjorde matematikkmodellene tydelig bedre på MathCAMPS innenfor pensum, og løftet dem ikke over grensen selv når treningsdataene lå på andre siden av den.
Modellene ligger ute som sjekkpunkter i alle tre størrelser, med base-, GRPO- og chat-varianter, og hver med sin matchede ufiltrerte kontroll. Den hostede 5-milliardersmodellen kan prates med direkte i nettleseren. Artikkelen er publisert på arXiv med Fanfei Li som førsteforfatter og Wieland Brendel som siste.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.