Inkling-Small slår storebroren på koding, men husker dårligere
Slipper Thinking Machines Inkling-Small med åpne vekter, en modell på en fjerdedel av storebrorens størrelse som likevel slår den på koding og resonnering.
Der Inkling har 975 milliarder parametere totalt og 41 milliarder aktive, har Inkling-Small 276 milliarder totalt og 12 milliarder aktive. Likevel scorer den lille modellen 31,6 % på Humanity's Last Exam mot storebrorens 29,7 %, og 80,2 % på SWEBench Verified mot 77,6 %, skriver Thinking Machines i lanseringsnotatet.
Forklaringen ligger i rekkefølgen. Inkling-Small begynte treningen etter den større modellen, noe som lot selskapet justere både datamiksen før trening og selve oppskriften underveis. Et tidlig sjekkpunkt ble ettertrent med on-policy-destillasjon der Inkling var lærer, og derfra kjørte Thinking Machines to uker ekstra med forsterkningslæring på agentisk koding.
«Inkling-Small oppnår sammenlignbar ytelse med en fjerdedel av størrelsen» — Thinking Machines, lanseringsnotat
Prisen står i tabellen. På SimpleQA Verified faller Inkling-Small til 20,6 %, mot Inkling sine 43,9 %. Modellen resonnerer og koder bedre enn forgjengeren, men vet mindre om verden. Skal den svare på faktaspørsmål uten søkeverktøy koblet på, er det det tallet som avgjør om den holder.
Vektene er sluppet i sin helhet. Modellen er en Mixture-of-Experts-transformer trent på NVIDIA GB300 NVL72, med kontekstvindu opp til 1 million tokens, justerbar tenkeinnsats og resonnering over lyd og bilder innebygd. Bilder deles i ruter på 40 × 40 piksler og lyd representeres som dMel-spektrogrammer, uten separat enkoder. Selskapet tilbyr den også for finjustering på Tinker og i Tinker Playground.
Hva bør du gjøre?
- Prøv modellen i Tinker Playground med tekst, bilde og lyd før du laster ned 276 milliarder parametere.
- Skru på justerbar tenkeinnsats og mål hvor lavt du kan legge den før kvaliteten faller for din egen oppgave.
- Har du en faktatung oppgave, test SimpleQA-gapet selv i stedet for å stole på totalscoren.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.