Strengere verifikator forkaster 1 487 GPU-kjerner som standardtesten godkjente
Mistro korrekthetstallene fra systemer som genererer GPU-kjerner med språkmodeller, for standardtesten godkjenner kjerner som er stille feil.
39,5 prosent av 2 638 maskingenererte GPU-kjerner er ødelagt utover enhver toleransediskusjon, ifølge en artikkel lagt ut på arXiv 13. august 2026. Kjernene var allerede godkjent som korrekte av det offentlige systemets eget testoppsett. Tar man med alle brudd, ikke bare de grove, bærer 62,1 prosent minst ett.
Problemet er testen feltet har brukt. Den kjører kjernen på noen få tilfeldige input i én fast form og godtar den hvis resultatet ligger nær en referanse. Forfatterne beskriver fire måter en kjerne kan passere den og likevel være feil: den kan returnere et vanlig tall der det sanne svaret er NaN eller uendelig, gi ulikt resultat fra kjøring til kjøring, ryke når formen endres, eller akkumulere i fp16 der referansen holder summen i fp32. Ingen av de fire krever at kjernen ser gal ut på den ene formen den ble testet på.
Verifikatoren de bygger består av tolv motstandsdyktige porter, hver av dem en egenskap en korrekt kjerne må oppfylle. Flere er helt uten toleranse, slik at ingen terskelvalg kan bortforklare et brudd: enten oppfyller kjernen kontrakten, eller så gjør den det ikke. Utslaget går nesten bare én vei. Standardtesten godkjenner 1 487 kjerner som verifikatoren forkaster, mot 14 den motsatte veien, og asymmetrien er selve funnet.
Funnet forsvares på fire uavhengige måter. En positiv kontroll treffer 7 av 7, et sveip over terskelkalibrering viser at resultatet ikke henger på ett valgt kutt, verifikatoren er 98,5 prosent enig med referansebenchmarkens egen korrekthetskode, og en stratifisert håndgjennomgang bekrefter utvalget.
«Korrekthetssignalet bak rapportert fremgang i kjernegenerering er langt svakere enn tallene antyder.» — fra artikkelens sammendrag
Den andre halvdelen av artikkelen retter verifikatoren innover, mot forfatternes egen kode. De presenterer det de beskriver som den første native Blackwell tcgen05-bakoverpassen for trening av gated-linear-recurrence-familien, inkludert reverse-state-steget feltet fortsatt kjører på en fallback. Korrektheten etableres mot et orakel i dobbel presisjon i stedet for mot en løs referanse, og fem medlemmer av familien er trent gjennom implementasjonen.
For deg som lener deg på maskingenererte kjerner i egne treningsløp, er poenget at en akseptrate sier mer om testen enn om koden. En kjerne som akkumulerer i feil presisjon eller ryker på en ny batch-størrelse gir ikke krasj, den gir tall som ser rimelige ut. Et sett toleransefrie kontrakter ville lukke mesteparten av gapet, skriver forfatterne, og inntil noe slikt er standard bør høye korrekthetstall fra kjernegenerering leses som en påstand om testoppsettet.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.