Photon-1 trente på 18 år skjermvideo uten handlingsetiketter og slår Gemini 3.1 Flash-Lite
Dropp handlingsetikettene: Induction Labs viser at ren videopretrening kan lære en modell å bruke en datamaskin.
575 millioner videobilder, 552 milliarder tokens, 18 år med skjermopptak samplet ett bilde i sekundet: det er datagrunnlaget Induction Labs oppgir for Photon-1 i forskningsnotatet selskapet la ut 23. juli. Modellen er en sparsom MoE-transformer med 106 milliarder parametere der 5 milliarder er aktive, og den så ikke én eneste handlingsetikett under pretreningen. Korpuset er filtrert ned fra en intern indeks på 2 milliarder offentlig tilgjengelige videoer til rundt 2 millioner skjermopptak.
Kompresjonen er nøkkelen. En vision-encoder med finite scalar quantization koder hvert bilde til 960 diskrete tokens på til sammen 2,2 KB, og en differensiell latent-encoder beskriver forskjellen mellom bildepar i stedet for innholdet i hvert enkelt bilde. Induction Labs oppgir over 100 ganger bedre kompresjon enn eksisterende OCR- og multimodalrepresentasjoner. Modellen predikerer neste tilstand i representasjonsrommet, aldri piksler, og etter finjustering på under 35 000 trajektorier med datamaskinbruk forutsier den først neste skjermtilstand og deretter handlingen som fører dit.
«Hovedresultatet vårt er at prediksjon av framtidige tilstander kan lære modeller å løse oppgaver selv om de aldri ser handlinger under pretrening» — Induction Labs, forskningsnotat 23. juli
Regnestykket er poenget for alle som regner på hva agenter koster å kjøre. Pretreningen tok rundt 30 000 H200-timer, 4,4 × 10²² FLOPs, med 40 prosent MFU gjennom hele løpet. Vektet inferenskostnad oppgis til 0,11 dollar per million tokens mot 0,36 for Gemini 3.1 Flash-Lite, som Photon-1 slår på selskapets interne benchmark for datamaskinbruk etter forsterkningslæring.
Forbeholdene står i notatet selv. Compute-tallet for Gemini er Induction Labs' eget konservative anslag, benchmarken er intern og ikke publisert, og det finnes verken vekter, API eller lisens å laste ned. For deg som bygger agenter er signalet likevel verdt å registrere: uannoterte skjermopptak er en langt billigere datakilde enn kuraterte handlingsspor, og holder resultatet utenfor ett laboratorium, flytter det terskelen for hvem som kan trene en datamaskinbrukende modell.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.