Hopp til hovedinnhold
Tilbake
Forskning 3 min · Kilde: The Decoder

GenCeption: DeepMind gjør videogenerator til datasynsmodell

KI Takeaway KI-generert · kan inneholde feil

Gjenbruker en ferdigtrent videogenerator som ryggrad for dybdeestimering, segmentering og 3D-positurgjenkjenning, med en brøkdel av treningsdataene spesialistmodellene trenger.

Språkmodeller ble allmennverktøy nærmest som et biprodukt av å forutsi neste ord. Datasyn har aldri fått en tilsvarende treningsoppgave, og feltet domineres fortsatt av spesialistmodeller med hver sin arkitektur, som Segment Anything for segmentering og Depth Anything for dybde. Google DeepMind argumenterer i en ny artikkel for at store tekst-til-video-modeller allerede har lært det som mangler, og har bygget GenCeption for å vise det.

GenCeption bygger på Alibabas åpne videomodell Wan2.1, men med en enklere arkitektur. Der diffusjonsmodeller normalt genererer video fra støy gjennom mange små steg, produserer GenCeption prediksjonen i én forlengs passering, raskt nok til praktisk bruk. Alle utdata representeres som et vanlig RGB-bilde, enten resultatet er et dybdekart, et normalkart eller en segmenteringsmaske, og en tekstinstruksjon forteller modellen hvilken oppgave den skal løse.

Treningsdataene er det mest oppsiktsvekkende. Mesteparten kom fra et syntetisk datasett på 7 500 videoer, laget ved å kombinere 800 digitale menneskemodeller med 200 bevegelsessekvenser og rendre resultatet i Blender med varierende bakgrunner og kameravinkler. Ifølge studien lander GenCeption likevel på nivå med eller over spesialistmodellene:

  1. Dybdeestimering på linje med DepthAnything 3.
  2. Bedre enn NormalCrafter og Lotus-2 på estimering av overflatenormaler, og bedre enn Genmo og TRAM på 3D-positur.
  3. På språkstyrt segmentering på nivå med Metas SAM 3 kombinert med Gemini 3.5 Flash.

Modeller som D4RT og VGGT Omega trente på millioner av videoer. GenCeption oppgir tilsvarende resultater med 7 til 500 ganger mindre data, og slår også V-JEPA og VideoMAE V2 under like betingelser. Forfatterne tilskriver det selve genereringsoppgaven, ikke datamengden.

Grensene er tydelige nok. Felles trening på alle oppgaver svekker 3D-nøkkelpunktestimering, den største modellen på 14 milliarder parametere bruker rundt ti sekunder på en video med 81 bilder, og spørsmålet om videogeneratorer virkelig rommer en verdensmodell er omstridt. Et internasjonalt forskerteam ekskluderte nylig tekst-til-video-modeller fra sin definisjon fordi de mangler tilbakemelding fra virkeligheten, og Yann LeCun har lenge hevdet at generativ video er en blindvei. En benchmark fra Tsinghua-universitetet viser at Sora 2, Seedance 2.0 og Veo 3.1 gjentatte ganger feiler på grunnleggende fysikk selv når resultatet ser overbevisende ut.

DeepMind ber ikke Wan2.1 om å forutsi hvordan verden oppfører seg. De henter ut representasjoner til avgrensede oppgaver, og det er nettopp der påstanden er lettest å teste. For deg som bygger med syn er poenget praktisk: den dyre delen kan flyttes til en ferdigtrent generator, slik at oppgaven din trenger tusenvis av eksempler i stedet for millioner.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter