World Labs viser Atlas: 3D-verdener fra to eller tre bilder
Bygger 3D-scener fra to eller tre bilder i én modell som World Labs oppgir slår spesialiserte rekonstruksjonsmodeller.
Siden oppstarten i 2024 har World Labs hatt ett mål: at KI skal forstå rom slik mennesker gjør. Nå har selskapet, medgrunnlagt av Fei-Fei Li, presentert Atlas, en verdensmodell som genererer, rekonstruerer og simulerer 3D-scener fra bare noen få bilder, skriver The Decoder. Selskapet hevder modellen slår spesialiserte modeller på deres egne oppgaver.
Atlas er trent fra bunnen av på tekst, bilder, video og 3D. Hvert innsignal forankres i en bestemt posisjon i rommet i stedet for å behandles som en flat sekvens. World Labs kaller den delte romforståelsen «spatial context», og det er den modellen bruker til å generere hvert nye bilde eller synspunkt. Det er problemet Fei-Fei Li beskrev i et essay i november 2025: dagens multimodale språkmodeller og videodiffusjonsmodeller bryter data ned i én- eller todimensjonale sekvenser, og gjør dermed selv enkle romlige oppgaver unødig vanskelige.
For kamerastyrt generering tar Atlas ett eller flere bilder og produserer nye synsvinkler fra frie kameraposisjoner og vinkler. Kamerabevegelsen sendes inn som geometri, ikke som tekstprompt slik mange videomodeller krever. Utgangen er opptil ett minutt video i 1440p, og poenget er at du styrer hvert bilde selv i stedet for å «trekke i spaken på en spilleautomat», som World Labs formulerer det.
Rekonstruksjon er der forspranget er tydeligst. Atlas bygger opp virkelige scener fra alt fra ett til flere dusin bilder uten spesialutstyr, og med bare to eller tre bilder oppgir selskapet at resultatene er tro mot originalen og bedre enn spesialiserte 3D-modeller. I en demo settes Stanfords Main Quad sammen fra 2 til 25 bakkenære fotografier, hvorpå modellen genererer luftbilder høyt over campus. Systemer som VGGT og InfiniteVGGT får geometriske inkonsistenser og uklare teksturer så snart kameraet flytter seg mye.
Modellen kan også skrive ut ekte 3D-data fordi den behandler dybdeinformasjon ved siden av RGB. Punktskyer og 3D Gaussian splats er blant formatene, samme representasjon som i Marble, selskapets eksisterende produkt.
Robotikk er den andre bruken. Atlas rekonstruerer et rom og genererer bilde- og dybdedataene en simulert robots sensorer ville sett langs ruten. Fra noen få fotografier kan du variere objekter, posisjoner, lys og bakgrunn og få treningsdata uten å filme hver situasjon i virkeligheten. Demomaterialet ble tatt opp med en håndfull mobiler og actionkameraer, ikke profesjonelt utstyr.
Arkitekturen låner fra begge leire. Atlas genererer bit for bit som en språkmodell og kan bruke de samme fartsknepene, blant annet KV-caching, samtidig som den filtrerer utdata ut av støy etter diffusjonsprinsippet fra bilde- og videomodeller.
På rekonstruksjon leder Atlas med en medianfeil på 25,3, foran Pi3X og VGGT-Ω 1B. World Labs oppgir at ytelsen fortsetter å bedre seg med mer treningsregnekraft.
Bakgrunn
World Labs ble grunnlagt i 2024 av Fei-Fei Li, som skapte ImageNet og ledet Google Clouds KI-divisjon fra 2017 til 2018. Marble kom i november 2025, og i februar 2026 hentet selskapet 1 milliard dollar fra blant andre Autodesk, Andreessen Horowitz, Nvidia og AMD.
Atlas er foreløpig bare tilgjengelig gjennom et program for tidlig tilgang for utvalgte partnere, og skal drive framtidige versjoner av Marble. For deg som bygger, er poenget at rekonstruksjon fra en håndfull mobilbilder flytter 3D-innhold og robotsimulering fra spesialutstyr til noe du kan filme selv.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.