Danijar Hafner lar agenter trene i drømte verdener før de møter en ekte stue
Bygger agenter som lærer inne i simulerte verdensmodeller, slik at roboter kan håndtere rom og møbler de aldri så under trening.
I et nesten tomt kontor i SoMa-distriktet i San Francisco henger humanoide roboter i ulike størrelser som marionetter fra stativer midt i lokalet. Kontoret tilhører Danijar Hafner (31), som forlot Google DeepMind høsten 2025 for å starte et selskap som fortsatt er i stealth og ikke har navnet sitt på døra. MIT Technology Review fant én annen person der på besøksdagen, nesten ingen møbler, og robotene han importerer fra Kina.
Metoden heter modellbasert forsterkningslæring. Hafner bygger verdensmodeller, altså KI-modeller som skal etterligne fysisk virkelighet, og trener agenter inne i dem. Agenten behandler modellen som en simulering av den ekte verden, lærer å handle der, og bruker erfaringene til å forutsi framtidige utfall. Poenget er at agenten, eller roboten den sitter i, skal klare situasjoner den aldri har møtt. Prøvingen og feilingen i den fysiske verden, som robotikk tradisjonelt har vært avhengig av, faller bort. En robot som skal inn i et privat hjem må håndtere en planløsning og en møblering den aldri har sett, og den får ikke øve seg på hver enkelt stue først.
«I get to interact with a lot of really smart people in research at Google, and he easily sits in the top half of 1%» — Timothy Lillicrap, Google DeepMind
Lillicrap, som var Hafners leder og medforfatter i Google, legger til at Hafner i mange tilfeller bygget alene ting det ville tatt hele ingeniørteam å lage.
Bakgrunn
Hafner vokste opp i en landsby nordøst i Tyskland, med to klassiske musikere som foreldre. Han lærte programmering av en nabo og tok KI-kurs på nett allerede på videregående.
«I was always fascinated with how thinking works» — Danijar Hafner
I 2015, som andreårsstudent i ingeniørfag ved Hasso Plattner Institute i Potsdam, fikk han jobb som studentforsker i Google Brain. Deretter fulgte et dusin internships og andre stillinger i selskapet, i Storbritannia, Canada og USA, og samarbeid med Geoffrey Hinton og med Ashish Vaswani, medforfatter av «Attention Is All You Need».
Sporet han har lagt igjen er lett å lese. PlaNet lot agenter handle ved å planlegge framover. Dreamer 2 var den første agenten som nådde menneskenivå på Atari 2600-spill ved hjelp av en verdensmodell. Dreamer 3 løste Minecraft-diamantutfordringen på egen hånd. Dreamer 4 gikk et steg lenger og lærte å utvinne diamanter fra et offline datasett med opptak av spilling, uten noen gang å røre spillet direkte. DayDreamer flyttet algoritmen ut i fysiske roboter, som kunne reagere på nye erfaringer, som å bli dyttet over, uten trening på akkurat det.
For den som bygger agenter i dag er verdensmodell-sporet en annen vei enn den språkmodell-drevne de fleste av oss jobber i. En agent som planlegger inne i en lært simulering trenger ikke å kalle et API for hvert steg, og feilene den gjør koster ingenting fordi de skjer i modellen. Hafner selv sier lite om hva det nye selskapet skal bli, annet enn at han var interessert i å løse et problem som ville endre verden.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.