GEN-1.5 treffer 59 prosent på nye robotoppgaver fra én demo
Lærer en ny fysisk oppgave fra en demonstrasjon på 3 til 12 sekunder lagt i kontekstvinduet, uten et eneste treningssteg.
Generalist AI oppgir i en bloggpost at robotmodellen GEN-1.5 treffer 59 prosent i snitt over ti ulike oppgaver med bare én demonstrasjon i konteksten, med et standardavvik på 10 prosentpoeng. Kjører du ti gradientsteg på fem minutter data per oppgave, rundt 50 demonstrasjoner, stiger treffsikkerheten til 83 prosent. Oppgavene er korte og enkle: åpne et glass, håndtere en glidelås, hente penger ut av en lommebok.
Mekanismen selskapet kaller «physical prompting» skiller dette fra vanlig robotlæring. GEN-1.5 er en multimodal modell som tar inn video med 30 sekunders minne sammen med språk, sensordata og propriosepsjon, og produserer handlingsbaner med 100 Hz. En demonstrasjon på 3 til 12 sekunder legges rett i kontekstvinduet og fungerer som korttidsminne. Etter det utfører roboten oppgaven uten at en eneste vekt er oppdatert.
Generalist oppgir at modellen også kan lenke sammen to slike prompter til én lengre sekvens, bruke demonstrasjoner tatt opp i simulering på virkelige oppgaver selv om treningen ikke inneholdt simuleringsdata, og delvis herme etter menneskehender foran kameraet. Ingen av disse egenskapene ble trent inn eksplisitt. Selskapet skriver at de kom av seg selv gjennom over åtte måneder med sammenhengende fortrening på interaksjonsdata, uten arkitekturendringer eller meta-læringsløkker.
«Dette er den første modellen vi kjenner til som har vist en generell evne til å lære et bredt spekter av fingerferdige closed-loop-oppgaver fra bare én eller noen få demonstrasjoner» — Generalist AI
Andre forskningsmiljøer har vist in-context-læring i robotikk før, men for et smalt sett oppgavetyper. Generalist hevder å være først med at det virker bredt. Forbeholdet er like tydelig: oppgavene er korte og enkle, treffsikkerheten er moderat, og samtlige tall kommer fra selskapet selv uten uavhengig etterprøving.
For deg som følger med på om robotikk får sitt eget GPT-3-øyeblikk er dette signalet å veie. Sammenligningen Generalist selv trekker er nettopp GPT-3, som traff rundt 45 prosent med ett eksempel i konteksten. Forskjellen er at språkmodeller kunne evalueres av hvem som helst med en API-nøkkel, mens 59 prosent på et glass med lokk foreløpig bare kan bekreftes av dem som eier roboten.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.