Hopp til hovedinnhold
Tilbake
Llm 3 min · Kilde: The Decoder

Reka Rho-1: én 19B-modell lager tekst, bilder, video og robotbevegelser i samme kontekst

KI Takeaway KI-generert · kan inneholde feil

Studer Reka Rho-1 som et motsvar til agentpipelines: én modell på 19 milliarder parametere forstår og genererer tekst, bilder, video og robothandlinger i ett felles kontekstvindu.

Typisk multimodal KI i dag er en kjede: en språkmodell planlegger og sender jobben videre til en bildemodell, en videomodell eller en egen robotpolicy. Reka AI mener hvert slikt overleveringspunkt koster latens og kontekst, og har sluppet en forskningsforhåndsvisning av Rho-1 for å vise alternativet. Modellen har 19 milliarder parametere, er trent fra bunnen av, og behandler alle modaliteter som tokens i samme kontekstvindu, uten verktøykall eller eksterne modeller.

Arkitekturen deler hver transformer-blokk i to ekspertstrømmer. En forståelsesstrøm tar seg av språk og bildeanalyse, mens en genereringsstrøm denoiser latente representasjoner til bilder og video. Begge leser og skriver til samme KV-cache, som dermed fungerer som en vedvarende tilstand for «verden» modellen holder på med. Tekst og kommandoer er diskrete tokens, mens bilder, videobilder og robothandlinger er kontinuerlige tokens. Modellen trenes samtidig på neste-token-prediksjon og flow matching.

Ifølge Reka genererer grunnmodellen video i 0,79 ganger sanntid (median), med en visningsklar strøm etter omtrent seks sekunder. En destillert variant kutter antall denoising-steg fra 99 til 8, og returnerte et videoklipp på 5,3 sekunder på rundt ett sekund i Rekas egne tester. Fordi videoen strømmer kontinuerlig, kan du endre instruksjonene underveis uten å starte på nytt. Reka kaller det en styrbar verdensmodell.

Samme vekter som forutsier kamerabilder styrer også robotbevegelser. Robotdata er mangelvare, så Reka har bygget en inverse dynamics-modell som trekker ut styresignaler fra vanlige internettvideoer og gjør dem om til treningsdata. Ifølge The Decoder er lanseringen en del av en bredere bevegelse:

«Lanseringen passer inn i et bredere skyv i KI-forskningen mot såkalte verdensmodeller.» — The Decoder

Reka er ærlig om begrensningene. En videostrøm på 30 sekunder kan beholde fotorealistiske detaljer mens romoppsettet glir ut av kurs, objektgjenkjenning fungerer på stillbilder men ennå ikke på tvers av video, redigering er ustabil, og videooppløsningen er begrenset til 672×384. Hele modellen er trent på 320 H100-GPU-er i tre måneder, en brøkdel av det frontmodeller bruker.

«Rho-1 er et fungerende proof-of-concept og en arkitektonisk retning, ikke et ferdig produkt.» — Reka AI, i forskningsinnlegget

Du kan ikke kjøre Rho-1 selv. Reka nevner verken åpne vekter eller et API, og ber interesserte innen robotikk og simulering ta kontakt på e-post. Reka er likevel ikke nykommer: selskapet lanserte den multimodale språkmodellen Reka Core i april 2024. For de som bygger agenter som limer sammen flere spesialistmodeller, er Rho-1 et konkret argument for at neste generasjon kan gjøre hele løkken i én modell og ett minne.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter