Hopp til hovedinnhold
Tilbake
Verktøy 3 min · Kilde: Tech Times

Molt kjører agentisk RL på 9 200 linjer kode, mot 62 000 for verl

KI Takeaway KI-generert · kan inneholde feil

Kjører fullasynkron agentisk RL opp til MoE-modeller i billionklassen på rundt 9 200 linjer RL-kode, mot 62 000 for verl.

verl, rammeverket de fleste produksjonsteam ender opp med, er rundt 62 000 linjer RL-kode. Molt, som NVIDIA sitt NeMo-labs har lagt ut under Apache 2.0 med første merkede utgivelse 14. juli og v0.1.4 den 26. juli, er rundt 9 200. Samme tabell i repoet oppgir OpenRLHF på rundt 7 200 linjer og slime på 25 000. Molt skalerer likevel til MoE-modeller i billionklassen.

Forskjellen i linjetall er poenget, ikke en bieffekt. verl dekker produksjonsbredde og betaler for det med overflate du må forstå før du kan endre en algoritme. Molt går motsatt vei: én trenbar aktør med valgfri KL-referanse, hver gradient eksplisitt, hvert tapsledd i én fil. Stakken er tre komponenter rundt én asynkron kø. Ray eier plassering og køen, vLLM kjører rollout, og NVIDIA AutoModel med FSDP2 trener i ren PyTorch.

«Les hver eneste linje som rører gradientene dine, i ren PyTorch» — Molt-repoets README

Den delen som er mest direkte brukbar hvis du allerede har en agent, er ChatAgent-grensesnittet. Molt starter en FastAPI-server som snakker både Chat Completions-protokollen til OpenAI og Messages-API-et til Anthropic, slik at en agent du har bygget mot en vanlig SDK-klient kan drive treningsløkka uten omskriving. Serveren fanger token-eksakt trajektorie underveis.

Et problem rammeverket løser eksplisitt er agenter som komprimerer konteksten sin midt i en episode. Når et komprimeringssteg skriver om prefikset i stedet for å utvide det, ryker den token-eksakte sporingen som importance sampling hviler på. Molt oppdager dette selv, forsegler segmentet, starter et nytt, og fordeler sluttbelønningen for episoden over alle segmentene.

Sju advantage-estimatorer følger med: REINFORCE, REINFORCE med baseline, RLOO, GRPO, DR-GRPO, GAE for PPO, og on-policy distillation. Den siste gjør KL-referansemodellen om til en frossen lærer med ett flagg, og trener studenten på reversert KL per token på egne on-policy-samples. Ingen skalar belønning kreves.

For MoE-skala er Router Replay den kritiske detaljen. Når vLLM og treningspasset regner ekspertrutingen hver for seg, kan presisjonsforskjeller mellom fp32 og bf16 sende samme token til ulike eksperter, og da er logg-sannsynlighetene GRPO bygger på regnet mot feil eksperter. vLLM logger derfor sine faktiske rutingvalg ved generering og spiller dem av i treningspasset, mens gate-vektene fortsatt får lære.

Molt er ikke et produksjonsrammeverk, og README-en sier det rett ut. Påstanden om at gjennomstrømningen er statistisk sammenlignbar med en Megatron-basert stack er forfatternes egen måling, uten uavhengig etterprøving. Oppskriftene som følger med dekker Qwen3-4B på matte og Qwen3.6-35B-A3B på geometrisk visuell resonnering, begge med enkeltnode-oppstart og Slurm-konfigurasjon for klynge.

Hva bør du gjøre?

  1. Kjør Qwen3-4B-oppskriften på én node først. Den er laget som hurtigstart og viser hele løkka uten klyngeoppsett.
  2. Bruk ChatAgent-grensesnittet hvis agenten din allerede snakker OpenAI- eller Anthropic-protokollen. Da slipper du å skrive om agenten for å trene den.
  3. Behandl ytelsestallene som retningsgivende til du har målt på din egen topologi. Sammenligningen er forfatternes egen, ikke en tredjeparts.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter