Miles v0.1: LMSYS slipper produksjonsklart rammeverk for post-training av KI-agenter
Slipper LMSYS Org rammeverket Miles v0.1, som post-trente en modell på 744 milliarder parametere med bare 64 GPU-er.
64 GPU-er. Det er hele maskinparken bak referansekjøringen i Miles v0.1, rammeverket LMSYS Org publiserte 18. august 2026: 32 kort til rollout og 32 til trening, som sammen kjørte forsterkningslæring på GLM-5.2 med 744 milliarder parametere (40 milliarder aktive) på terminal-oppgaver. Treningsstegene lå stabilt rundt 4,5 minutter gjennom 100 steg, og rollout-vektene lå i snitt 1,7 steg bak treneren.
Miles er etterfølgeren til LMSYS Orgs første Miles-utgivelse og bygger på slime fra THUDM. Koden ligger under Apache 2.0 i repoet radixark/miles og er skrevet i Python. Nyheten er ikke et forskningsresultat, men at hele løkken er satt sammen og verifisert: SGLang genererer banene, NVIDIA Megatron-LM eller FSDP trener, og nye vekter synkroniseres tilbake til inferens-flåten mens generering pågår.
«Miles optimaliserer hvert steg i RL-treningsløkken rundt et enkelt prinsipp: verifisert, ryddig og tilpassbart overalt» — Miles-teamet, LMSYS Org
Vektsynkroniseringen er der de skarpeste tallene ligger. Kjører du en flåte uten direkte NCCL eller RDMA mellom nodene, sender Miles bare differansen mot forrige policy-versjon i stedet for et helt sjekkpunkt. To prosent av parameterne endrer seg typisk per steg i BF16-rollout, 0,5 prosent i FP4. I en kjøring med GLM-4.7-Flash krympet det oppdateringen fra 62,4 GB til mellom 0,69 og 0,83 GB, med en generering-pause på tre til fem sekunder.
For deg som finjusterer egne modeller er LoRA-støtten trolig det mest praktiske. Basemodellen står frossen i minnet mens Miles trener og synkroniserer bare adapterne, og SGLang legger på siste adapter under rollout. For GLM-5.2 744B-A40B utgjør de trenbare parameterne 212 MB, rundt 0,014 prosent av basemodellens BF16-vekter. Et eksperiment med selvdestillasjon på Qwen3.5-35B-A3B kuttet snittlengden på rollouts fra 18 600 til rundt 6 000 tokens samtidig som DAPO-resultatet på holdout gikk fra 84,6 til 89,5 prosent.
Rammeverket kjører samme treningsløkke på NVIDIA fra A100 til GB300 og på AMD Instinct MI300X til MI355X via ROCm, med CI som tester begge leverandører. Modellstøtten dekker DeepSeek-V3.2, Kimi-K2.6, Qwen3.8, GLM-5.2, Gemma-4 og GPT-OSS, hver med en oppskrift som er vaktet av CI.
Hva bør du gjøre?
- Start med LoRA-RL hvis du har ett eller to kort. Den frosne basemodellen pluss adaptere på noen hundre megabyte er forskjellen på om oppsettet i det hele tatt får plass.
- Sjekk CI-oppskriftene under docs/models før du velger modell. Kjører du noe utenfor listen, må du selv verifisere at rollout og trening ser samme kvantiserte vekter.
- Slå på asynkron rollout først når banene dine faktisk varierer i lengde. På korte, jevne oppgaver er gevinsten liten og feilsøkingen vanskeligere.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.