UC Berkeley slipper CUA-Lite: samlet plattform for KI-agenter som styrer datamaskiner
Kjører CUA-Lite hele OSWorld-oppgavesettet i en vanlig Docker-container i stedet for en KVM-virtuell maskin, slik at skrivebordsagenter kan trenes og måles på infrastruktur uten nested virtualisering.
Å måle en agent som styrer et skrivebord har hatt en fast pris: én komplett virtuell maskin per oppgave. OSWorld, referansesettet på området, leverer et trofast Ubuntu-skrivebord som QEMU/KVM-maskin og krever tilgang til /dev/kvm. De fleste administrerte skytjenester, CI-kjørere og nestede containere gir deg ikke den tilgangen, og dermed har mye av arbeidet med computer-use-agenter vært låst til maskinvare du eier selv.
Forskere ved UC Berkeley har lagt ut CUA-Lite, en åpen plattform som samler agenter, miljøer, treningsdata og evaluering bak ett handlingsrom og én kommando. Ifølge MarkTechPost er det mest konkrete bidraget Lite.OSWorld, som reproduserer samme oppgavesett og samme evaluatorer på et GNOME-skrivebord inne i en helt vanlig Docker-container. Minnebruken faller fra 4,1 GB til 0,9 GB per instans, kaldstart går fra 29,9 til 23,8 sekunder, og du får rundt 4,6 ganger så mange parallelle skrivebord på samme maskin.
Det åpenbare spørsmålet ved å bytte virtuell maskin mot container er om resultatene fortsatt gjelder. MarkTechPost oppgir at Lite.OSWorld-scorene matcher VM-versjonens på tvers av 13 modeller, slik at et treningssignal opptjent i containeren overføres tilbake til den ekte benchmarken. Den samme basen bærer nå en familie sandkasser under navnene Lite.ScaleCUA, Lite.CUAGym og Lite.CUAWorld.
Andre lag er LiteSample, ett felles skjema for treningsdata som deles av alle miljøer, agenter og oppgavetyper, levert som ren parquet pluss bilder. Over ti eksisterende datasett er forhåndsbehandlet inn i formatet og publisert gratis på Hugging Face, blant dem Aguvis, OpenCUA, ScaleCUA, GUI-360, GUIOdyssey og Multimodal-Mind2Web. Ved siden av dem ligger ferske rollout-datasett generert ved å kjøre en frontier-modell gjennom sandkassene, ment for destillasjon ned i mindre elevmodeller.
Treningsløkken bruker samme grensesnitt. For finjustering dokumenterer prosjektet at Qwen3-VL-2B-Instruct trent på Lite.ScaleCUA-trajektorier løftet snitt-episodeavkastningen fra 0,138 til 0,237 på en evalueringssplitt med 332 oppgaver. Det er én rapportert konfigurasjon på to GPU-er, ikke et uavhengig reprodusert resultat. For forsterkningslæring driver rollouts som scores i miljøet GRPO-oppdateringer oppå Slime, med et gjennomarbeidet MobileGym-eksempel på 416 mobiloppgaver fordelt på 28 apper.
Én praktisk hake: MarkTechPost påpeker at repoet foreløpig ikke sender med noen eksplisitt lisens. Uten lisensfil har du strengt tatt ingen bruksrett utover å se på koden, uansett hvor åpen plattformen presenteres som.
Hva bør du gjøre?
- Installer med
uv sync --all-extraspå Python 3.12 og kjørscripts/rollout.pymotlite.demoførst. Hele grensesnittet er å bytte--model-idog--env-id. - Regn om kapasiteten din før du planlegger et treningsløp: 0,9 GB per skrivebord betyr at en maskin med 32 GB minne holder langt flere parallelle oppgaver enn KVM-oppsettet ga rom for.
- Avklar lisensspørsmålet med forfatterne før du bygger noe kommersielt på plattformen.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.