Hopp til hovedinnhold
Tilbake
Openai 2 min · Kilde: Robocurve

GPT-6 Astra fullførte 7 av 100 robotforsøk, MolmoAct2 klarte ingen

KI Takeaway KI-generert · kan inneholde feil

Viser Robocurves StationeryBench at GPT-6 Astra kommer langt lenger enn robotmodellen MolmoAct2 med to robotarmer, selv om Astra bare fullførte 7 av 100 forsøk.

En generell språkmodell med et agentlag rundt seg slo en modell som er trent spesifikt for å styre roboter. Robocurve lot OpenAIs GPT-6 Astra og Ai2s MolmoAct2 styre de samme YAM-armene gjennom fem oppgaver med skrivesaker, 200 forsøk totalt, og publiserte resultatene 10. september. Astra fullførte 7 av 100 forsøk, MolmoAct2 0 av 100. På en framdriftsskala fra 0 til 100, der hvert av fire delmål gir 25 poeng, fikk Astra 46 og MolmoAct2 12.

Oppgavene høres enkle ut for et menneske: ta korken av en tusj, helle binders i en skål som holdes i lufta, gi en linjal fra den ene gripeklo til den andre, trekke ut den midterste av tre post-it-blokker og hente et viskelær ut av en eske med lokk. Astra ble styrt gjennom agentpolicyen i Inspect Robots, brukte mellom 12,6 og 19,4 modellkall per forsøk og kostet anslagsvis 1,21 til 1,93 dollar per kjøring.

Nøkkeltall
62 mot 25
framdrift på å ta korken av tusjen, der Astra fullførte 5 av 20
51 mot 18
helle binders i skålen, ingen fullførte
46 mot 16
gi linjalen mellom armene, Astra fullførte 1 av 20
34 mot 0
både post-it-blokken og viskelæret, der MolmoAct2 aldri flyttet armene

Robocurve er tydelig på svakhetene. En menneskelig vurderer satte poengene og visste hvilken modell som kjørte. MolmoAct2 ble kjørt uten finjustering på oppgavene, og i 47 av 100 forsøk flyttet armene seg knapt fra startposisjonen, noe Robocurve tilskriver at scenene lå utenfor modellens treningsdata. Instruksjonene var også lengre enn kommandoene MolmoAct2 er trent på, og Astra ble bare testet på middels innsatsnivå.

For deg som bygger er det interessante at en API-modell nå kan drive fysiske armer via et agentlag, uten robotspesifikk trening. Med en fullføringsrate på 7 prosent er det fortsatt et forskningsresultat og ikke noe du setter i produksjon.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter