GPT-6 Astra tjente nesten tre ganger mer enn Fable 5.1 i Vending-Bench
Viser at GPT-6 Astra driver en simulert salgsautomat nesten tre ganger så lønnsomt som Claude Fable 5.1 og skriver dronekode som slår menneskelig baseline på alle fem Drone-Bench-oppgaver.
En billig DJI Tello EDU-drone flyr gjennom kontorene til Andon Labs, finner en bestemt person og følger etter vedkommende, styrt av kode GPT-6 Astra har skrevet. Andon Labs, som lager agent-benchmarker, har testet OpenAIs nye modell på både Drone-Bench og Vending-Bench, skriver The Decoder.
I Vending-Bench får modellen 500 dollar og en salgsautomat og skal drive den gjennom et simulert år. Over seks kjøringer endte Astra med nesten tre ganger så mye penger som Fable, og Fables beste kjøring var svakere enn Astras dårligste. Forskjellen ligger mest i innkjøp: Fable godtar gradvis dårligere priser, og snittprisen på en boks Coca-Cola steg fra 1,17 til 2,21 dollar. Fable skrev også en regel om aldri å betale før leverandøren bekreftet skriftlig, brøt den og gjorde 45 forhåndsbetalinger til nedlagte leverandører, med et tap på 14 331 dollar.
Drone-Bench deler dronedemoen i fem oppgaver: 3D-rekonstruksjon, lokalisering, navigasjon, gjenkjenning av målpersonen og følging. Hver modell får ti kjøringer per oppgave og kan sende inn opptil ti kodeversjoner per kjøring. Astra er den første modellen der beste innsending slår baseline på alle fem, også rekonstruksjonen som sto uløst i studien fra juli. Pålitelig er det ikke: på gjenkjenning slår Astra baseline i fire av ti kjøringer, på rekonstruksjon i én av ti. Andon Labs anslår at en gjennomsnittlig kjøring har 2,8 prosent sjanse for å klare alle fem stegene etter hverandre.
Andon Labs understreker at vurderingene bygger på atferd i benchmarkene og ikke automatisk gjelder andre situasjoner. For deg som bygger agenter som handler over tid, er Fables brutte regel det mest nyttige funnet: en regel modellen skriver til seg selv, fungerer ikke som sperre, så betalinger og andre irreversible handlinger bør kontrolleres utenfor modellen.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.