GPT-6 Astra topper Terminal-Bench 4.0 og koster 10 dollar per million tokens inn
Sammenlign prisen per oppgave, ikke prisen per token, hvis du vurderer å flytte agentene dine til GPT-6 Astra.
57,9 prosent. Det er resultatet OpenAI oppgir for GPT-6 Astra på Terminal-Bench 4.0, som tester agenter på sammensatte terminaloppgaver innen programvareutvikling, systemkonfigurasjon og dataanalyse. Til sammenligning oppgir selskapet 37,3 prosent for GPT-5.6 Sol og 55,8 prosent for Claude Fable 5.1. Det interessante ligger i kostnadstallet ved siden av: OpenAI anslår at Astra løser en oppgave til rundt 9 prosent lavere kostnad enn Sol og 63 prosent lavere enn Claude Fable 5.1, fordi modellen er trent til å fullføre oppgaver på færre tokens og med færre omkjøringer.
Prisen er 10 dollar per million tokens inn og 50 dollar per million ut. Astra ble lansert forrige uke og er nå tilgjengelig i ChatGPT Work, i Codex og i APIet. Salgsargumentet OpenAI fører frem er datamaskinbruk: modellen kan jobbe gjennom de samme programmene folk bruker til daglig, også der programmene ikke har noe API, slik at du slipper å bygge integrasjoner før du får noe ut av den.
Sikkerhetstallene er formulert på samme måte. På OpenAIs interne referansetest for trygg datamaskinbruk, som måler de vanskeligste scenariene i en bedrift som å eksponere konfidensiell informasjon, dele et dashbord for bredt eller slette data, produserte Astra utilsiktede utfall 89 prosent sjeldnere enn GPT-5.6 Sol og 74,7 prosent sjeldnere enn Claude Fable 5.1. Tallene kommer fra OpenAI selv, på en test bare OpenAI kan kjøre.
Astra er samtidig den første modellen som når terskelen «Critical» for cybersikkerhetsevner i OpenAIs eget beredskapsrammeverk. Selskapet svarer med å ha trent modellen til å respektere sikkerhetsgrenser, styrket motstanden mot forsøk på å omgå vernemekanismene, og lagt inn automatiske kontroller som skal blokkere skadelige svar. For bedrifter kommer det nye administratorkontroller som begrenser hvilke nettsteder og skrivebordsprogrammer modellen får bruke, styrer opplasting og nedlasting, og krever godkjenning før konsekvensrike handlinger.
Det mest konkrete eksempelet i innlegget kommer fra OpenAIs egen ingeniørgruppe. De brukte Astra til å finne en flaskehals i minneallokering som gjorde Codex-sesjoner trege i et testmiljø, og ved å bytte allokator fikk de 25 ganger lavere forsinkelse per tur mot rundt 30 prosent høyere topputnyttelse av minnet. Det er den typen arbeid der en modell med datamaskinbruk faktisk sparer timer, og det sier mer om bruksområdet enn benchmarktabellene gjør.
Hva bør du gjøre?
- Regn om til kostnad per fullført oppgave før du bytter. Astra er dyrere per token enn forgjengeren, og hele argumentet hviler på at den bruker færre tokens og færre forsøk på samme jobb. Det er en påstand du kan etterprøve på dine egne oppgaver.
- Slår du på datamaskinbruk mot systemer som betyr noe, skru på bekreftelseskrav for konsekvensrike handlinger fra dag én i stedet for å legge dem til etter det første uhellet.
- Har du et krav om at data ikke lagres, må du søke: Zero Data Retention er tilgjengelig for kvalifiserte API-kunder på støttede endepunkter, etter godkjenning.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.