OpenAI slipper GPT-6 Astra: 100 prosent på ExploitBench og 2,5 ganger prisen av Sol
OpenAI har sluppet GPT-6 Astra: 2,5 ganger dyrere tokens enn Sol, men ifølge selskapet lavere pris per fullført oppgave.
«Welcome to the AGI era.» Slik avsluttet OpenAI-president Greg Brockman pressebriefingen torsdag 3. september, skriver The Decoder. Brockman erkjente samtidig at det ikke finnes noe tydelig AGI-øyeblikk, og at overgangen har vært mer gradvis enn selskapet trodde da det ble grunnlagt. Modellen han lanserte, GPT-6 Astra, rulles først ut til utvalgte organisasjoner i OpenAIs cybersikkerhetsprogram Daybreak, og deretter i dagene som kommer til ChatGPT Plus, Pro, Business og Enterprise, til API-et og til skyplattformer som AWS Bedrock og Microsoft Azure.
Astra er forhåndstrent på over 100 000 GPU-er i Stargate-anlegget i Texas. OpenAI-forsker Aidan Clark kaller det selskapets største treningsløp noensinne, og sier spranget fra Sol til Astra er større enn spranget opp til Sol var. Tallene selskapet legger fram følger etter: 97,6 prosent på FrontierMath Tier 4 v2, 74,1 prosent på DeepSWE v1.1 og 57,7 prosent på Terminal Bench 4.0 mot 37,3 prosent for forgjengeren GPT-5.6 Sol. På lang kontekst tar Astra 96,3 prosent på MRCR v2 med åtte nåler mellom 512K og 1M tokens, der Sol lå på 73,8 prosent.
For deg som lar en agent styre en maskin er OSWorld-tallet mer interessant enn matematikken. Der scorer Astra 72,6 prosent på rundt 40 minutter per oppgave, mot 65,7 prosent på rundt 75 minutter for Sol. Altså både høyere treffrate og under halve tidsbruken på samme type arbeid.
Astra er også den første modellen OpenAI plasserer i kategorien «kritisk» under sitt eget Preparedness Framework. Den tar 100 prosent på ExploitBench, fant to tidligere ukjente nulldagssårbarheter under evalueringen, og de skarpeste cyberfunksjonene er foreløpig forbeholdt betrodde forsvarere i Daybreak Blue-programmet. OpenAI innrømmer i samme dokumentasjon at Astras nedskrevne resonnement er vanskeligere å overvåke enn Sols, uten å tallfeste hvor mye.
Prisen er 10 dollar per million input-tokens og 50 dollar per million output-tokens i standardmodus. Fast mode lover 2,5 ganger hastigheten og dobler prisen. Det gjør Astra 2,5 ganger dyrere enn Sol og legger den i samme prisklasse som Anthropics Fable 5.1. Brockman argumenterer for at tokenpris er en dårlig målestokk mellom modeller, siden tokens ikke er sammenlignbare på tvers av leverandører eller engang mellom OpenAIs egne modellfamilier. Pris per fullført oppgave er det som teller, mener han: på DeepSWE v1.1 oppgir OpenAI at Astras toppkonfigurasjon kutter estimert API-kostnad per oppgave med rundt 57 prosent mot Sol.
Hva bør du gjøre?
- Regn om budsjettet fra tokenpris til pris per fullført oppgave før du konkluderer. Forskjellen mellom 2,5 ganger dyrere tokens og 57 prosent billigere oppgaver avgjøres av hvor mange runder agenten din faktisk bruker.
- Se på Codex-oppdateringen som fulgte med lanseringen. Modellen kan nå ta notater på tvers av flere kontekstvinduer i lange økter, og tidligere vinduer forblir søkbare i stedet for å bli komprimert til ett sammendrag. Funksjonen er eksperimentell nå og skal bli standard i løpet av noen uker.
- Bytt ut logging av tankekjeden med utfallsbasert overvåking hvis den er en del av kontrollene dine. OpenAI sier selv at Astra er vanskeligere å følge i teksten enn forgjengeren.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.