GPT-5.6 Luna matcher GPT-5.5 på BrowseComp for en tjuefemtedel av prisen
Kutt reasoning-nivået og flytt volumarbeid til de små 5.6-modellene: OpenAI viser at agentkostnaden kan falle med en faktor på 25 uten at treffsikkerheten ryker.
For tre måneder siden kostet 84,36 prosent på BrowseComp 33,27 dollar med GPT-5.5 på «extra high» reasoning. Ved lanseringen av GPT-5.6 leverte Luna 84,04 prosent på samme benchmark for 1,33 dollar, skriver OpenAI i byggeguiden selskapet publiserte 13. august.
BrowseComp måler om en modell klarer å grave fram obskure fakta på nett, altså nettopp den typen langkjørende søkearbeid agenter bruker mest tokens på. OpenAI beskriver samme mønster på Agents' Last Exam, der GPT-5.6 Sol på «low» reasoning slo GPT-5.5 på «high» med uendret kjøreoppsett. Konklusjonen selskapet trekker er at standardinnstillingene fra forrige generasjon er blitt for dyre: du betaler for resonnering du ikke lenger trenger.
«Bruksområder som tidligere krevde en frontier-modell i hvert steg, kan nå oppnå sammenlignbare eller bedre resultater til en brøkdel av kostnaden» — OpenAI, byggeguiden til GPT-5.6
Guiden knytter gevinsten til tre grep i Responses API. Persistert resonnering lar modellen gjenbruke tankearbeidet sitt på tvers av turer, native compaction komprimerer lange samtaler, og programmatic tool calling lar GPT-5.6 skrive JavaScript som filtrerer og kombinerer verktøyresultater utenfor kontekstvinduet. På ARC-AGI-3 gikk GPT-5.6 Sol fra 13,3 prosent med standardoppsettet til 38,3 prosent da OpenAI slo på persistert resonnering og compaction, med rundt seks ganger færre output-tokens.
Multi-agent ligger nå som beta i Responses API, der en primæragent fordeler deloppgaver til subagenter som jobber parallelt og leverer tilbake for syntese. Det er samme mekanikk som ultra-innstillingen i ChatGPT bruker. Prompt-cachen har fått minst 30 minutters levetid i hele 5.6-familien, og cache-brytpunkter kan settes deterministisk i stedet for at du håper på implisitt treff.
Byggeguiden nevner ikke kostnaden på den andre siden. OpenAIs egen API-dokumentasjon for 5.6 beskriver klassifikatorer for cyber- og biologimisbruk som kjører i sanntid mens svaret genereres, og som kan pause strømmen i flere sekunder eller blokkere forespørselen helt.
«Sikkerhetsmekanismene kan av og til gripe inn i legitimt arbeid, særlig på tvebruksområder der defensiv og offensiv aktivitet kan se like ut i starten» — OpenAIs API-dokumentasjon for GPT-5.6
For deg som bygger er det andre leddet i regnestykket det viktigste. Valget står ikke lenger mellom flaggskip og billigmodell, men mellom hvor mye test-time compute du gir en liten modell. Tallene er OpenAIs egne, målt i deres eget oppsett, så avstanden til din arbeidsflyt er en empirisk sak.
Hva bør du gjøre?
- Kjør din egen eval på ett nivå lavere resonnering enn i dag, med uendret oppsett, før du bytter modell.
- Flytt filtrering og aggregering av verktøyresultater ut av kontekstvinduet med programmatic tool calling, og mål tokens per fullført oppgave i stedet for pris per million.
- Sett cache-brytpunkter eksplisitt og hold på en stabil prompt_cache_key, nå som cachen lever i minst 30 minutter.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.