OpenAIs Jalapeño gir 1,9 ganger flere tokens per kilowatt enn GB200
Måler egen inferensbrikke til 1,9 ganger flere tokens per kilowatt og 1,7 ganger lavere latens enn et Nvidia GB200-system på GPT-OSS 120B.
OpenAI la 25. august fram de første målte resultatene for Jalapeño, selskapets første egenutviklede brikke for inferens. Målingene er gjort på InferenceX, en offentlig benchmark fra analysehuset SemiAnalysis som dekker hele veien fra forespørsel til ferdig svar. På GPT-OSS 120B leverte Jalapeño 85 448 tokens per kilowatt mot 44 960 for sammenligningssystemet, og ende-til-ende-latensen falt fra 1,80 til 1,03 sekunder.
Testene dekker tre åpne modeller: GPT-OSS 120B, DeepSeek R1 på 670 milliarder parametere og Kimi K2.5 på 1 billion. Over alle tre oppgir OpenAI 1,5 til 1,9 ganger mer arbeid per watt ved topp gjennomstrømning og 1,7 til 3,6 ganger lavere ende-til-ende-latens enn sammenligningssystemene. For sterkt interaktive arbeidslaster, som er dem agenter lager mest av, er spennet 2,1 til 4,1 ganger høyere ytelse. Tallene er normalisert mot hver akselerators oppgitte effektbudsjett: Jalapeño er klassifisert til 700 watt og GB200 til 1200 watt, mens Jalapeños målte vedvarende effekt holdt seg på eller under 550 watt.
«Jalapeño leverer både høyere gjennomstrømning og lavere latens med én arkitektur, der eksisterende maskinvaresystemer ofte må gjøre en avveining mellom de to» — OpenAI
Utviklingsløpet er den delen som er mest interessant for deg som bygger. OpenAI oppgir at brikken gikk fra første design til tapeout på ni måneder, med selskapets egne modeller inne i løkka for å utforske implementasjoner og korte ned design- og verifikasjonsrundene. Da teamet skulle støtte tre modeller med åpne vekter som ikke lå i den opprinnelige produksjonsplanen, brukte de Codex med GPT-Astra og fikk dem opp på høy ytelse i løpet av to måneder. For utvalgte attention- og mixture-of-experts-blokker i GPT-OSS kjørte KI-genererte implementasjoner 1,5 til 1,8 ganger raskere enn de menneskeskrevne ekspertversjonene. OpenAI presiserer at de tallene gjelder de utvalgte blokkene, ikke hele modellen.
Arkitekturvalget handler om å flytte minst mulig data. Inferens går gjennom to faser med ulike flaskehalser: prefill, der prompten prosesseres, er regnetung, mens decode, der svaret genereres token for token, begrenses av minnebåndbredde. Jalapeño lar modelltilstanden, inkludert KV-cachen, plasseres eksplisitt og bli liggende lokalt, og nettverksdomenet er stort nok til å holde hele arbeidslasten innenfor ett sammenkoblet system.
OpenAI planlegger å ta Jalapeño i bruk i egen infrastruktur før årsskiftet, og beskriver generasjon 2 som godt i gang og generasjon 3 som under utforming. Selskapet understreker samtidig at det fortsatt vil kjøpe akseleratorer fra Nvidia og andre partnere til både trening og inferens. I en parallell post om compute-strategien lister OpenAI opp AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy og SoftBank ved siden av Microsoft og Nvidia.
For deg som bygger på API-et, ligger poenget i kostnaden per fullførte oppgave, ikke i brikketellingen. Klarer OpenAI å servere samme jobb på under halve effekten, er det den marginen som til slutt bestemmer hva et kall koster. At InferenceX er offentlig, betyr dessuten at tallene kan etterprøves av andre enn OpenAI selv.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.