Hopp til hovedinnhold
Tilbake
Gemini 3 min · Kilde: The Decoder

Gemini 3.8 Flash tar 73,7 prosent på DeepSWE, men koster 40 prosent mer per oppgave

KI Takeaway KI-generert · kan inneholde feil

Sammenlign kostnad per oppgave, ikke pris per token, før du bytter fra Gemini 3.7 Flash til 3.8 Flash.

73,7 prosent på DeepSWE v1.1 er tallet Google leder med for Gemini 3.8 Flash, benchmarken for programvareoppgaver som strekker seg over mange steg. Det er så vidt under Claude Opus 5 på 74,0 prosent, og godt foran GPT-5.6 Sol på 72,7 prosent, Claude Sonnet 5 på 53,8 prosent og forgjengeren 3.7 Flash på 65,3 prosent. Dette er Googles tredje Flash-modell på seks uker, skriver The Decoder, mens Gemini 3.5 Pro og Gemini 4 fortsatt uteblir.

Prisen er 0,75 dollar per million input-tokens og 3,75 dollar per million output-tokens, det samme som 3.7 Flash. Fra januar 2027 stiger den til 1,50 og 7,50. Til sammenligning koster Claude Opus 5 5,00 og 25,00 dollar, GPT-5.6 Sol 4,00 og 20,00. Selv etter prishoppet ligger 3.8 Flash altså langt under toppmodellene per token.

Per token. Det er der regnestykket sprekker. Google forklarer selv deler av forbedringen med at 3.8 Flash kjører flere resonneringssteg på komplekse oppgaver og kaller verktøy iterativt. Modellen «jobber hardere», som Google formulerer det, og hardere arbeid er flere tokens. Artificial Analysis måler kostnad per oppgave til 0,58 dollar mot 0,40 dollar for 3.7 Flash, en økning på rundt 40 prosent, selv om tokenprisen står stille. Google anbefaler derfor selv lavere resonneringsnivå eller å bli på 3.7 Flash når kompute-effektivitet er det som teller.

Intelligence Index fra Artificial Analysis setter 3.8 Flash på 59, tre poeng over forgjengeren og på linje med GPT-5.6 Sol på xhigh og Grok 4.6 på medium. Gevinsten kommer i hovedsak fra agentiske benchmarks: verktøybruk og koding. På høyt resonneringsnivå produserer modellen rundt 300 output-tokens i sekundet med 2,5 minutter snittid per oppgave, tregere enn Claude Fable 5.1 på 2,1 minutter og faktisk tregere enn gamle 3.7 Flash på 2,2. På lavt nivå faller tiden til rundt 48 sekunder.

Den andre utgaven, 3.8 Flash Cyber, får du ikke tak i. Google distribuerer den gjennom Fairwind-programmet til offentlige etater, operatører av kritisk infrastruktur og programvarevedlikeholdere, med mindre restriktive sikkerhetsinnstillinger fordi den er bygget for defensivt sikkerhetsarbeid. Den scorer 86,2 prosent på CyberGym for sårbarhetsdeteksjon i C og C++, mot 83,6 for GPT-5.6 Sol.

Ett tall er verdt å merke seg for alle som bygger agenter: på Gray Swan sin IPI-benchmark for prompt-injeksjon har Gemini 3.8 Flash en angreps-suksessrate på 5,5 prosent. DeepSeek V4 Pro ligger på 60,1 prosent, Kimi K3 på 52,7 og Grok 4.6 på 51,8. Bare Claude Opus 5 gjør det marginalt bedre, med 4,8 prosent.

Modellen er tilgjengelig i Google AI Studio, Google Antigravity og Android Studio.

Hva bør du gjøre?

  1. Kjør din egen arbeidsmengde gjennom begge modellene og mål totalkostnad per fullført oppgave, ikke tokenpris. Med 40 prosents økning i tokenforbruk kan 3.8 Flash bli dyrere enn 3.7 Flash på oppgaver som allerede løses greit.
  2. Skru ned resonneringsnivået som første grep hvis kostnaden løper. Google peker selv på det før de peker på modellbytte.
  3. Legg inn prishoppet i januar 2027 i budsjettet nå. Introduksjonsprisen dobles, og en agent som kjører kontinuerlig merker det umiddelbart.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter