Hopp til hovedinnhold
Tilbake
Modell 3 min · Kilde: OfficeChai

DeepSeek V4-Flash-0731 scorer 82,7 på Terminal Bench til 0,14 dollar per million tokens

KI Takeaway KI-generert · kan inneholde feil

Oppdaterer DeepSeek V4-Flash til en 0731-versjon som scorer 82,7 på Terminal Bench 2.1 uten å endre arkitektur eller parameterantall.

Claude Sonnet 5 koster 3 dollar per million input-tokens. DeepSeek-V4-Flash-0731, som gikk i offentlig beta 31. juli, tar 0,14 dollar for det samme ved cache-bom og 0,0028 dollar når prompten treffer cachen. På Terminal Bench 2.1 oppgir DeepSeek 82,7 for den nye modellen, mot 85,0 for Claude Opus 4.8 i sammenligningen nettstedet officechai har satt opp fra DeepSeeks egne tall.

Det interessante er hva som ikke er endret. I endringsloggen skriver DeepSeek at 0731 beholder samme arkitektur og størrelse som V4-Flash-Preview og bare er post-trent på nytt. Oppdateringen gjelder utelukkende Flash-API-et: V4-Pro-API-et og app- og webversjonene står på sine gamle bygg, med en offisiell V4-Pro-utgivelse varslet som nært forestående. Modellen støtter nå Responses-formatet direkte og er tilpasset Codex, med 1 million tokens kontekst og maksimalt 384 000 tokens ut.

De øvrige agent-tallene DeepSeek publiserer: NL2Repo 54,2, Cybergym 76,7, DeepSWE 54,4, Toolathlon Verified 70,3 og Agents' Last Exam 25,2. Selskapet oppgir selv at Code Agent-testene ble kjørt i deres eget kjøreoppsett i minimal modus, et rammeverk som ennå ikke er sluppet, med maks innsatsnivå, top-p 0,95 og temperatur 1,0. Det gjør tallene vanskelige å reprodusere utenfra.

«Dette er mer spennende enn K3. DSv4-modellene er ekstremt billige å serve, og når kapasiteten deres øker, blir de gode nok til stadig flere oppgaver.» — NitpickLawyer, Hacker News

Diskusjonstråden på Hacker News, som passerte 440 poeng samme morgen, legger til to forbehold. Vektene for 0731 er ikke lagt ut ennå: preview-versjonen ligger på Hugging Face som en MoE-modell med 284 milliarder parametere og 13 milliarder aktive, men flere kommentatorer venter fortsatt på de nye. Modellen mangler også bildeforståelse, som flere trekker fram som den viktigste begrensningen for agent-oppgaver.

Prisregnestykket har en hake. DeepSeek varsler i prisdokumentasjonen at API-et snart går over til pristopp-modell med doblet pris i tidsrommene 09 til 12 og 14 til 18 kinesisk tid. Samtidighetsgrensen er 2 500 parallelle kall for Flash mot 500 for Pro. Utgivelsen kom dagen etter at OpenAI kuttet prisen på GPT-5.6 Luna med 80 prosent, til 0,20 dollar inn og 1,20 dollar ut, skriver officechai. Uavhengige tall er på vei: Artificial Analysis har publisert sin egen analyse av 0731, og der ligger modellen rundt dobbelt så billig per løste oppgave som Luna.

Hva bør du gjøre?

  1. Modellnavnet er uendret. Peker koden din allerede på deepseek-v4-flash, kjører du 0731 nå, uten endringer. Fest versjonen eksplisitt hvis du trenger reproduserbare resultater.
  2. Mål cache-treffraten din før du regner på kostnad. Forskjellen mellom 0,14 og 0,0028 dollar per million tokens er femti ganger, og den avgjør hele kalkylen.
  3. Kjør din egen eval mot dine egne oppgaver før du bytter. Tallene over er målt i et oppsett DeepSeek ikke har publisert ennå.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter