DeepSeek V4 Flash 0731: 82,7 prosent på Terminal-Bench til 68 dollar
Topper DeepSeek V4 Flash 0731 Antigmas Terminal-Bench 2.1-tabell med 82,7 prosent, til 68,41 dollar for hele kjøringen.
82,7 prosent av 89 oppgaver, fordelt på 445 forsøk. Det er resultatet DeepSeek V4 Flash 0731 fikk da Antigma kjørte modellen gjennom Terminal-Bench 2.1 med sin egen Ante-agent 9. august 2026, og det plasserer modellen øverst i Antigmas tabell.
Prisen skiller den fra resten av feltet. Kjøringen kostet 68,41 dollar. Grok 4.5 på andreplass med 80,9 prosent kostet 242,57 dollar, og GLM 5.2 på tredjeplass kostet 260,11 dollar for 74,6 prosent. DeepSeeks egen V4 Pro er billigere igjen, 26,34 dollar, men lander på 69,1 prosent. Til gjengjeld er Flash 0731 treg: 38,9 minutter, mot 8,4 minutter for Grok 4.5.
Tallene kan ikke sammenlignes direkte med den Terminal-Bench-tabellen folk flest siterer. Antigma måler alle modellene gjennom sin egen Ante-agent, mens referansetabellen fra Vals AI måler agent og modell sammen: Claude Code med Fable 5 ligger på 83,8 prosent og Codex med GPT-5.5 på 83,2 prosent. Bytter du agentramme, flytter tallene seg. Standardfeilen på 1,79 prosentpoeng gjør dessuten avstanden ned til Grok 4.5 statistisk tynn.
For deg som velger modell til en kodeagent sier kostnad per fullført oppgave mer enn plasseringen: 68,41 dollar fordelt på 445 forsøk er rundt 15 cent per forsøk, og tåler agenten din 39 minutters kjøretid, er dette den billigste veien inn i toppsjiktet av tabellen.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.