DeepSeek gir V4-Flash syn: 36,5 mot 26,2 på ApexBench
Last ned DeepSeek-V4-Flash-Vision-Exp hvis du bygger agenter som må lese skjermbilder og diagrammer, men regn med serverklasse-maskinvare.
DeepSeek la ut DeepSeek-V4-Flash-Vision-Exp på Hugging Face, den første multimodale modellen i V4-familien. Den bygger på arkitekturen fra DeepSeek-V4-Flash og har fått visuelle moduler og videre trening oppå, i stedet for å være trent fra bunnen som en egen multimodal modell.
Tallene i modellkortet forteller hvor gevinsten ligger. På ApexBench går den fra 26,2 til 36,5 mot forgjengeren DeepSeek-V4-Flash-0731, og på Agents' Last Exam fra 25,2 til 27,3. Begge er multimodale agent-benchmarker, og DeepSeek noterer selv at 0731-modellen rett og slett ignorerte de multimodale elementene i inputen. Det er altså ikke en marginal forbedring, men forskjellen mellom å se bildet og ikke se det.
På rene tekstoppgaver holder den stillingen. Terminal Bench 2.1 går fra 82,7 til 83,9 og DeepSWE fra 54,4 til 59,3, mens Cybergym faller litt, fra 76,7 til 75,3. Det er den interessante delen for deg som allerede kjører en DeepSeek-modell i en agentsløyfe: syn er lagt til uten at kodeevnen ble ofret. Til sammenligning oppgir DeepSeek at Opus-4.8 ligger på 85,0 på Terminal Bench 2.1 og 39,4 på ApexBench, så gapet mot toppen er der, men det er ikke stort på agent-terminaloppgaver.
Kan du kjøre den lokalt?
Kort svar: neppe på en laptop. Hugging Faces metadata for repoet summerer vektene til rundt 305 milliarder parametere, lagret i fp8, og config-filen beskriver en MoE-modell med 256 rutede eksperter der seks er aktive per token. Aktiv beregning per token er altså langt lavere enn totalvekten, men du må fortsatt ha hele modellen i minne et sted.
Til gjengjeld er terskelen for å prøve lav hvis du har maskinen. Modellkortet gir ferdige kommandoer for vLLM, SGLang og Docker Model Runner, og repoet inneholder en minimal PyTorch-implementasjon som dekker vision-encoderen, aligneren, DFlash-attention, MoE og Hyper-Connections. Prompt-koding er bevisst skilt fra inferens, slik at du kan formatere prompter uten å dra inn PyTorch. Lisensen er MIT, som er uvanlig romslig for en modell i denne størrelsesklassen.
Hva bør du gjøre?
- Start med vLLM eller SGLang hvis du har GPU-kapasitet. Begge har ferdige serve-kommandoer i modellkortet og eksponerer et OpenAI-kompatibelt endepunkt, så eksisterende klientkode fungerer uendret.
- Merk deg at dette er merket eksperimentelt, både i navnet og i introduksjonen. Bygg ikke produksjonsflyt på den før DeepSeek slipper en stabil variant.
- Sammenlign mot din egen oppgave, ikke mot benchmarklista. DeepSeek kjørte tekstbenchmarkene med sitt eget agent-rammeverk i minimal modus, med maks resonneringsnivå, temperature 1,0 og top_p 0,95. Kjører du et annet oppsett, får du andre tall.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.