DeepSeek V4.1 Flash krymper KV-cachen til en firedel
Krymper KV-cachen til 890 byte per token og slår forgjengeren V4-Pro på flere agentbenchmarker, med vekter under MIT-lisens.
Forrige Flash-modell fra DeepSeek hadde 284 milliarder parametre og aktiverte 13 milliarder per token. DeepSeek-V4.1-Flash, som nå ligger på Hugging Face, er nesten dobbelt så stor med 552 milliarder backbone-parametre, men aktiverer bare 8 milliarder per token når den leser input og 16 milliarder når den skriver. Modellen forstår bilder og tekst, støtter kontekst på opptil 1 million tokens, og både repoet og vektene er lisensiert under MIT.
Grepet er en ny arkitektur DeepSeek kaller Causal Encoder-Decoder. De 40 lagene er delt i en kausal encoder på 20 lag og en decoder på 20 lag, og decoderens globale KV-cache projiseres fra encoderens siste skjulte tilstander i stedet for å regnes ut i hvert decoder-lag. Sammen med Compressed Sparse Attention 2 og FP4-lagring av hoved-cachen gir det omtrent en firedel av KV-cachen til V4-Flash, og rundt en åttedel av cachen som må lagres varig.
«Disse designvalgene reduserer det globale KV-cache-fotavtrykket til 890 byte per token, omtrent en firedel av DeepSeek-V4-Flash.» — DeepSeek-AI, modellkortet på Hugging Face
For deg som kjører agenter er dette mer enn en arkitekturdetalj. En agentløkke sender den samme lange konteksten inn gang på gang, og DeepSeek begrunner kompresjonen nettopp med regningen.
«Kostnader for cache-treff utgjør ofte en stor del av agentkostnadene. Å komprimere cachen kutter de kostnadene betydelig.» — DeepSeek, API-kunngjøringen av V4.1-Flash
I DeepSeeks egne tester med maksimal resonneringsinnsats scorer V4.1-Flash 90,6 på Terminal-Bench 2.1, mot 89,1 for Opus-5.0 og 88,8 for GPT-5.6 Sol. På DeepSWE v1.1 får den 74,2, mot 62,7 for V4-Pro. Forspranget gjelder ikke overalt: på Terminal-Bench 4.0 får den 31,2 mot 51,8 for Opus-5.0, og på HLE 36,8 mot 56,3. Oppsettet rundt modellen teller også. På DeepSWE v1.1 spenner resultatet fra 65,5 med OpenCode til 74,2 med mini-SWE, mens Claude Code ga 69,8.
I API-et heter modellen nå deepseek-flash. Ifølge kunngjøringen er V4-Flash og V4-Flash-Vision-Exp pensjonert, og kall til de gamle navnene rutes midlertidig til V4.1-Flash. Fra 14. september klokken 04.00 UTC går også alle kall til deepseek-v4-pro til V4.1-Flash, til V4.1-Flash-pris, fram til V4.1-Pro kommer.
Lokalt er modellen tung. Med 552 milliarder backbone-parametre og en Engram-hukommelse på 196 milliarder er dette ikke noe du kjører på ett skjermkort. Utgivelsen mangler også en Jinja-chatmal. DeepSeek legger i stedet ved en Python-referanse i encoding.py og Rust-bibliotekene i deepseek-recipe for promptformatet.
Hva bør du gjøre?
- Test agentene dine mot deepseek-flash før 14. september hvis du bruker deepseek-v4-pro i API-et, siden kallene uansett rutes dit.
- Bruk encoding.py eller deepseek-recipe til promptene hvis du serverer vektene selv, ettersom en ferdig chatmal mangler.
- Mål modellen i ditt eget agentoppsett før du bytter, siden DeepSeeks egne tall viser 8,7 poengs spenn mellom oppsett på samme benchmark.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.