Hopp til hovedinnhold
Tilbake

ds4 får synsstøtte: DeepSeek V4 Flash leser bilder lokalt på Metal, CUDA og ROCm

KI Takeaway KI-generert · kan inneholde feil

Legg til en bildeenkoder på 0,9 GiB, så leser DeepSeek V4 Flash bilder lokalt gjennom ds4 på Metal, CUDA eller ROCm.

llama.cpp prøver å kjøre alt. ds4 gjør det motsatte. README-en i antirez/ds4 beskriver prosjektet som en liten, innebygd inferensmotor bygget først for DeepSeek V4 Flash, og slår uttrykkelig fast at den ikke er en generell GGUF-kjører. Nå har den smale motoren fått noe de brede sjelden har på plass først: syn.

«It is self-contained and deliberately narrow, not a general GGUF runner.» — README, antirez/ds4

Synsstøtten er ikke en bryter du skrur på i tekstmodellen. Vision-Exp er et eget DeepSeek-sjekkpunkt, ikke 0731-tekstmodellen, og det kjører med en tilhørende språk-GGUF pluss en egen bildeenkoder på 0,9 GiB. Salvatore Sanfilippo anbefaler Q2-versjonen for maskiner med 96 og 128 GB minne, som er akkurat det spennet en godt utstyrt MacBook eller Framework Desktop lander i.

Når enkoderen er lastet, får du tre veier inn. I det interaktive grensesnittet skriver du «/read image.png». Samme «--vision»-flagg gir kodeagenten ds4-agent et «view_image»-verktøy, og det åpner bildeinngang gjennom ds4-server. Det siste er poenget for deg som allerede kjører ds4-server som en liten intern modelltjeneste: klientene dine kan sende bilder uten at du bytter motor.

Maskinvarelista er kort og konkret. Metal er hovedmålet, på Mac-er med 96 GB eller mer, mens mindre maskiner kan bruke SSD-strømming av vektene. NVIDIA CUDA dekker også fler-GPU-systemer og DGX Spark. ROCm dekker Strix Halo-systemer som Framework Desktop. Motoren er lisensiert under MIT.

Prosjektet er ærlig om modenheten, og det bør du ta med i vurderingen før du setter det i noe som må stå stabilt.

«The software is currently very fast changing. Consider it beta quality.» — README, antirez/ds4

Bakgrunn

ds4 følger bevisst de beste åpne vektene for maskinstørrelser folk faktisk har, særlig 128 GB-laptoper og 512 GB-arbeidsstasjoner, og README-en varsler at en modell kan bli fjernet når noe bedre kommer. Motoren støtter i tillegg GLM 5.2 og 5.3 samt GLM 5.3 Flash, og på maskiner med svært mye minne DeepSeek V4 PRO. Modellasting, promptgjengivelse, verktøykall, KV-tilstand, HTTP-serveren og kodeagenten bygges og testes sammen, som er hele begrunnelsen for å holde støtten smal.

Hva bør du gjøre?

  1. Sjekk minnet først. Har du 96 eller 128 GB, hent Q2-versjonen av synsmodellen. Har du mindre, må du regne med SSD-strømming og lavere hastighet.
  2. Last ned synsmodellen og enkoderen som to separate ting. Språk-GGUF-en og bildeenkoderen hører sammen, og enkoderen peker du på med «--vision».
  3. Test gjennom ds4-server hvis du allerede har klienter mot den. Da får du bildeinngang uten å endre noe annet i oppsettet.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter