Hopp til hovedinnhold
Tilbake
Modell 2 min · Kilde: RuntimeWire

VisionPsy-Nano kjører bildeforståelse på mobilen: 460 millioner parametere, Apache 2.0

KI Takeaway KI-generert · kan inneholde feil

Slapp Tether Data 29. juli to bildeforståelsesmodeller på 460 millioner parametere under Apache 2.0, bygget for å kjøre lokalt på telefonen.

En modell på 460 millioner parametere skal normalt tape mot en på over en milliard. VisionPsy-Nano gjør det på totalen, men ikke overalt: Tether Data oppgir at modellen slår både Qwen3.5-0.8B og InternVL3.5-1B rett ut på tre hele benchmarks, med 86,5 på ScienceQA, 42,3 på MM-IFEval og 87,9 i F1 på POPE, som måler motstand mot hallusinering.

Innenfor egen vektklasse er tallene tydeligere. Tether oppgir en normalisert samlescore på 62,3, mot 59,6 for Liquid AIs LFM2.5-VL-450M, 54,9 for basemodellen nanoVLM-460M-8k og 52,5 for Hugging Faces SmolVLM2-500M. Modellkortet sier den kommer gunstig ut på 16 av 17 offentlige benchmarks, med MMVet som eneste klare unntak.

Arkitekturen er nanoVLM: en SigLIP2-bildekoder koblet til SmolLM2-360M som språkmodell, 8 192 tokens kontekst og 512x512 som nativ oppløsning. Flash-varianten er den praktisk interessante. Den kollapser bildet til 64 visuelle tokens, altså 17 ganger færre enn nanoVLM-460M og SmolVLM2-500M, og det er prefill-kostnaden som avgjør hvor lang tid det tar før du ser det første tegnet.

«At vi oppnår klassens beste kvalitet og ytelse på generelle synsoppgaver med bare 460 millioner parametere, viser at lokal-først og svært effektiv KI er en farbar vei.» — Paolo Ardoino, daglig leder i Tether

Målt med 4-bits GGUF-bygg på Pixel 9, Galaxy S23, Galaxy S25 og iPhone 15 oppgir Tether at Flash når første token 19 til 23 ganger raskere enn nanoVLM-460M og SmolVLM2-500M, og opptil 36 ganger raskere på iPhone 15, med rundt 40 prosent lavere toppminne. Alle tallene er kjørt internt i ett VLMEvalKit-oppsett med Qwen3.6-27B som dommer, og endringene som trengs for å reprodusere dem ligger fortsatt som åpne pull requests hos VLMEvalKit.

Hva bør du gjøre?

  1. Hent Flash-varianten som 4-bits GGUF fra qvac-organisasjonen på Hugging Face og mål tid til første token på din egen enhet, ikke på Tethers.
  2. Regn med engelsk. Modellkortet oppgir engelsk som eneste språk, så norske kvitteringer og skjemaer krever finjustering før dette er brukbart.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter