LFM2.5-VL-3B kjører på 3 GB minne og leser skjermbilder
Kjører Liquid AIs nye LFM2.5-VL-3B på rundt 3 GB minne og dekoder 228 tokener i sekundet på en M5 Max.
228 tokener i sekundet på en M5 Max, 116 på en Ryzen AI Max+ 395 og 20 på en Galaxy S26 Ultra. Det er tallene Liquid AI oppgir for LFM2.5-VL-3B, en visjonsmodell på 3,1 milliarder parametere som selskapet nå har lagt ut på Hugging Face. Modellen har støtte fra dag én i llama.cpp, MLX, vLLM, SGLang og ONNX.
Fire ting er nye siden forrige generasjon: forståelse av skjermer og brukergrensesnitt, grounding og objektdeteksjon fra naturlig språk, resonnering over flere bilder samtidig, og funksjonskall. Skjermforståelsen er der spranget er størst. På ScreenSpot-v2 for skrivebord går modellen fra 6,0 til 78,7 poeng mot forgjengeren LFM2-VL-3B, og på RefCOCO-snittet fra 57,1 til 87,9. Samlet snitt over vision-testene er 69,4 mot 57,2. Det plasserer modellen på linje med InternVL 3.5 4B, som har 4,7 milliarder parametere, og like bak Qwen3.5-4B på 70,1.
Under panseret sitter en SigLIP2 400M NaFlex-encoder koblet til samme forhåndstrente basismodell som tekstmodellen LFM2.5-2.6B. Treningen brukte rundt 34 billioner tokener med fire ganger så mye visuelle data som før, og vokabularet ble doblet til 128 000 ved å utvide tokenizeren i stedet for å trene den på nytt. Det siste er grepet som gjør at ikke-latinske skriftsystemer fungerer bedre.
Tallene er Liquid AIs egne, målt med vLLM 0.26.0 og uten resonneringsmodus. For deg som bygger agenter som skal klikke i grensesnitt, er skjermforståelse kombinert med funksjonskall på en modell som får plass i 3 GB likevel en kombinasjon som til nå har krevd et API-kall ut av maskinen.
Hva bør du gjøre?
- Test grounding på dine egne skjermbilder før du stoler på ScreenSpot-tallene. Testsettene er engelskspråklige, og norske grensesnitt er ikke representert i dem.
- Kjører du på telefon eller laptop, mål minnebruken under reell last. 3 GB er modellens fotavtrykk, ikke det bildene og konteksten legger oppå.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.