Liquid AI slipper LFM2.5-2.6B: lokal agent på 220 tokens i sekundet
Slipper Liquid AI agentmodellen LFM2.5-2.6B, som kjører lokalt på under 2,5 GB minne og gjør 220 tokens i sekundet på en Apple M5 Max.
«Koding er det ene stedet der de større modellene beholder et klart forsprang, så strekk deg etter noe større der.» Formuleringen står i Liquid AIs egen lanseringstekst, midt i en ellers selvsikker gjennomgang av benchmarktall. Den avgrenser presist hva LFM2.5-2.6B er bygget for: verktøykall og instruksjonsfølging på enheten din, ikke kodegenerering.
Modellen har 2,6 milliarder parametere, er pretrent på rundt 34 billioner tokens og har et kontekstvindu på 128 000 tokens. Liquid AI måler 220 tokens i sekundet på en Apple M5 Max og 113 tokens i sekundet på en Ryzen AI Max+ 395, alt innenfor 2,5 GB minne. På telefon oppgir selskapet rundt 30 tokens i sekundet, nok til at en agent faktisk kan kjøre der.
Tallene som betyr noe for agentbygging er instruksjonsfølging og verktøykall. LFM2.5-2.6B topper alle instruksjonsbenchmarkene i Liquid AIs eget oppsett med 59,17 på IFBench, 80,07 på Multi-IF og 85,49 på IFStruct, mot modeller opptil fire ganger større. På verktøykall scorer den 56,88 på BFCLv4 og 77,83 på ToolSandbox, der bare en Qwen3.5 på 9,7 milliarder parametere går forbi på den første.
Utgivelsen føyer seg inn i en tett serie fra Liquid AI. LFM2.5-familien startet med 1,2-milliardersmodellen i januar 2026, fikk en mixture-of-experts-variant på 8 milliarder i mai, og en 230-millionersmodell for de aller minste enhetene. Oppskriften bak 2.6B er den samme selskapet har brukt hele veien: to runder veiledet finjustering vektet mot agentdata, én spesialisert lærermodell per domene, destillasjon ned til én elevmodell, og til slutt forsterkningslæring inne i ekte agentrammeverk som OpenClaw og Hermes Agent.
Det siste steget er det som skiller modellen fra en vanlig småmodell. Liquid AI kjører treningen gjennom en proxy som lar dem behandle agentrammeverket som en svart boks, uten å endre det, samtidig som de fanger opp tokennivå-sporene de trenger for å rekonstruere og validere treningsdataene. Modellen lærer altså å jobbe i det rammeverket den senere skal kjøre i.
Uavhengige tester av forrige generasjon gir likevel grunn til å måle selv før du velger størrelse. En utvikler som bygde et stemmetastatur på en Raspberry Pi 5 sammenlignet LFM2.5-1.2B-Thinking med den eldre LFM2-2.6B i februar 2026 og landet på den minste:
«Større er ikke bedre. Jeg kjørte tallene. 1,2B-modellen vinner.» — DoDataThings.dev
Det gjaldt forrige arkitekturgenerasjon, ikke den nye 2.6B-en. Poenget står likevel: minnebudsjettet ditt deles ofte med Whisper eller andre modeller på samme brett, og en modell som er dobbelt så rask kan slå en som scorer høyere på papiret.
Det praktiske for deg som bygger lokalt er støtten fra dag én i llama.cpp, MLX, vLLM, SGLang og ONNX, pluss en WebGPU-demo som kjører i nettleseren uten oppsett. Både LFM2.5-2.6B og basevarianten ligger på Hugging Face.
Hva bør du gjøre?
- Last ned LFM2.5-2.6B fra Hugging Face og kjør den via llama.cpp eller MLX på maskinen du faktisk skal bruke, ikke på en M5 Max hvis målet er en Ryzen eller en telefon.
- Mål verktøykall og instruksjonsfølging på dine egne oppgaver før du bytter ut en større modell, og hold kodegenerering utenfor testen.
- Sammenlign minnebruk og hastighet mot LFM2.5-1.2B på samme oppgave hvis du deler RAM med andre modeller.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.