LFM2.5-2.6B går fra 61 til 139 tokens i sekundet på MacBook
Doblet Liquid AI farten på LFM2.5-2.6B med åpne utkastmodeller som gir ordrett samme utdata som modellen alene.
En MacBook Pro med M4 Max kjørte LFM2.5-2.6B på 61 tokens i sekundet. Med DSpark-utkastmodellen foran seg gjør den 139. De fleste proprietære skymodellene ligger rundt 140 tokens i sekundet, opplyser Liquid AI, som slapp utkastmodellene 20. august for tre sjekkpunkter i LFM2.5-familien: 1.2B-Instruct, 2.6B og 8B-A1B.
Spekulativ dekoding er ikke nytt. En liten utkastmodell gjetter flere tokens fremover, målmodellen verifiserer hele blokken i én gjennomkjøring, og kostnaden ved å laste vektene fra minnet fordeles over flere tokens. Dekodefasen er minnebundet, ikke regnebundet, både på en H100 og på en laptop. DSpark kombinerer en parallell ryggrad i DFlash-stil, et sekvensielt hode modellert som en Markov-kjede mellom nabotokens, og en verifikator som kutter lavkonfidens-haler før målmodellen kaster sykluser på dem.
Det avgjørende for produksjonsbruk er at kvaliteten står stille. Modellkortet på Hugging Face formulerer det som at «you get the speedup, not a different model»: under grådig dekoding godtas et utkast-token bare hvis det matcher målmodellens eget valg, ellers overtar målmodellens token. Sekvensen blir identisk med basislinjen.
«We believe co-designing the model architecture with speculation methods to model real-world inference characteristics will be a crucial part of model design going forward» — Liquid AI
Tallene for 2.6B er målt med llama.cpp og Metal på M4 Max i FP16, og med SGLang på en H100 i BF16, begge med batch-størrelse 1. Snittet er 2,27x på MacBook og 2,67x på H100, der 323 tokens i sekundet blir 864. Utkastmodellene er små, rundt 300 millioner parametere hver, med fem attention-lag og blokkstørrelse 9.
Det mest relevante tallet for agentbyggere er likevel et annet. På BFCL-datasettet for verktøykall kutter DSpark latensen med 57 prosent i snitt for 2.6B. Agenter resonnerer foran hvert verktøykall, og brukeren venter gjennom hele runden, så korte og strukturerte genereringer er nettopp der spekulativ dekoding gir mest.
MoE-modellen skuffer på laptop. Liquid AI oppgir 2,54x på GPU for 8B-A1B, men bare 18 prosent forbedring på edge-enheter, fordi verifisering av flere tokens aktiverer flere eksperter og dermed mer vekttrafikk i Metal-backenden til llama.cpp. Selskapet publiserer tallene med den forklaringen og kaller det et tema for videre arbeid.
Hva bør du gjøre?
- Kjører du LFM2.5-2.6B lokalt: hent GGUF-utkastmodellen og legg den til i llama.cpp. Blokkstørrelsen leses fra utkastmodellens config, så det er ingen tuning å gjøre.
- Serverer du på GPU: SGLang tar DSpark via speculative-algorithm-flagget, og basislinjen er samme kommando uten de spekulative flaggene.
- Har du en agent som gjør mange verktøykall: mål latensen per kall før og etter. Gevinsten ligger der, ikke i lange svar.
- Kjører du 8B-A1B på Apple Silicon: vent. 18 prosent er ikke verdt bryet ennå.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.