FastFlowLM 1.0 inn i ROCm: en 17 MB kjøretid for Ryzen-NPU-en
Flytter AMD FastFlowLM inn i ROCm med versjon 1.0, en 17 MB kjøretid som kjører språkmodeller på Ryzen AI-NPU-en alene.
AMD har lagt en NPU på hver eneste Ryzen AI-brikke siden Strix Point, og den har stort sett vært det minst brukte silisiumet i laptopen. FastFlowLM 1.0 kom 11. august som prosjektets første generelle utgivelse under ROCm-organisasjonen på GitHub, skriver hwbusters, og AMD peker dermed formelt på et utenforstående kjøretidsmiljø som veien inn til den blokka.
FastFlowLM, eller flm blant dem som bruker det, startet som et uavhengig prosjekt med ett formål: å få en språkmodell til å kjøre på en XDNA2-NPU uten å bruke en ettermiddag på avhengighetsarkeologi. AMD hentet inn teamet 17. juli, og v1.0.0 gjør papirarbeidet ferdig. Repoet ligger nå på ROCm/FastFlowLM, med saker, pull requests og commit-historikk overført fra det gamle stedet framfor startet på nytt.
Bruksmønsteret er lånt fra Ollama. Kommandoen flm run llama3.2:1b henter en modell og gir deg en chatprompt, og flm serve starter en lokal server på port 52625 som snakker OpenAI-APIet. Alt du allerede har pekt mot et lokalt endepunkt fungerer da uten en eneste kodeendring. Selve kjøretiden er 17 MB og installerer seg på rundt tjue sekunder.
Maskinvarekravene er smale. FLM treffer kun XDNA2-NPUer, altså Strix, Strix Halo, Kraken og Gorgon Point, og all inferens skjer på NPU-en alene mens CPU og integrert GPU står stille. Prosjektet oppgir over ti ganger bedre strømeffektivitet enn alternativene, og på en tynn laptop er det forskjellen på en assistent du kan la stå på hele dagen og en som starter viften hver gang du spør om noe. Kontekstvinduet strekker seg til 256k tokens på modeller som Qwen3-4B-Thinking-2507.
«v1.0.0 markerer vår første generelle utgivelse under ROCm-organisasjonen. Alt fra det gamle repoet, saker, pull requests og historikk, er overført, så ingenting går tapt i flyttingen.» > — FastFlowLM-teamet, i utgivelsesnotatet for v1.0.0
Utover flyttingen er hovedtilskuddet SmolVLA, en vision-language-action-modell som drar robotikk inn i en portefølje som til nå besto av språkmodeller og bildemodeller. Kommandoen flm bench kjører nå to iterasjoner per kontekstlengde fra 1k til 32k som standard, med flagget bench-iterations når du vil ha flere datapunkter. En feil i qwen3vl-it, der to bilder i samme forespørsel kunne gjøre at modellen ikke kjente igjen noen av dem, er også rettet.
Lisensen avgjør om du kan bygge på dette. Orkestreringskoden og kommandolinjeverktøyet er MIT, og de NPU-akselererte binærkjernene er gratis til all bruk, også kommersiell. Det er ikke en liten ting, gitt at kjernene er håndtunet gjennom AMDs IRON- og AIE-MLIR-verktøykjeder framfor kompilert fra noe portabelt. Binærfiler dekker Windows, Debian 13, Ubuntu 24.04, 25.10 og 26.04, pluss en generisk x86_64-tarball. Linux-støtten kom først i mars, via AMDs Lemonade Server.
Én fallgruve før du starter: FLM krever NPU-driver 32.0.203.304 eller nyere, og anbefaler .311. Mange Ryzen AI-maskiner står fortsatt på det som lå i esken.
Hva bør du gjøre?
- Sjekk NPU-driverversjonen før du installerer. FLM krever 32.0.203.304 eller nyere, og maskinen din kjører sannsynligvis den som fulgte med fra fabrikk.
- Pek et eksisterende verktøy mot port 52625 i stedet for å skrive om koden. Serveren snakker OpenAI-APIet, så en lokal klient du allerede bruker fungerer uendret.
- Mål strømforbruket på din egen maskin før du flytter en langtkjørende agent over. Tallet på over ti ganger kommer fra prosjektet selv, ikke fra en uavhengig test.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.