LattePanda Mu Ultra kjører Qwen3.5-9B lokalt på 18 tokens i sekundet
Pakker 115 TOPS og 16 GB minne inn i en x86-modul på 69,6 × 60 millimeter til 599 dollar.
18 tokens i sekundet med Qwen3.5-9B, og 55 med Qwen3.5-2B. Det er tallene LattePanda oppgir for Mu Ultra, beregningsmodulen selskapet lanserte 9. september. Testene kjørte INT4-kvantisering gjennom OpenVINO GenAI på den integrerte GPU-en, ikke på NPU-en.
Modulen bygger på Intel Core Ultra 5 226V eller Ultra 7 256V, og LattePanda oppgir opptil 115 TOPS i INT8 når CPU, GPU og NPU regnes sammen. NPU-en alene står for 47 av dem. Minnet er 16 GB LPDDR5X-8533, og opptil 11,6 GB kan allokeres som grafikkminne. Det taket er i praksis budsjettet en lokal modell og KV-cachen må dele på.
Programvaresiden avgjør om dette er brukbart for deg. Modulen kjører Windows og Linux, og LattePanda oppgir støtte for Intel OpenVINO, llama.cpp og Ollama. Formfaktoren på 69,6 × 60 millimeter og et tomgangsforbruk ned mot 2,5 W peker mot innebygde systemer og roboter framfor skrivebordet, og prisen starter på 599 dollar i LattePandas egen nettbutikk.
Hva bør du gjøre?
- Regn på 11,6 GB, ikke 16. Grafikkminnetaket bestemmer hvilken modell du får plass til sammen med KV-cachen, og en 9B-modell i INT4 ligger allerede godt inne i det budsjettet.
- Verifiser tokenhastigheten mot din egen stack. Tallene er LattePandas egne, målt med OpenVINO GenAI på iGPU-en, så kjører du llama.cpp eller Ollama i stedet er utgangspunktet et annet.
- Sjekk carrier-boardet du allerede har. Mu Ultra beholder formfaktoren og kontakten fra Mu-familien og skal passe eksisterende kort, som er forskjellen på et modulbytte og en helt ny design.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.