Hopp til hovedinnhold
Tilbake
Kvantisering 2 min · Kilde: TechPowerUp

LattePanda Mu Ultra kjører Qwen3.5-9B lokalt på 18 tokens i sekundet

KI Takeaway KI-generert · kan inneholde feil

Pakker 115 TOPS og 16 GB minne inn i en x86-modul på 69,6 × 60 millimeter til 599 dollar.

18 tokens i sekundet med Qwen3.5-9B, og 55 med Qwen3.5-2B. Det er tallene LattePanda oppgir for Mu Ultra, beregningsmodulen selskapet lanserte 9. september. Testene kjørte INT4-kvantisering gjennom OpenVINO GenAI på den integrerte GPU-en, ikke på NPU-en.

Modulen bygger på Intel Core Ultra 5 226V eller Ultra 7 256V, og LattePanda oppgir opptil 115 TOPS i INT8 når CPU, GPU og NPU regnes sammen. NPU-en alene står for 47 av dem. Minnet er 16 GB LPDDR5X-8533, og opptil 11,6 GB kan allokeres som grafikkminne. Det taket er i praksis budsjettet en lokal modell og KV-cachen må dele på.

Programvaresiden avgjør om dette er brukbart for deg. Modulen kjører Windows og Linux, og LattePanda oppgir støtte for Intel OpenVINO, llama.cpp og Ollama. Formfaktoren på 69,6 × 60 millimeter og et tomgangsforbruk ned mot 2,5 W peker mot innebygde systemer og roboter framfor skrivebordet, og prisen starter på 599 dollar i LattePandas egen nettbutikk.

Hva bør du gjøre?

  1. Regn på 11,6 GB, ikke 16. Grafikkminnetaket bestemmer hvilken modell du får plass til sammen med KV-cachen, og en 9B-modell i INT4 ligger allerede godt inne i det budsjettet.
  2. Verifiser tokenhastigheten mot din egen stack. Tallene er LattePandas egne, målt med OpenVINO GenAI på iGPU-en, så kjører du llama.cpp eller Ollama i stedet er utgangspunktet et annet.
  3. Sjekk carrier-boardet du allerede har. Mu Ultra beholder formfaktoren og kontakten fra Mu-familien og skal passe eksisterende kort, som er forskjellen på et modulbytte og en helt ny design.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter