Hopp til hovedinnhold
Tilbake
Modell 3 min · Kilde: Hugging Face - Blog

Muse Glimmer: Metas 30B slår Gemma 4 på agenttester, men taper mot Qwen på terminalen

KI Takeaway KI-generert · kan inneholde feil

Slipper Meta modellen Muse Glimmer på 30 milliarder parametere med åpne vekter under Apache 2.0, bygget for å kjøre lokalt.

Muse Glimmer slår Gemma 4 på 31 milliarder parametere på alle de åtte testene for generell agentbruk som Hugging Face satte opp side om side 9. august, men taper mot Qwen 3.6 på 27 milliarder der agenten må styre en skjerm eller en terminal. På MCP Atlas står det 75,5 mot Gemma 4s 54,2 og Qwen 3.6s 62,5. På OSWorld-Verified snur bildet: 65,9 mot Qwens 75,6, og på TerminalBench 2.1 er det 51,7 mot 60,7. Begge konkurrentene måles i tenkemodus.

Modellen er tett, ikke en blanding av eksperter. To milliarder parametere går til en Perception Encoder som håndterer både bilder og video, 28 milliarder til tekstdekoderen. Oppmerksomheten veksler mellom tre lag med glidende vindu på 2 048 tokens og et fjerde lag med full oppmerksomhet uten posisjonskoding, et mønster som gjentas 13 ganger til 52 lag. Hvert nøkkel- og verdihode deles av 16 spørringshoder, noe som ifølge Hugging Face kutter KV-cachen med 16 ganger.

Støtten er på plass fra dag én i transformers, llama.cpp, vLLM med transformers-backend og Inference Endpoints. Meta har selv lagt ut kalibrerte GGUF-kvantiseringer, og Unsloth kommer med egne. Med på lasset følger DFlash, en lettvekts utkastmodell for spekulativ dekoding som foreslår inntil 15 tokens av gangen etter ett ankertoken. Den kan slås på med ett flagg, --spec-type draft-dflash, og treffer ifølge Hugging Face særlig godt på strukturert innhold som kode.

«Det kuleste med denne modellen er at den er en personlig assistent i lokal skala som kan kode» — Hugging Face, i lanseringsomtalen av Muse Glimmer

Kravene til maskinvare er likevel ikke beskjedne i full presisjon. Hugging Face oppgir én H100 med 80 GB som praktisk minimum for inferens og LoRA-finjustering i bf16, mens full finjustering trenger åtte. Kvantisering er altså ikke valgfritt for de fleste som vil kjøre den hjemme. Alle benchmarktallene er gjengitt slik de er publisert, altså Metas egne målinger, og de er ikke reprodusert av en tredjepart.

Sikkerhetstallene fortjener et blikk før du gir modellen verktøy. På Siren AgentDojo lykkes 28,4 av angrepsforsøkene, der lavere er bedre. Gemma 4 ligger på 25,6 og Qwen 3.6 på 40,3. På GPQA Diamond er Muse Glimmer lavest av de tre med 83,5. En modell som kan kjøre agentløkker på din egen maskin, kan også lokkes til det av en nettside den leser.

Hva bør du gjøre?

  1. Hent kvantiseringen direkte med llama serve -hf meta-models/Muse-Glimmer-30B-GGUF og legg til --spec-type draft-dflash hvis du vil ha spekulativ dekoding.
  2. Sett kontekstvinduet til 32 768 tokens når du kobler modellen til et agentverktøy, som i konfigurasjonen Hugging Face viser for OpenClaw.
  3. Kjør din egen prompt injection-test før du gir den filsystem eller nettverk, gitt AgentDojo-tallet.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter