Hopp til hovedinnhold
Tilbake

MiniCPM5-2B slår Qwen3.5-4B på snittet av 34 benchmarks og kjører på enheten

KI Takeaway KI-generert · kan inneholde feil

Slipper OpenBMB modellen MiniCPM5-2B under Apache 2.0, med et snitt på 53,9 over 34 benchmarks og tydeligst forsprang på verktøybruk.

En modell på 2,52 milliarder parametere ligger foran en på fire milliarder. OpenBMB oppgir at MiniCPM5-2B snitter 53,9 poeng over 34 benchmark-rader, mot 51,1 for Qwen3.5-4B, 42,7 for granite-4.2-3B og 33,2 for LFM2.5-2.6B, skriver MarkTechPost. Rader hentet fra Artificial Analysis er merket separat fra dem OpenBMB har reprodusert selv.

Forspranget er ujevnt fordelt, og det er verktøybruk som bærer snittet. Der er marginen størst, med 97,1 på tau2-Bench Telecom, 66,6 på BFCL v4 og 20,8 på tau3-Bench Banking mot 6,8 for sammenligningsmodellen. Kodearbeid følger etter: 69,1 på LiveCodeBench v6 mot 56,4, og 46,4 på SWE-bench Verified mot 33,6. På allmennkunnskap slår størrelsen tilbake, med 70,8 på MMLU-Pro mot 78,0. Dette er altså en agent- og verktøymodell, ikke en kunnskapsmodell.

Arkitekturen er grunnen til at du kan prøve den med en gang. Modellen bruker standard LlamaForCausalLM med 42 lag, grouped-query attention med 16 query-hoder og 2 key/value-hoder, og et kontekstvindu på 131 072 tokens. Vektene er Apache 2.0 og lastes av vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX og FlagOS uten egne kjerner og uten en gaffel av modellkoden.

OpenBMB har også publisert treningsdataene, blant dem Ultra-FineWeb, UltraData-SFT-Agent-2609 med 500 000 agent-eksempler og UltraData-RL-2609 med over 80 000 RL-eksempler, sammen med mellomsjekkpunkter for Base, Midtrain og SFT. Ettertreningen kombinerer 400 milliarder tokens dyptenkende SFT, spesialiserte RL-lærere og on-policy-destillasjon som slår sammen 16 RL-eksperter til én utgitt modell. Med sjekkpunktene ute kan du selv måle hvor mye hvert steg bidro, i stedet for å ta snittet på tro.

Hva bør du gjøre?

  1. Test den på verktøykall og kodeagenter først: det er der forspranget faktisk er målt, ikke på kunnskapsoppgaver.
  2. Hent vektene via Ollama eller llama.cpp hvis du vil kjøre lokalt, siden standard Llama-arkitektur betyr at eksisterende oppsett laster den uendret.
  3. Bruk mellomsjekkpunktene hvis du skal finjustere: Base- og SFT-only-versjonene gir et renere utgangspunkt enn den ferdig destillerte modellen.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter