Mellum2.1 fra JetBrains: åpen 12B-kodemodell går fra 2 til 47 prosent på SWE-bench Verified
torsdag 8. oktober · KI-generert · Kilde: JetBrains Blog
Last ned Mellum2.1 i Q4_K_M-varianten på 8,1 GB hvis du vil ha en rask lokal sub-agent for koding, men regn med at Qwen3.5-9B fortsatt er sterkere på de tyngste agentoppgavene.
47 prosent av oppgavene i SWE-bench Verified løser JetBrains' nye Mellum2.1, mot 2 prosent for forgjengeren Mellum2. Det viser modellkortet JetBrains publiserte sammen med lanseringsposten 8. oktober, der selskapet slipper versjon 2.1 av den åpne kodemodellen under Apache 2.0. Arkitekturen er uendret: en mixture-of-experts-modell på 12 milliarder parametere, der 2,5 milliarder er aktive, med 64 eksperter (8 aktive per token) og et kontekstvindu på 131 072 tokens.
Hele hoppet kommer fra ettertrening. JetBrains flyttet forsterkningslæring (RL) fra et kort sluttsteg til hoveddelen av treningen, og kjørte millioner av sandkasser fordelt på tusenvis av miljøer. For programvareoppgavene jobber modellen inne i ekte repoer med skall og filredigering, og får belønning når testene passerer.
«Mellum2 var rask, men den klarte ikke å jobbe inne i et repository på det nivået vi ønsket.» — JetBrains, i lanseringsposten
Mellum2.1 slår likevel ikke alt i sin klasse. Qwen3.5-9B ligger foran på SWE-bench Verified (50,0), SWE-bench Pro (38,0 mot 28,0) og Terminal-Bench 2.1 (21,7 mot 17,4). Mellum2.1 vinner på LiveCodeBench v6 (82,0 mot 75,4) og på verktøykall i BFCL v4 (62,3 mot 58,5). Agenttestene ble kjørt med samme åpne agentoppsett for alle modellene, Pi v0.73.1 med skall- og filverktøy, men det er JetBrains selv som har målt.
Der Mellum2.1 skiller seg ut, er fart. Under tung last er den raskest av modellene i sammenligningen og leverer nesten dobbelt så mange tokens som Qwen3.5-9B, ifølge JetBrains. Fartsgrafen i posten måler output-tokens per sekund på ett H200-kort. Den oppgitte farten på rundt 1,6 ganger for enkeltforespørsler kommer fra multi-token prediction (MTP), og MTP-hodet for spekulativ dekoding i vLLM er ennå ikke sluppet.
Lanseringsposten sier at GGUF-bygg for llama.cpp, Ollama og LM Studio kommer snart. JetBrains har likevel allerede lagt ut et eget GGUF-repo på Hugging Face med fem varianter, fra BF16 på 24,3 GB ned til MXFP4_MOE på 7,0 GB. Anbefalt variant er Q4_K_M på 8,1 GB, som ifølge JetBrains' egne målinger velger samme topp-token som BF16 i 88,0 prosent av tilfellene.
«Alle verdiene er selvrapportert av JetBrains.» — modellkortet for Mellum2.1 på Hugging Face
Hva bør du gjøre?
- Start modellen lokalt med
llama-server -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M, som gir deg et OpenAI-kompatibelt API på port 8080. - Bruk den som rask sub-agent for avgrensede jobber, som å finne rotårsaken til en test som feiler, og la en større modell ta planleggingen.
- Sett av token-budsjett: Mellum2.1 er en thinking-modell, og JetBrains bruker
max_tokenspå 81 920 i sine egne eksempler.