Hopp til hovedinnhold
Tilbake
Modell 3 min · Kilde: Hugging Face - Blog

IBMs Granite 4.2 30B når 57 på SWE-bench Verified under Apache 2.0

KI Takeaway KI-generert · kan inneholde feil

Slipper tre resonnerende modeller under Apache 2.0 der 30B-utgaven treffer 57,0 på SWE-bench Verified, men bare 8B og 30B har vært gjennom agentisk trening.

Granite 4.2 er IBMs første familie av tette, resonnerende språkmodeller, sluppet i 3B, 8B og 30B under Apache 2.0. Den største modellen scorer 57,0 på SWE-bench Verified, 41,9 på SWE-bench Multilingual, 33,3 på SWE-bench Pro og 29,2 på Terminal-Bench 2.1. På resonneringssiden lander den på 89,2 på AIME25, 66,4 på GPQA og 77,6 på MMLU-Pro. Tallene kommer fra IBMs egen gjennomgang på Hugging Face.

Alle tre størrelsene har en bryter mellom tenkende og ikke-tenkende modus, pluss en lavterskelmodus som bruker et kort resonneringsbudsjett på enkle spørsmål. Verktøykall er innebygd: serveres modellen bak et OpenAI-kompatibelt endepunkt, for eksempel med vLLM, sender den kallene i OpenAI-formatet og kobles på eksisterende agentoppsett uten limkode. SGLang har egen oppskrift.

Skillet mellom størrelsene er det viktigste å forstå før du velger. 3B-modellen har fått grunnleggende RL og alignment, men ingen agentisk trening, og lander på 45,8 på tau-3-bench og 78,3 på AIME25. 8B har vært gjennom hele stigen med SWE-, terminal- og søkeagent, og scorer 47,7 på SWE-bench Verified og 20,6 på Terminal-Bench 2.1. 30B kjører samme stige med en ekstra runde verifiserbar RL og en egen SFT-fase for agentisk koding.

Treningen er kjørt fra bunnen av på rundt 15 billioner tokens i fem faser, der femte fase strekker kontekstvinduet til 512 000 tokens. Finjusteringen bruker rundt 7,2 millioner eksempler, cirka 100 milliarder tokens, fordelt på 31,6 prosent agentiske data og 68,4 prosent øvrige. Innenfor det agentiske settet står programvareutvikling for 69 prosent og verktøykall for 12,1 prosent. IBM brukte GPT-OSS-120B og Gemma 4 som dommermodeller for å kaste ut lavkvalitetseksempler, hallusinerte data og verktøykall mot funksjoner som ikke fantes i verktøylista.

Etterpå følger en RL-pipeline med ett steg per ferdighet, der hvert steg varmstarter fra forrige sjekkpunkt: verifiserbar RL, korte boostere for instruksjonsfølging og koding, deretter SWE-agent, terminal og søk, og til slutt RLHF. De agentiske stegene kjører i ekte miljøer, ikke simulerte: SWE-steget gir modellen et virkelig kodelager i sandkasse og belønner den bare hvis de skjulte testene passerer, mens terminalsteget lar den kjøre opptil 64 kommandorunder per rollout.

«3B er en sterk modell fra grunnleggende RL, mens 8B og 30B legger den agentiske RL-blokken på toppen og lærer å handle med verktøy i ekte miljøer» — Granite-teamet i IBM

Hele stacken er åpen på begge sider: NeMo-RL driver GRPO-løkka med Megatron-Core og vLLM, mens NeMo-Gym eksponerer sandkasser, verktøy og belønningsmodeller bak ett felles grensesnitt. Det er den uniformiteten som gjør at en enkel matteverifikator og et fullt kodelager ser like ut for treneren.

Hva bør du gjøre?

  1. Velg størrelse etter oppgave, ikke etter ledig minne. Skal modellen kalle verktøy, redigere filer eller kjøre kommandoer, er 8B den minste som faktisk er trent for det.
  2. Server den bak et OpenAI-kompatibelt endepunkt. Med vLLM eller SGLang slipper du å skrive om agentkoden din for å få verktøykallene i riktig format.
  3. Bruk lavterskel-tenkemodus som standard. Modellene fikk en straff for lange resonneringskjeder i siste treningssteg, men enkle spørsmål trenger fortsatt ikke full tenkemodus.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter