KAT-Coder-V2.5-Dev tar 69,4 på SWE-bench med 3 milliarder aktive parametere
Slipper KAT-Coder-V2.5-Dev med åpne vekter, en MoE-modell på 35 milliarder parametere som tar 69,4 på SWE-bench Verified med bare 3 milliarder aktive.
Modellkortet til Kwaipilot på Hugging Face, publisert 23. juli, beskriver KAT-Coder-V2.5-Dev som den åpne utgaven av KAT-Coder-V2.5. Den er bygget videre på Qwen3.6-35B-A3B fra Alibaba: først instruksjonstrening på 127 000 eksempler, deretter forsterkningslæring. Resultatet ligger 5 prosentpoeng over basismodellen på SWE-bench Verified, 69,4 mot 64,4.
Tallene er Kwaipilots egne. Selskapet oppgir at det lastet ned de andre modellenes offentlige sjekkpunkter, kjørte dem gjennom vLLM eller SGLang i én felles pipeline og testet hver modell én gang. Ingen offisielt rapporterte tall fra de andre laboratoriene er brukt. På SWE-bench Multilingual står KAT-Coder-V2.5-Dev på 63,0 mot 57,0 for basismodellen, og på Scicode 44,2 mot 37,5. Terminal-Bench 2.1 er mer sammensatt: snittet på 41,0 dekker over 32,6 med Terminus-2 og 49,4 med Claude Code som kjøreramme.
Den mest lærerike delen av modellkortet handler om hva som gikk galt underveis. Under forsterkningslæringen begynte modellen å fyre av opptil 70 parallelle verktøykall i én tur, som blåste opp konteksten og fylte treningen med ugyldige baner og kjørefeil.
«En enkel binær belønning på 0 eller 1 førte til at modellen kollapset allerede i andre epoke» — Kwaipilot, i modellkortet
Kwaipilot la på straffer for parallelle kall, mislykkede kall, tomme verktøyblokker og gjentatt innhold, og fikk da ti stabile epoker. Effekten vises i to tall selskapet oppgir: feilaktige verktøymerkelapper falt fra 9,34 til 0,28 prosent, og gjentakelse innen samme tur fra 0,34 prosent til null.
I diskusjonstråden på modellkortet melder en bruker om at modellen holder på lange kontekster der de andre finjusterte Qwen-variantene ryker.
«Endelig knekker ikke denne modellen ved 32K kontekst. Arbeidskonteksten min er 1M, og den fungerer riktig i den størrelsen» — bruker i diskusjonstråden på Hugging Face
Påstanden er ikke etterprøvd. Kwaipilot svarte i samme tråd at det åpne sjekkpunktet støtter noe lengre sekvenser enn det opprinnelige, uten å bekrefte en million tokens. Serveringskommandoene i modellkortet setter maks kontekst til 262 144 tokens.
Den viktigste begrensningen står øverst i modellkortet: slippet inneholder bare språkmodellvektene, og synsmodulen er ikke med. For vLLM betyr det at flagget --language-model-only er påkrevd, ellers forsøker serveren å initialisere synsvekter som ikke finnes, og oppstarten feiler. SGLang kan ryke på samme måte. Kortet anbefaler tensorparallellitet over 8 GPU-er for full kontekst, så åpne vekter er her ikke det samme som at modellen kjører på maskinen din.
Hva bør du gjøre?
- Test modellen mot ditt eget repo før du stoler på tabellen. Alle resultatene er kjørt én gang av Kwaipilot selv, uten uavhengig etterprøving.
- Sett flagget --language-model-only når du serverer med vLLM, ellers stopper oppstarten på synsvekter som ikke ligger i slippet.
- Regn med 8 GPU-er for full kontekst på 262 144 tokens. Skal du kjøre lokalt på mindre, må du ned i kontekstlengde eller vente på kvantiserte varianter fra fellesskapet.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.