Hopp til hovedinnhold
Tilbake

VeriLoop E2: 27B-modell lover 76,2 % på SWE-bench Pro, men tallene krever et lukket kjøremiljø

KI Takeaway KI-generert · kan inneholde feil

Test VeriLoop E2 som lokal kodemodell på et 24 GB-kort, men regn ikke med benchmarktallene: de er målt med et verifiseringslag som ikke er sluppet.

VeriLoop E2 oppgir 76,2 % på SWE-bench Pro, 11,6 poeng foran OpenAIs GPT-5.6 Sol og 5 poeng bak Anthropics Claude Fable 5.1, med bare 27 milliarder parametere. Modellen er post-trent fra Qwen3.8-27B, ble lagt ut på Hugging Face 22. september under Apache 2.0, og har 262 144 tokens innebygd kontekst. Bak står kontoen Tsinghua SIGS Robot Lab og forskeren Libo Wang, ifølge modellkortet. Organisasjonskontoen er ikke verifisert og har én registrert bruker. Forgjengeren VeriLoop-Coder-E1 kom i mars.

Haken står i modellkortet selv. Poengene er målt med E2 inne i laboratoriets eget VeriLoop-miljø, der modellen foreslår endringer mens et eksternt lag kjører tester, sammenligner mot forrige tilstand og ruller tilbake alt som ikke er en klar forbedring. Produksjonsversjonen av dette laget er ikke med i utgivelsen og er ikke lisensiert. Det som er offentlig, er en funksjonell beskrivelse og 14 arbeidsregler for modellen, som «Fail Loud, Never Fake Success» og «Read Before Rewrite».

«De bør ikke tolkes som bevis på at et urørt Qwen3.8-27B-basissjekkpunkt, eller E2-sjekkpunktet utenfor det evaluerte kjøremiljøet, gir de samme tallene.» — Modellkortet til VeriLoop E2

I diskusjonstråden på Hugging Face er brukerne delt. Én kalte modellen «benchmaxxed ai slop» og anbefalte å holde seg til basismodellen. En annen beskrev resonneringen som kort og fokusert etter første test. En tredje prøver å gjenskape miljøet selv:

«Benchmarkresultatene ble oppnådd med deres eget kjøremiljø, jeg prøver å gjenskape det som en pi-utvidelse med de generelle reglene de ga i modellkortet» — Throghar, bruker på Hugging Face

For deg med ett 24 GB-kort er GGUF-repoet det interessante. Laboratoriet har lagt ut offisielle llama.cpp-filer fra BF16 ned til IQ1_M. Navnet lurer: IQ1_M er ikke en 1-bits modell, men en blanding der 429 av 851 tensorer er Q5_K, med 5,36 bits per vekt i snitt. Derfor ligger Q3_K_M, IQ2_S og IQ1_M alle på rundt 16,8 GiB, og derfor spør en bruker hvorfor kvantene er større enn vanlig. Kvalitetstallene er perpleksitet og KL-divergens mot BF16 på WikiText-2. De ni benchmarkene er ikke kjørt på nytt for hvert kvantiseringsnivå, skriver laboratoriet.

Nøkkeltall
50,1 GiB
BF16-referansen i GGUF
26,6 GiB
Q8_0, høyest gjengivelse
20,6 GiB
Q6_K, laboratoriets anbefalte balansepunkt
16,8 GiB
IQ1_M, minste offisielle fil

Hva bør du gjøre?

  1. Start med Q6_K eller Q5_K_M (19,0 GiB) på et 24 GB-kort, og hold konteksten moderat. Laboratoriets eget llama-server-eksempel bruker 32 768 tokens.
  2. Bruk chat-malen som følger med modellrepoet. Modellkortet advarer om at endrede rolleskilletegn, syntaks for verktøykall eller stoppregler kan endre oppførselen selv med samme vekter.
  3. Sammenlign mot Qwen3.8-27B på dine egne oppgaver før du bytter. Uten VeriLoop-miljøet er det basismodellen E2 må slå, ikke GPT-5.6 Sol.

Bakgrunn

Utgivelsen har også med to vitenskapelige artefakter: et datamaskinassistert sertifikat på 67,35 % for andelen nullpunkter i Riemanns zeta-funksjon, og et rammeverk for gravitontomografi. Laboratoriet skriver selv at det første ikke er et bevis for Riemann-hypotesen, og at det andre ikke løser informasjonsparadokset for sorte hull. Riemann-artefaktet er begrenset til ikke-kommersiell forskning og arver ikke Apache 2.0-lisensen.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter