Hopp til hovedinnhold
Tilbake
Zhipu 2 min · Kilde: Hugging Face

Cantina Apex Flash-1: åpen sikkerhetsmodell løser 40 av 60 exploit-oppgaver for 2,38 dollar

KI Takeaway KI-generert · kan inneholde feil

Bruk apex-flash-1 som billig arbeidermodell for avgrensede sikkerhetsoppgaver, men test den mot egne mål før du stoler på Cantinas interne tall.

2,38 dollar. Så mye anslår Cantina Security at hele testkjøringen på 60 sårbarhetsoppgaver kostet med apex-flash-1, ifølge modellkortet på Hugging Face. Modellen løste 40 av 60 (66,7 % pass@1). Claude Opus 5 High løste 43 for 74,68 dollar, mens basismodellen GLM-5.3-Flash løste 36 for 4,56 dollar.

apex-flash-1 er en RL-finjustering av GLM-5.3-Flash fra Z.ai, en MoE-modell med 320 milliarder parametere totalt og 18 milliarder aktive. Cantina og partneren Yeta Labs trente med GRPO på 150 oppgaver fra 50 sårbarhetscaser, med rank-256 LoRA over alle eksperter og routere pluss full oppdatering av 16 utvalgte eksperter. Å oppdatere alle parametere i alle eksperter fikk modellen til å kollapse, skriver Cantina i lanseringsposten.

«Vi designet den som en sterk arbeidermodell, ment å bli orkestrert av en større modell som gir den en avgrenset sikkerhetsoppgave.» — Cantina Security, lanseringsposten for Apex Flash

Det betyr at du ikke skal gi den et helt kodebase-revisjonsoppdrag alene. Oppsettet Cantina beskriver er en planlegger som deler ut én konkret oppgave om gangen, og en arbeider som leser kode, bruker verktøy og verifiserer at exploiten faktisk virker mot et kjørende mål. Cantina trente med Codex som agentoppsett og anbefaler det samme ved bruk.

Tallene har to forbehold. Evalueringen er Cantinas egne 20 caser, ikke en offentlig benchmark, og selskapet lover flere offentlige resultater senere. I tillegg har Cantina sluppet apex-flash-1-abliterated, en variant med endret avvisningsatferd som evalueringen ikke gjelder for. Begge er MIT-lisensiert.

Hva bør du gjøre?

  1. Kjør modellen bare mot systemer du eier eller har skriftlig tillatelse til å teste, i en isolert sandkasse slik Cantina gjorde i sine egne tester.
  2. Planlegg for maskinvaren: med 320 milliarder parametere totalt trenger du et multi-GPU-oppsett, og Z.ai lister blant annet vLLM, SGLang og KTransformers for lokal kjøring av basismodellen.
  3. Bygg et lite testsett av kjente sårbarheter i egen kode og sammenlign mot modellen du bruker i dag før du bytter.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter