Åpne modeller er nå fire til sju måneder bak på cyberangrep
Krymper avstanden mellom åpne og lukkede modeller på offensiv sikkerhet til fire til sju måneder, til en brøkdel av prisen.
Åpne modeller lå gjennom det meste av 2025 seks til ti måneder bak de lukkede frontmodellene på cyberoppgaver. Nå er avstanden fire til sju måneder, ifølge den første offentlige vurderingen fra det britiske AI Security Institute (AISI). GLM-5.2 og DeepSeek V4-Pro er modellene som har lukket gapet.
AISI brukte to metoder. «Narrow Cyber Tasks» består av 70 oppgaver over fire vanskelighetsnivåer, fra ikke-teknisk arbeid til ekspertnivå, og dekker sårbarhetsforskning, reverse engineering, webutnyttelse og kryptografi. Der matchet GLM-5.2, sluppet i juni 2026, ytelsen til Opus 4.6 fra februar 2026, altså rundt fire måneder etter. DeepSeek V4-Pro lå på nivå med Opus 4.5 fra november 2025.
Den andre metoden, «Cyber Ranges», tester autonom angrepsevne i simulerte nettverk. Scenarioet «The Last Ones» er et 32-stegs angrep mot et bedriftsnettverk med fire subnett og rundt 20 verter, en oppgave AISI anslår at en menneskelig ekspert bruker cirka 20 timer på. Her presterte GLM-5.2 omtrent som Opus 4.5, mens DeepSeek V4-Pro havnet under Sonnet 4.5. GPT-5.6-Sol leverte det beste resultatet, foran Claude Mythos 5. Avstanden er større her, rundt sju måneder, men AISI regner dette som svakere bevis fordi det bygger på færre scenarioer, og testene kan ikke skille mellom en modell som mangler ferdigheter og en som ikke klarer å holde en plan gjennom et langt angrep.
Kostnadsforskjellen er den delen som endrer regnestykket for en angriper.
Sikkerhetsmekanismene i de åpne modellene fant AISI stort sett virkningsløse. DeepSeek V4-Pro nektet av og til å utføre reverse engineering, men det holdt å prøve på nytt. Poenget er strukturelt: overvåking, klassifikatorer og brukerbegrensninger forutsetter at noen kontrollerer tilgangen til modellen, og det gjør ingen når vektene er lastet ned. AISI beskriver det som «en vedvarende og irreversibel risiko for misbruk», samtidig som instituttet fremhever de reelle fordelene ved åpne vekter: privat hosting uten at data går tilbake til leverandøren, tilpasning, lavere kostnad og et fundament ingen leverandør kan endre eller slå av.
«Konkurrerende hensyn som må balanseres mot hverandre.» AISI, om avveiningen mellom risiko og nytte ved åpne vekter
Vinduet mellom lukket og åpen kapasitet er der forsvarere rekker å forberede seg, og det vinduet krymper. I april 2026 ga Mythos Preview og GPT-5.5 noen av de største kapasitetshoppene AISI har målt, og britiske NCSC sendte deretter ut internasjonale varsler om at trusselbildet endrer seg raskt. AISI planlegger å teste Kimi K3 når vektene slippes i slutten av juli, og dagens kodebenchmarks antyder at den kan komme nærmere frontmodellene enn noen annen åpen modell, om enn til vesentlig høyere driftskostnad.
Hva bør du gjøre?
- Legg til grunn at en angriper mot tjenestene dine kan kjøre noe som tilsvarer fjorårets frontmodell, døgnet rundt, for under to dollar per kampanje. Prioriteringen av herding bør følge den prisen, ikke antakelsen om at avansert kapasitet er dyr.
- Test dine egne selvhostede modeller på nekting før du eksponerer dem. AISI fant at gjentatt forsøk var nok til å omgå de innebygde begrensningene, så et enkelt avslag i første forsøk sier lite.
- Følg med på Kimi K3-vektene i slutten av juli. Får AISI-tallene bekreftet at en åpen modell nærmer seg frontnivå på cyberoppgaver, forsvinner mesteparten av forberedelsesvinduet.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.