Gemini 3.5 Flash Cyber fant 55 sårbarheter i V8, mot 36 for Claude Opus 4.6
Fant 55 unike sårbarheter i Chromes V8-motor der Claude Opus 4.6 fant 36, men Googles nye Gemini 3.5 Flash Cyber slippes foreløpig bare til myndigheter og utvalgte partnere.
55 unike, bekreftede sårbarheter. Det er tallet Google DeepMind oppgir at Gemini 3.5 Flash Cyber fant i V8, JavaScript-motoren i Chrome, over et fast antall kall. Vanlig Gemini 3.5 Flash fant 47 på samme oppgave, Claude Opus 4.6 fant 36. Ti av funnene var det bare Cyber-modellen som så. Lanseringen kom 21. juli.
Modellen er liten, og det er hele poenget. Den er bygget på 3.5 Flash og finjustert for å finne, verifisere og patche sårbarheter. Argumentet Google fører er at søkerommet er flaskehalsen: å avdekke dyptliggende feil krever at du går gjennom et enormt antall utførelsesbaner, og ett dyrt kall mot en gigantisk modell skalerer dårlig. CodeMender, Googles kodesikkerhetsagent, kaller derfor Flash Cyber opptil fem ganger per rapport og lar underagenter slå sammen funnene til én samlet rapport.
«Grunnleggende sikkerhetsmodeller kan sette seg fast i en løkke, finne den samme feilen om og om igjen og samtidig gå glipp av kritiske sårbarheter. En sterk modell kaster et bredere garn.» — Google DeepMind i lanseringsnotatet
Modellen er allerede i produksjon internt hos Google, på kodebaser som Chrome, Android, Cloud, Ads og YouTube. Sikkerhetsforskningsteamet i Google Cloud brukte den til å finne fjernkjøringssårbarheter i offentlige API-er og en minnekorrupsjonsfeil i en sensitiv produksjonstjeneste på to timer. Deretter genererte den en fjernkjøringsutnyttelse som virket hver gang, og som omgikk både ASLR og W^X.
Tilgangen er strammet inn av samme grunn. Google beskriver teknologien som dual-use og slipper Flash Cyber i et begrenset pilotprogram, forbeholdt myndigheter og betrodde partnere via CodeMender. Selve skanne- og utbedringsfunksjonene i CodeMender kommer bredere ut gjennom Gemini Enterprise Agent Platform.
«CodeMender er vår forvaltede kodesikkerhetsagent, og fra i dag tar vi skannings- og utbedringsevnene rett ut til deg i forhåndsvisning.» — Michael Gerstenhaber, VP for produktledelse i Gemini Enterprise, og Clemens Viernickel, direktør for produktledelse i Cloud AI
En detalj i Googles egen benchmark er verdt mer enn tallene: konkurrentmodeller nyere enn Opus 4.6 er utelatt fra sammenligningen fordi de nekter å utføre oppgavene på grunn av innebygde sikkerhetsvakter. Det er utviklingen som treffer deg som bygger. Generelle frontier-modeller blir gradvis mindre brukbare til sårbarhetsjakt, også når du gjør det defensivt på din egen kode, mens de spesialiserte modellene som faktisk kan jobben låses bak tilgangskontroll.
Bakgrunn
Google har bygget datagrunnlaget for dette over år. OSV.dev, selskapets sårbarhetsdatabase, dekker over 700 000 open source-sårbarheter, og OSS-Fuzz har over ti år med kjøringer bak seg. Det gir treningsdata fra ekte sikkerhetsarbeid i stedet for syntetiske eksempler, og er grunnen til at en Flash-basert modell i det hele tatt kan konkurrere med langt større modeller på denne oppgaven.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.