Hopp til hovedinnhold
Tilbake
Automatisering 3 min · Kilde: dev.to

Semgrep fanget mønstrene, Gemini Flash fant autorisasjonshullene: 12 mot 5 funn

KI Takeaway KI-generert · kan inneholde feil

Kombiner gratis Semgrep og Bandit med ett vanlig Gemini 3.8 Flash-kall, og du fanger både mønsterfeilene og autorisasjonshullene skannerne aldri ser.

Fairwind-porten hos Google er stengt for alle andre enn myndigheter, operatører av kritisk infrastruktur og navngitte sikkerhetsleverandører. Rundt 650 organisasjoner har tilgang til Gemini 3.8 Flash Cyber, og resten står uten API, uten offentlig pris og uten påmeldingsside. Utvikleren jamilxt brukte i stedet en kveld på å bygge versjonen som faktisk er tilgjengelig, og la ut hele kjøringen med kostnader på dev.to 4. september.

Oppsettet er bevisst kjedelig og består av to lag. Lag én er deterministiske skannere: Bandit pluss Semgrep med regelsettet p/owasp-top-ten, 152 regler. Lag to er ett kall til den offentlige Gemini 3.8 Flash-modellen, der prompten oppgir hvilke linjer skannerne allerede har flagget og ber om nettopp det de ikke fanger: logikkfeil, autorisasjonshull og dataeksponering. Poenget er at lagene feiler ulikt. Skannere bommer på alt som ikke er et kjent mønster, mens språkmodeller dikter opp funn eller mister tråden i store filer.

Testobjektet var en liten Flask-app med fire plantede klassikere: SQL-injeksjon bygget med strengsammensetning, kommandoinjeksjon via shell=True, MD5-token med hardkodet salt og en path traversal i opplastingen. Skannerne fant 12 treff, alle ekte, på sekunder og uten kostnad. Modellkallet ga fem funn med null overlapp mot skannerne: to HIGH for at endepunktene /user og /upload manglet både autentisering og autorisasjon på objektnivå, én MEDIUM for ubegrenset request.get_data() uten grense på forespørselsstørrelsen, og to LOW. Kallet brukte 464 input-tokens og 296 output-tokens på 13,8 sekunder, som med prisene 0,75 dollar per million input og 3,75 dollar per million output ga 0,00146 dollar.

«De farligste feilene i testappen var ikke dem noen skanner fanger. Det var manglende autorisasjonssjekker, de kjedelige arkitekturvalgene ingen regex noensinne vil flagge.» — jamilxt, forfatteren bak innlegget

Cyber-variantens forsprang er ekte. 86,2 prosent på CyberGym for autonom sårbarhetsoppdagelse er en annen liga enn det en generell modell klarer alene. Men porten handler om tillatelser, ikke resonnement: de to modellene deler arkitektur, og forskjellen er at Cyber-varianten har det Google beskriver som mer tillatende cyber-begrensninger. Den offentlige Flash-modellen scorer 71,0 prosent på DeepSWE v1.1 og er fullt legitim til kodegjennomgang.

Hva bør du gjøre?

  1. Kjør skannerne først og send linjenumrene deres inn i prompten. Uten den lista gjentar modellen det åpenbare i stedet for å lete etter noe nytt.
  2. Del opp per rute eller modul. Kontekstvinduet på 1 million tokens frister, men funnkvaliteten faller når modellen må holde for mye kode samtidig.
  3. Kjør laget i CI på diffen, ikke på hele repoet, og behandle modellfunn som spor et menneske må bekrefte.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter