Hopp til hovedinnhold
Tilbake
Modell 2 min · Kilde: The Decoder

MAI-Cyber-1-Flash tar 90 prosent av sikkerhetsjobben, GPT-5.4 tar resten

KI Takeaway KI-generert · kan inneholde feil

Lanserte Microsoft mandag sin første egentrente sikkerhetsmodell, MAI-Cyber-1-Flash, som håndterer 90 prosent av oppgavene selv og eskalerer resten til OpenAIs GPT-5.4.

Microsoft har i årevis solgt Azure-vekst på eksklusiv distribusjon av OpenAIs modeller. Mandag snudde selskapet rollefordelingen på et av sine egne kjerneområder: en liten, egentrent modell gjør grovarbeidet, mens frontier-modellen fra OpenAI er redusert til et eskaleringsnivå for de tyngste sakene. Microsoft oppgir at arbeidsdelingen kutter kostnaden med nesten 50 prosent mot dagens MDASH-oppsett, og begrunner den med at kontinuerlig forsvar må være billig nok til å kjøre døgnet rundt.

Modellen kommer fra Microsofts MAI-divisjon og bygger på MAI-Thinking-1-linjen. Den er lagt inn i MDASH, agentsystemet Microsoft presenterte tidligere i år for å oppdage, validere og utbedre sårbarheter i store kodebaser. Kombinasjonen scorer 96 prosent på CyberGym, en benchmark bygget på 1 507 reelle sårbarheter, og ligger 12 poeng over Anthropics Mythos, skriver Microsoft i kunngjøringen.

«Vi har MAI-1 Cyber Flash koblet med GPT-5.4 inne i MDASH, og den slår Gemini, GPT-5.5 Cyber, GPT-5.6 Sol og Mythos 5 på CyberGym, den viktigste benchmarken vi alle bruker.» — Mustafa Suleyman, sjef for Microsoft AI, til TechCrunch

Samtidig kunngjorde Microsoft Project Perception, et agentbasert system som fordeler arbeidet på tre lag: røde agenter som leter etter angrepsveier, blå som vurderer hva som utgjør reell risiko, og grønne som retter opp. Offentlig forhåndsvisning åpner 3. august. Selskapet viser til 100 billioner sikkerhetssignaler daglig og 1,6 millioner kunder som sitt datafortrinn.

Nøkkeltall
96 %
MDASH med MAI-Cyber-1-Flash på CyberGym
12 poeng
Forspranget Microsoft oppgir mot Anthropics Mythos
90 %
Oppgavene den lille modellen håndterer uten GPT-5.4
50 %
Kostnadskuttet Microsoft tilskriver rutingen

Alle tallene er Microsofts egne, målt på en benchmark selskapet selv har valgt å vise frem. Mønsteret tåler likevel lesning uavhengig av hvem som vant testen: aktøren som bygde distribusjonen sin på OpenAI, trener nå sin egen billigmodell og kjøper frontier-kapasitet bare der den faktisk trengs.

Hva bør du gjøre?

  1. Kopier ruting-mønsteret, ikke produktet. Mål hvor stor andel av dine egne agent-kall som faktisk trenger en frontier-modell, før du betaler frontier-pris for alle.
  2. Sett terskelen for eskalering på målt vanskelighetsgrad, ikke magefølelse. Microsofts 90/10-fordeling er et resultat av måling, ikke et tall du kan låne.
  3. Be om CyberGym-tallene brutt ned per oppgavetype før du vurderer Project Perception i forhåndsvisningen fra 3. august.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter