Hopp til hovedinnhold
Tilbake
Modell 2 min · Kilde: Simon Willison's Weblog

Opus 5 er mye vanskeligere å prompt-injisere, men Sonnet 5 holder stand

KI Takeaway KI-generert · kan inneholde feil

Reduserer Claude Opus 5 andelen vellykkede prompt injection-angrep i kodemiljøer fra 7,03 til 0,56 prosent sammenlignet med Opus 4.8, ifølge Anthropics eget systemkort.

Hvor mye skjult instruks tåler en kodeagent i det den leser? Anthropic setter tall på det i systemkortet for Claude Opus 5, publisert 24. juli. I kodemiljøer lykkes en angriper som optimaliserer mot testtilfellene i 0,56 prosent av forsøkene med utvidet tenking, mot 7,03 prosent for Opus 4.8. I nettlesermiljø, der 129 kuraterte scenarier ble angrepet av profesjonelle red teamere med 200 forsøk hver, faller andelen fra 31,5 prosent på Opus 4.8 til 3,7 prosent på Opus 5.

Boris Cherny i Anthropic løftet fram akkurat denne delen etter lanseringen og viste til side 73 i systemkortet, gjengitt av Simon Willison:

«Mer enn noen av disse eval-scorene er det noe annet som begeistrer meg mest: Opus 5 er den modellen vår som er vanskeligst å prompt-injisere så langt» — Boris Cherny, Anthropic

Tallene bak påstanden er mer sammensatte enn sitatet. Claude Sonnet 5 er faktisk mer robust enn Opus 5 i to av de tre kategoriene: 0,31 mot 0,56 prosent i kodemiljøer og 0,93 mot 3,7 prosent i nettleser. Opus 5 er til gjengjeld klart best på datamaskinbruk gjennom grafisk grensesnitt, med 0,54 prosent mot Sonnet 5 sine 2,25. Alle målingene er Anthropics egne kjøringer, ikke uavhengige tester, og Anthropic understreker selv at differansene ligger innenfor et smalt bånd av lave absolutte rater.

Det som faktisk lukker hullet er ikke modellvalget alene. Anthropic kjører to lag i produktene sine: prober som inspiserer verktøyresultater før modellen handler på dem, og en klassifiserer som blokkerer farlige verktøykall på vei ut. Fordi det ene laget virker på data inn og det andre på handlinger ut, må et angrep slå gjennom begge uavhengig. Med begge på lander angrepsraten i nettleser på 0 av 129 scenarier, og probe-laget alene tar kodemiljøene ned til 0,18 prosent.

For deg som lar en agent lese e-post, nettsider eller pull requests er poenget at modellvalget flytter risikoen betydelig, mens det er lagene rundt modellen som tar den ned mot null.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter