Hopp til hovedinnhold
Tilbake
Llm 2 min · Kilde: The Decoder

OpenAI gir Astra høyeste cyberrisiko og advarer om at kontrollene kan stanse ditt arbeid

KI Takeaway KI-generert · kan inneholde feil

Regn med at OpenAIs klassifikatorer for Astra kan stanse legitimt arbeid, også arbeid uten noe med sikkerhet å gjøre.

«Overvåking av tankekjeden er skjør, og dessverre på vei i negativ retning» — Jakub Pachocki, sjefforsker i OpenAI, på X

Pachocki svarte på en rapport fra The Information om arkitekturen i Astra, den kommende modellen OpenAI selv har gitt høyeste risikonivå for cybersikkerhet i sitt eget Preparedness Framework. Ingen tidligere modell fra selskapet har fått den vurderingen. Med de rette verktøyene kan Astra finne og utnytte ukjente sikkerhetshull i godt beskyttede systemer uten at et menneske styrer hvert steg.

Begrunnelsen ligger i testene. På ExploitBench fikk Astra full pott, og på en intern oppfølger bygget rundt 20 nylig avslørte, alvorlige V8-sårbarheter slo den forgjengeren GPT-5.6 Sol med god margin på langt færre tokens. Den fant også to tidligere ukjente nulldagssårbarheter og lenket dem til en fungerende utnyttelse. Samtidig avviser Astra 91,5 prosent av ikke-tillatte cyberforespørsler i interne evalueringer, mot 59 prosent for GPT-5.6 Sol, målt uten produksjonssikringene.

Den praktiske konsekvensen ligger i overvåkingen. I produksjon skal klassifikatorer følge modellens tankekjede og automatisk stanse mistenkelig aktivitet, og OpenAI sier selv at kontrollene kan bremse, pause eller avbryte legitimt arbeid, også oppgaver uten noe med cybersikkerhet å gjøre. Ifølge The Information bruker Astra en teknikk kalt recurrent depth, der modellen sender samme tekst gjennom de samme lagene flere ganger før neste ord. Det gir bedre koding til lavere kostnad, men flytter deler av tenkingen fra lesbar tekst til interne talrepresentasjoner. En kilde med kjennskap til arbeidet sier OpenAI bevisst begrenset teknikken i Astra, slik at tankekjeden fortsatt er lesbar.

Hva bør du gjøre?

  1. Bygg for at kall kan bli stanset eller forsinket av en klassifikator du ikke ser. Retry-logikk og tidsavbrudd bør tåle at en helt vanlig oppgave blir avbrutt midtveis.
  2. Hold sikkerhetsrelatert arbeid, som skanning av din egen kode, på en modell du vet du får svar fra. Grensen for hva som er en ikke-tillatt forespørsel trekkes av OpenAI, ikke av deg.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter