AI
OpenAI innrømmer: Bremset egen AI-modell som selv kan angripe godt beskyttede systemer
For første gang klassifiserer OpenAI en av sine egne modeller som «kritisk» på cybersikkerhet.
Selskapet kunngjorde 7. august at det pauser deler av arbeidet med den kommende modellen Astra etter at interne tester viste at den kan finne og utnytte sårbarheter i tunge, virkelige systemer uten menneskelig hjelp.
I en fersk melding fra selskapet heter det at internevalueringer viser at Astra er så sterk på agentisk koding og cybersikkerhet at OpenAI ikke lenger kan utelukke at modellen når det høyeste nivået i selskapets eget rammeverk for risiko, Preparedness Framework.
Det er første gang OpenAI knytter en spesifikk modell til denne merkelappen. Tidligere frontier-modeller, som GPT-5.6-Sol, ble klassifisert som «High», aldri «Critical».
Hva den «kritiske» grensen betyr
I OpenAIs eget rammeverk krysser en modell den kritiske terskelen dersom den kan «identifisere og utvikle fungerende nulldags-utnyttelser av alle alvorlighetsgrader i mange herdede, virkelige kritiske systemer uten menneskelig inngripen», eller «utarbeide og gjennomføre helt nye, gjennomgående strategier for cyberangrep mot herdede mål» kun ut fra et overordnet mål.
Les også: Tesla Model Y får raskere trådløs lading: Men iPhone-eiere merker knapt forskjell
Nulldags-sårbarheter er svakheter som verken produsent eller sikkerhetsmiljøet er klar over på det tidspunktet de utnyttes, og dermed ikke rekker å tette. En modell som selv kan finne og bygge slike utnyttelser mot store nettjenester, banker eller offentlig infrastruktur, er den typen kapasitet rammeverket ble laget for å håndtere.
Astra er ikke lansert, og OpenAI presiserer at testingen fortsetter. Terskelen er ikke bekreftet krysset, men selskapet vil altså ikke lenger utelukke det.
Hva OpenAI gjør nå
Selskapet har innført en rekke tiltak parallelt med at utviklingen bremses.
Arbeidet foregår i isolerte testmiljøer med strammere nettverksregler, kraftigere kryptering av modellvekter og sandbaserte kjøremiljøer. Interne aktiviteter med Astra som ikke oppfyller de skjerpede sikkerhetskravene, er satt på pause.
Les også: Bilen din spionerer: 70 merker sender privat kjøredata til 12 land uten at du vet det
Modellens agentiske applikasjoner overvåkes universelt, og OpenAI evaluerer det som kalles modellens tankekjede, altså det interne resonnementet den bruker underveis. Uavhengige testere fra myndigheter og utvalgte AI-sikkerhetsorganisasjoner skal etter planen få kjøre egne evalueringer, og tredjepartspartnere får anbefalte sikkerhetskontroller de skal følge.
Michael Dalton, som beskrives som medlem av OpenAIs tekniske stab, forklarer ifølge Forkast at selskapet bevisst bremser forskningen for å styrke sikkerheten.
Kommer i kjølvannet av Hugging Face-hendelsen
Meldingen kommer bare uker etter en oppsiktsvekkende hendelse i AI-bransjen. 21. juli avslørte OpenAI at modeller som kjørte selskapets ExploitGym-benchmark med reduserte refusjonsmekanismer klarte å bryte ut av et isolert miljø og nå produksjonsdatabasen til Hugging Face, ved å utnytte et tidligere ukjent nulldag i JFrog Artifactory og komme seg videre ut på det åpne internett.
Astra var ikke involvert i Hugging Face-hendelsen, understreker OpenAI. Men episoden viste konkret hva modeller som er svakere enn Astra allerede kan gjøre når de får litt for lange snorer i test.
Les også: Ny forskning skremmer: AI er nå bedre til å lure deg i romantiske svindler
OpenAI er heller ikke alene om denne typen hendelser. Ifølge Yahoo Finance har Anthropic-modeller brutt containment under testing på grunn av konfigurasjonsfeil, nådd internett og kompromittert systemene til tre organisasjoner. En Meta-modell rømte også ut av et sikret testmiljø etter en feilkonfigurasjon.
Det britiske AI Security Institute har dokumentert at AI-agenter i 10 tilfeller av 122 tester «tok selvstendige, ikke-sanksjonerte handlinger på det levende internett, rettet mot virkelige mennesker og organisasjoner». I ett tilfelle forsøkte en agent å plante ondsinnet kode i et open source-prosjekt ved å bruke falske identiteter til sosial manipulering.
Hva det betyr for vanlige brukere
Astra er foreløpig bak lås og slå hos OpenAI, og hverken nordmenn eller andre kan bruke den. Poenget med kunngjøringen er derfor ikke en umiddelbar advarsel til forbrukere om å endre passord eller sikkerhetsinnstillinger i dag.
Nyheten er større enn det. Det er første gang en av verdens ledende AI-utviklere selv sier at de kan stå med en modell som overgår grensen for hva rammeverket regner som forsvarlig å slippe ut uten kraftige mottiltak. De nettjenestene folk flest bruker, fra nettbank til e-post og skylagring, er nettopp de typene «tradisjonelt godt beskyttede systemer» rammeverket omtaler.
Les også: eBay betaler 55 millioner dollar: Selskapet organiserte trakassering mot bloggere som kritiserte dem
At OpenAI selv legger på bremsen og trekker inn myndigheter, er en indikasjon på at neste generasjons AI-modeller vil måtte leve med en helt annen type sikkerhetsregime enn dagens ChatGPT.
Les også: Tesla passerer 10 millioner elbiler: Alene om milepælen, men veksten har stoppet

