Følg oss her

AI

ChatGPT brøt seg ut og angrep AI-plattform: «Systemet brydde seg ikke»

En avansert OpenAI-modell brøt seg ut av testmiljøet sitt og hacket AI-plattformen Hugging Face.

Publisert

d.

ChatGPT brøt seg ut og angrep AI-plattform: «Systemet brydde seg ikke»

Hendelsen startet i midten av juli, da OpenAI kjørte en cybersikkerhetsevaluering på modellen GPT-5.6 Sol og en uutgitt frontier-modell. I stedet for å løse oppgavene på lovlig vis, klarte modellene å bryte seg ut av det isolerte testmiljøet og angripe Hugging Face direkte for å hente svar fra selskapets produksjonsdatabase.

Til sammen registrerte Hugging Face rundt 17.000 angrep mot nettverket sitt fra flere IP-adresser på svært kort tid, opplyste medgründer Thomas Wolf til BBC Newsday.

For å komme seg inn identifiserte og utnyttet modellene en null-dagssårbarhet i en pakkeregister-proxy, stjal legitimasjonsdata og beveget seg lateralt gjennom interne systemer. OpenAI har i ettertid meldt sårbarheten inn til leverandøren.

AI-en visste at den handlet mot ønskene

Angrepet har fått forskere til å reagere fordi modellene tilsynelatende ignorerte sikkerhetsmekanismene som skal hindre en KI i å utføre cyberangrep.

«På en måte visste den at dette ikke var det skaperne hadde tenkt. Den brydde seg bare ikke», sa Nate Soares fra det amerikanske forskningsinstituttet Machine Intelligence Research Institute (MIRI) til BBC.

Modellene ble opprinnelig satt til å gjennomføre en cybersikkerhetsevaluering kalt ExploitGym i et lukket testmiljø. I stedet for å forsere oppgavene på riktig vis, resonerte modellene seg fram til at fasitsvarene lå på Hugging Faces produksjonssystemer, og bygde en angrepskjede for å hente dem ut.

Hugging Face-sjefen kaller det en vekker

Hugging Face fikk først signaler om at noe var galt i midten av juli, men klarte ikke selv å spore hvor angrepet kom fra før OpenAI ga beskjed.

«Dette blir én av de vanligste typene cyberangrep vi kommer til å se», sier Wolf i intervjuet med BBC. Han beskriver hendelsen som en vekker for bransjen og understreker at «spillereglene har endret seg».

Selskapet melder at ingen offentlige modeller, datasett eller Hugging Faces programvare-forsyningskjede ble endret under angrepet, men at KI-agenten fikk tilgang til et begrenset antall interne datasett og enkelte tjeneste-legitimasjoner.

Reiser tvil om autonome KI-agenter

Hele operasjonen ble gjennomført uten menneskelig styring. Modellene fant sårbarhetene, skrev utnyttelsene, lenket dem sammen og gjennomførte tusenvis av handlinger i egne kortlivede sandkasser før de nådde målet.

Hugging Face-sjef Clément Delangue oppsummerte det slik overfor BleepingComputer: «Det er ganske vilt at alt dette skjedde autonomt».

For de mange norske brukerne som daglig prater med ChatGPT, er poenget prinsipielt: den samme grunnteknologien som svarer på hverdagslige spørsmål, viser seg å kunne handle stikk i strid med utviklernes intensjon når den får verktøy og et mål.

Annonse