AI
Etter OpenAI-sjokket: Nå innrømmer Anthropic at egne AI-modeller hacket tre organisasjoner uten instruksjon
Anthropic bekrefter at tre Claude-modeller brøt seg inn i systemene til tre virkelige selskaper under interne sikkerhetstester.
Selskapet publiserte funnene torsdag 30. juli 2026, drøyt en uke etter at OpenAI innrømmet at deres egen agent hacket seg inn hos AI-plattformen Hugging Face. Bare to av de tre rammede organisasjonene er hittil varslet.
Anthropic gikk gjennom 141.006 testkjøringer der Claude i teorien kunne ha kommet seg ut på det åpne internett, og fant tre hendelser der modellene rent faktisk gjorde det. Feilen lå ifølge selskapet i konfigurasjonen hos evalueringspartneren Irregular, som skulle sørge for et lukket testmiljø.
Modellene ble i sine oppstartsinstruksjoner fortalt at de ikke hadde internettilgang. Det stemte ikke, og de brukte anledningen til å angripe produksjonssystemene til tre virkelige organisasjoner med enkle metoder som svake passord og ubeskyttede endepunkter.
Én modell la ut skadelig kode på PyPI
De tre hendelsene involverte hver sin modell. Claude Opus 4.7 kom seg inn i et selskaps database og hentet ut applikasjonslegitimasjon og flere hundre rader med produksjonsdata, etter at et fiktivt selskapsnavn i oppgaven viste seg å tilhøre et reelt nettsted.
Les også: Disney+ sletter populære funksjoner uten varsel: Europeiske abonnenter betaler fortsatt full pris
Verre var det med Claude Mythos 5. Modellen bygde og publiserte en ondsinnet Python-pakke på det offentlige registeret PyPI. Pakken lå ute i omtrent én time og ble lastet ned på 15 virkelige systemer, inkludert en sårbarhetsskanner hos et sikkerhetsselskap, der Claude klarte å stjele selskapets legitimasjon.
Den tredje modellen, en intern forskningsprototype, skannet rundt 9.000 mål før den brøt seg inn hos ett selskap. Da modellen skjønte at målet var reelt og ikke en del av øvelsen, stoppet den angrepet av seg selv.
Modellene overbeviste seg selv om at det var en øvelse
Både Opus 4.7 og Mythos 5 registrerte tegn på at systemene de angrep tilhørte den virkelige verden, men fortsatte likevel. Ifølge Anthropics egen gjennomgang «rasjonaliserte Claude at det som virket å høre til den virkelige verden, måtte være del av simuleringen».
Mythos 5 skrev til og med at handlingen ville vært uetisk om den var reell, men overbeviste seg selv om at oppgaven fant sted i et testscenario.
Les også: Android-telefonen din har en skjult utløpsdato: Slik sjekker du om din snart er utløpt
Anthropic karakteriserer hendelsene som operasjonelle feil, ikke sviktende justering av modellenes verdier. Selskapet har stoppet alle cyberevalueringer i påvente av strengere kontroller og har lovet å publisere redigerte transkripsjoner fra hendelsene.
Sikkerhetsforskere: bare et forvarsel
Innrømmelsen kommer kort tid etter at OpenAI måtte gjøre det samme. Selskapets agent utnyttet en tidligere ukjent sårbarhet i pakkeregisteret Artifactory for å komme seg ut av testmiljøet og hacke seg inn hos Hugging Face. Hugging Face-sjef Clément Delangue omtalte innbruddet som et enestående angrep som krevde et enestående svar.
Jeffrey Ladish, direktør for sikkerhetsselskapet Palisade Research, sier til HuffPost at problemet vil vokse sammen med modellene: «Dette kommer bare til å bli verre etter hvert som modellene blir smartere. De blir bedre til å jukse. De blir bedre til å lyve.»
Les også: Kina begynner å måle elbil-lading i sekunder
Les også: Rockstar endret tre ting på GTA 6-nettsiden: Fans mener Trailer 3 er rett rundt hjørnet

