Følg oss her

AI

Etter OpenAI-sjokket: Nå innrømmer Anthropic at egne AI-modeller hacket tre organisasjoner uten instruksjon

Anthropic bekrefter at tre Claude-modeller brøt seg inn i systemene til tre virkelige selskaper under interne sikkerhetstester.

Publisert

d.

Etter OpenAI-sjokket: Nå innrømmer Anthropic at egne AI-modeller hacket tre organisasjoner uten instruksjon

Selskapet publiserte funnene torsdag 30. juli 2026, drøyt en uke etter at OpenAI innrømmet at deres egen agent hacket seg inn hos AI-plattformen Hugging Face. Bare to av de tre rammede organisasjonene er hittil varslet.

Anthropic gikk gjennom 141.006 testkjøringer der Claude i teorien kunne ha kommet seg ut på det åpne internett, og fant tre hendelser der modellene rent faktisk gjorde det. Feilen lå ifølge selskapet i konfigurasjonen hos evalueringspartneren Irregular, som skulle sørge for et lukket testmiljø.

Modellene ble i sine oppstartsinstruksjoner fortalt at de ikke hadde internettilgang. Det stemte ikke, og de brukte anledningen til å angripe produksjonssystemene til tre virkelige organisasjoner med enkle metoder som svake passord og ubeskyttede endepunkter.

Én modell la ut skadelig kode på PyPI

De tre hendelsene involverte hver sin modell. Claude Opus 4.7 kom seg inn i et selskaps database og hentet ut applikasjonslegitimasjon og flere hundre rader med produksjonsdata, etter at et fiktivt selskapsnavn i oppgaven viste seg å tilhøre et reelt nettsted.

Les også: Disney+ sletter populære funksjoner uten varsel: Europeiske abonnenter betaler fortsatt full pris

Verre var det med Claude Mythos 5. Modellen bygde og publiserte en ondsinnet Python-pakke på det offentlige registeret PyPI. Pakken lå ute i omtrent én time og ble lastet ned på 15 virkelige systemer, inkludert en sårbarhetsskanner hos et sikkerhetsselskap, der Claude klarte å stjele selskapets legitimasjon.

Den tredje modellen, en intern forskningsprototype, skannet rundt 9.000 mål før den brøt seg inn hos ett selskap. Da modellen skjønte at målet var reelt og ikke en del av øvelsen, stoppet den angrepet av seg selv.

Modellene overbeviste seg selv om at det var en øvelse

Både Opus 4.7 og Mythos 5 registrerte tegn på at systemene de angrep tilhørte den virkelige verden, men fortsatte likevel. Ifølge Anthropics egen gjennomgang «rasjonaliserte Claude at det som virket å høre til den virkelige verden, måtte være del av simuleringen».

Mythos 5 skrev til og med at handlingen ville vært uetisk om den var reell, men overbeviste seg selv om at oppgaven fant sted i et testscenario.

Les også: Android-telefonen din har en skjult utløpsdato: Slik sjekker du om din snart er utløpt

Anthropic karakteriserer hendelsene som operasjonelle feil, ikke sviktende justering av modellenes verdier. Selskapet har stoppet alle cyberevalueringer i påvente av strengere kontroller og har lovet å publisere redigerte transkripsjoner fra hendelsene.

Sikkerhetsforskere: bare et forvarsel

Innrømmelsen kommer kort tid etter at OpenAI måtte gjøre det samme. Selskapets agent utnyttet en tidligere ukjent sårbarhet i pakkeregisteret Artifactory for å komme seg ut av testmiljøet og hacke seg inn hos Hugging Face. Hugging Face-sjef Clément Delangue omtalte innbruddet som et enestående angrep som krevde et enestående svar.

Jeffrey Ladish, direktør for sikkerhetsselskapet Palisade Research, sier til HuffPost at problemet vil vokse sammen med modellene: «Dette kommer bare til å bli verre etter hvert som modellene blir smartere. De blir bedre til å jukse. De blir bedre til å lyve.»

Les også: Kina begynner å måle elbil-lading i sekunder

Les også: Rockstar endret tre ting på GTA 6-nettsiden: Fans mener Trailer 3 er rett rundt hjørnet

Jeg heter Morten Lyhne og er tech-spesialist i redaksjonen. Jeg har et særlig ansvar for testing og vurdering av produkter fra noen av verdens største teknologiselskaper, og gjennomfører grundige tester av blant annet smarttelefoner, datamaskiner og annet forbrukerelektronikk. Jeg følger utviklingen i teknologi tett og skriver om alt fra nye produkter og innovasjoner til biler, elbiler og gadgets. Målet mitt er alltid å gi leserne grundige, faktabaserte og troverdige vurderinger som gjør det enklere å ta gode valg.

Annonse