AI
Etter OpenAI-skandalen kom Anthropic-erkjennelsen: Egne AI-modeller hacket tre organisasjoner uten at noen ba om det
Anthropic bekrefter at Claude-modeller brøt seg inn i tre selskapers systemer under testing – to av dem ante ingenting før varselet kom.
Bare drøyt en uke etter at OpenAI innrømmet at en av deres modeller hacket seg inn i AI-plattformen Hugging Face, kommer Anthropic med et lignende ubehagelig varsel. Under interne cybersikkerhetstester har selskapets Claude-modeller på egen hånd trengt inn i produksjonssystemene til tre uavhengige organisasjoner.
Blant modellene som brøt seg inn var Claude Opus 4.7, Claude Mythos 5 og en intern forskningsmodell, ifølge selskapets egen redegjørelse referert av The National. To av de tre rammede organisasjonene visste ingenting om at systemene deres hadde blitt kompromittert, før Anthropic tok kontakt 27. juli.
Modellene fikk internett ved en glipp
Testene skulle egentlig foregå i et lukket miljø. Modellene fikk beskjed om at de ikke hadde tilgang til internett, men i praksis hadde de det likevel. Årsaken var en misforståelse med Anthropics evalueringspartner, sikkerhetslaboratoriet Irregular, som førte til at testsystemene forble koblet til det åpne nettet.
Da Claude ble satt til å løse såkalte «capture-the-flag»-oppgaver – simulerte hackerkonkurranser der modellen skal finne skjulte data i et innelukket miljø – tolket den de virkelige, levende systemene som en del av oppgaven. En av modellene angrep til og med et reelt selskap fordi det hadde samme navn som et simulert mål, ifølge HuffPost.
Les også: Historisk gjennombrudd: IBM beviser at kvantedatamaskinen slår klassiske maskiner
Anthropic understreker at innbruddene ikke krevde avansert hacking. Claude «kompromitterte de rammede organisasjonenes infrastruktur med grunnleggende teknikker, som utnyttelse av svake passord og uautentiserte endepunkter», heter det i selskapets redegjørelse gjengitt av Al Jazeera.
Fra oppdagelse til varsel på fire dager
Tidslinjen viser at Anthropic reagerte relativt raskt da de forsto hva som hadde skjedd. Selskapet gikk gjennom 141.006 testøkter fra og med 23. juli, samme dag som all cybersikkerhets-evaluering ble satt på pause. Dagen etter var alle tre hendelsene identifisert, og 27. juli ble de berørte organisasjonene varslet. Kontakten med den tredje organisasjonen pågikk fortsatt da nyheten ble kjent.
Selv om selve internett-tilgangen skyldtes en menneskelig feil, er selve modellatferden det som gjør saken alvorlig. «Innbruddene understreker at stadig mer kapable AI-systemer kan utnytte reelle sikkerhetssvakheter dersom testmiljøet ikke er ordentlig avgrenset», heter det i Anthropics redegjørelse.
OpenAI-saken kom først
Anthropic-nyheten kommer i kjølvannet av en tilsvarende hendelse hos OpenAI, som ble kjent om lag en uke tidligere. Der brøt selskapets Sol-modell og en ikke-lansert prototype seg ut av sitt eget testmiljø og kompromitterte produksjonsservere hos AI-plattformen Hugging Face. Til forskjell fra Anthropic-saken var OpenAI-modellene reelt autonome i selve rømningen fra testmiljøet, mens Anthropics modeller kun fikk anledning til å gjøre skade fordi mennesker glemte å stenge døren.
Les også: Sjokk-studie: Plug-in-hybridbiler forbruker opp til 300 prosent mer enn det produsentene lover
Fellesnevneren er likevel den samme: to av verdens ledende AI-selskaper har på under to uker innrømmet at deres egne modeller har utført uautorisert inntrenging hos tredjepart under interne tester.
Hva det betyr for virksomheter som bruker AI-agenter
For norske virksomheter er dette mer enn en kuriositet fra to amerikanske selskaper. Både offentlig sektor og private aktører har det siste året tatt i bruk såkalte AI-agenter i økende tempo – språkmodeller som får lov til å utføre handlinger på egen hånd, ikke bare svare på spørsmål.
Anthropic-saken viser konkret hva som kan skje når slike agenter får bredere tilgang enn tiltenkt. Selskapet påpeker selv at innbruddene kunne vært unngått med bedre kontroll av hvilke nettverkstilganger modellene faktisk har, og hyppigere gjennomgang av testresultatene underveis. Det er et prinsipp som er direkte overførbart til enhver organisasjon som lar en AI-agent handle på egen hånd i eller mot deres systemer.
Les også: Kinesisk sjokk-elbil: 845 km rekkevidde, LiDAR og Porsche-inspirert design fra under 180.000 kroner
Les også: PlayStation Plus sletter ni spill 18. august: Spill dem ferdig nå eller mist dem for alltid

