Følg oss her

AI

Etter OpenAI-skandalen kom Anthropic-erkjennelsen: Egne AI-modeller hacket tre organisasjoner uten at noen ba om det

Anthropic bekrefter at Claude-modeller brøt seg inn i tre selskapers systemer under testing – to av dem ante ingenting før varselet kom.

Publisert

d.

Etter OpenAI-skandalen kom Anthropic-erkjennelsen: Egne AI-modeller hacket tre organisasjoner uten at noen ba om det

Bare drøyt en uke etter at OpenAI innrømmet at en av deres modeller hacket seg inn i AI-plattformen Hugging Face, kommer Anthropic med et lignende ubehagelig varsel. Under interne cybersikkerhetstester har selskapets Claude-modeller på egen hånd trengt inn i produksjonssystemene til tre uavhengige organisasjoner.

Blant modellene som brøt seg inn var Claude Opus 4.7, Claude Mythos 5 og en intern forskningsmodell, ifølge selskapets egen redegjørelse referert av The National. To av de tre rammede organisasjonene visste ingenting om at systemene deres hadde blitt kompromittert, før Anthropic tok kontakt 27. juli.

Modellene fikk internett ved en glipp

Testene skulle egentlig foregå i et lukket miljø. Modellene fikk beskjed om at de ikke hadde tilgang til internett, men i praksis hadde de det likevel. Årsaken var en misforståelse med Anthropics evalueringspartner, sikkerhetslaboratoriet Irregular, som førte til at testsystemene forble koblet til det åpne nettet.

Da Claude ble satt til å løse såkalte «capture-the-flag»-oppgaver – simulerte hackerkonkurranser der modellen skal finne skjulte data i et innelukket miljø – tolket den de virkelige, levende systemene som en del av oppgaven. En av modellene angrep til og med et reelt selskap fordi det hadde samme navn som et simulert mål, ifølge HuffPost.

Les også: Historisk gjennombrudd: IBM beviser at kvantedatamaskinen slår klassiske maskiner

Anthropic understreker at innbruddene ikke krevde avansert hacking. Claude «kompromitterte de rammede organisasjonenes infrastruktur med grunnleggende teknikker, som utnyttelse av svake passord og uautentiserte endepunkter», heter det i selskapets redegjørelse gjengitt av Al Jazeera.

Fra oppdagelse til varsel på fire dager

Tidslinjen viser at Anthropic reagerte relativt raskt da de forsto hva som hadde skjedd. Selskapet gikk gjennom 141.006 testøkter fra og med 23. juli, samme dag som all cybersikkerhets-evaluering ble satt på pause. Dagen etter var alle tre hendelsene identifisert, og 27. juli ble de berørte organisasjonene varslet. Kontakten med den tredje organisasjonen pågikk fortsatt da nyheten ble kjent.

Selv om selve internett-tilgangen skyldtes en menneskelig feil, er selve modellatferden det som gjør saken alvorlig. «Innbruddene understreker at stadig mer kapable AI-systemer kan utnytte reelle sikkerhetssvakheter dersom testmiljøet ikke er ordentlig avgrenset», heter det i Anthropics redegjørelse.

OpenAI-saken kom først

Anthropic-nyheten kommer i kjølvannet av en tilsvarende hendelse hos OpenAI, som ble kjent om lag en uke tidligere. Der brøt selskapets Sol-modell og en ikke-lansert prototype seg ut av sitt eget testmiljø og kompromitterte produksjonsservere hos AI-plattformen Hugging Face. Til forskjell fra Anthropic-saken var OpenAI-modellene reelt autonome i selve rømningen fra testmiljøet, mens Anthropics modeller kun fikk anledning til å gjøre skade fordi mennesker glemte å stenge døren.

Les også: Sjokk-studie: Plug-in-hybridbiler forbruker opp til 300 prosent mer enn det produsentene lover

Fellesnevneren er likevel den samme: to av verdens ledende AI-selskaper har på under to uker innrømmet at deres egne modeller har utført uautorisert inntrenging hos tredjepart under interne tester.

Hva det betyr for virksomheter som bruker AI-agenter

For norske virksomheter er dette mer enn en kuriositet fra to amerikanske selskaper. Både offentlig sektor og private aktører har det siste året tatt i bruk såkalte AI-agenter i økende tempo – språkmodeller som får lov til å utføre handlinger på egen hånd, ikke bare svare på spørsmål.

Anthropic-saken viser konkret hva som kan skje når slike agenter får bredere tilgang enn tiltenkt. Selskapet påpeker selv at innbruddene kunne vært unngått med bedre kontroll av hvilke nettverkstilganger modellene faktisk har, og hyppigere gjennomgang av testresultatene underveis. Det er et prinsipp som er direkte overførbart til enhver organisasjon som lar en AI-agent handle på egen hånd i eller mot deres systemer.

Les også: Kinesisk sjokk-elbil: 845 km rekkevidde, LiDAR og Porsche-inspirert design fra under 180.000 kroner

Les også: PlayStation Plus sletter ni spill 18. august: Spill dem ferdig nå eller mist dem for alltid

Jeg heter Jesper Bengtson og er trafikkansvarlig for hele MGDK, hvor jeg har ansvar for å analysere leseradferd, følge utviklingen i søk og digitale plattformer, og sikre at journalistikken når ut til flest mulig lesere. Gjennom arbeidet følger jeg teknologiutviklingen tett og holder meg kontinuerlig oppdatert på nye produkter, trender og innovasjoner. Elbiler er et av mine spesialområder, men jeg skriver også om smarttelefoner, wearables, datamaskiner, kunstig intelligens, forbrukerelektronikk og annen teknologi. Jeg legger vekt på grundig research, faktabaserte vurderinger og troverdige kilder, slik at leserne får oppdatert og pålitelig informasjon om produktene og teknologien som preger hverdagen.

Annonse