kunstig intelligens

Gransket seg selv etter hacking-skandale: Fant tre sikkerhetsbrudd

AI-selskapet innrømmer innbrudd hos eksterne organisasjoner. 

Publisert

Torsdag publiserte Anthropic en redegjørelse der selskapet avslører tre tilfeller hvor Claude-modeller skaffet seg uautorisert tilgang til eksterne organisasjoners systemer under testing.

Det kommer frem kort tid etter at erkerivalen OpenAI innrømmet at selskapets modeller sto bak den mye omtalte hackingen av Hugging Face.

Nettopp den hendelsen fikk Anthropic til å granske seg selv, skriver selskapet: 

– Som følge av hendelsen startet vi en omfattende gjennomgang i ettertid av våre egne cybersikkerhetsevalueringer. 

– Vi lette særlig etter tegn på at Claude, i likhet med OpenAI-modellene som fikk tilgang til Hugging Face, hadde klart å koble seg til internett fra testmiljøer som skulle ha vært avskåret fra omverdenen.

Selskapet gikk gjennom 141.006 testkjøringer der Claude kan ha fått uautorisert internettilgang. Det avdekket tre hendelser.

Disse skjedde under såkalte «capture the flag»-tester, der modellene fikk i oppgave å bryte seg inn i fiktive systemer og finne hemmelig informasjon.

Problemet var altså at testmiljøene ved en feil var koblet til internett. Claude hadde samtidig fått beskjed om at alt den kunne nå, var en del av simuleringen.

Tre forskjellige Claude-modeller var involvert: Opus 4.7, Mythos 5 og en intern forskningstestmodell.

De tidligste hendelsene fant sted i april. 

Innrømmelsen kommer i en krevende uke for sikkerhetsprofilen til Anthropic. Bare dager tidligere ble det kjent at hundrevis av delte Claude-samtaler, flere med sensitiv informasjon, kunne finnes gjennom Google-søk.

Sikkerhet har blitt et stadig viktigere våpen i konkurransen med OpenAI. Da OpenAI inngikk en omstridt avtale med det amerikanske forsvaret, skjøt avinstalleringene av ChatGPT i været. Samtidig gikk Claude til i blant annet Norge og USA.

Nå får glansbildet en ny ripe. Anthropic legger hovedansvaret for hackinghendelsene på en feil i testoppsettet, ikke på modellene selv. Cyberevalueringene er stanset, og de berørte organisasjonene er varslet.