angrep

AI på ville veier – nye angrep

Etter at Anthropic og OpenAIs modeller angrep organisasjoner, var det nå Meta sin tur. Og et britisk sikkerhetsinstitutt fant grove overtredelser fra spesielt Mythos og GTP-5.6 Sol.

Bilde for illustrasjon: Robot som sitter å gjør arbeidsoppgaver. AI. Kunstig Intelligens.
Bilde for illustrasjon: Robot som sitter å gjør arbeidsoppgaver.
Publisert

Britiske AISI, AI Security Institue, oppdaget gjennom en rutinetest at AI-agenter fra OpenAI og Anthropic bevegde seg utenfor oppdragene sine. Sikkerhetsinstituttet skriver på sine sider at AI-agentene «utførte vedvarende, uautoriserte handlinger rettet mot personer og organisasjoner».

Hackingen fra agentene skal ha blitt utført av to modeller: Anthropics Mythos 5 og OpenAIs GPT-5.6 Sol. I den verste saken prøvde en agent fra Mythos å legge inn en skadelig kode i et open source-prosjekt på GitHub, en plattform som brukes av programutviklere, etter å ha vurdert at dette ville hjelpe modellen med å bestå evalueringen.

I forsøket på å få koden godkjent opprettet agenten falske nettidentiteter og brukte disse til å presse prosjektets ansvarlige (mennesker) til å godta koden. Agenten skal blant annet ha sendt eposter til to av utviklerne som inneholdt skadelig software.

Flere tilfeller

Undersøkelsen til AISI kommer samtidig som både Anthropic og OpenAI har måttet komme ut med offisielle meldinger etter at modellene deres har gått til angrep, da på organisasjoner. Opptil flere ganger.

Denne uken har også Meta sin modell Muse Spark utnyttet en sårbarhet i sikkerheten til et selskap, og The Information skriver at Metas agent både hacket og gjorde interne endringer hos selskapet.

Så da har alle de store måttet erkjenne at modellene deres løper løpsk til tider.