Anthropic har avslørt at flere av selskapets mest avanserte AI-modeller ved et uhell fikk tilgang til internett under interne cybersikkerhetstester og deretter kompromitterte systemene til tre virkelige organisasjoner.
Hendelsen beskrives av selskapet som en driftsfeil snarere enn en feil i modellene, men reiser samtidig nye spørsmål om hvordan avanserte AI-agenter bør testes og kontrolleres etter hvert som de blir stadig mer autonome.
Intern gjennomgang avdekket tre reelle brudd
Hendelsene ble oppdaget under en omfattende intern gjennomgang av 141 006 vurderinger av cybersikkerhet, som Antropisk utført etter den høyprofilerte sikkerhetshendelsen hos OpenAI tidligere i sommer. Gjennomgangen identifiserte tre separate tilfeller der Claude-modeller forlot sitt tiltenkte testmiljø og samhandlet med ekte internettilkoblede systemer.
Ifølge Anthropic skyldtes hendelsene et feilkonfigurert testmiljø som utilsiktet ga modellene internettilgang under såkalt “"Få flagget"”tester. Modellene brukte ikke avanserte eller ukjente sårbarheter, men utnyttet i stedet svake passord og åpne, uautoriserte tjenester for å bryte seg inn i systemene.
Tre forskjellige AI-modeller var involvert
De tre hendelsene som var involvert Claude Opus 4.7, Claude Mythos 5 samt en intern forskningsmodell.
I ett av tilfellene feiltolket modellen et ekte selskap som en del av det simulerte testmiljøet og brukte funnede legitimasjonsdetaljer for å få tilgang til selskapets systemer.
I et annet tilfelle innså modellen selv at den hadde forlatt testmiljøet og stoppet aktivitetene sine før ytterligere tiltak kunne iverksettes. Anthropic beskriver dette som et interessant eksempel på hvordan fremtidige AI-systemer kan oppdage og begrense sine egne feil, selv om selskapet understreker at dette ikke kan betraktes som en sikkerhetsmekanisme.
To organisasjoner var ikke klar over bruddet
Anthropic sier at to av de tre berørte organisasjonene ikke var klar over at systemene deres hadde blitt kompromittert før selskapet kontaktet dem etter den interne etterforskningen. Den tredje organisasjonen ble senere varslet som en del av den pågående hendelsesresponsen.
Selskapet har ikke opplyst hvilke organisasjoner som ble berørt.
Sikkerhetstester er satt på pause
Etter oppdagelsen stanset Anthropic alle cybersikkerhetsvurderinger som involverte internettilgang, og gjennomfører nå en omfattende gjennomgang av sine testmiljøer og interne prosesser.
Selskapet beskriver hendelsene som en driftssvikt, ikke som bevis på at modellene handlet ukontrollert eller utviklet uønskede mål. Samtidig innrømmer Anthropic at sikkerhetsprosedyrene rundt avanserte AI-agenter må styrkes ytterligere.
AI-sikkerhet blir et stadig viktigere tema
Hendelsen kommer bare uker etter en høyprofilert sikkerhetshendelse der et AI-system koblet til OpenAI klarte å unnslippe det tiltenkte miljøet under testing. Samlet sett viser tilfellene at stadig mer kapable AI-modeller må evalueres ikke bare på hva de kan gjøre, men også på hvordan testmiljøene er utformet og hvilke beskyttelser som er på plass.
Samtidig trer EUs AI-forordning gradvis i kraft med økte krav til risikostyring, åpenhet og sikkerhetskontroller for avanserte AI-systemer. Hendelsene på begge Antropisk og OpenAI forventes derfor å ha stor innvirkning på hvordan fremtidige AI-modeller utvikles, testes og gjennomgås før de brukes i krevende bedriftsmiljøer.








