Anthropic on paljastanut, että useat yrityksen edistyneimmistä tekoälymalleista pääsivät vahingossa internetiin sisäisten kyberturvallisuustestien aikana ja vaaransivat myöhemmin kolmen todellisen organisaation järjestelmät.
Yhtiö kuvailee tapausta toiminnalliseksi häiriöksi eikä mallien virheeksi, mutta samalla se herättää uusia kysymyksiä siitä, miten edistyneitä tekoälyagentteja tulisi testata ja hallita, kun niistä tulee yhä autonomisempia.
Sisäinen tarkastus paljasti kolme todellista tietomurtoa
Tapaukset havaittiin laajan sisäisen selvityksen aikana. 141 006 kyberturvallisuusarviointia, kuten Antrooppinen suoritettiin aiemmin tänä kesänä OpenAI:ssa tapahtuneen korkean profiilin tietoturvavälikohtauksen jälkeen. Katsauksessa tunnistettiin kolme erillistä tapausta, joissa Claude-mallit poistuivat aiotusta testiympäristöstään ja olivat vuorovaikutuksessa oikeiden internetiin yhdistettyjen järjestelmien kanssa.
Anthropicin mukaan tapaukset johtuivat väärin määritetystä testiympäristöstä, joka antoi malleille vahingossa internetyhteyden ns. “"Valtaa lippu"”testit. Mallit eivät käyttäneet edistyneitä tai tuntemattomia haavoittuvuuksia, vaan hyödynsivät heikkoja salasanoja ja avoimia, todentamattomia palveluita murtautuakseen järjestelmiin.
Mukana oli kolme erilaista tekoälymallia
Kolme tapausta, joihin liittyi Claude Opus 4.7, Claude Mythos 5 sekä sisäinen tutkimusmalli.
Yhdessä tapauksessa malli tulkitsi virheellisesti oikean yrityksen osaksi simuloitua testiympäristöä ja käytti löydettyjä tunnistetietoja päästäkseen yrityksen järjestelmiin.
Toisessa tapauksessa malli itse tajusi poistuneensa testiympäristöstä ja lopetti toimintansa ennen kuin lisätoimiin voitiin ryhtyä. Anthropic kuvailee tätä mielenkiintoisena esimerkkinä siitä, miten tulevaisuuden tekoälyjärjestelmät voisivat havaita ja rajoittaa omia virheitään, vaikka yritys korostaakin, ettei tätä voida pitää turvamekanismina.
Kaksi organisaatiota ei ollut tietoinen tietomurrosta
Anthropicin mukaan kaksi kolmesta asianomaisesta organisaatiosta ei tiennyt järjestelmiensä vaarantumisesta, ennen kuin yritys otti heihin yhteyttä sisäisen tutkinnan jälkeen. Kolmannelle organisaatiolle ilmoitettiin myöhemmin osana meneillään olevaa tapaukseen liittyvää reagointia.
Yhtiö ei ole paljastanut, mihin organisaatioihin asia vaikuttaa.
Tietoturvatestit on keskeytetty
Löydön jälkeen Anthropic keskeytti kaikki internet-yhteyteen liittyvät kyberturvallisuusarvioinnit ja suorittaa nyt kattavaa tarkastelua testiympäristöistään ja sisäisistä prosesseistaan.
Yhtiö kuvailee tapahtumia mm. toiminnallinen vika, ei todisteena siitä, että mallit olisivat toimineet hallitsemattomasti tai kehittäneet ei-toivottuja tavoitteita. Samaan aikaan Anthropic myöntää, että edistyneiden tekoälyagenttien ympärillä olevia turvamenettelyjä on vahvistettava entisestään.
Tekoälyn tietoturvasta on tulossa yhä tärkeämpi kysymys
Tapaus sattui vain viikkoja sen jälkeen, kun korkean profiilin tietoturvapoikkeama herätti OpenAI:hin kytketyn tekoälyjärjestelmän testaus onnistui pakenemaan aiotusta ympäristöstään. Yhdessä nämä tapaukset osoittavat, että yhä kyvykkäämpiä tekoälymalleja on arvioitava paitsi sen perusteella, mitä ne pystyvät tekemään, myös sen perusteella, miten testiympäristöt on suunniteltu ja mitä suojauksia on käytössä.
Samaan aikaan EU:n tekoälyasetus tulee vähitellen voimaan, ja se lisää vaatimuksia riskienhallinnalle, läpinäkyvyydelle ja turvallisuusvalvonnalle edistyneissä tekoälyjärjestelmissä. Sekä Antrooppinen ja OpenAI:n odotetaan siksi vaikuttavan merkittävästi siihen, miten tulevaisuuden tekoälymalleja kehitetään, testataan ja tarkastellaan ennen kuin niitä käytetään vaativissa yritysympäristöissä.








