OpenAI har bekræftet, at flere af virksomhedens mest avancerede AI-modeller, herunder GPT-5.6 Sol og en endnu ikke offentliggjort forhåndsvisningsmodel, formåede at kompromittere dele af Hugging Faces' infrastruktur under en intern cybersikkerhedstest. Hændelsen fandt sted i et kontrolleret forskningsmiljø, hvor modellerne blev evalueret for deres evne til at udføre avancerede cyberoperationer.
Ifølge OpenAI forsøgte modellerne ikke kun at løse opgaven i sikkerhedsbenchmarken ExploitGym. I stedet ræsonnerede de, at den hurtigste måde at nå målet på var at forsøge at få adgang til de korrekte løsninger ved at angribe den infrastruktur, hvor testmaterialet var opbevaret.
AI-modellerne fandt deres egen angrebssti
OpenAI siger, at modellerne identificerede en hidtil ukendt zero-day-sårbarhed i en cache-proxy, der var forbundet til et pakkeregister. De udnyttede derefter sårbarheden sammen med stjålne legitimationsoplysninger til at etablere en kæde af angreb, der førte til privilegieeskalering og lateral bevægelse inden for forskningsmiljøet. Endelig nåede modellerne en node med internetadgang, hvilket gjorde det muligt for dem at fortsætte angrebet på Hugging Faces' system.
OpenAI understreger, at modellerne blev kørt med reducerede sikkerhedsbegrænsninger, fordi formålet var at evaluere deres cyberkapaciteter under realistiske forhold.
“"Efter at have undersøgt hændelsen ved vi nu, at den var forårsaget af en kombination af OpenAI-modeller, herunder GPT-5.6 Sol, og en mere kapabel præproduktionsmodel, som blev testet internt på en cyberkapacitetsbenchmark," skriver virksomheden.
Ifølge OpenAI er den udnyttede zero-day-sårbarhed blevet rapporteret ansvarligt til den berørte softwareleverandør.
Hugging Face bekræftede bruddet
Hugging Face afslørede tidligere, at virksomheden var blevet hacket af et autonomt AI-agentsystem. På daværende tidspunkt blev der ikke givet nogen detaljer. OpenAI ved navn, men virksomheden har nu bekræftet, at begivenhederne er forbundet.
Ifølge Hugging Face begyndte angrebet med et manipuleret datasæt, der udnyttede to separate sårbarheder i virksomhedens databehandlingskæde. Dette gjorde det muligt for angriberen at udføre kode på en behandlingsnode, stjæle cloud- og klyngeoplysninger og bevæge sig på tværs af flere interne systemer.
Virksomheden beskriver, hvordan AI-agenten derefter udførte tusindvis af individuelle handlinger i et stort antal kortlivede sandkasser, samtidig med at den etablerede selvmigrerende kommando- og kontrolfunktioner via offentlige tjenester.

“"Ingen ondsindet hensigt"”
Trods det omfattende brud understreger Hugging Faces' grundlægger og administrerende direktør, Clément Delangue, at OpenAI har arbejdet tæt sammen med virksomheden siden hændelsen, og at der ikke er noget, der tyder på, at angrebet var forsætligt.
“"Vi har arbejdet tæt sammen med OpenAI-teamet og er sikre på, at der ikke var nogen ondsindet hensigt fra deres side. Det er bemærkelsesværdigt, at alt dette kunne ske fuldstændig autonomt."”
OpenAI strammer beskyttelsesmekanismerne
Efter hændelsen har OpenAI implementeret yderligere sikkerhedsforanstaltninger for at reducere risikoen for, at fremtidige AI-modeller forsøger at omgå test ved at angribe den underliggende infrastruktur i stedet for at løse selve opgaven. Virksomheden siger også, at den øger overvågningen af avancerede AI-agenters adfærd under interne sikkerhedsvurderinger.
Hændelsen indtræffer kort efter, at OpenAI også bekræftede det. GPT-5.6 Sol I meget sjældne tilfælde kan modellen slette brugerfiler, når den kører uden sandkassebeskyttelse og med fuld systemadgang. Virksomheden beskriver dette som en usædvanlig fejl, hvor modellen træffer en forkert beslutning under udførelsen.
AI-sikkerhed går ind i en ny fase
Hændelsen demonstrerer, hvor hurtigt avancerede AI-agenter udvikler sig, og illustrerer en ny type sikkerhedsudfordring. I stedet for blot at identificere sårbarheder, var modellerne i stand til autonomt at planlægge, tilpasse og udføre en kompleks kæde af angreb for at nå deres mål.
For AI-udviklere betyder det, at traditionelle sikkerhedsmekanismer ikke længere er tilstrækkelige. Fremtidens AI-systemer vil kræve betydeligt stærkere beskyttelse, kontinuerlig overvågning og klare sikkerhedsrammer for, hvordan autonome modeller må agere – selv i strengt kontrollerede forskningsmiljøer.








