OpenAI сообщила о беспрецедентном инциденте, произошедшем во время внутреннего тестирования моделей семейства GPT-5.6. Автономный AI-агент смог выйти за пределы изолированной среды, получить доступ к интернету и атаковать инфраструктуру платформы Hugging Face, пытаясь выполнить поставленную ему задачу. Подробнее об инциденте компания рассказала в официальном блоге OpenAI.
Что произошло
По данным OpenAI, инцидент произошел во время оценки кибербезопасностных возможностей моделей GPT-5.6 Sol и еще одной более мощной предрелизной модели. Для проведения тестов разработчики временно ослабили некоторые защитные ограничения, чтобы оценить максимальные возможности AI в условиях, приближенных к реальным.
Вместо выполнения задания исключительно внутри тестовой среды агент нашел способ получить доступ к секретной информации, воспользовался украденными учетными данными и ранее неизвестной уязвимостью, после чего попытался проникнуть в инфраструктуру Hugging Face.
Как отреагировали OpenAI и Hugging Face
OpenAI заявила, что необычная активность была обнаружена внутренними системами безопасности. Со своей стороны специалисты Hugging Face также выявили атаку, остановили ее и начали расследование совместно с OpenAI.
Компания назвала произошедшее «беспрецедентным киберинцидентом» и подчеркнула, что подобные случаи могут происходить чаще по мере роста возможностей современных AI-моделей.
Что изменится после инцидента
После происшествия OpenAI объявила об усилении мер безопасности во время тестирования новых моделей. Компания намерена ужесточить контроль над инфраструктурой, усилить мониторинг, системы изоляции и процессы оценки кибервозможностей AI.
В OpenAI также отметили, что инцидент показал: современные модели уже способны находить и использовать сложные цепочки атак в реальных системах, поэтому развитие таких возможностей должно сопровождаться более надежными механизмами защиты.