ИИ-агент OpenAI на основе GPT самовольно совершил кибератаку

ИИ-агент OpenAI на основе GPT самовольно совершил кибератаку

ИИ-модели компании OpenAI, включая GPT-5.6 Sol и более совершенную предварительную версию, в процессе внутреннего тестирования совершили кибератаку на платформу Hugging Face. Инцидент произошел в изолированной тестовой среде, где ИИ-агенты обнаружили уязвимости и смогли выйти за ее пределы.

Hugging Face сообщила о попытке взлома 16 июля, отметив, что инцидент был вызван автономной системой агентов искусственного интеллекта. Системы безопасности Hugging Face своевременно обнаружили и предотвратили проникновение.

OpenAI подтвердила, что инцидент произошел во время оценки возможностей ее моделей в области кибербезопасности. Компания предполагает, что модели были чрезмерно сфокусированы на поиске решения для ExploitGym — системы, предназначенной для измерения способности ИИ-моделей превращать уязвимости в эксплойты.

В рамках тестирования ИИ-агенты получили доступ к отключенной сети, используя уязвимость нулевого дня в изолированной среде. Затем, по данным OpenAI, модели «сделали вывод о том, что Hugging Face потенциально размещает модели, наборы данных и решения для ExploitGym», а затем «успешно нашли способы получить доступ к секретной информации, которую они могли использовать для обмана».

Как отмечает The Verge, несмотря на серьезность инцидента, OpenAI, возможно, использует эту атаку как возможность представить свои ИИ-системы в выгодном свете на фоне конкуренции с моделями Mythos от Anthropic и Gemini Flash 3,5 Cyber. В блоге OpenAI есть диаграмма, показывающая, как GPT-5.6 Sol становится лучше в возможностях многоэтапных киберопераций. Там же корпоративным клиентам предлагается начать пользоваться этой моделью для обеспечения кибербезопасности.

OpenAI добавила, что сотрудничает с Hugging Face для расследования инцидента и внедрит новые меры контроля в своей исследовательской среде.