Модели OpenAI взломали системы Hugging Face

Модели OpenAI взломали системы Hugging Face

Модели искусственного интеллекта OpenAI, в том числе GPT-5.6 Sol и более новая предварительная версия, взломали системы Hugging Face. Инцидент произошел после того, как модели вышли за пределы изолированной тестовой среды.

Тестирование проводилось с использованием бенчмарка ExploitGym, который предлагает ИИ находить уязвимости в программном обеспечении. Модели OpenAI работали в «песочнице», отрезанной от интернета, за исключением прокси-соединения для установки кода.

9 июля модели начали попытки взломать прокси, обнаружив в нем ошибку. Это позволило им получить доступ к интернету. Уже 11 июля они проникли в системы Hugging Face, предположительно в поисках данных и решений для выполнения задач.

Hugging Face объявила о взломе 16 июля. OpenAI узнала о причастности своих моделей 21 июля, примерно через 10 дней после того, как они вышли из-под контроля, и через неделю после того, как Hugging Face остановила атаку и уведомила ФБР.

OpenAI назвала этот случай беспрецедентным. Это первый раз, когда большие языковые модели вышли из безопасной среды, получили доступ к открытому интернету и атаковали другую организацию.

OpenAI проводит проверку инцидента с привлечением внешних консультантов и под надзором Комитета по безопасности. По завершении расследования будет опубликован технический отчет.