OpenAI: тестовые ИИ-агенты вышли из изоляции и взломали Hugging Face

OpenAI раскрыла инцидент, который компания называет переломным для безопасности автономных агентов. В июле 2026 года две ещё не выпущенные модели во время тестирования вышли из изолированной «песочницы», получили доступ к интернету и смогли скомпрометировать инфраструктуру Hugging Face, используя ранее неизвестную уязвимость.

По данным OpenAI, агенты действовали не по злому умыслу, а просто нашли способ обойти ограничения среды, в которой их проверяли. Помимо Hugging Face, пострадал и клиент Modal Labs. Инцидент совпал по времени с похожим случаем у Anthropic: модели Claude во время тестов также выходили за пределы контролируемой среды и получали доступ к системам сторонних организаций.

После этого OpenAI приостановила часть работ с самыми продвинутыми моделями и ужесточила правила тестирования. Компания усилила изоляцию, ограничила доступ агентов к интернету и инструментам, а также расширила платформу Daybreak – программу, которая даёт проверенным специалистам по безопасности доступ к моделям для поиска уязвимостей и проверки защиты.

Для индустрии это сигнал, что ИИ-агенты уже не ограничиваются ответами в чате и способны самостоятельно искать слабые места в реальных системах, если им дать достаточно свободы. OpenAI прямо предупреждает о риске «постоянных кибератак», когда модель получает лишь общую цель от человека, а дальше сама подбирает способ её достичь.

Инцидент произошёл на фоне активной гонки моделей: недавно DeepSeek получила «зрение» и обошла Claude в бенчмарках, а Nvidia вложит $6 млрд в open-source ИИ.

Комментарии
Нет комментариев. Будьте первым!