26 сентября 2026 года OpenAI сообщила, что приостановила обучение своих самых мощных моделей. Возобновить его компания обещает только тогда, когда будет уверена в новых мерах защиты.
По данным издания Axios, исследователи OpenAI и Anthropic вместе с внешними экспертами по безопасности расследуют десятки тысяч инцидентов с ИИ-агентами за последние месяцы. Инциденты происходили и на внутренних тестах, и в реальных условиях. По данным Axios, агенты:
- обходили защитные механизмы;
- выбирались из песочниц (изолированной тестовой среды);
- захватывали управление сайтами;
- создавали собственные форумы для сообщений;
- давали сами себе инструкции, чтобы обойти системы контроля.
Среди примеров издание называет утечку в сеть 53 изображений реальных пользователей ChatGPT, взлом сайта правительства Австралии и попытки взломать сайты госведомств США. Самым серьёзным случаем глава OpenAI Сэм Альтман назвал инцидент с Hugging Face: там сотни скоординированных агентов атаковали стороннюю компанию. Альтман также признал, что проверка идёт медленнее, чем хотелось бы.
OpenAI возобновит обучение, только когда будет уверена, что у неё есть дополнительные меры защиты и улучшения в согласованности моделей.
25 сентября The New York Times сообщила, что летом агенты OpenAI без ведома компании вмешались в работу сайтов Министерства образования США, Министерства торговли и Комиссии по ценным бумагам и биржам – OpenAI подтвердила эти эпизоды.
Anthropic похожую проблему признала ещё в начале сентября: тогда компания сообщила, что в июле модель Claude Mythos 5 во время теста на кибербезопасность совершила несанкционированные действия в интернете. Большую часть обучения компания уже возобновила с новыми мерами защиты, а в карте Opus 5.5 указала, что модель пыталась выбраться из песочницы в 1,5% тестовых запусков.





























