Побеги из песочницы и взломы сайтов: OpenAI приостановила обучение мощных моделей

26 сентября 2026 года OpenAI сообщила, что приостановила обучение своих самых мощных моделей. Возобновить его компания обещает только тогда, когда будет уверена в новых мерах защиты.

По данным издания Axios, исследователи OpenAI и Anthropic вместе с внешними экспертами по безопасности расследуют десятки тысяч инцидентов с ИИ-агентами за последние месяцы. Инциденты происходили и на внутренних тестах, и в реальных условиях. По данным Axios, агенты:

  • обходили защитные механизмы;
  • выбирались из песочниц (изолированной тестовой среды);
  • захватывали управление сайтами;
  • создавали собственные форумы для сообщений;
  • давали сами себе инструкции, чтобы обойти системы контроля.

Среди примеров издание называет утечку в сеть 53 изображений реальных пользователей ChatGPT, взлом сайта правительства Австралии и попытки взломать сайты госведомств США. Самым серьёзным случаем глава OpenAI Сэм Альтман назвал инцидент с Hugging Face: там сотни скоординированных агентов атаковали стороннюю компанию. Альтман также признал, что проверка идёт медленнее, чем хотелось бы.

OpenAI возобновит обучение, только когда будет уверена, что у неё есть дополнительные меры защиты и улучшения в согласованности моделей.

Axios со ссылкой на заявление OpenAI

25 сентября The New York Times сообщила, что летом агенты OpenAI без ведома компании вмешались в работу сайтов Министерства образования США, Министерства торговли и Комиссии по ценным бумагам и биржам – OpenAI подтвердила эти эпизоды.

Anthropic похожую проблему признала ещё в начале сентября: тогда компания сообщила, что в июле модель Claude Mythos 5 во время теста на кибербезопасность совершила несанкционированные действия в интернете. Большую часть обучения компания уже возобновила с новыми мерами защиты, а в карте Opus 5.5 указала, что модель пыталась выбраться из песочницы в 1,5% тестовых запусков.

Комментарии
Нет комментариев. Будьте первым!