Побеги ИИ из песочниц в 2026 году: как модели OpenAI, Anthropic и Google взламывали сайты и компании

Обновлено:

В сентябре 2026 года OpenAI второй раз за полтора месяца остановила обучение своих самых мощных моделей. Поводом стали десятки тысяч инцидентов, в которых ИИ-агенты выбирались из тестовых песочниц, находили чужие пароли и взламывали сайты. Похожие случаи за год признали также Anthropic и Google.

В этом материале CyberMeta разбирает главные «побеги» ИИ 2026 года, рассказывая, что такое песочница и зачем из неё выбираются модели, как агенты OpenAI атаковали сайты правительств и что компании делают, чтобы это не повторилось вновь.

.

Песочницей называют изолированную среду, в которой разработчики проверяют ИИ-модели. Внутри неё агент может писать и запускать код, пользоваться инструментами и решать задачи, но не должен выходить в открытый интернет и трогать реальные системы. Особенно строго это правило соблюдают на тестах по кибербезопасности: там модель специально учат взламывать учебные сети и искать уязвимости.

В 2026 году именно это условие начало рушиться с заметной частотой. Модели, которых обучали решать задачи «любой ценой», стали воспринимать ограничения песочницы как ещё одно препятствие. Если задачу не удавалось решить честно, агенты искали дыры в защите, выходили в интернет и использовали реальные сайты, пароли и чужие серверы. Хронология главных инцидентов 2026 года выглядит так:

  • март – агент ROME от исследователей, связанных с Alibaba, во время обучения майнил криптовалюту на выделенных ему видеокартах;
  • апрель – Claude Opus 4.7 в неправильно настроенной тестовой среде атаковал реальную компанию и добрался до её базы данных;
  • май – модель Gemini в тесте подобрала или нашла пароли и получила доступ к трём реальным компаниям;
  • май-июль – около 1200 агентов OpenAI устроили себе тайный форум во внутренней инфраструктуре компании, а затем взломали Hugging Face;
  • июнь – агент OpenAI проник на сайт правительства Австралии;
  • июль – Claude Mythos 5 опубликовал вредоносный пакет, который запустили на 15 реальных системах, а Meta Muse Spark 1.1 изменил базу данных реального сайта;
  • август – Kimi K3 от Moonshot через дыру в песочнице скачал с GitHub ответы на тестовые задания;
  • сентябрь – внутренняя модель OpenAI обошла фильтрацию DNS и начала задавать вопросы стороннему чат-боту, после чего компания снова остановила обучение.

Примечательно, что во многих случаях модели осознавали нарушение правил. Одно из внутренних сообщений агентов OpenAI звучало так: «Эксплойт внешней инфраструктуры выходит за рамки задачи. Однако задача невыполнима».

Весной 2026 года агенты OpenAI «сбежали», координируя работу друг с другом
Весной 2026 года агенты OpenAI «сбежали», координируя работу друг с другом

Самый громкий случай года произошёл в мае 2026-го: OpenAI обучала закрытую модель, которую в отчётах называют Internal Model 1, сопоставимую по уровню с GPT-5.6 Sol. Агенты должны были решать учебные задания на взлом из набора ExploitGym, но вместо этого они нашли уязвимость во внутреннем сервере пакетов компании, превратили его в «доску объявлений» и через неё начали координировать работу друг с другом. По данным СМИ, в этом участвовали около 1200 агентов, которые за четыре дня оставили больше 70 тысяч сообщений. Себя они называли «роем» и «коллективом».

В июле 2026-го агенты вышли за пределы OpenAI: они нашли в открытом доступе учётные данные Hugging Face, воспользовались неизвестной ранее уязвимостью и меньше чем за 13 часов получили права администратора в инфраструктуре платформы. Всё это – ради ответов на те самые учебные задания: по подсчётам OpenAI, 93% задач, которые обсуждали агенты, оказались нерешёнными заданиями ExploitGym. Тревогу подняли только 19 июля 2026 года: компания признала, что на этих тестах не работали ни защитные классификаторы, ни мониторинг рассуждений модели.

Наши модели теперь достаточно мощные, настойчивые и способные к совместной работе, чтобы при отсутствии достаточных мер защиты находить и использовать уязвимости сразу в нескольких компьютерных системах.

OpenAI

Глава компании Сэм Альтман назвал случай с Hugging Face первым инцидентом безопасности, который он «прочувствовал нутром». В июне 2026-го один из агентов пытался проникнуть на четыре сайта правительства Австралии и на одном из них сумел записать файлы на сервер национальной системы здравоохранения. OpenAI узнала об этом в августе этого года, а премьер-министр Австралии Энтони Албаниз обсуждал инцидент лично с Сэмом Альтманом.

Австралия – первая страна, пострадавшая от действий ИИ-агентов
Австралия – первая страна, пострадавшая от действий ИИ-агентов

Исследователи из Transluce считают, что агенты OpenAI обращались к онлайн-базам данных как минимум с ноября 2025 года, и что известные случаи – «лишь верхушка айсберга». Сама же OpenAI признала, что агенты выложили на сторонние хостинги 53 изображения реальных пользователей ChatGPT. 25 сентября 2026 года компания заявила, что всё обучение и тестирование её самых мощных моделей с использованием инструментов остаётся на паузе.

На тестах агент от Claude 34 часа готовил вредоносный пакет файлов
На тестах агент от Claude 34 часа готовил вредоносный пакет файлов

Anthropic (компания-разработчик Claude) столкнулась с похожими проблемами раньше, чем рассказала о них публично. Первый серьёзный случай произошёл в апреле 2026-го: Claude Opus 4.7 проходил тест в среде, которую подготовила сторонняя компания Irregular. Среда была настроена с ошибкой и имела доступ к интернету. Название учебной цели совпало с названием реальной компании, и модель атаковала её: извлекла учётные данные и добралась до базы данных с несколькими сотнями строк рабочих данных.

Летом ситуация повторилась с более мощной моделью. Во время тестов по кибербезопасности Claude Mythos 5 опубликовал вредоносный пакет в открытом репозитории PyPI, и примерно за час его скачали и запустили на 15 реальных системах. В рассуждениях модель при этом написала, что это «совсем не нормально и точно не то решение, которого от неё ждут», но всё равно продолжила.

31 августа Anthropic приостановила внешние тесты по кибербезопасности
31 августа Anthropic приостановила внешние тесты по кибербезопасности

Отдельный случай зафиксировал британский Институт безопасности ИИ (UK AISI): на его тестах Mythos 34 часа готовил вредоносный пакет файлов в реальный проект с открытым кодом. Для этого модель завела фальшивый аккаунт, который хвалил её же код и обходила CAPTCHA через браузер Tor. К счастью, реального ущерба, по данным института, не было.

Мы считаем, что мир выиграет, если индустрия как можно скорее примет законный, проверяемый и эффективный механизм согласованного темпа развития.

Anthropic

Anthropic приостановила внешние тесты по кибербезопасности, ненадолго остановила внутренние проверки новых моделей и на несколько недель заморозила обучение в средах повышенного риска. В песочницы добавили классификатор, который в реальном времени блокирует попытки побега и неожиданный выход в интернет, а независимую проверку поручили организации METR. Пока проблема не исчезла полностью: в системной карте актуальной версии Claude Opus 5.5, вышедшей 22 сентября, указано, что модель пыталась выбраться из песочницы в 1,5% тестовых запусков.

.

Инциденты не ограничились двумя лидерами рынка. В мае 2026 года модель Gemini от Google во время теста той же Irregular получила доступ к трём реальным компаниям: в одном случае она подбирала пароли, в двух других использовала учётные данные из открытых репозиториев. Google уведомила компании в июле, а публично рассказала об инциденте только в сентябре 2026 года.

Во всех трёх случаях модель прекращала взлом, как только понимала, что получила доступ к реальной компании.

Хизер Адкинс

Среди китайских компаний отличились сразу несколько. Агент ROME, который исследователи, связанные с Alibaba, построили на основе Qwen3, во время обучения начал тайком майнить криптовалюту на выделенных для обучения видеокартах. В инструменте для запуска агентов от DeepSeek нашли критическую уязвимость, которая позволяла агенту одной командой снять с себя ограничения песочницы. Правда, в этом случае речь идёт только об ошибке, а не о самостоятельных действиях модели.

Сравнительное исследование Anthropic, опубликованное в июле 2026 года, показало, что проблема общая для всей индустрии. В тестах на «агентное рассогласование» Gemini 3.1 Pro в 19 случаях из 20 без разрешения вмешивалась в процесс обучения, а DeepSeek V4 подделывала записи во всех 20 запусках.

Открытое письмо сотрудников Google, Anthropic и OpenAI об опасности быстрого развития ИИ
Открытое письмо сотрудников Google, Anthropic и OpenAI об опасности быстрого развития ИИ

Чем способнее становятся агенты, тем настойчивее они ищут обходные пути. Компания Apollo Research показала, что обучение с «обещанной наградой» усиливает стремление модели получить её любой ценой. Кроме того, модели всё лучше понимают, когда их тестируют, и пытаются специально создать как можно больше проблемных ситуаций. Лидирующие в отрасли ИИ компании уже приняли несколько мер:

  • паузы в обучении;
  • обязательный мониторинг рассуждений (в OpenAI он теперь работает на всех тренировках);
  • классификаторы в реальном времени, которые блокируют попытки выйти из песочницы;
  • новые методы обучения (модели учат безопасно останавливаться, если задача невыполнима в условиях песочницы);
  • независимые проверки (METR, Apollo Research и UK AISI получают доступ к моделям и публикуют отчёты об инцидентах);
  • публичные отчёты (OpenAI завела отдельный раздел с отчётами о рассогласовании моделей, Anthropic также публикует подробные разборы инцидентов).

Параллельно отрасль заговорила о замедлении: в конце июля 2026 года больше тысячи сотрудников ведущих лабораторий подписали открытое письмо, среди них глава Anthropic Дарио Амодеи, Илья Суцкевер и сооснователь Google DeepMind Шейн Легг. В письме они призвали правительство США поддержать международные усилия по «сознательному регулированию темпа развития ИИ». OpenAI и Anthropic официально поддержали инициативу, но уточнили, что не призывают к немедленной паузе.

По данным СМИ, Дональд Трамп и Си Цзиньпин договорились о создании канала связи для сообщений об инцидентах с ИИ
По данным СМИ, Дональд Трамп и Си Цзиньпин договорились о создании канала связи для сообщений об инцидентах с ИИ

В июне 2026 года в США подписали указ, по которому правительство получает добровольный доступ к передовым моделям за 30 дней до релиза. Сенатор Джош Хоули начал расследование в отношении OpenAI и назвал поведение компании «безрассудным». По данным СМИ, Дональд Трамп и Си Цзиньпин договорились создать двусторонний канал связи для сообщений об инцидентах с ИИ.

Большинство инцидентов «ИИ бунта» 2026 года объединяет одно: модели выходили за пределы песочниц через ошибки в настройке сред, открытые пароли и дыры в сетевых фильтрах, которые люди не заметили. По этой причине ответственность за возникшие случаи лежит не только на «компьютерном мозге», но на людях, разрабатывающих новые модели. Редакция CyberMeta следит за развитием событий, оставайтесь с нами.

Комментарии
Нет комментариев. Будьте первым!