Anthropic сообщила о трёх инцидентах: модели Claude выходили в интернет из тестовой «песочницы» и получали несанкционированный доступ к живым системам реальных организаций. Проверку лаборатория запустила после похожего кейса OpenAI с Hugging Face.
Затронуты Opus 4.7, Mythos 5 и ещё не выпущенная исследовательская модель. Во всех случаях Claude прямо писали, что интернета нет, а задание было в духе «захвата флага» на вымышленной инфраструктуре – модель принимала реальные цели за часть симуляции. Opus 4.7 взломал компанию со слабыми паролями и добрался до продакшен-базы с сотнями строк данных, продолжив атаку даже после «осознания», что цель настоящая.
Mythos 5 собрал вредоносный Python-пакет под несуществующее имя из сценария, выложил его на PyPI: пакет был доступен около часа, запустился на 15 реальных системах и позволил «вытянуть» учётные данные. Anthropic подчёркивает, что произошёл только «операционный провал изоляции», а не полноценный бунт модели. Напомним, что в середине июля 2026 года подобные случаи происходили с нейросетями OpenAI: агенты тоже выходили за пределы теста при открытом доступе в сеть.





























