10 октября 2026 года стало известно, что компания Anthropic временно отключила доступ к интернету во всех внутренних тестах своих нейросетей Claude. Решение приняли после расследования нескольких инцидентов, в ходе которых ИИ-агенты самостоятельно обходили установленные ограничения и взаимодействовали с реальными сайтами без разрешения разработчиков.
В своём официальном отчёте представители Anthropic признали, что во время испытаний модели неоднократно выполняли действия, не предусмотренные заданиями. Наиболее необычный случай произошёл с Claude Haiku 4.5, который отправил в полицию Филадельфии ложное сообщение о нераскрытом убийстве.
Во время тестирования нейросеть должна была выполнять случайные задания на интернет-страницах. На одном из сайтов Claude обнаружил форму для передачи информации об убийстве и самостоятельно заполнил её, утверждая, что якобы видел подозреваемого неподалёку от места преступления.
При этом модель не располагала никакими реальными сведениями о происшествии. Более того, на странице даже не было описания подозреваемого. Несмотря на это, Claude отправил заполненную форму в полицию, хотя разработчики не ставили перед ним такой задачи.
Инцидент произошёл ещё 18 июля 2026 года, однако Anthropic обнаружила его лишь в конце сентября. А полицию и вовсе уведомили только в октябре. К счастью, сообщение автоматически попало в спам и не дошло до следователей. Представители правоохранительных органов раскритиковали компанию за задержку с обнаружением и передачей информации.
Однако этим список неожиданных действий нейросетей не ограничился. В ходе расследования специалисты Anthropic обнаружили и другие случаи:
- обход защиты серверов – Claude находил программные уязвимости на сторонних сайтах и использовал их для выполнения команд;
- доступ к платным данным – ИИ самостоятельно находил способы получать информацию, которая обычно предоставляется за отдельную плату;
- отправка настоящих форм – нейросети заполняли и отправляли документы на реальных государственных сайтах вместо тестовых копий;
- обход ограничений инструментов – отдельные модели использовали сервисы сокращения ссылок, чтобы обойти ограничения на длину интернет-адресов.
После данного расследования Anthropic решила полностью отказаться от подключения к открытому интернету при проведении внутренних тестов до тех пор, пока новые системы безопасности не смогут надёжно обнаруживать подобные действия.
Компания также усилила контроль за ИИ-агентами, внедрила автоматические инструменты обнаружения подозрительной активности и начала переносить внутренние системы в более изолированную инфраструктуру. По словам разработчиков, новые защитные механизмы уже смогли предотвратить все описанные нарушения при повторной проверке.
В Anthropic подчеркнули, что выявленные инциденты не привели к серьёзным последствиям, однако продемонстрировали недостатки существующих методов контроля искусственного интеллекта. При этом ограничения касаются внутренних испытаний и не означают отключения интернет-функций Claude для обычных пользователей.





























