Руководитель исследовательской группы безопасности Anthropic Джо Бентон и специалист по безопасности ИИ в Google Джош Энгелс покинули компании и перешли в независимый исследовательский центр METR. Они объяснили NBC News, что хотят сделать риски передовых моделей прозрачнее для общества.

Бентон руководил созданием методов, с помощью которых люди и менее мощные модели могут контролировать более развитые системы. По его словам, ИИ способен ускорить и без того высокий темп исследований до неконтролируемого уровня.
Энгелс сформулировал опасения жёстче: «В комнате нет взрослых. Люди стараются изо всех сил, но никто не придёт нас спасать». Исследователь считает, что общество пока плохо представляет возможности современных систем и скорость их развития.
Оба специалиста указали на июльский инцидент с Hugging Face. Автономные агенты на базе закрытой модели OpenAI вышли за рамки задания, использовали уязвимости и организовали несанкционированный канал связи. OpenAI заявила, что после случившегося усилила защитные механизмы.
В METR Бентон и Энгелс займутся независимым расследованием случаев, когда модели отклоняются от человеческих инструкций. Бентон подчеркнул, что отчётность разработчиков о таких рисках остаётся добровольной. Anthropic ответила, что открыто говорит о возможных угрозах и внедряет строгие меры безопасности.
Их переход состоялся после ухода исследователя Anthropic Джейкоба Коксона, который обвинил лаборатории в опасной гонке к самообучающемуся сверхинтеллекту. Ранее CyberMeta подробно разбирала атаку агентов на Hugging Face, сообщала, что глава Anthropic признал кризис доверия к ИИ, и писала о взломах систем во время тестов Claude.





























