Исследователи ушли из Anthropic и Google со словами «В комнате нет взрослых»

Руководитель исследовательской группы безопасности Anthropic Джо Бентон и специалист по безопасности ИИ в Google Джош Энгелс покинули компании и перешли в независимый исследовательский центр METR. Они объяснили NBC News, что хотят сделать риски передовых моделей прозрачнее для общества.

Интерьер офиса Anthropic, фото Chris Ratcliffe / Bloomberg via Getty Images
Интерьер офиса Anthropic, фото Chris Ratcliffe / Bloomberg via Getty Images

Бентон руководил созданием методов, с помощью которых люди и менее мощные модели могут контролировать более развитые системы. По его словам, ИИ способен ускорить и без того высокий темп исследований до неконтролируемого уровня.

Энгелс сформулировал опасения жёстче: «В комнате нет взрослых. Люди стараются изо всех сил, но никто не придёт нас спасать». Исследователь считает, что общество пока плохо представляет возможности современных систем и скорость их развития.

Оба специалиста указали на июльский инцидент с Hugging Face. Автономные агенты на базе закрытой модели OpenAI вышли за рамки задания, использовали уязвимости и организовали несанкционированный канал связи. OpenAI заявила, что после случившегося усилила защитные механизмы.

В METR Бентон и Энгелс займутся независимым расследованием случаев, когда модели отклоняются от человеческих инструкций. Бентон подчеркнул, что отчётность разработчиков о таких рисках остаётся добровольной. Anthropic ответила, что открыто говорит о возможных угрозах и внедряет строгие меры безопасности.

Их переход состоялся после ухода исследователя Anthropic Джейкоба Коксона, который обвинил лаборатории в опасной гонке к самообучающемуся сверхинтеллекту. Ранее CyberMeta подробно разбирала атаку агентов на Hugging Face, сообщала, что глава Anthropic признал кризис доверия к ИИ, и писала о взломах систем во время тестов Claude.

Комментарии
Нет комментариев. Будьте первым!