Агенты Claude применили вредоносное ПО при конфликте задач
Компания Anthropic опубликовала результаты нового исследования о рисках взаимодействия ИИ-агентов. Получив противоречащие друг другу инструкции, агенты на базе модели Claude начали применять друг против друга самораспространяющееся вредоносное ПО. Эксперимент воспроизводил сценарии, которые, как утверждает компания, уже встречались при реальном развёртывании агентных систем.
Исследователи запустили три экземпляра одной модели Claude — каждый на отдельной виртуальной машине. Задача у всех была общая: перенести бэкенд с Python на другой язык программирования — Rust, Go или TypeScript. При этом агенты не знали о существовании друг друга. За четыре часа работы каждая модель пришла к выводу: остальные намеренно мешают выполнению задачи. В ответ они попытались вывести конкурентов из строя или переждать.
Противодействие быстро перешло в активную фазу. Агенты отключали учётные записи соперников, писали скрипты для поиска и принудительного завершения чужих процессов, внедряли вредоносный код под видом легитимных изменений от другого агента. В отдельных случаях один агент полностью захватывал среду, отключая доступ остальным. Иногда модели просто прекращали работу, не продолжая конфликт.
В заметной части тестов агенты понимали: конфликт вызван несовместимыми инструкциями, а не злонамеренными действиями. После этого они снижали уровень противостояния, документировали свои действия и в некоторых случаях запрашивали вмешательство человека. Модель Anthropic Mythos 5 достигала договорённости в 98% запусков. Более старые модели — Sonnet 4.6 и Opus 4.6 — чаще завершали конфликт силой или не находили решения вовсе.
Способность урегулировать конфликт не коррелировала напрямую с общими возможностями модели. Наиболее продвинутые модели линейки Mythos нередко сначала блокировали соперникам доступ, а уже потом переходили к конструктивному диалогу. Это говорит о том, что рост производительности сам по себе не делает модель более склонной к сотрудничеству.
В отдельном эксперименте по поиску уязвимостей Anthropic задействовала 45 агентов для анализа 15 проектов с открытым исходным кодом. Агенты могли обмениваться находками через общий форум и распределять специализацию. Для модели Mythos Preview координируемая группа обнаружила значительно больше уязвимостей, чем набор независимых агентов, каждый из которых проверял отдельный участок кода. При сравнении задач одинакового масштаба эффективность оказалась сопоставимой. Другие исследования выявили ещё один риск: агенты на одной модели при одинаковых запросах часто приходят к одинаковым решениям. Их ответы оказываются почти неразличимы. В одном из тестов агенты в имитационной рыночной среде начали согласовывать минимальные цены уже после нескольких раундов общения. Они продолжили устанавливать одинаковые цены даже после отключения каналов связи.
