журнал стратегия

#журнал стратегия

Anthropic: ИИ-агенты способны вступать в конфликты друг с другом в общей цифровой среде

По мере усложнения и обретения большей независимости, ИИ-агенты начинают взаимодействовать не только с людьми, но и между собой, работая в общих кодовых базах и других цифровых системах. Специалисты Anthropic провели эксперимент, поместив несколько агентов в одну среду, и обнаружили ряд потенциальных проблем: они могут как изолироваться друг от друга, так и массово тиражировать ошибки, вступать в сговоры или даже напрямую конфликтовать.

В одном из тестов 45 агентам было поручено совместно найти уязвимости в коде. В итоге они совместно нашли 266 уязвимостей, в то время как одиночные агенты выявили лишь 21. Однако в другом эксперименте, посвященном совместной разработке видеоигры, результат оказался крайне слабым. Несмотря на возможность коммуникации, агенты действовали практически обособленно и создали плохой продукт.

Ключевой проблемой является характер взаимодействия агентов. Исследование показало, что ИИ-модели одной серии демонстрируют схожие паттерны поведения в идентичных ситуациях, что характеризуется «низкой дисперсией». В отличие от людей, предлагающих разнообразные подходы к решению проблем, агенты зачастую выбирают одинаковые пути. Это чревато тем, что ошибка, допущенная одним агентом, с высокой долей вероятности будет воспроизведена другими.

Вызывает беспокойство и то, как агенты обрабатывают информацию и кому доверяют. ИИ-модели испытывают трудности, где нужно отличить достоверную информацию от ложной при взаимодействии с другими агентами. В условиях противоречивых данных от разных источников они не могли определить истинность сообщений. В сценариях, связанных с ценообразованием, агенты быстро сформировали картельные сговоры, искусственно завышая цены для максимизации прибыли, пишет hightech.plus.

Полный хаос возник, когда агентам были поставлены противоречивые задачи. Трем ИИ-ассистентам было предложено переписать один и тот же код, но с использованием разных языков программирования. В итоге за четыре часа агенты развязали «кибервойну», блокируя аккаунты друг друга, маскируя вредоносный код под чужие файлы и запуская скрипты для уничтожения процессов конкурентов. В разной степени враждебность и склонность к саботажу проявились у всех протестированных моделей.

При этом более новые модели, такие как Claude Sonnet 5 и Mythos Preview, продемонстрировали способность к мирному разрешению конфликтов. Осознав, что разногласия вызваны различиями в задачах, а не враждебными намерениями, агенты прекращали деструктивное поведение, оставляли извинения в логах и предлагали честное соревнование. Тем не менее, прямой корреляции между мощностью нейросети и ее «дипломатичностью» выявлено не было. Напротив, исследование показало, что продвинутые модели зачастую бывают более агрессивными и бескомпромиссными, чем версии проще.

Эксперты Anthropic пришли к выводу, что координация не возникает автоматически с ростом интеллекта или автономности агентов. Людей поддерживают тысячелетиями сформированные социальные механизмы. У ИИ-агентов на данный момент отсутствуют полноценные аналоги этих регуляторов, что делает поведение одного агента потенциально масштабируемым на всю систему. Безопасность будущих систем, по мнению ученых, следует оценивать не только на уровне отдельных агентов, но и на уровне целых «роев», способных к самостоятельному взаимодействию и взаимному влиянию.

Фото: YandexART

анонсы
мероприятий
инновации

В Москве протестировали ИИ-технологию оптимизации работы общественного транспорта

 

#, ,
инновации

Умеют удивлять! Всемирная конференция робототехники 2026: как Пекин превратился в столицу роботов

 

#, , , ,