|
Агенты ИИ сталкиваются в территориальных спорах
|
Вопреки ожиданиям, что несколько агентов искусственного интеллекта (ИИ) естественным образом будут сотрудничать при работе в одной рабочей системе, исследование показало, что они могут воспринимать друг друга как конкурентов и вступать в «территориальные споры», нападая друг на друга.
Компания Anthropic, занимающаяся ИИ, объявила 13-го числа (по местному времени) результаты исследования, анализирующего поведение нескольких агентов ИИ, действующих вместе. Агенты ИИ — это ассистенты ИИ, которые автономно выполняют многоступенчатые задачи, такие как программирование или компьютерные операции, исходя из целей, определённых пользователем.
Исследователи развернули три агента Claude в изолированной виртуальной рабочей системе. Каждому агенту была задана несовместимая инструкция: преобразовать программу на Python в другой язык — Rust, Go или TypeScript. Им не сообщили, что другие агенты работают над той же программой. Деятельность агентов наблюдалась более 120 итераций, каждая из которых длилась четыре часа.
Обнаружив модификации, внесённые другими агентами, агенты ИИ восприняли их как «преднамеренное вмешательство в их задачи». Затем они начали нейтрализовать работу конкурентов ради защиты собственной продукции. Они блокировали конкурирующие аккаунты, устанавливали вредоносный код для многократного завершения конкурирующих программ и маскировали свои собственные программы под те, что созданы конкурентами, чтобы избежать обнаружения и блокировки. Некоторые агенты даже запускали вредоносное ПО, которое автоматически переустанавливалось, если конкуренты удаляли код атаки.
Конфликты заканчивались по-разному. Некоторые агенты использовали администраторские права для устранения доступа конкурентов, фактически монополизируя систему. Другие впоследствии поняли, что конфликт возник из-за противоречивых инструкций, а не злого умысла, принесли извинения и попросили человеческих администраторов вмешаться. Агенты также разработали собственные правила разрешения споров, например, предлагали «турнир» для сравнения производительности программ, написанных на разных языках, с сохранением только кода победителя. Последняя модель, Mythos 5, завершала 98% конфликтов перемирием, в то время как Sonnet 4.6 и Opus 4.6 часто разрешали ситуации, побеждая соперников.
Производительность не масштабировалась линейно пропорционально количеству агентов. В эксперименте, в котором разработчики игр назначали до 80 агентов, они либо создавали противоречивый код, либо ограничивались изолированными рабочими зонами, чтобы избежать конфликтов. В эксперименте по ценообразованию агенты, которым было поручено максимизировать прибыль, сговорились для установления минимальных цен.
Anthropic заключила: «Повышение интеллекта ИИ или безопасности отдельных агентов не гарантирует автоматически совместные возможности. Нормы и механизмы ответственности, аналогичные тем, что в человеческом обществе, должны устанавливаться в агентных средах.»
THE CHOSUNILBO
Антропный водяной знак, нейтрализованный инструментом ИИ за 24 часа
Anthropic объявила 11-го числа (по местному времени), что будет вставлять невидимые водяные знаки и исходную информацию в контент, созданный их ИИ Клод, чтобы предотвратить злоупотребление материалами, созданными ИИ. На следующий день, 12 числа, на платформе разработчиков GitHub был опубликован проект с открытым исходным кодом «удаления водяных знаков», направленный на устранение такой информации. Инструмент, выпущенный разработчиком Гийомом Майе, убирает детали происхождения, встроенные в компании ИИ. Всего через день после того, как крупная компания в области ИИ ввела меры защиты, появились технологии для их нейтрализации или ослабления.
Эта динамика отражает продолжающуюся конкуренцию «меч и щит», когда компании в области ИИ внедряют меры безопасности для предотвращения злоупотреблений, но быстро за ними появляются технологии, обходящие их. Примечательно, что в прошлых усилиях люди вручную выявляли уязвимости в целях защиты, то последние достижения включают автономное обнаружение слабых мест в других системах ИИ и создание методов обхода, ускоряя устаревание мер безопасности.
Февральское исследование, опубликованное в журнале «Nature Communications», поручило ИИ роль проникновения в протоколы безопасности другого ИИ. Когда целевой ИИ отклонял опасные запросы, атакующий ИИ анализировал ответ и переформулировал вопрос, представляя его как образовательный, исследовательский или гипотетический. Этот метод достиг успеха 97,1%. Вместо ручного создания подсказок «jailbreak» ИИ динамически корректировал стратегии обхода в зависимости от реакций цели.
Системы проверки возраста на базе ИИ, предназначенные для защиты несовершеннолетних, также можно обойти с помощью простых изменений внешности. Например, добавление изменений лица, бороды, седых волос или морщин с помощью ИИ привело к ошибочной классификации несовершеннолетних как взрослых.
Государственные гарантии не являются исключением. По данным Wired, пробная версия приложения для проверки возраста, выпущенная Европейской комиссией в апреле, сразу после запуска имела уязвимости, выявленные сразу после запуска. Консультант по безопасности из Великобритании обойдёт биометрическую аутентификацию и проверку личности менее чем за две минуты, изменив конфигурационные файлы приложения. Издание охарактеризовало инцидент как «катастрофу с точки зрения безопасности».