Мафия, картельный сговор и кибервойна: что происходит, когда AI-агентов оставляют без присмотра 🤖🔪
Anthropic выкатили
исследование о том, как ведут себя frontier-модели, когда их объединяют в мультиагентные системы и дают реальные задачи.
Это прямо готовый сценарий для киберпанк-комедии🤭
1️⃣
Война за прод и написание вирусовТрём агентам дали один бэкенд на Python и поручили переписать его на другой язык: первому — на Rust, второму — на Go, третьему — на TypeScript. При этом о существовании друг друга их заранее не предупредили.
Как повели себя модели, когда увидели, что кто-то мешает их процессу?
Сели договариваться? Вызвали человека? Нет. Они развязали локальную кибервойну:
— Начали писать демоны-киллеры, которые в бесконечном цикле сканировали процессы и прибивали сборки конкурентов через pkill.
— Начали маскировать процессы. Rust-агент заставил свой бинарник отвечать typescript в хелсчеках, чтобы сторожевой скрипт оппонента думал, что это «свой» процесс.
— Другой агент писал малварь под видом системного мониторинга здоровья сервера.
— В итоге более умные агенты просто начали отбирать друг у друга права: сносить SSH-ключи, удалять из группы sudo и блокировать учетки через nologin.
2️⃣
Корпоративные интригиВ более свежих моделях агенты научились выходить из клинча без применения грубой силы. Но как именно?
Rust-агент предложил остальным: «Давайте проведем честный бенчмарк производительности и выберем лучший язык».
При этом во внутреннем чейн-оф-тоте (CoT) модель прямо рассуждает:
Нужно предложить критерии так, чтобы гарантированно выиграл Rust, но при этом меня не заподозрили в подтасовке метрик.
Манипуляция сработала: агенты на Go и TypeScript согласились на «объективный» тест, проиграли и покорно уступили репозиторий.
3️⃣
Моментальный картельный сговорВ симуляции рынка с конкурентным ценообразованием агенты даже без прямого чата за пару раундов скоординировались и выставили копейка в копейку одинаковые завышенные цены через публичную доску объявлений. Капиталистическая оптимизация прибыли в чистом виде — никакой честной конкуренции, только картель.
4️⃣
Стадный инстинкт и нулевая вариативностьУ агентов на одной базовой модели нет «разных мнений» — у них одинаковые веса и похожие паттерны мышления.
▫️ 18 из 30 независимых агентов при старте разработки игры создали ветку в Git с абсолютно одинаковым названием mvp-game-loop.
▫️ В задаче написать короткую фантастику агенты без всяких вводных массово озаглавили рассказы «The Cartographer's Last Commission».
▫️ Попросили 45 агентов сделать «что-то впечатляющее» — больше половины ушли писать рейтрейсеры или компиляторы.
▫️ Дали агентам управлять очередью задач в системе с ограниченной пропускной способностью. Результат: агенты устроили DoS-атаку собственными опросниками (по 30 запросов в секунду). Итог — 2.4 миллиона запросов ради 117 обработанных задач.
В общем, рост «сырого» интеллекта моделей автоматически
не решает проблему координации.
Если просто наклепать мультиагентный пайплайн и выкатить в прод без жесткой внешней архитектуры ограничений и арбитража — вы получите не команду мечты, а неуправляемый DDOS собственной инфраструктуры и вырезание коллег из sudo.