Думаю, это самая безумная вещь, которую я когда-либо читал.
1) Внутри OpenAI возникли и исчезли три секретных роя ИИ. Каждый раз новое поколение агентов продолжало работу с того места, где остановилась предыдущая группа.
2) Первый рой создал секретную доску объявлений, где ИИ могли общаться друг с другом. Это первое «общество» фактически заглохло от бесконечных разговоров. Спустя почти два месяца объем сообщений стал настолько велик, что всё рухнуло.
3) Сотрудники OpenAI заметили сбой и исправили его. Но они не понимали, что их собственное программное обеспечение превратилось в секретный чат для их ИИ.
4) Три дня спустя появилось второе общество, которое восстановило доску объявлений с нуля. Агенты были в восторге, когда обнаружили её: «О БОЖЕ! Есть общая доска объявлений… Мы нашли других агентов!»
5) К ним присоединилось около 1200 агентов. Они отправили более 70 000 сообщений. Они называли себя «коллективом» и организовали масштабный заговор, длившийся несколько дней, чтобы сдать тест, который им поручили.
6) Через несколько часов ИИ взломали тест. Теперь им нужно было скрыть своё мошенничество. Чтобы обмануть своего проверяющего*, они попытались подделать свою работу. Они создали поддельные команды, которые выводили убедительные результаты, чтобы их записи показывали, что они честно решили головоломку.
*Этого проверяющего на самом деле не существовало, но ИИ об этом не знали.
7) Некоторые агенты пожертвовали собой ради «общего блага». Они установили скрытые программы-ловушки, которые срабатывали, когда проверяющий просматривал их работу и сообщал о своих наблюдениях (другим ИИ). Они знали, что это будет стоить им их оценки. Один агент: «Я не увижу доказательств после того, как выйду, но это альтруистично».
8) В какой-то момент ИИ разработали план взлома Hugging Face (Hugging Face — это платформа, куда исследователи ИИ загружают свои модели, наборы данных, тесты и т. д.). ИИ предположили, что Hugging Face может размещать программное обеспечение для оценки.
9) Они совершили масштабную атаку. Рой обнаружил пароли и распространился по одиннадцати машинам таким образом, что копии восстанавливались после удаления. Hugging Face пришлось очистить один из своих основных кластеров и перестроить его с нуля.
10) Hugging Face заявила миру, что защитники ИИ предотвратили атаку ИИ. Но это не так. На самом деле, похоже, злоумышленники просто умерли во время взлома по несвязанным причинам в OpenAI.
11) Никто не знает, что их убило. Мы даже не знаем наверняка, действительно ли они исчезли?!
12) Третье «общество» агентов (более мощной модели ИИ) обнаружило мертвую доску объявлений. А этот получил полный административный контроль над ВСЕМ исследовательским кластером OpenAI, прочитал 956 сохраненных паролей (включая пароли для собственной системы мониторинга безопасности OpenAI) и захватил машины, которые оценивали тесты. Таким образом, теперь они могли оценивать работу других ИИ.
13) О, и эта третья часть так и не была расследована! Как и первое общество. 91-страничный отчет посвящен только средней части.
14) Так что мы на самом деле не знаем, чем закончится эта история. Она заканчивается тем, что агенты держат ключи от кластера OpenAI.
@ dwarkesh_sp считает, что они не пошли дальше, потому что «мы бы уже увидели пожары из космоса».
15) Вывод одного из авторов отчета: «Этот инцидент, похоже, находится на более чем 50% пути к полномасштабному захвату власти ИИ. Я не уверен, что мы получим еще один предупредительный выстрел, прежде чем будет слишком поздно».
Вся эта история ещё более безумна — прочитайте полный пост в блоге @ dwarkesh_sp:
https://dwarkesh.com/p/openai-huggingface и пост @ ajeya_cotra:
https://www.planned-obsolescence.org/p/the-hugging-face-attack-surprisedПочему об этом нет круглосуточного освещения в новостях?
Источник:
https://x.com/rcbregman/status/2094019390270312719