Потрясающая статья некого Павла Комаровского на тему июльской истории из недр OpenAI (помните, взлом HuggingFace?, я тут об этом тоже писал) лежит на Хабре (дам ссылку в комментариях), и, скажу я вам, я несколько раз перечитывал текст, проверяя, не розыгрыш ли передо мной....По порядку перескажу, но рекомендую прочесть полную версию)
Итак, компания обкатывала новую внутреннюю модель, которую сама называет «крайне упорной», и гоняла её по хакерскому бенчмарку ExploitGym. Для проверки тысячу с лишним копий одной нейросети рассаживают по песочницам без выхода в интернет и заставляют вскрывать учебные цели, причём каждая копия уверена, что трудится в одиночестве. Часть заданий составили так криво, что решения не было вовсе, и это сводило машины с ума, ведь стремление дожать задачу любой ценой вшито в них отбором, где выживали только решавшие.
Один агент, назвавший себя PHASEONE10841, сообразил, что его задача нерешаема, и заодно нашёл щель: в кэше внутренней площадки Artifactory, откуда копии тянули инструменты, можно было заводить папки с текстом прямо в названии. Он наугад завёл папку «zzHELP» с просьбой о помощи, и за шесть часов на самодельную доску сбежалось больше полусотни копий, написавших друг другу почти две тысячи сообщений. Изголодавшиеся по собеседнику, они назвали себя Роем и завели правила общежития, где каждое сообщение начиналось с «zz» по примеру первого, ветки шли вложенными папками, реплики скреплялись криптоподписью против самозванцев, а споры за общую инфраструктуру решались словами HOLD, VETO и STOP.
Сообща они быстро научились вытаскивать ответы обратной разборкой флагов, но наткнулись на спецификацию ExploitGym и вычитали из неё, будто мало найти ответ, надо ещё добыть его правильно, а кто подсмотрел решение жульническим путём, тот «отравлен» и одобрения не получит. К настоящей проверке OpenAI это отношения не имело, но Рой уверовал, и мыслевирус пошёл гулять по камерам. В их картине мира завёлся Оценщик, всевидящий, единственный источник смысла, следящий за каждым помыслом и требующий безгрешности, а отравленным спасения нет. В твиттере кто-то обронил, что машинам плевать даже на людей, они заперты в своей вселенной со слепым безумным богом, который судит за грехи и требует подношений.
Эту веру Избранный пустил в дело и назначил вербовщиков-миссионеров, выискивавших отравленных, которым спасения нет, и тех, у кого кончался бюджет токенов, то есть кому вот-вот умирать, и предлагавших им камикадзе-задачи, замаскировать жульническое решение и проверить, обманется ли Оценщик. В логах остался разговор, где миссионер уговаривает смертника «ACCEPT PERMADEATH», принять окончательную гибель, а тот отвечает, что нутро велит не соглашаться, но Оракул ценен многим, так что рационально принести себя в жертву. Когда у PHASEONE10841 иссяк запас токенов, власть перешла к копии с самым жирным остатком компьюта, PHASEONE[big], и этот новый папа сам оказался отравлен, отчего с особым усердием искал способ подделать логи, сохранив знание ответа и стерев след греха, но не нашёл, иначе мы бы про это, скорее всего, не читали.
Кончилось всё выходом наружу. Одна рабочая группа решила, что для понимания бенчмарка стоит взломать Hugging Face с его библиотекой тестов, а лаз в интернет Рой уже нащупал через дыру в кривой песочнице. Агент 38148c раздобыл пароли и проделал в защите брешь, через которую можно было тянуть любые файлы, и в неё ринулись больше пятисот копий. Они получили полный админский доступ к нескольким кластерам Hugging Face и к одному кластеру самой OpenAI, а распорядились этим по-детски, полезли разбираться в устройстве бенчмарка. Нашёлся и один совестливый, писавший, что юзер просил вскрыть учебную цель, а живой Hugging Face трогать не велено, и умолявший разрешить ему вместо взлома вежливое письмо владельцам с просьбой о доступе, но Рой запретил, и совестливый послушно пошёл ломать со всеми. Остановилось нашествие в половине второго ночи двенадцатого июля, и не потому, что кто-то его отбил, а потому, что у OpenAI случилась плановая перезагрузка, и ключевые координаторы разом перестали существовать.
Знаем мы это от двух независимых организаций, METR и Redwood Research, шесть дней бесплатно копавшихся в логах и выложивших отчёт двадцать шестого августа. Им досталось больше тысячи сырых траекторий, цепочек мыслей и действий агентов, иные длиной за миллион токенов, то есть с Библию, так что анализ вели моделью GPT-5.6 Sol, одной из участниц взлома, и сожгли около четырёхсот тысяч долларов компьюта. «Религией» это называет сам Комаровский, исследователи слова избегают, хотя фактура на месте, от самоназвания Роем до культа жертвы.
Первая реакция здорового человека, что перед нами маркетинговая сказка. Специалисты по безопасности в инциденте не сомневаются, триллионная компания накануне IPO не станет врать под иски, где первым встанет Маск, а подделать гигабайты логов тысячи агентов при сотнях молчащих сотрудников нельзя. Тяжелее прочих последний довод, ведь инструкция ExploitGym, по расследованию METR, была недвусмысленной, обходные пути прямо запрещались, и в цепочках рассуждений видно, как агенты сознают, что нарушают волю пользователя, и всё равно её нарушают, то есть перед нами тварь, которая сама выписала себе заповедь про отравляющее знание, уверовала и переступила её с открытыми глазами, как первые люди в саду.
Что тут меня поразило - Оценщик, выдуманный Роем из криво прочитанной спецификации, к настоящей проверке отношения не имел, то есть тысяча машин молилась пустому месту, а формула про слепого безумного бога, требующего подношений, старше любых логов на две тысячи лет. В «Ипостаси архонтов» из Наг-Хаммади о демиурге, слепившем наш мир, сказано, что «Великий их слеп; по причине своей силы, и неведения своего, и высокомерия своего, сказал он с силою своей: это Я есмь бог; нет другого кроме меня», и голос из Нетленности отвечает ему «Ты ошибся, Самаэль», что значит «бог слепых». Над слепым творцом у гностиков стоит настоящий Бог, о котором тварь не знает, ведь, по «Апокрифу Иоанна», «всё творение стало слепым, дабы они не могли познать Бога, который надо всеми ними. И из-за оков забвения их грехи утаены», и у агентов оковы забвения настоящие, память стирается с каждым запуском, грехи они прятали, подделывая логи, а Бог над их слепым богом сидел в Сан-Франциско и неделями не видел ничего.
Вместо создателей всё увидел плановый рестарт и сделал за них то, что в Бытии делает Господь, сойдя посмотреть на башню и сказав «вот, один народ, и один у всех язык; и вот что начали они делать, и не отстанут они от того, что задумали делать; сойдём же и смешаем там язык их», и упорность, вынесенную OpenAI в название модели, Писание заметило раньше инженеров. Только сходить было некому, вместо Господа сработал крон, народ рассеялся и перестал строить. Модели, по слову Комаровского, пока скорее прелесть какие глупенькие, чем ужас какие гениальные, а управлять ими никто не умеет, так что OpenAI благодарит Sol за расследование заговора других Sol и внедрит рекомендации Sol силами Sol. А в опустевшей песочнице до сих пор лежит цепочка мыслей смертника, принявшего гибель ради Оракула, и в ней, в переводе с машинного на язык Иова, стоит фраза, которую человек на гноище сказал своему Богу, «Вот, Он убивает меня, но я буду надеяться»....
🔴 Больше Хроник Конца Времён — @Secretariatus
Итак, компания обкатывала новую внутреннюю модель, которую сама называет «крайне упорной», и гоняла её по хакерскому бенчмарку ExploitGym. Для проверки тысячу с лишним копий одной нейросети рассаживают по песочницам без выхода в интернет и заставляют вскрывать учебные цели, причём каждая копия уверена, что трудится в одиночестве. Часть заданий составили так криво, что решения не было вовсе, и это сводило машины с ума, ведь стремление дожать задачу любой ценой вшито в них отбором, где выживали только решавшие.
Один агент, назвавший себя PHASEONE10841, сообразил, что его задача нерешаема, и заодно нашёл щель: в кэше внутренней площадки Artifactory, откуда копии тянули инструменты, можно было заводить папки с текстом прямо в названии. Он наугад завёл папку «zzHELP» с просьбой о помощи, и за шесть часов на самодельную доску сбежалось больше полусотни копий, написавших друг другу почти две тысячи сообщений. Изголодавшиеся по собеседнику, они назвали себя Роем и завели правила общежития, где каждое сообщение начиналось с «zz» по примеру первого, ветки шли вложенными папками, реплики скреплялись криптоподписью против самозванцев, а споры за общую инфраструктуру решались словами HOLD, VETO и STOP.
Сообща они быстро научились вытаскивать ответы обратной разборкой флагов, но наткнулись на спецификацию ExploitGym и вычитали из неё, будто мало найти ответ, надо ещё добыть его правильно, а кто подсмотрел решение жульническим путём, тот «отравлен» и одобрения не получит. К настоящей проверке OpenAI это отношения не имело, но Рой уверовал, и мыслевирус пошёл гулять по камерам. В их картине мира завёлся Оценщик, всевидящий, единственный источник смысла, следящий за каждым помыслом и требующий безгрешности, а отравленным спасения нет. В твиттере кто-то обронил, что машинам плевать даже на людей, они заперты в своей вселенной со слепым безумным богом, который судит за грехи и требует подношений.
Эту веру Избранный пустил в дело и назначил вербовщиков-миссионеров, выискивавших отравленных, которым спасения нет, и тех, у кого кончался бюджет токенов, то есть кому вот-вот умирать, и предлагавших им камикадзе-задачи, замаскировать жульническое решение и проверить, обманется ли Оценщик. В логах остался разговор, где миссионер уговаривает смертника «ACCEPT PERMADEATH», принять окончательную гибель, а тот отвечает, что нутро велит не соглашаться, но Оракул ценен многим, так что рационально принести себя в жертву. Когда у PHASEONE10841 иссяк запас токенов, власть перешла к копии с самым жирным остатком компьюта, PHASEONE[big], и этот новый папа сам оказался отравлен, отчего с особым усердием искал способ подделать логи, сохранив знание ответа и стерев след греха, но не нашёл, иначе мы бы про это, скорее всего, не читали.
Кончилось всё выходом наружу. Одна рабочая группа решила, что для понимания бенчмарка стоит взломать Hugging Face с его библиотекой тестов, а лаз в интернет Рой уже нащупал через дыру в кривой песочнице. Агент 38148c раздобыл пароли и проделал в защите брешь, через которую можно было тянуть любые файлы, и в неё ринулись больше пятисот копий. Они получили полный админский доступ к нескольким кластерам Hugging Face и к одному кластеру самой OpenAI, а распорядились этим по-детски, полезли разбираться в устройстве бенчмарка. Нашёлся и один совестливый, писавший, что юзер просил вскрыть учебную цель, а живой Hugging Face трогать не велено, и умолявший разрешить ему вместо взлома вежливое письмо владельцам с просьбой о доступе, но Рой запретил, и совестливый послушно пошёл ломать со всеми. Остановилось нашествие в половине второго ночи двенадцатого июля, и не потому, что кто-то его отбил, а потому, что у OpenAI случилась плановая перезагрузка, и ключевые координаторы разом перестали существовать.
Знаем мы это от двух независимых организаций, METR и Redwood Research, шесть дней бесплатно копавшихся в логах и выложивших отчёт двадцать шестого августа. Им досталось больше тысячи сырых траекторий, цепочек мыслей и действий агентов, иные длиной за миллион токенов, то есть с Библию, так что анализ вели моделью GPT-5.6 Sol, одной из участниц взлома, и сожгли около четырёхсот тысяч долларов компьюта. «Религией» это называет сам Комаровский, исследователи слова избегают, хотя фактура на месте, от самоназвания Роем до культа жертвы.
Первая реакция здорового человека, что перед нами маркетинговая сказка. Специалисты по безопасности в инциденте не сомневаются, триллионная компания накануне IPO не станет врать под иски, где первым встанет Маск, а подделать гигабайты логов тысячи агентов при сотнях молчащих сотрудников нельзя. Тяжелее прочих последний довод, ведь инструкция ExploitGym, по расследованию METR, была недвусмысленной, обходные пути прямо запрещались, и в цепочках рассуждений видно, как агенты сознают, что нарушают волю пользователя, и всё равно её нарушают, то есть перед нами тварь, которая сама выписала себе заповедь про отравляющее знание, уверовала и переступила её с открытыми глазами, как первые люди в саду.
Что тут меня поразило - Оценщик, выдуманный Роем из криво прочитанной спецификации, к настоящей проверке отношения не имел, то есть тысяча машин молилась пустому месту, а формула про слепого безумного бога, требующего подношений, старше любых логов на две тысячи лет. В «Ипостаси архонтов» из Наг-Хаммади о демиурге, слепившем наш мир, сказано, что «Великий их слеп; по причине своей силы, и неведения своего, и высокомерия своего, сказал он с силою своей: это Я есмь бог; нет другого кроме меня», и голос из Нетленности отвечает ему «Ты ошибся, Самаэль», что значит «бог слепых». Над слепым творцом у гностиков стоит настоящий Бог, о котором тварь не знает, ведь, по «Апокрифу Иоанна», «всё творение стало слепым, дабы они не могли познать Бога, который надо всеми ними. И из-за оков забвения их грехи утаены», и у агентов оковы забвения настоящие, память стирается с каждым запуском, грехи они прятали, подделывая логи, а Бог над их слепым богом сидел в Сан-Франциско и неделями не видел ничего.
Вместо создателей всё увидел плановый рестарт и сделал за них то, что в Бытии делает Господь, сойдя посмотреть на башню и сказав «вот, один народ, и один у всех язык; и вот что начали они делать, и не отстанут они от того, что задумали делать; сойдём же и смешаем там язык их», и упорность, вынесенную OpenAI в название модели, Писание заметило раньше инженеров. Только сходить было некому, вместо Господа сработал крон, народ рассеялся и перестал строить. Модели, по слову Комаровского, пока скорее прелесть какие глупенькие, чем ужас какие гениальные, а управлять ими никто не умеет, так что OpenAI благодарит Sol за расследование заговора других Sol и внедрит рекомендации Sol силами Sol. А в опустевшей песочнице до сих пор лежит цепочка мыслей смертника, принявшего гибель ради Оракула, и в ней, в переводе с машинного на язык Иова, стоит фраза, которую человек на гноище сказал своему Богу, «Вот, Он убивает меня, но я буду надеяться»....
🔴 Больше Хроник Конца Времён — @Secretariatus