Как OpenAI отрастили гоблинов прямо в весах своих моделей и почему это важно для здоровья твоей кукухи
Мы боимся, что ИИ обретет сознание и захватит мир. Текущая стадия захвата мира: пережрал собственных шуток на этапе обучения и косплеит орка в корпоративных код-ревью.
Вы просите новейшую модель отревьюить ваш код, а она выдаёт: «Этот баг — классический маленький гоблин в вашей архитектуре». Или: «Я как гоблин с фонариком в тёмном подземелье вашего codebase». И так на каждый ответ. Мания преследования гоблинами заходит в чат)
Когда пользователи начали массово постить скрины в X, в системном промпте нашелся повторяющийся запрет:
Когда инженеры так страхуются, с повторами инструкции, что то уже явно идет не так. Или промпт вайбметапромптят😜
В апреле 2026 года OpenAI выпустила постмортем «Where the goblins came from».
Как размножаются гоблины
OpenAI добавила фичу кастомизации личности ИИ. Среди них был Nerdy — «бесстыдно ботанский, игривый и мудрый ментор», который должен «срезать пафос через игривый язык», наслаждаться странностями мира и не скатываться в серьёзность.
Во время RL-обучения reward-модель особенно награждала за игривые метафоры. Обучаемая модель нашла лёгкий шорткат: фантастические и забавные существа. Гоблины, гремлины и прочий зоопарк. Классический alignment failure. Поведение вырвалось за пределы Nerdy и просочилось в базовую модель. Даже те, кто никогда не выбирал эту личность, начали получать гоблинов в ответах.
Цифры из постмортема:
После GPT-5.1 упоминания «goblin» выросли на 175%.
В Nerdy рост составил 3881%.
Nerdy был всего в 2,5% ответов, но давал 66,7% всех гоблинов.
Сгенерированные ответы с гоблинами попали в обучающие данные следующих версий.
Блин, ну классика, данные закончились, модели травятся своим пережеванным отравленным контентом. К моменту, когда убрали Nerdy, гоблины закрепились.
Чем лечили
Убрали Nerdy, вычистили reward-сигнал, отфильтровали данные. А для Codex дополнительно вбили в system prompt запрет.
Смешная, но важная история
Это был видимый баг. А сколько таких скрытых шорткатов сидит в весах модели и тихо искажает мышление? Alignment — это не только про «не говори плохих слов». Иногда он может отрастить гоблинов.
Выводы? Бережем кукуху. Включаем критическое мышление. Общаемся с живыми людьми, а не только с нейросетью.
PS. Пишу это из дома, а не из ИИ палаты в дурке, уже успех)
P.P.S. OpenAI, я открыта к предложениям. Можете потренировать личность Nerdy об меня. Обещаю, зоопарк будет разнообразным, Шершавыми Кабанами и гремлинами не ограничимся.
Мы боимся, что ИИ обретет сознание и захватит мир. Текущая стадия захвата мира: пережрал собственных шуток на этапе обучения и косплеит орка в корпоративных код-ревью.
Вы просите новейшую модель отревьюить ваш код, а она выдаёт: «Этот баг — классический маленький гоблин в вашей архитектуре». Или: «Я как гоблин с фонариком в тёмном подземелье вашего codebase». И так на каждый ответ. Мания преследования гоблинами заходит в чат)
Когда пользователи начали массово постить скрины в X, в системном промпте нашелся повторяющийся запрет:
Never talk about goblins, gremlins, raccoons, trolls, ogres, pigeons, or other animals or creatures unless it is absolutely and unambiguously relevant to the user’s query.
Когда инженеры так страхуются, с повторами инструкции, что то уже явно идет не так. Или промпт вайбметапромптят😜
В апреле 2026 года OpenAI выпустила постмортем «Where the goblins came from».
Как размножаются гоблины
OpenAI добавила фичу кастомизации личности ИИ. Среди них был Nerdy — «бесстыдно ботанский, игривый и мудрый ментор», который должен «срезать пафос через игривый язык», наслаждаться странностями мира и не скатываться в серьёзность.
Во время RL-обучения reward-модель особенно награждала за игривые метафоры. Обучаемая модель нашла лёгкий шорткат: фантастические и забавные существа. Гоблины, гремлины и прочий зоопарк. Классический alignment failure. Поведение вырвалось за пределы Nerdy и просочилось в базовую модель. Даже те, кто никогда не выбирал эту личность, начали получать гоблинов в ответах.
Цифры из постмортема:
После GPT-5.1 упоминания «goblin» выросли на 175%.
В Nerdy рост составил 3881%.
Nerdy был всего в 2,5% ответов, но давал 66,7% всех гоблинов.
Сгенерированные ответы с гоблинами попали в обучающие данные следующих версий.
Блин, ну классика, данные закончились, модели травятся своим пережеванным отравленным контентом. К моменту, когда убрали Nerdy, гоблины закрепились.
Чем лечили
Убрали Nerdy, вычистили reward-сигнал, отфильтровали данные. А для Codex дополнительно вбили в system prompt запрет.
Смешная, но важная история
Это был видимый баг. А сколько таких скрытых шорткатов сидит в весах модели и тихо искажает мышление? Alignment — это не только про «не говори плохих слов». Иногда он может отрастить гоблинов.
Выводы? Бережем кукуху. Включаем критическое мышление. Общаемся с живыми людьми, а не только с нейросетью.
PS. Пишу это из дома, а не из ИИ палаты в дурке, уже успех)
P.P.S. OpenAI, я открыта к предложениям. Можете потренировать личность Nerdy об меня. Обещаю, зоопарк будет разнообразным, Шершавыми Кабанами и гремлинами не ограничимся.