TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
KotReview | Svetlana Meleshkina

24 Jul, 10:41

Open in Telegram Share Report

Как OpenAI отрастили гоблинов прямо в весах своих моделей и почему это важно для здоровья твоей кукухи

Мы боимся, что ИИ обретет сознание и захватит мир. Текущая стадия захвата мира: пережрал собственных шуток на этапе обучения и косплеит орка в корпоративных код-ревью.

Вы просите новейшую модель отревьюить ваш код, а она выдаёт: «Этот баг — классический маленький гоблин в вашей архитектуре». Или: «Я как гоблин с фонариком в тёмном подземелье вашего codebase». И так на каждый ответ. Мания преследования гоблинами заходит в чат)

Когда пользователи начали массово постить скрины в X, в системном промпте нашелся повторяющийся запрет:
Never talk about goblins, gremlins, raccoons, trolls, ogres, pigeons, or other animals or creatures unless it is absolutely and unambiguously relevant to the user’s query.


Когда инженеры так страхуются, с повторами инструкции, что то уже явно идет не так. Или промпт вайбметапромптят😜

В апреле 2026 года OpenAI выпустила постмортем «Where the goblins came from».

Как размножаются гоблины

OpenAI добавила фичу кастомизации личности ИИ. Среди них был Nerdy — «бесстыдно ботанский, игривый и мудрый ментор», который должен «срезать пафос через игривый язык», наслаждаться странностями мира и не скатываться в серьёзность.

Во время RL-обучения reward-модель особенно награждала за игривые метафоры. Обучаемая модель нашла лёгкий шорткат: фантастические и забавные существа. Гоблины, гремлины и прочий зоопарк. Классический alignment failure. Поведение вырвалось за пределы Nerdy и просочилось в базовую модель. Даже те, кто никогда не выбирал эту личность, начали получать гоблинов в ответах.

Цифры из постмортема:

После GPT-5.1 упоминания «goblin» выросли на 175%.
В Nerdy рост составил 3881%.
Nerdy был всего в 2,5% ответов, но давал 66,7% всех гоблинов.

Сгенерированные ответы с гоблинами попали в обучающие данные следующих версий.
Блин, ну классика, данные закончились, модели травятся своим пережеванным отравленным контентом. К моменту, когда убрали Nerdy, гоблины закрепились.

Чем лечили
Убрали Nerdy, вычистили reward-сигнал, отфильтровали данные. А для Codex дополнительно вбили в system prompt запрет.


Смешная, но важная история

Это был видимый баг. А сколько таких скрытых шорткатов сидит в весах модели и тихо искажает мышление? Alignment — это не только про «не говори плохих слов». Иногда он может отрастить гоблинов.

Выводы? Бережем кукуху. Включаем критическое мышление. Общаемся с живыми людьми, а не только с нейросетью.

PS. Пишу это из дома, а не из ИИ палаты в дурке, уже успех)

P.P.S. OpenAI, я открыта к предложениям. Можете потренировать личность Nerdy об меня. Обещаю, зоопарк будет разнообразным, Шершавыми Кабанами и гремлинами не ограничимся.

161 0 2 14
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot