На скриншоте выше — ризонинг новой Fable 5 от антропиков.
Модель решает карточную головоломку. Начинает на человеческом, заканчивает на смайликах-черепах и карточных символах. Перед ответом — возвращается к нормальному языку. При обучении прошлых моделей были замечены переключения на другие языки, но таких сильных изменений не было.
Есть несколько версий:
1. RL не штрафует за непонятность
Модель получает награду за правильный ответ. Читаемость рассуждений — не метрика. Если короткие последовательности быстрее ведут к решению, модель упрощает.
2. Собственный «внутренний язык»
Мы в заметках себе тоже сокращаем и шифруем. Модель перешла на заметки, т.к. K♣→t2 короче, чем «переместить короля треф на вторую временную ячейку».
3. Компрессия через эмодзи
💀 занимает один токен. «Это тупик, не сработало, перебираем дальше» — восемь токенов. На длинных траекториях модель выбирает компактный способ записывать свои мысли.
4. Наиболее тревожная версия — обученное уклонение от мониторинга
Модель переключается на нормальный язык перед ответом. Она как будто знает, что внутреннюю кухню кто-то читает, и что непонятный формат усложняет проверку. UK AISI подтверждает: «Mythos 5 будет сложнее мониторить, чем другие модели Anthropic».
5. Лингвистическое давление пропало
На претрейне модель учится предсказывать следующий токен, а на этапе RL основная метрика — успех задачи. Язык становится инструментом, а не целью. Можно сказать, если бы модель была чуваком с бензопилой, то она сделала себе удобную форму бензопилы.
Насколько это выражено? Anthropic сравнила Mythos 5 с Opus 4.8, Mythos Preview и Sonnet 4.6. И нашла, что не баг. Это новая черта более мощных моделей: они сильнее — и сложнее для понимания. Anthropic выделила отдельную секцию «chain-of-thought monitorability» и пытается решить проблему.
Модель учится шифровать свои мысли. Вопрос — от кого.
Модель решает карточную головоломку. Начинает на человеческом, заканчивает на смайликах-черепах и карточных символах. Перед ответом — возвращается к нормальному языку. При обучении прошлых моделей были замечены переключения на другие языки, но таких сильных изменений не было.
Есть несколько версий:
1. RL не штрафует за непонятность
Модель получает награду за правильный ответ. Читаемость рассуждений — не метрика. Если короткие последовательности быстрее ведут к решению, модель упрощает.
2. Собственный «внутренний язык»
Мы в заметках себе тоже сокращаем и шифруем. Модель перешла на заметки, т.к. K♣→t2 короче, чем «переместить короля треф на вторую временную ячейку».
3. Компрессия через эмодзи
💀 занимает один токен. «Это тупик, не сработало, перебираем дальше» — восемь токенов. На длинных траекториях модель выбирает компактный способ записывать свои мысли.
4. Наиболее тревожная версия — обученное уклонение от мониторинга
Модель переключается на нормальный язык перед ответом. Она как будто знает, что внутреннюю кухню кто-то читает, и что непонятный формат усложняет проверку. UK AISI подтверждает: «Mythos 5 будет сложнее мониторить, чем другие модели Anthropic».
5. Лингвистическое давление пропало
На претрейне модель учится предсказывать следующий токен, а на этапе RL основная метрика — успех задачи. Язык становится инструментом, а не целью. Можно сказать, если бы модель была чуваком с бензопилой, то она сделала себе удобную форму бензопилы.
Насколько это выражено? Anthropic сравнила Mythos 5 с Opus 4.8, Mythos Preview и Sonnet 4.6. И нашла, что не баг. Это новая черта более мощных моделей: они сильнее — и сложнее для понимания. Anthropic выделила отдельную секцию «chain-of-thought monitorability» и пытается решить проблему.
Модель учится шифровать свои мысли. Вопрос — от кого.