TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
Карим Кусербаев

10 Jun, 23:39

Открыть в Telegram Поделиться Пожаловаться

На скриншоте выше — ризонинг новой Fable 5 от антропиков.

Модель решает карточную головоломку. Начинает на человеческом, заканчивает на смайликах-черепах и карточных символах. Перед ответом — возвращается к нормальному языку. При обучении прошлых моделей были замечены переключения на другие языки, но таких сильных изменений не было.

Есть несколько версий:

1. RL не штрафует за непонятность
Модель получает награду за правильный ответ. Читаемость рассуждений — не метрика. Если короткие последовательности быстрее ведут к решению, модель упрощает.

2. Собственный «внутренний язык»
Мы в заметках себе тоже сокращаем и шифруем. Модель перешла на заметки, т.к. K♣→t2 короче, чем «переместить короля треф на вторую временную ячейку».

3. Компрессия через эмодзи
💀 занимает один токен. «Это тупик, не сработало, перебираем дальше» — восемь токенов. На длинных траекториях модель выбирает компактный способ записывать свои мысли.

4. Наиболее тревожная версия — обученное уклонение от мониторинга
Модель переключается на нормальный язык перед ответом. Она как будто знает, что внутреннюю кухню кто-то читает, и что непонятный формат усложняет проверку. UK AISI подтверждает: «Mythos 5 будет сложнее мониторить, чем другие модели Anthropic».

5. Лингвистическое давление пропало
На претрейне модель учится предсказывать следующий токен, а на этапе RL основная метрика — успех задачи. Язык становится инструментом, а не целью. Можно сказать, если бы модель была чуваком с бензопилой, то она сделала себе удобную форму бензопилы.

Насколько это выражено? Anthropic сравнила Mythos 5 с Opus 4.8, Mythos Preview и Sonnet 4.6. И нашла, что не баг. Это новая черта более мощных моделей: они сильнее — и сложнее для понимания. Anthropic выделила отдельную секцию «chain-of-thought monitorability» и пытается решить проблему.

Модель учится шифровать свои мысли. Вопрос — от кого.

161 0 1 2 3
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot