TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
ОР | опыт рефлексии

9 Jun, 22:59

Открыть в Telegram Поделиться Пожаловаться

Репост из: Roman Doronin | AI for Friends
Ричард Саттон - ключевая фигура в reinforcement learning

5 марта 2025 года ACM объявили: Тьюринговская премия за 2024 год достается Ричарду Саттону и его научному руководителю Эндрю Барто. Премия за reinforcement learning, по сути за идею, которую сам Тьюринг сформулировал в лекции 1947-го: "What we want is a machine that can learn from experience." Спустя семьдесят лет, наверное, это можно признать.

В прошлых постах я писал про Дартмутскую конференцию 1956 года — там Маккарти и Минский с коллегами впервые произнесли словосочетание Artificial Intelligence. Их рамка была про логику и символы: интеллект — это что-то, что можно описать формально и заложить в машину. Из этого выросла классическая ветка AI — экспертные системы, gofAI (старый искусственный интеллект), Lisp (язык программирования адаптированный под концепцию).

Сегодня AI и Machine Learning почти синонимы, но изначально это были две разные концепции, и спор шёл ровно про то, как должна учиться машина. И AI Маккарти, и ранний ML делали одно общее предположение: знание в машину надо положить — либо как набор правил, либо через миллион размеченных примеров. Никакой биологии, никакого "учится сама".

Саттон вырос из противоположной школы. Психолог по первому образованию (Стэнфорд, 1978), он пришёл в CS через бихевиоризм. На него сильно повлиял Harry Klopf, доказывавший в 1970-х, что supervised learning принципиально недостаточен. Машина должна учиться сама, через trial-and-error и сигнал награды, как это происходит в биологических организмах.

Эту идею развивали в течении сорока лет, писалось много научных работ, и в 1998 году, Саттон совместно с Барто публикуют культовый учебник Reinforcement Learning: An Introduction. К моменту премии в 2025 году — 75 тысяч цитирований у книги, и еще под 200 тысяч у самого Саттона. AlphaGo, AlphaZero, RLHF в ChatGPT строились на этом фундаменте.

И вот в 2025м, Саттон в полный голос говорит, что LLM — это тупик. Логика та же, что и сорок лет назад: LLM не учится из опыта, она имитирует человеческие тексты. Нет цели, нет агентности, нет on-the-job обучения. В подкасте Dwarkesh Patel в сентябре 2025 он формулирует так: они умеют предсказывать, что сказал бы человек, но не то, что произойдёт в мире.

С ним согласны очень многие. Ян Лекун (Тьюринг 2018) в ноябре 2025 ушёл из Meta и основал стартап AMI ровно с этим тезисом — его JEPA про world models, не про next-token prediction. Jürgen Schmidhuber, ещё один пионер RL, с 1990-х продвигает агентов, которые учатся через опыт; его манифест "World Models" (2018, с David Ha) — прямой идейный родственник работ Саттона.

RL действительно похож на AGI, который все ждут, но всё сложнее. Саттон убежден, что следующий шаг в сторону AGI произойдет не от больших моделей, выученных на человеческих текстах, а от агентов, которые учатся в среде через reward.

Этот пост, подводка к Bitter Lesson, короткому эссе Саттона 2019 года: оглядываясь на 70 лет AI, Саттон формулирует главный вывод — общие методы, умеющие масштабироваться с compute (search и learning). В долгой перспективе всегда побеждают системы, в которые мы пытаемся зашить человеческие знания о домене. Эссе сегодня цитируется индустрией как библия scale-pilled подхода, еще не однократно мы увидим, что очень многие деятели из нашей области ссылаются именно на него.

#history #person #Sutton

122 0 0 2
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot