TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
Knowledge Accumulator

8 Jan, 11:01

Open in Telegram Share Report

DiscoRL - out-of-distribution RL наконец-то решён?

Когда я увидел название статьи "Discovering state-of-the-art reinforcement learning algorithms" с David Silver в авторах, я прищурился. Заметив "meta-learning", "Atari", "outperforms manually designed" в абстракте, мой пульс подскочил в полтора раза. "Неужели это оно?" - думал я, открывая статью трясущимися руками.

Итак, в 2020 году вышла статья "Discovering reinforcement learning algorithms" - от того же автора. На заре существования канала я даже делал на неё обзор. Общий принцип работы с тех пор не изменился, просто всё допилено до лучшего состояния. На сайте у первого автора (junhyuk.com), кстати, написано "The majority of the work was finished in 2022.", так что, предположу, что он больше не развивает это направление, и его припахали к Gemini.

Так, обычно в RL-постановке у нас есть нейросеть-агент, которую мы обучаем, к примеру, с помощью Policy Gradient. То есть, определяющим в Policy Gradient является именно алгоритм, который считает таргеты. Подход LPG заключается в том, что мы начинаем генерировать таргеты для обучения отдельной нейросетью, которая и является объектом мета-обучения.

Основной агент выдаёт помимо стандартных policy и q-value ещё 2 вектора - y(s) и z(s, a), которые не имеют заранее определённой семантики.

Ключевой кусок алгоритма - мета-сеть - это LSTM, которая получает на вход траекторию из последних policy, y, z и Q и выдаёт таргеты для обучения - policy*, y* и z*, а основной агент просто обучается их приближать, и дополнительно учит свою Q-функцию также, как и в алгоритме Retrace - какой-то Prior Knowledge тут всё-таки зашит.

Обучают мета-агента, как и в оригинальной статье, с помощью дифференцирования по параметрам мета-сети чем-то на подобие Policy Gradient. С прошлой работой есть много различий в деталях, с которыми мало смысла разбираться. Приятные сюрпризы начинаются в районе результатов.

Что касается общей производительности алгоритма, есть улучшение в качестве относительно бейзлайна, но не прям какое-то экспоненциальное. Самое интересное начинается при тестировании на Out of Distribution Generalization.

Авторы обучили Disco57 на атари и затем гоняли его на других средах. На ProcGen качество получилось выше, чем у бейзлайнов! Ну и на других средах тоже работает нормально. Другая вариация - Disco103, которую обучили ещё на 2 наборах сред, показывает себя ещё лучше на hold-out средах из наборов 4-6, чем Disco57. Так что, какая-то степень генерализации точно присутствует! Авторы справедливо отмечают, что такой результат это что-то новенькое.

Безумно рад видеть прогресс в задаче OOD-RL. Несмотря на прогресс, на мой взгляд, нужно стремиться к результату другого уровня.

Во-первых, уверен, что можно на порядки сокращать количество шагов в среде, которые нужны, чтобы достичь уровней бейзлайнов, или даже набирать теоретический максимум во всех этих играх. Во-вторых, нужно учить алгоритмы в режиме Continual Learning, когда они умеют в ходе своей жизни накапливать знания и переносить скилл из одних игр в другие.

Можно ли достичь этого подобным подходом? Не знаю, для этого надо пушить это направление. Надеюсь, автор когда-нибудь вернётся к этой работе.

@knowledge_accumulator

2.6k 1 42 5 28
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot