⚡️⚡️⚡️
_NEW PAPERS ALERT_⚡️⚡️⚡️
Мы сейчас много занимаемся Meta-RL, и в частности In-Context Reinforcement Learning (ICRL) — это такая подобласть Offline Meta-RL, где обычный next-action prediction в совокупности с правильными данными позволяет адаптироваться к новым задачам без дообучения. Как-нибудь расскажу подробнее.
Все наши последние работы так или иначе направлены в эту сторону, и мы наконец довели их до полноценных full papers. Вот они, слева-направо:
In-Context Reinforcement Learning for Variable Action Spaces [
X,
arXiv] — о том как заставить Algorithm Distillation работать с меняющимися пространствами действий. Рандомные проекции угар.
Emergence of In-Context Reinforcement Learning from Noise Distillation [
X,
arXiv]
— о том что нам на самом деле не нужна разметка оптимальными действиями или траектории RL алгоритмов и можно обойтись простым “добавьте немного (а потом много) шума к вашему демонстратору”. Тут в целом можно заметить связь с диффузиями по касательной, туда не копали, но кажется может быть интересно.
XLand-MiniGrid: Scalable Meta-Reinforcement Learning Environments in JAX [
arXiv,
src] — ну тут понятно, про триллион шагов рассказывал сверху. Сейчас довезли полноценных бенчмарков, порефакторили все это дело и обильно рассказали про устройство библиотеки в самой статье. Если вы все еще не умеете в Jax, то уже опаздываете (no jokes).
As usual, все лавры и похвала прекрасным работягам запускающим по тыще экспериментов в неделю —
@suessmann @umagumm_a @howuhh. Для некоторых из них это первая полноценная статья, оч круто справились !
@causality_links