TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
Center for Cognitive Modeling

1 Sep, 13:28

Open in Telegram Share Report

🪼Дайджест ЦКМ: что мы читали на этой неделе

Собрали для вас подборку интересных работ — от генерации поз схвата до универсальных моделей мира.

GraspGen-X: Cross-Embodiment 6-DOF Diffusion-based Grasping
Фундаментальная модель для генерации 6-DoF-позы схвата по геометрии объекта. Умеет адаптироваться к новым захватам через описание их рабочего объёма без отдельного переобучения. Ранжирует кандидатов по вероятности успешного схвата, используя опыт на миллиардах симуляционных примеров для тысяч объектов.

Быстрый тест на наших любимых объектах выдаёт вполне разумные позы для схвата.

🔗 статья| гитхаб

Hydra-0: Action Flow for Generalist World Modeling and Control

Универсальная модель мира, обусловленная последовательностью действий. Представляет действия робота в виде движения пикселей (action flow) — это позволяет моделировать последствия действий в разных воплощениях, задачах и средах.

Результаты впечатляют: на 90,4% меньшая погрешность при движении робота и на 60,2% — при движении объектов по сравнению с Cosmos-2.5.

🔗 сайт | статья

EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories
Авторы взяли датасет LIBERO-Spatial и построили для него графы пространственных отношений на основе состояния симулятора и геометрических эвристик. На полученных графах сравнили разные VLM по качеству предсказания триплетов. Также исследовали влияние графов на success rate VLA: во время evaluation графы генерировали из текущего состояния симулятора и добавляли к инструкции VLA, чтобы проверить, помогают ли они в задачах манипуляции.

🔗 статья

Q-Learning With World Models
Исследователи из Generalist представили GEN-1.5 — модель, которая способна обучаться новым физическим навыкам по одной демонстрации, без дообучения и градиентных обновлений.

Ключевые фишки:
— Physical prompting: в контекст передаётся полноценная сенсомоторная демонстрация (визуальные наблюдения, состояния робота и действия) — аналог in-context prompt для LLM.
— Масштаб претрейна: модель обучалась более 8 месяцев на большом объёме данных физического взаимодействия. Способность к one-shot in-context learning появилась как emergent property, а не была заложена в архитектуру.

Веса и pipeline пока закрыты, но blogpost уже есть.

🔗 blogpost

Похожее направление — In-Context Imitation Learning with Visual Reasoning (ICLR 2026)
Тоже in-context imitation learning по сенсомоторным демонстрациям, но с дополнительным visual reasoning: модель сначала предсказывает промежуточную визуальную траекторию движения робота в image space, а затем генерирует low-level actions. Reasoning выступает связующим звеном между наблюдением и действием.

Работа принята на IROS 2026, есть статья на arXiv и открытый код — в отличие от GEN-1.5, её уже можно изучать и воспроизводить.

🔗 статья | гитхаб

✏️Читаем, анализируем, берём в работу!

1.2k 0 14 15
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot