TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
Knowledge Accumulator

24 Oct 2023, 09:59

Открыть в Telegram Поделиться Пожаловаться

Почему рекомендательные системы - это ад для ML-инженера

- Нестационарные условия работы
Реальный мир и среда, в которой работает система, постоянно меняется. Постоянно появляются и забываются объекты рекомендаций, периодически происходят праздники (например, новый год), к которым модели вынуждены адаптироваться по ходу дела.

- Огромное пространство объектов
Из-за невозможности посчитать релевантность каждого объекта для пользователя мы вынуждены городить костыли в виде многоступенчатой системы. Об одном из алгоритмов для первой ступени - кандидатогенерации - я рассказывал не так давно у себя в посте. И это не последний побочный эффект этой проблемы.

- Невозможность изолировать компоненты друг от друга
Когда вы работаете над большой штуковиной, вы хотите иметь возможность улучшать её составные части независимо друг от друга. Чтобы делать это, вам нужно уметь тестировать влияние изменений на систему. Для этого обычно используется AB-тестирование, но в рекомендациях не всё так просто. После внедрения вроде бы положительного изменения изменяется датасет для обучения, что в свою очередь может повлиять на другие компоненты (и пользователей) и в конце концов сделать так, что изменение перестанет быть положительным.

- Невозможность декомпозировать бизнес-метрику
Обычно, вы можете быть более-менее уверены, что чем лучше выбранная метрика качества вашей ML-компоненты, тем будет лучше для бизнеса. Но в рекомендациях нет очевидной связи между конечной бизнес-метрикой (например, GMV) и какой-либо краткосрочной метрикой. Главная проблема в том, что связь должна быть именно причинно-следственной, а обнаружить её крайне сложно. Оптимизировать конечную метрику можно было бы с помощью RL, но с его применением в рекомендациях всё очень печально. В результате, в реальных системах оптимизируется какая-нибудь костыльная прокси-метрика, и каждый раз мы просто надеемся на то, что её рост приведёт к росту бизнес-метрики.

Таким образом, с рекомендациями не соскучишься, и при этом есть возможность принести большую пользу бизнесу и людям. Поэтому я и продолжаю ими заниматься.

@knowledge_accumulator

1.7k 1 16 1 40
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot