TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
Карим Кусербаев

6 Jul, 20:37

Открыть в Telegram Поделиться Пожаловаться

Репост из: Аня Подображных [Будни продакта]
В мире AI-продуктов бенчмарк — это не подготовка к продуктовой работе, это и есть продуктовая работа. Короткой дороги нет.

Ко мне регулярно приходят продакты, которые хотят построить своих ассистентов. И все хотят быстро. Демка правда собирается быстро. И на глаз даже кажется, что отвечает неплохо. Но первый же замер качества на нормальном датасете даёт ~50%

Почему никто не хочет строить бенчмарк и эвал, даже если знает о существовании этих слов? Потому что это нудно. Собрать запросы, убедиться, что они похожи на то, что люди реально будут спрашивать (иначе вся работа в стол). Понять, что такое хороший ответ, научиться согласованно размечать ответы на хорошие и нехорошие…

А что такое хороший ответ? Если девушка попросила красную помаду, и ассистент подобрал красную помаду, — это хорошо? Да вообще не факт. Может, она хотела весь вечер целоваться, не оставляя нигде следов. Откуда ж мы знаем.

Узнать можно только одним способом — спросить. Так мы и строили ассистента для подбора товаров: обзвонили людей, которые недавно что-то покупали, опросили их по методологии, близкой к JTBD: что искал, в каком контексте, какого результата ждал… Ценность не в том, чтобы найти товар по запросу, а в том, чтобы решить задачу, которая за этим запросом стоит.

Тогда работа ассистента распалась на две части: правильно собрать контекст с человека и правильно подобрать товар под этот контекст. Но что значит «правильно подобрать»? С помадой разобрались — не должна оставлять следов. А если «ноутбук для брата, чтобы играть в майнкрафт и делать проекты в скретче»? Я в ноутбуках не разбираюсь вообще. Для некоторых категорий нам пришлось привлекать экспертов, которые объясняли, как переводить человеческий запрос на язык фильтров и критериев подходящести. Так мы руками проделали работу ассистента на большом датасете. И именно поэтому поняли, как её автоматизировать и как проверять.

Сбор бенчмарка оказался половиной всей работы над продуктом, если не больше. Всё остальное (прототипы, выбивание целевого качества, переезд на маленькие модельки…) стояло на этом фундаменте.

Так что пропустить сбор бенчмарка — это как сказать "Я знаю короткую дорогу". А потом сделать крюк и пойти по навигатору ))

Через 2 недели на TurboML Conf наш ML-инженер Саша Замиралов расскажет как мы научили ассистента подбирать товары. Как строили бенчмарк, итерировались, как переезжали на маленькие модельки, улучшая скорость и не теряя в качестве. Будет довольно технический доклад — приходите, если не боитесь!

Рега закроется завтра: https://l.tbank.ru/turbo-ap

319 0 0 1
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot