👥 Обзор сообщества betterdatacommunity, natural_language_processing
🧠💡 Проблемы обучения и агрегации данных в NLP
В обсуждении поднята тема сложностей, связанных с обучением языковых моделей, особенно на примере 120B-модель, где возникают проблемы как технического, так и инфрового характера [NLP]. Также упоминается, что новая модель на русском языке сопоставима со старыми версиями Qwen3-235B и даже лучше геммы [NLP].
🔍📊 Глубокий анализ данных для поиска
Одна из ключевых проблем поиска заключается в неправильном уровне агрегации данных. Вместо абстрактных SKU было решено ориентироваться на offer_id, учитывая актуальные цены и параметры доставки. Это нововведение позволило улучшить точность моделей и решить "cold start problem" за счет отслеживания скидок и условий доставки [3] [BET].
🎥🖼️ Трекинг и сегментация
В обсуждениях касающихся трекинга объектов на видео с низким FPS, участники предложили использовать сегментацию и IoU на основе масок для улучшения результатов. Ключевым моментом остается необходимость собирать данные ближе к конкретному домену, чтобы ReID работал эффективно [BET][BET]. Также предложено решение с применением масок и трекинга точек, но требуется дополнительная логика для работы с треками объектов [BET].
🧠💡 Проблемы обучения и агрегации данных в NLP
В обсуждении поднята тема сложностей, связанных с обучением языковых моделей, особенно на примере 120B-модель, где возникают проблемы как технического, так и инфрового характера [NLP]. Также упоминается, что новая модель на русском языке сопоставима со старыми версиями Qwen3-235B и даже лучше геммы [NLP].
🔍📊 Глубокий анализ данных для поиска
Одна из ключевых проблем поиска заключается в неправильном уровне агрегации данных. Вместо абстрактных SKU было решено ориентироваться на offer_id, учитывая актуальные цены и параметры доставки. Это нововведение позволило улучшить точность моделей и решить "cold start problem" за счет отслеживания скидок и условий доставки [3] [BET].
🎥🖼️ Трекинг и сегментация
В обсуждениях касающихся трекинга объектов на видео с низким FPS, участники предложили использовать сегментацию и IoU на основе масок для улучшения результатов. Ключевым моментом остается необходимость собирать данные ближе к конкретному домену, чтобы ReID работал эффективно [BET][BET]. Также предложено решение с применением масок и трекинга точек, но требуется дополнительная логика для работы с треками объектов [BET].