👥 Обзор сообщества betterdatacommunity, sberlogabio, natural_language_processing
🔥🚀 Qwen 3.5 Medium - Новый уровень в LLM
Модель Qwen 3.5 Medium значительно улучшена по метрикам в сравнении с предыдущей версией 3.0, благодаря использованию гибридной архитектуры, которая сочетает линейное внимание (через Gated Delta Networks) с разреженной смесью экспертов. Скорость декодирования модели Qwen3.5-397B-A17B выросла в 3.5 раза по сравнению с Qwen3-235B-A22B при использовании контекста в 32k токенов. Кроме того, Qwen3.5-35B-A3B превосходит несколько других моделей, подтверждая, что достижения в качестве возможны не только за счет увеличения параметров, но и благодаря архитектурным улучшениям и качеству данных [NLP].
💼📈 Вакансия для Senior NLP Engineer
Компания Social Discovery Group ищет старшего NLP-инженера для работы над масштабируемыми продуктами, основанными на LLM. Обязанности включают эксперименты с LLM, создание и поддержание оценочных фреймворков, а также оптимизацию производительности. Требуются знания Python, ML & DL, а также опыт работы с NLP-технологиями и инструментами, такими как PyTorch и Transformers. Работа удаленная с зарплатой 6000-9000 USD. Предоставляются отпускные, бонусы и возможность профессионального обучения [BET], [BET].
🔍🧩 Помощь в обучении трансформеров
Участник группы запрашивает информацию о том, как правильно обучать трансформеры, интересуясь статьями, лекциями и документами на эту тему. Особенный интерес представлен к методам и подходам [BET].
🤔🔍 Проблемы с маскированием в NLP
Участник интересуется, почему маскирование (с использованием предикатов для маскированной области) не работает эффективно в его задачах, тогда как на протеиновых данных (например, с ProT5) это удаётся. Он обсуждает возможность применения других подходов к более широкому кругу задач [SBE1].
🔥🚀 Qwen 3.5 Medium - Новый уровень в LLM
Модель Qwen 3.5 Medium значительно улучшена по метрикам в сравнении с предыдущей версией 3.0, благодаря использованию гибридной архитектуры, которая сочетает линейное внимание (через Gated Delta Networks) с разреженной смесью экспертов. Скорость декодирования модели Qwen3.5-397B-A17B выросла в 3.5 раза по сравнению с Qwen3-235B-A22B при использовании контекста в 32k токенов. Кроме того, Qwen3.5-35B-A3B превосходит несколько других моделей, подтверждая, что достижения в качестве возможны не только за счет увеличения параметров, но и благодаря архитектурным улучшениям и качеству данных [NLP].
💼📈 Вакансия для Senior NLP Engineer
Компания Social Discovery Group ищет старшего NLP-инженера для работы над масштабируемыми продуктами, основанными на LLM. Обязанности включают эксперименты с LLM, создание и поддержание оценочных фреймворков, а также оптимизацию производительности. Требуются знания Python, ML & DL, а также опыт работы с NLP-технологиями и инструментами, такими как PyTorch и Transformers. Работа удаленная с зарплатой 6000-9000 USD. Предоставляются отпускные, бонусы и возможность профессионального обучения [BET], [BET].
🔍🧩 Помощь в обучении трансформеров
Участник группы запрашивает информацию о том, как правильно обучать трансформеры, интересуясь статьями, лекциями и документами на эту тему. Особенный интерес представлен к методам и подходам [BET].
🤔🔍 Проблемы с маскированием в NLP
Участник интересуется, почему маскирование (с использованием предикатов для маскированной области) не работает эффективно в его задачах, тогда как на протеиновых данных (например, с ProT5) это удаётся. Он обсуждает возможность применения других подходов к более широкому кругу задач [SBE1].