📞 Data Scientist (NLP) в Ростелеком📍
Формат: гибрид / удалёнка
💼
Уровень: Middle+
🔗
Ссылка на вакансию 💼 Что предстоит делать:* Разрабатывать
виртуального ассистента на базе LLM для автоматизации поддержки и внутренних процессов.
* Реализовывать
генерацию саммари и структурированных текстов из технической и бизнес-документации.
* Строить
RAG-системы для поиска и извлечения информации по большим массивам документов.
* Выделять сущности (NER), классифицировать тексты и строить семантические индексы.
* Интегрировать модели в production: от прототипа до API и мониторинга.
📌 Требования:✔ Опыт в Data Science от 2 лет, фокус на NLP
✔ Уверенное владение PyTorch или TensorFlow
✔ Опыт решения задач: Text Classification, NER, Summarization, Semantic Search
✔ Знание SQL, Docker, git, опыт работы в Unix-подобных средах
✔ Понимание архитектур трансформеров и подходов к fine-tuning моделей
✔ Английский — чтение технической документации (на уровне чтения)
🌟 Почему Ростелеком — сильный опыт для NLP-специалиста?Ростелеком даёт доступ к
масштабным реальным данным , сложным бизнес-задачам в телекоме и госсекторе, а также инфраструктуре для запуска NLP-решений в продакшн — идеальная среда для роста от Middle к Senior.
🎯 Как подготовиться к собеседованию: профессиональный гайд1. Повторите ключевые NLP-архитектуры и задачи* Summarization : разберитесь в отличиях BART, PEGASUS, T5. Уметь объяснить, почему PEGASUS хорошо подходит для суммаризации длинных текстов (обучение на gap-sentence prediction).
* NER : знайте, как работает fine-tuning BERT для NER, что такое BIO-разметка, как считается F1-score по сущностям. Будьте готовы обсудить обработку длинных документов (например, через sliding window или Longformer).
* Embeddings & Retrieval : разберитесь в difference между BM25, SBERT, DPR. Как строится dense retrieval в RAG? Как оценивается релевантность?
2. Глубоко проработайте RAG и LLM-интеграцию* Поймите, как работает
Retrieval-Augmented Generation : от индексации документов (FAISS, Elasticsearch) до генерации ответа.
Будьте готовы обсудить:
* Как минимизировать
hallucinations ?
* Как оценивать качество RAG end-to-end (ROUGE, ответ relevance, faithfulness)?
* Как обрабатывать
длинные контексты (например, 10k+ токенов)?
Кейс:
«Как бы вы построили ассистента по внутренним регламентам компании?»3. Подготовьте 2–3 кейса из опыта (с фокусом на NLP)Используйте структуру:
Проблема → Данные → Решение → Эксперименты → Метрики → РезультатПример:
«Разрабатывала систему суммаризации клиентских обращений. Сравнил BART и T5, внедрил пост-обработку для сохранения ключевых терминов. Улучшил ROUGE-L на 18%, сократил время обработки тикетов на 30%».
4. Практика по техническим темам* PyTorch : повторите, как устроен training loop, как работает DataLoader, как сделать custom loss.
* Fine-tuning : как выбрать learning rate, scheduler, как избежать catastrophic forgetting.
* Production : как упаковать модель в Docker, как уменьшить latency (quantization, ONNX, kv-cache).
* SQL : будьте готовы написать запрос с оконными функциями или агрегацией по временным рядам.
5. Возможные вопросы на интервью* В чём разница между абстрактной и экстрактивной суммиризацией?
* Как вы оцениваете качество NER-модели на несбалансированном датасете?
* Что такое positional encoding в трансформере? Почему он важен?
* Как адаптировать LLM под доменную задачу с малым количеством размеченных данных (LoRA, prompt-tuning)?
* Как вы боретесь с перегрузкой контекста в RAG?
Покажите
глубину понимания NLP, а не только использование
pipeline() из
Transformers. Интервьюеры ждут, что вы:
* Понимаете trade-offs между моделями,
* Умеете оценивать качество не только по метрикам, но и в бизнес-контексте,
* Готовы к инженерной работе: от датасетов до деплоя.