Moñge Daş


Channel's geo and language: not specified, not specified
Category: not specified



Channel's geo and language
not specified, not specified
Category
not specified
Statistics
Posts filter


📖 The Old Turkic Dictionary

A bot for searching words from the Old Turkic Dictionary (DTS): almost 18,000 entries with glosses, examples from ancient texts and source references.

What it can do:
• Search Old Turkic words without special characters: tengri finds täŋri, ajguchi finds ajγučï
• Search by Russian meaning: just type «вода» (water) or «лошадь» (horse)
• Show senses, examples and homonyms, with one-tap links to related entries

The entries were extracted from a PDF automatically, so some errors are possible. If you spot one, let me know and I'll fix it.

👉 @old_turk_dict_bot






Попробовал убрать пары из словаря Клосона на англ языке. Перевод улучшился в плане чистоты (меньше артефактов), но кажется пострадала точность. Данная версия уже загружена и готова к использованию.


Развёртывание

Модель развёрнута на платформе Hugging Face с минимальным веб-интерфейсом, обеспечивающим перевод в направлениях древнетюркский ↔ английский. Демонстрационная версия позволяет ознакомиться с работой модели без установки программного обеспечения.
Ссылка на переводчик


Процесс обучения

Методической основой послужил апробированный ноутбук Дэвида Дейла по дообучению NLLB на языковую пару «русский — тувинский» — надёжный подход к добавлению нового низкоресурсного языка.

Внесённые адаптации: отключение смешанной точности fp16 (препятствовавшей сходимости), введение токена oturk_Latn с инициализацией от родственного языка, а также реализация двунаправленного сэмплера батчей по всем четырём направлениям перевода.

📉 Обучение заняло 11 508 шагов (≈2 ч 44 мин на GPU T4). Значение функции потерь снижалось равномерно:

▪️ шаг 0 → 4.87 ▪️ шаг 3 000 → 2.71 ▪️ шаг 6 000 → 2.03 ▪️ шаг 9 000 → 1.62 ▪️ шаг 11 508 → 1.28

Снижение более чем втрое при отсутствии деградации в повторяющиеся токены свидетельствует о корректности обучения.

Результаты (BLEU / chrF++)
▪️ древнетюркский → русский: 17.22 / 45.95 ▪️ древнетюркский → английский: 14.42 / 40.96 ▪️ английский → древнетюркский: 8.34 / 50.91 ▪️ русский → древнетюркский: 6.83 / 42.43

Перевод с древнетюркского языка демонстрирует более высокие показатели, чем перевод на него, что закономерно: генерация текста на языках, известных базовой модели, проще порождения самого древнетюркского.

Сочетание высокого chrF++ при умеренном BLEU указывает на корректное воспроизведение морфологии и корневых основ при неполном совпадении точных словоформ — типичная картина для агглютинативного языка.

Следует отметить, что англоязычные направления оценивались на малых выборках, ввиду чего соответствующие показатели носят ориентировочный характер.


Подготовка данных

Первичный корпус составил около 51 300 пар. Поскольку сырые данные словарных парсеров и OCR содержат артефакты, напрямую влияющие на качество модели, была проведена очистка. Удалено 2 507 некорректных строк (≈5%):
▪️ Записи с недопустимыми символами — посторонние знаки, вклинившиеся в корректные слова.
▪️ Записи со смешением алфавитов — случаи, когда источник, перевод и глосс оказались объединены в одну строку.

Фильтрация по значительному расхождению длины источника и перевода сознательно не применялась: в словарной статье одно заглавное слово с многословным толкованием является нормой, и подобный фильтр привёл бы к потере значительного объёма корректных данных.

📊 Итоговый корпус — 48 770 пар по четырём направлениям:
▪️ древнетюркский → русский: 19 815 ▪️ русский → древнетюркский: 19 806 ▪️ древнетюркский → английский: 4 576 ▪️ английский → древнетюркский: 4 573
Объём русскоязычных данных приблизительно вчетверо превышает англоязычные, что существенно для интерпретации результатов.


Машинный перевод для древнетюркского языка

Настоящий материал описывает разработку модели машинного перевода для древнетюркского (преимущественно древнеуйгурского) языка — языка письменных памятников буддийской и манихейской традиций, а также рунических надписей.

Для живых языков машинный перевод является отработанной технологией, однако для мёртвых и малоизученных языков готовые решения практически отсутствуют: сказываются нехватка параллельных данных и специфичность лексики.
Цель работы — проверить, возможно ли на основе современной мультиязычной модели и небольшого корпуса, собранного из словарей, получить работоспособный переводчик в направлениях древнетюркский ↔ русский и древнетюркский ↔ английский.

Базовая модель
В качестве основы была использована модель NLLB-200 distilled (600M) от Meta, поддерживающая перевод для 200 языков. Древнетюркский среди них отсутствует, однако присутствуют современные тюркские языки. Метод дообучения (fine-tuning) позволяет опереться на уже накопленное моделью понимание тюркской морфологии и синтаксиса.

Сбор данных
Готовый параллельный корпус для древнетюркского языка отсутствует, в связи с чем он был собран из двух источников:
▪️ Этимологический словарь Клосона — заголовочные слова в транслитерации, переводы и примеры из памятников различных традиций.
▪️ Древнетюркский словарь (ДТС) — основной массив данных: лексические статьи и параллельные фрагменты буддийских текстов.

Парсинг каждого источника потребовал разбора разметки транслитерации, отделения заголовочного слова от толкования и интерпретации грамматических сокращений. Результат приведён к единому формату JSONL.

8 last posts shown.