🎓 Работы выпускников. Как научить ИИ читать русский рукописный текст — и уместить его в лёгкую модель
Бахер Мохаммад, выпускник магистратуры ФТИИ по программе «Большие данные и машинное обучение» (научный руководитель — Пётр Гладилин), добивается, чтобы ИИ хорошо распознавал русский текст с картинок — даже кривой почерк или размытую вывеску — и при этом оставался лёгким. Сильные OCR-модели для русского обычно либо огромные, либо маленькие, но с кучей ошибок.
Он зашёл с двух сторон. Сначала выжал максимум из небольшой открытой модели и придумал аккуратный способ «сливать» две версии модели без конфликта — метод Decoupled SLERP. Когда стало ясно, что 100-миллионная модель не тянет всё разнообразие рукописного русского, взял модель посильнее (2 млрд параметров) и сжал её вдвое своим методом ROCKET — за 5 часов на одной видеокарте, без обучения с нуля. Итог делает вдвое меньше ошибок на рукописном русском, чем прежняя лучшая «лёгкая».
Где пригодится: мобильные сканеры документов, приложения для незрячих — читать вывески, этикетки лекарств, меню в реальном времени. А сами методы ROCKET и Decoupled SLERP работают не только с OCR — их можно применять и к большим языковым моделям.
Сейчас Бахер — ML-исследователь в MWS AI (ИИ-направление МТС): участвовал в Cotype-VL (мультимодальная модель на 32 млрд параметров, уже работает у корпоративных клиентов), а научную часть ведёт в лаборатории LEAD — совместной у MWS AI и ИТМО. Дальше — голосовые модели и публикации на конференциях уровня A*.
Репозиторий: github.com/mts-ai/ROCKET
Препринт: arxiv.org/abs/2602.11008
#работы_выпускников
Бахер Мохаммад, выпускник магистратуры ФТИИ по программе «Большие данные и машинное обучение» (научный руководитель — Пётр Гладилин), добивается, чтобы ИИ хорошо распознавал русский текст с картинок — даже кривой почерк или размытую вывеску — и при этом оставался лёгким. Сильные OCR-модели для русского обычно либо огромные, либо маленькие, но с кучей ошибок.
Он зашёл с двух сторон. Сначала выжал максимум из небольшой открытой модели и придумал аккуратный способ «сливать» две версии модели без конфликта — метод Decoupled SLERP. Когда стало ясно, что 100-миллионная модель не тянет всё разнообразие рукописного русского, взял модель посильнее (2 млрд параметров) и сжал её вдвое своим методом ROCKET — за 5 часов на одной видеокарте, без обучения с нуля. Итог делает вдвое меньше ошибок на рукописном русском, чем прежняя лучшая «лёгкая».
Где пригодится: мобильные сканеры документов, приложения для незрячих — читать вывески, этикетки лекарств, меню в реальном времени. А сами методы ROCKET и Decoupled SLERP работают не только с OCR — их можно применять и к большим языковым моделям.
Сейчас Бахер — ML-исследователь в MWS AI (ИИ-направление МТС): участвовал в Cotype-VL (мультимодальная модель на 32 млрд параметров, уже работает у корпоративных клиентов), а научную часть ведёт в лаборатории LEAD — совместной у MWS AI и ИТМО. Дальше — голосовые модели и публикации на конференциях уровня A*.
Репозиторий: github.com/mts-ai/ROCKET
Препринт: arxiv.org/abs/2602.11008
#работы_выпускников