TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
ФТИИ ИТМО

22 Jun, 11:30

Открыть в Telegram Поделиться Пожаловаться

🎓 Работы выпускников. Как научить ИИ читать сложную документацию так, чтобы он не терялся в таблицах, схемах и формулах

Откройте инженерный регламент или технический стандарт — там не только текст. Таблицы, чертежи, формулы, подписи к рисункам. Человек считывает эту структуру с одного взгляда, а машина видит сплошной поток символов и легко теряет нить. Из-за этого помощник на основе языковой модели либо упускает смысл, либо в ответ на точный вопрос выдаёт слишком общий кусок документа.

Дмитрий Львов, выпускник магистратуры ФТИИ, в дипломной работе взялся за эту задачу — научить мультимодальные языковые модели отвечать на вопросы по сложным техническим PDF-документам. Научный руководитель — Анастасия Лаушкина.

Идея в том, чтобы сначала разбить документ с учётом его визуальной структуры, а потом подавать модели нужный объём контекста: где-то достаточно точного локального фрагмента с ответом, где-то — целой страницы вокруг него.

Чем работа сильна:
🔹 собран полный воспроизводимый конвейер — от обработки PDF-документов и сегментации до поиска нужного контекста;
🔹 разные стратегии подачи контекста сравнили между собой и проверили на нескольких эталонных наборах;
🔹 результаты вошли в статью в журнале IEEE Access.

Работу Дмитрия отдельно отметила государственная экзаменационная комиссия.

Где это пригодится: всюду, где нужно быстро и надёжно отвечать на вопросы по сложной документации — инженерные регламенты, технические стандарты, инструкции, проверка соответствия, научно-техническая документация. Это шаг к системам, которые понимают структуру документа, а не просто читают текст.

Что дальше — развивать интеллектуальную обработку документов: точнее находить доказательную часть ответа, работать с разными типами документов, доводить методы до прикладных задач в индустрии и исследованиях.

Репозиторий с кодом: https://github.com/mindlab-itmo/layout-aware-doc-segmentation

681 0 29 12
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot