🎓 Работы выпускников. Как научить ИИ читать сложную документацию так, чтобы он не терялся в таблицах, схемах и формулах
Откройте инженерный регламент или технический стандарт — там не только текст. Таблицы, чертежи, формулы, подписи к рисункам. Человек считывает эту структуру с одного взгляда, а машина видит сплошной поток символов и легко теряет нить. Из-за этого помощник на основе языковой модели либо упускает смысл, либо в ответ на точный вопрос выдаёт слишком общий кусок документа.
Дмитрий Львов, выпускник магистратуры ФТИИ, в дипломной работе взялся за эту задачу — научить мультимодальные языковые модели отвечать на вопросы по сложным техническим PDF-документам. Научный руководитель — Анастасия Лаушкина.
Идея в том, чтобы сначала разбить документ с учётом его визуальной структуры, а потом подавать модели нужный объём контекста: где-то достаточно точного локального фрагмента с ответом, где-то — целой страницы вокруг него.
Чем работа сильна:
🔹 собран полный воспроизводимый конвейер — от обработки PDF-документов и сегментации до поиска нужного контекста;
🔹 разные стратегии подачи контекста сравнили между собой и проверили на нескольких эталонных наборах;
🔹 результаты вошли в статью в журнале IEEE Access.
Работу Дмитрия отдельно отметила государственная экзаменационная комиссия.
Где это пригодится: всюду, где нужно быстро и надёжно отвечать на вопросы по сложной документации — инженерные регламенты, технические стандарты, инструкции, проверка соответствия, научно-техническая документация. Это шаг к системам, которые понимают структуру документа, а не просто читают текст.
Что дальше — развивать интеллектуальную обработку документов: точнее находить доказательную часть ответа, работать с разными типами документов, доводить методы до прикладных задач в индустрии и исследованиях.
Репозиторий с кодом: https://github.com/mindlab-itmo/layout-aware-doc-segmentation
Откройте инженерный регламент или технический стандарт — там не только текст. Таблицы, чертежи, формулы, подписи к рисункам. Человек считывает эту структуру с одного взгляда, а машина видит сплошной поток символов и легко теряет нить. Из-за этого помощник на основе языковой модели либо упускает смысл, либо в ответ на точный вопрос выдаёт слишком общий кусок документа.
Дмитрий Львов, выпускник магистратуры ФТИИ, в дипломной работе взялся за эту задачу — научить мультимодальные языковые модели отвечать на вопросы по сложным техническим PDF-документам. Научный руководитель — Анастасия Лаушкина.
Идея в том, чтобы сначала разбить документ с учётом его визуальной структуры, а потом подавать модели нужный объём контекста: где-то достаточно точного локального фрагмента с ответом, где-то — целой страницы вокруг него.
Чем работа сильна:
🔹 собран полный воспроизводимый конвейер — от обработки PDF-документов и сегментации до поиска нужного контекста;
🔹 разные стратегии подачи контекста сравнили между собой и проверили на нескольких эталонных наборах;
🔹 результаты вошли в статью в журнале IEEE Access.
Работу Дмитрия отдельно отметила государственная экзаменационная комиссия.
Где это пригодится: всюду, где нужно быстро и надёжно отвечать на вопросы по сложной документации — инженерные регламенты, технические стандарты, инструкции, проверка соответствия, научно-техническая документация. Это шаг к системам, которые понимают структуру документа, а не просто читают текст.
Что дальше — развивать интеллектуальную обработку документов: точнее находить доказательную часть ответа, работать с разными типами документов, доводить методы до прикладных задач в индустрии и исследованиях.
Репозиторий с кодом: https://github.com/mindlab-itmo/layout-aware-doc-segmentation