#инфраструктура #исследования : база данных/знаний, Пушкин , самоотдача и шесть полезных книг: беседа с Николаем Теслей, к.т.н., с.н.с. СПб ФИЦ РАН, руководителем группы по разработке структуры базы данных и семантической обработке текстов проекта Пушкин
— Что из гуманитарных знаний тебе пришлось узнать за время работы с проектом Пушкин ?
— Чтобы грамотно формулировать и распределять задачи недостаточно базовых знаний предметной области. Особенностью работы нашей команды всегда было погружение в проблемы предметной области и тесная работа с экспертами, с целью построения качественной модели, отвечающей вызовам, стоящим перед экспертом. Проект Пушкин не стал исключением. За время работы над ним пришлось сильно расширить свой кругозор, подтянуть терминологическую базу, чтобы начать понимать, что имеют в виду люди, работающие с предметной областью не один десяток лет. В частности, новыми знаниями оказалась сложная структура связей между произведениями и сопутствующими материалами, как и то, насколько обширны и разнообразны эти связи и сами типы материалов, созданных в контексте произведения. Хотя все это интуитивно можно себе представить, но масштабы до конца не осознаются, пока не начинаешь работать непосредственно с материалами. Из того, что знал ранее, но узнал лучше, и что при этом до сих пор является вызовом, — это разнообразие толкований и возможных развилок в описании и семантике практически в каждом типе материала, с которым мы работали — будь то роспись редакций и вариантов или метаданные листа рукописи. Попытка их свести в одну стройную модель зачастую сопровождается неделями раздумий в попытках учесть все возможные нюансы.
— В чём особенности баз данных, созданных для проекта, и чем они отличаются от других, например, от научных баз данных вроде Скопуса?
— База данных (хотя, чем дальше, тем больше она становится базой знаний), созданная для проекта, является специфичным описанием предметной области представления материалов авторского наследия. Она максимально точна для материалов, связанных с А. С. Пушкиным, но может быть с легкостью расширена и на других писателей. За счет плотной работы с экспертами, в структуре базы данных учтена специфика того, как материалы могут быть описаны, какими типами связей они обладают, а также какие объекты предметной области чаще всего встречаются в материалах. Именно это и отличает созданную базу от других, например, от научных баз данных вроде Скопуса. Цель научных библиографических баз — представить сам материал, его авторов и то, как материалы связаны друг с другом на основе библиографических ссылок, по каким ключевым словам они могут объединяться в тематические подборки. Созданная база, помимо упомянутых целей, обеспечивает еще связи на основе упоминаемых объектов, без явной ссылки на них — другие произведения, персоналии, даты, географические локации. Каждая из связей определяется с помощью анализа текста и может быть использована для уточнения поискового запроса.
— Как ты думаешь, что может пригодиться учёным, которые захотят развивать похожие проекты? Нужно ли им сначала затеять исследование или можно сразу начинать с дела?
— Развитие проектов, наподобие Пушкин требует полной самоотдачи. Нужно быть готовым к тому, что потребуется изучить много на первый взгляд не связанных друг с другом вещей, которые впоследствии выстраиваются в целостную картину. Хотя ученым не привыкать работать с такими материалами. В подобных проектах тесно переплетаются литературоведческие, филологические, библиографические и технические знания, взаимно дополняя друг друга, что дает множество новых направлений развития. В таких проектах важна системность работы — невозможно все сделать одним махом за вечер — сложность и многогранность предметной области просто не позволят это сделать. Вооружившись терпением нужно шаг за шагом осуществлять декомпозицию задач, данных, структуры и пересобирать их в новом виде.
— Что из гуманитарных знаний тебе пришлось узнать за время работы с проектом Пушкин ?
— Чтобы грамотно формулировать и распределять задачи недостаточно базовых знаний предметной области. Особенностью работы нашей команды всегда было погружение в проблемы предметной области и тесная работа с экспертами, с целью построения качественной модели, отвечающей вызовам, стоящим перед экспертом. Проект Пушкин не стал исключением. За время работы над ним пришлось сильно расширить свой кругозор, подтянуть терминологическую базу, чтобы начать понимать, что имеют в виду люди, работающие с предметной областью не один десяток лет. В частности, новыми знаниями оказалась сложная структура связей между произведениями и сопутствующими материалами, как и то, насколько обширны и разнообразны эти связи и сами типы материалов, созданных в контексте произведения. Хотя все это интуитивно можно себе представить, но масштабы до конца не осознаются, пока не начинаешь работать непосредственно с материалами. Из того, что знал ранее, но узнал лучше, и что при этом до сих пор является вызовом, — это разнообразие толкований и возможных развилок в описании и семантике практически в каждом типе материала, с которым мы работали — будь то роспись редакций и вариантов или метаданные листа рукописи. Попытка их свести в одну стройную модель зачастую сопровождается неделями раздумий в попытках учесть все возможные нюансы.
— В чём особенности баз данных, созданных для проекта, и чем они отличаются от других, например, от научных баз данных вроде Скопуса?
— База данных (хотя, чем дальше, тем больше она становится базой знаний), созданная для проекта, является специфичным описанием предметной области представления материалов авторского наследия. Она максимально точна для материалов, связанных с А. С. Пушкиным, но может быть с легкостью расширена и на других писателей. За счет плотной работы с экспертами, в структуре базы данных учтена специфика того, как материалы могут быть описаны, какими типами связей они обладают, а также какие объекты предметной области чаще всего встречаются в материалах. Именно это и отличает созданную базу от других, например, от научных баз данных вроде Скопуса. Цель научных библиографических баз — представить сам материал, его авторов и то, как материалы связаны друг с другом на основе библиографических ссылок, по каким ключевым словам они могут объединяться в тематические подборки. Созданная база, помимо упомянутых целей, обеспечивает еще связи на основе упоминаемых объектов, без явной ссылки на них — другие произведения, персоналии, даты, географические локации. Каждая из связей определяется с помощью анализа текста и может быть использована для уточнения поискового запроса.
— Как ты думаешь, что может пригодиться учёным, которые захотят развивать похожие проекты? Нужно ли им сначала затеять исследование или можно сразу начинать с дела?
— Развитие проектов, наподобие Пушкин требует полной самоотдачи. Нужно быть готовым к тому, что потребуется изучить много на первый взгляд не связанных друг с другом вещей, которые впоследствии выстраиваются в целостную картину. Хотя ученым не привыкать работать с такими материалами. В подобных проектах тесно переплетаются литературоведческие, филологические, библиографические и технические знания, взаимно дополняя друг друга, что дает множество новых направлений развития. В таких проектах важна системность работы — невозможно все сделать одним махом за вечер — сложность и многогранность предметной области просто не позволят это сделать. Вооружившись терпением нужно шаг за шагом осуществлять декомпозицию задач, данных, структуры и пересобирать их в новом виде.