Северина Е.М., Ларионова М.Ч. —
Проект Chekhov Digital: задачи и проблемы реализации семантической разметки текстов (на примере рассказа А. П. Чехова «Смерть чиновника»)
// Litera. – 2023. – № 10.
– С. 211 - 222.
DOI: 10.25136/2409-8698.2023.10.68862
URL: https://e-notabene.ru/fil/article_68862.html
Читать статью
Аннотация: В статье рассматривается модель подготовки машиночитаемой (семантической) разметки текстов для проекта Chekhov Digital на примере филологической интерпретации отдельных значимых элементов рассказа А. П. Чехова «Смерть чиновника» и представления этих сведений в явном виде с опорой на стандарты цифровой публикации Text Encoding Initiative (TEI/XML). Выявлены значимые сущности для разметки корпуса текстов писателя, однако вопрос их репрезентации в тексте остается достаточно сложным. Проведена филологическая экспертиза таких аспектов, как «свойства, состояния и события; особенности характера» в отрывке из рассказа А.П. Чехова с точки зрения возможностей разметки TEI по сохранению филологических знаний в машиночитаемом формате. Одна из задач проекта Chekhov Digital – выйти за рамки простого оцифрованного текста и предусмотреть полезные для исследователя цифровые инструменты. Представлены элементы машиночитаемой разметки, позволяющие разметить значимые сущности в чеховских текстах для организации семантического поиска по корпусу текстов писателя, рассмотрены проблемы и исследовательские задачи, возникающие в процессе реализации такого рода междисциплинарных проектов в связи с необходимостью объединения усилий специалистов из разных областей знания. В рамках проекта реализуется принцип открытых исследовательских данных (Open Data), важнейшей задачей которого является создание научных сообществ вокруг данных. Работа над проектом привела к развитию научного сотрудничества между исследователями НИУ ВШЭ, ЮНЦ РАН и ЮФУ.
Abstract: The article considers a model of preparation of machine-readable (semantic) markup of texts for the Chekhov Digital project on the example of philological interpretation of individual significant elements of A. P. Chekhov's story "Death of an Official" and presentation of this information explicitly based on the standards of digital publication Text Encoding Initiative (TEI/XML). Based on the work of literary researchers, significant entities have been identified for marking up the corpus of the writer's texts, but the question of their representation in the text remains quite complex. A philological examination of such aspects as "properties, states and events; character features" in an excerpt from the story of A.P. Chekhov was carried out from the point of view of the TEI markup capabilities for preserving philological knowledge in a machine-readable format. One of the objectives of the Chekhov Digital project is to go beyond a simple digitized text and provide useful digital tools for the researcher. The elements of machine-readable markup are presented, which make it possible to mark up significant entities in Chekhov's texts for organizing semantic search through the corpus of the writer's texts, the problems and research tasks arising in the process of implementing such interdisciplinary projects due to the need to combine the efforts of specialists from different fields of knowledge are considered. The project implements the principle of Open research data, the most important task of which is to create scientific communities around data. The work on the project led to the development of scientific cooperation between researchers of the Higher School of Economics, the UNC RAS and the SFU.