Русский стилеметрический датасет: новая исследовательская инфраструктура для Digital Humanities
В области стилеметрии одним из главных вызовов остается создание качественных, стратифицированных и открытых корпусов текстов. Особенно остро эта проблема стоит для русскоязычного материала, где исторические, жанровые и стилистические особенности накладывают серьезные ограничения на применение автоматических методов анализа. Публикация Русского стилеметрического датасета (RSD) , подготовленного Борисом Ореховым, представляет собой важный шаг в решении этой задачи.
Стратификация как научный принцип
Ключевая особенность RSD, выгодно отличающая его от многих других коллекций, — продуманная многоуровневая структура. Датасет построен на фундаментальной методологической предпосылке: при автоматической классификации и стилеметрическом анализе недопустимо смешивать произведения разных эпох, жанров или авторских групп. Этот принцип нашел отражение в детальной иерархии подкорпусов.
Общий объем датасета — 322 документа (более 16 млн словоупотреблений) от 94 авторов, охватывающих период с 1763 по 1932 год. Временной диапазон в 169 лет разбит на хронологические срезы, что позволяет исследователям тестировать гипотезы об эволюции литературного языка с минимальными искажениями, вызванными «шумом» эпохи.
Структура исследовательских возможностей
RSD предлагает исследователям систему экспериментальных подкорпусов, каждый из которых нацелен на решение конкретных научных задач:
1. Хронологические срезы: XVIII век, первая половина XIX века, вторая половина XIX века, рубеж XIX–XX веков. Это позволяет отслеживать эволюцию стиля на больших временных промежутках.
2. Социально-демографические срезы: подкорпуса, сгруппированные по полу и возрасту авторов (например, тексты 30-летних и 50-летних писателей 1832–1833 гг.) или по поколенческой принадлежности (поколение С. Т. Аксакова vs. Л. Н. Толстого). Это открывает возможности для эмпирической проверки гипотез о социальных и возрастных маркерах в литературном языке.
3. Жанрово-стилевой спектр: художественная, публицистическая и научная проза (включая дифференциацию по отдельным наукам: история, богословие, психофизиология, философия). Также представлены подкорпуса для анализа стихотворных размеров и противопоставления стиха и прозы.
4. Идейно-эстетический аспект: тексты, размеченные по литературным направлениям (романтизм vs. реализм) и по принадлежности к идейным течениям в публицистике (западники vs. славянофилы).
5. Специальные лингвистические задачи: отдельные коллекции для изучения речи персонажей в прозе и драматургии, а также сопоставления естественных текстов с текстами, сгенерированными нейросетевыми моделями (LSTM и Transformer). Последний подкорпус представляет особый интерес в контексте современных исследований по детекции машинного текста.
Формат и доступность
Датасет поставляется в формате plain text (UTF-8), структура файлов и схема именования (автор_название.txt) изначально адаптированы для работы с пакетом stylo в среде R, что делает его удобным для учебных курсов по компьютерному анализу текста. Одновременно с этим RSD совместим с инструментарием Python (приведены примеры работы с scikit-learn для кластеризации и визуализации).
Важной особенностью является открытость и воспроизводимость: тексты находятся в общественном достоянии, метаданные и вспомогательные скрипты распространяются под лицензией GPL-3.0. Датасет имеет постоянный DOI (10.5281/zenodo.20701309), что обеспечивает его цитируемость.
Значение для научного сообщества
RSD решает несколько критических задач:
- Стандартизация бенчмарков: предоставляет унифицированную платформу для тестирования и сравнения стилеметрических методов на русскоязычном материале.
- Эмпирическая база: позволяет проверять гипотезы о факторах, влияющих на стиль (эпоха, жанр, пол, возраст), на репрезентативном материале.
- Образовательный ресурс: дает возможность студентам и молодым исследователям работать с реальными данными в контролируемых условиях.
- Методологический полигон: позволяет оценивать устойчивость алгоритмов к изменениям параметров (объем текста, количество авторов, жанровая принадлежность).
Публикация RSD — важный шаг к формированию полноценной инфраструктуры для цифровых исследований русской литературы. Датасет не просто предоставляет тексты, он задает стандарты их организации и предоставляет исследователям готовый инструментарий для верификации гипотез и построения новых моделей понимания литературного процесса.
Библиографическая ссылка:
Орехов Б. Русский стилеметрический датасет : [набор данных] / Б. Орехов. — Версия 1.0. — Zenodo, 2026. — DOI: 10.5281/zenodo.20701309.
Ссылка на репозиторий: https://github.com/nevmenandr/RSD
