Русский стилеметрический датасет: новая исследовательская инфраструктура для Digital Humanities

В области стилеметрии одним из главных вызовов остается создание качественных, стратифицированных и открытых корпусов текстов. Особенно остро эта проблема стоит для русскоязычного материала, где исторические, жанровые и стилистические особенности накладывают серьезные ограничения на применение автоматических методов анализа. Публикация Русского стилеметрического датасета (RSD) , подготовленного Борисом Ореховым, представляет собой важный шаг в решении этой задачи.

Стратификация как научный принцип

Ключевая особенность RSD, выгодно отличающая его от многих других коллекций, — продуманная многоуровневая структура. Датасет построен на фундаментальной методологической предпосылке: при автоматической классификации и стилеметрическом анализе недопустимо смешивать произведения разных эпох, жанров или авторских групп. Этот принцип нашел отражение в детальной иерархии подкорпусов.

Общий объем датасета — 322 документа (более 16 млн словоупотреблений) от 94 авторов, охватывающих период с 1763 по 1932 год. Временной диапазон в 169 лет разбит на хронологические срезы, что позволяет исследователям тестировать гипотезы об эволюции литературного языка с минимальными искажениями, вызванными «шумом» эпохи.

Структура исследовательских возможностей

RSD предлагает исследователям систему экспериментальных подкорпусов, каждый из которых нацелен на решение конкретных научных задач:

1. Хронологические срезы: XVIII век, первая половина XIX века, вторая половина XIX века, рубеж XIX–XX веков. Это позволяет отслеживать эволюцию стиля на больших временных промежутках.

2. Социально-демографические срезы: подкорпуса, сгруппированные по полу и возрасту авторов (например, тексты 30-летних и 50-летних писателей 1832–1833 гг.) или по поколенческой принадлежности (поколение С. Т. Аксакова vs. Л. Н. Толстого). Это открывает возможности для эмпирической проверки гипотез о социальных и возрастных маркерах в литературном языке.

3. Жанрово-стилевой спектр: художественная, публицистическая и научная проза (включая дифференциацию по отдельным наукам: история, богословие, психофизиология, философия). Также представлены подкорпуса для анализа стихотворных размеров и противопоставления стиха и прозы.

4. Идейно-эстетический аспект: тексты, размеченные по литературным направлениям (романтизм vs. реализм) и по принадлежности к идейным течениям в публицистике (западники vs. славянофилы).

5. Специальные лингвистические задачи: отдельные коллекции для изучения речи персонажей в прозе и драматургии, а также сопоставления естественных текстов с текстами, сгенерированными нейросетевыми моделями (LSTM и Transformer). Последний подкорпус представляет особый интерес в контексте современных исследований по детекции машинного текста.

Формат и доступность

Датасет поставляется в формате plain text (UTF-8), структура файлов и схема именования (автор_название.txt) изначально адаптированы для работы с пакетом stylo в среде R, что делает его удобным для учебных курсов по компьютерному анализу текста. Одновременно с этим RSD совместим с инструментарием Python (приведены примеры работы с scikit-learn для кластеризации и визуализации).

Важной особенностью является открытость и воспроизводимость: тексты находятся в общественном достоянии, метаданные и вспомогательные скрипты распространяются под лицензией GPL-3.0. Датасет имеет постоянный DOI (10.5281/zenodo.20701309), что обеспечивает его цитируемость.

Значение для научного сообщества

RSD решает несколько критических задач:

  • Стандартизация бенчмарков: предоставляет унифицированную платформу для тестирования и сравнения стилеметрических методов на русскоязычном материале.
  • Эмпирическая база: позволяет проверять гипотезы о факторах, влияющих на стиль (эпоха, жанр, пол, возраст), на репрезентативном материале.
  • Образовательный ресурс: дает возможность студентам и молодым исследователям работать с реальными данными в контролируемых условиях.
  • Методологический полигон: позволяет оценивать устойчивость алгоритмов к изменениям параметров (объем текста, количество авторов, жанровая принадлежность).

Публикация RSD — важный шаг к формированию полноценной инфраструктуры для цифровых исследований русской литературы. Датасет не просто предоставляет тексты, он задает стандарты их организации и предоставляет исследователям готовый инструментарий для верификации гипотез и построения новых моделей понимания литературного процесса.

Библиографическая ссылка:

Орехов Б. Русский стилеметрический датасет : [набор данных] / Б. Орехов. — Версия 1.0. — Zenodo, 2026. — DOI: 10.5281/zenodo.20701309.

Ссылка на репозиторий: https://github.com/nevmenandr/RSD

Борис Орехов

Я занимаюсь научными исследованиями и иногда говорю про них в популярном жанре. Еще я пишу код, как полезный, так и развлекательный. https://nevmenandr.github.io/