Датасет: русская проза с размеченными ударениями
В научно-исследовательском репозитории опубликован датасет, посвященный силлабо-тоническому стиху в русской прозе XIX века. Автор работы, Борис Орехов, представляет коллекцию из 462 текстов художественной прозы, в которых размечена система ударений, что позволило выявить фрагменты, читаемые как стихотворные.
В основе датасета лежат тексты из Корпуса нарративной прозы XIX в. (Собчук, Лекаревич, 2020). Расстановка ударений и поиск метризованных фрагментов выполнены автоматически с использованием Python-пакета. Принципы выделения случайных метров описаны в статье Орехова Б. В. «Случайные метры в русской прозе XIX века».
Структура датасета включает две папки: accented_texts – исходные тексты с проставленными ударениями (знак ' после ударной гласной) и meters – TSV-таблицы с выделенными метрическими фрагментами. Каждая строка таблицы содержит название метра, текст фрагмента, начальную и конечную позицию. Используются обозначения: Я – ямб, Х – хорей, Д – дактиль, Аф – амфибрахий, Ан – анапест, с указанием количества стоп.
В исследовании, представленном на конференции «Долгий и короткий метр: структуры, жанры, словари» (декабрь 2023), анализируются закономерности появления случайных метров. Одним из ключевых результатов стало отсутствие статистически значимой связи между метризованностью прозы и прямой речью персонажей. Усредненные данные по десятилетиям обнаруживают любопытный эффект: до 1870-х годов значения метризованности растут, в 1880-е резко падают, а в 1900-е вновь демонстрируют тенденцию к росту.
Библиографическая ссылка:
Orekhov, B. (2024). accentual-syllabic-verse-in-russian-prose (Revision 489fea1). Hugging Face. https://doi.org/10.57967/hf/2438
Дополнительное чтение:
Орехов Б. В. Случайные метры в русской прозе XIX века // Вещество поэзии: К 70-летию Юрия Борисовича Орлицкого: Сборник научных статей. — М.: РГГУ, 2022. — С. 24–30. https://nevmenandr.github.io/portfolio/assets/pdf/rhythm_prose.pdf
