Датасет для исследования авторства в танской поэзии: “Delta for Tang Poets”

В цифровых гуманитарных исследованиях, и особенно в стилометрии, большое значение имеют качественно подготовленные данные. В 2024 году Борис Орехов (НИУ ВШЭ, Институт русской литературы РАН) опубликовал набор данных “Delta for Tang Poets”, созданный для проверки эффективности метода Дельты Берроуза на материале средневековой китайской поэзии. Этот датасет представляет интерес не только как вспомогательный материал для исследования, но и как самостоятельный объект, демонстрирующий подходы к работе с нетривиальными для стилометрии текстами.

Назначение и структура данных

Основная цель датасета — предоставить материал для тестирования того, как метод Дельты, хорошо зарекомендовавший себя на европейских языках, справляется с китайским языком, имеющим иной грамматический строй и письменность [Orekhov, 2024]. Ключевая особенность данных в том, что исследователь сознательно отказался от сложной и потенциально ошибочной токенизации текста, используя в качестве минимальной единицы не слово, а отдельный иероглиф . Это делает датасет удобным инструментом для отработки методов, работающих на уровне символов.

Источником текстов послужило цифровое собрание “Полное собрание танской поэзии” (Quan Tangshi) из репозитория snowtraces/poetry-source. Для создания датасета были отобраны 20 самых плодовитых поэтов эпохи Тан. Общий корпус включает 2537 авторов, но для визуального анализа и фокусировки на результатах были выбраны именно самые крупные фигуры, что обеспечило достаточный объем текста для каждого автора .

Вот список поэтов, вошедших в датасет, с указанием общего количества символов (включая знаки препинания и пробелы) в их сохранившемся наследии :

  • 白居易 (Bai Juyi) — 229 346 символов
  • 杜甫 (Du Fu) — 129 391
  • 李白 (Li Bai) — 103 294
  • 元稹 (Yuan Zhen) — 80 968
  • 韩愈 (Han Yu) — 60 013
  • 劉禹錫 (Liu Yuxi) — 58 224
  • 贯休 (Guan Xiu) — 48 836
  • 齊己 (Qi Ji) — 46 381
  • 陆龟蒙 (Lu Guimeng) — 45 104
  • 韦应物 (Wei Yingwu) — 40 776
  • 孟郊 (Meng Jiao) — 40 582
  • 李商隐 (Li Shangyin) — 39 589
  • 皎然 (Jiaoran) — 38 349
  • 劉長卿 (Liu Zhangqing) — 35 301
  • 皮日休 (Pi Rixiu) — 34 357
  • 杜牧 (Du Mu) — 33 483
  • 王建 (Wang Jian) — 31 607
  • 姚合 (Yao He) — 30 887
  • 钱起 (Qian Qi) — 29 874
  • 许浑 (Xu Hun) — 29 775

Методология создания выборок

Стилометрия чувствительна к объему текста, поэтому стихотворения каждого поэта были объединены в несколько крупных выборок . Чтобы избежать случайных искажений, которые могли бы возникнуть из-за конкретного сочетания стихов в одной выборке, автор применил рандомизацию:

  1. Случайное перемешивание: Стихотворения каждого поэта были случайным образом перемешаны.
  2. Разбиение на две половины: Весь массив текста для одного поэта был разделен на две равные части, каждая из которых стала отдельным текстом-образцом.
  3. Пятикратное повторение: Эта процедура (перемешивание и разбиение) была повторена пять раз, в результате чего было создано пять независимых тестовых корпусов . Такой подход позволил оценить стабильность результатов кластеризации вне зависимости от случайного распределения стихов.

Содержимое репозитория и код

Репозиторий на платформе OSF [Orekhov, 2024] включает в себя не только сами данные, но и код для их воспроизводимого анализа. Это позволяет другим исследователям не только проверить результаты, но и применить аналогичную методологию к другим текстам. В репозитории представлены:

  • Сгенерированные текстовые файлы: Пять вариантов корпусов с разделенными выборками для 20 поэтов.
  • R-скрипты: Код, использующий пакет stylo [Eder et al., 2016] для расчета дельты Барроуза. Настройки пакета были специально изменены для работы с иероглифами вместо слов, и для анализа использовались 100 самых частотных символов .
  • Результаты анализа: Матрицы расстояний и визуализации (кластерные дендрограммы и тепловые карты), демонстрирующие, что выборки одного автора стабильно группируются вместе, не смешиваясь с другими поэтами .

Этот датасет — ценный ресурс не только для стилометрических экспериментов, но и для изучения классической китайской поэзии с помощью количественных методов, предоставляющий как выверенные данные, так и рабочий код для их обработки.


Orekhov, 2024 – Orekhov, Boris V. 2024. “Delta for Tang Poets.” OSF. July 9. https://osf.io/j4fn3/.

Препринт с исследованием на эту тему:  Orekhov, Boris. ‘How does Burrows’ Delta work on medieval Chinese poetic texts?’ ArXiv [Cs.CL], 2024. arXiv. https://arxiv.org/abs/2407.08099.

Борис Орехов

Я занимаюсь научными исследованиями и иногда говорю про них в популярном жанре. Еще я пишу код, как полезный, так и развлекательный. https://nevmenandr.github.io/