Новый датасет для стилометрического анализа «Дела Роулинг»

Ссылка на данные: Orekhov, Boris V. 2024. “Stylometry data for the Rowling case.” OSF. July 14.

В июле 2024 года я опубликовал препринт, в котором проверил, насколько надёжно работает метод Барроуза (Burrows’ Delta) для атрибуции романа The Cuckoo’s Calling. Однако ключевой результат этой работы с точки зрения исследовательской инфраструктуры — это не сами выводы, а новый датасет, который я выложил в открытый доступ на платформе OSF.

Почему оригинальный датасет из пакета stylo проблематичен

В популярном R-пакете для стилометрии stylo есть встроенный набор данных galbraith. Он включает частотную таблицу 3000 самых частотных слов из 26 книг 5 авторов, среди которых — сама Роулинг, «подозрительный» роман Галбрейта и тексты-дистракторы: Харлана Кобена, К.С. Льюиса и Дж.Р.Р. Толкина. Этот датасет часто используют для демонстрации возможностей пакета, и на нём Delta действительно уверенно показывает, что Роулинг и Галбрейт — один автор.

Однако при ближайшем рассмотрении обнаруживаются серьёзные методологические проблемы этого набора данных:

  • Жанровая неоднородность. The Cuckoo’s Calling — это детектив. А дистракторы включают фэнтези Льюиса и Толкина, которые стилистически очень далеки от детективного жанра. Поскольку Delta чувствительна к жанровым различиям, такое включение заранее упрощает задачу.
  • Временнáя дистанция. Льюис и Толкин писали в первой половине XX века, тогда как Роулинг — современный автор. Стиль языка меняется со временем, и Delta тоже улавливает этот сдвиг, что искажает результаты.
  • Культурные различия. Кобен — американец, а Роулинг — британка; это дополнительный фактор стилистического расхождения, который не имеет отношения к интересующему нас вопросу авторства.

Иными словами, в оригинальном датасете задача атрибуции была слишком лёгкой, потому что авторы-дистракторы были заведомо непохожи на Роулинг.

Что содержит новый датасет

Я собрал два новых корпуса современных текстов, которые гораздо лучше соответствуют исследовательскому вопросу и учитывают жанровую специфику.

Детективный корпус

В этот корпус вошли романы современных британских и ирландских авторов, работающих в детективном жанре. Сравнение проводится на фоне текстов, близких по жанру и времени создания.

  • Тана Френч: The Secret Place (2014), The Trespasser (2016).
  • Грэм Макрей Бернет: The Disappearance of Adèle Bedeau (2014), His Bloody Project (2015).
  • Стюарт Тертон: The Seven Deaths of Evelyn Hardcastle (2018), The Devil and the Dark Water (2020).

Общий объём корпуса (без текстов Роулинг): 815 749 токенов.

Фэнтезийный корпус

Этот корпус составлен из текстов современных авторов, работающих в жанре фэнтези, что позволяет оценить стиль Роулинг на фоне «коллег по цеху».

  • Фреда Уоррингтон: A Blackbird in Silver (1986), The Dark Arts of Blood (2015).
  • Брендон Сандерсон: трилогия «Рожденный туманом»: The Final Empire (2006), The Well of Ascension (2007), The Hero of Ages (2008).
  • Джонатан Страуд: трилогия «Трилогия Бартимеуса»: The Amulet of Samarkand (2003), The Golem’s Eye (2004), Ptolemy’s Gate (2005).

Общий объём корпуса: 1 327 578 токенов.

Что именно опубликовано и как использовать данные

Сам датасет представляет собой таблицы с частотами слов, полученные с помощью пакета stylo, а не исходные художественные тексты. Это сделано намеренно из-за ограничений, связанных с авторским правом. Такой подход позволяет любому исследователю воспроизвести анализ, не нарушая законодательства.

Технические детали:

  • Формат: текстовые файлы table_with_frequencies.txt.
  • Структура: матрица относительных частот наиболее частотных слов для каждого текста.
  • Инструменты: данные предназначены для загрузки в среду R и использования с пакетом stylo.

Пример кода для загрузки и анализа:

# Загрузка и анализ данных для детективного корпуса
setwd('путь/к/папке/с/данными')
stylo()  # Запуск интерактивного интерфейса stylo

# Или для использования функции imposters (самозванцев)
detective <- read.csv("table_with_frequencies.txt", sep=' ')
df.detective <- t(detective)
imposters(df.detective)

Почему этот датасет важен

Этот датасет даёт исследовательскому сообществу возможность:

  1. Проверить надёжность метода в более сложных и реалистичных условиях, когда тексты-дистракторы подобраны корректно, с учётом жанра и времени создания.
  2. Сравнить разные методы атрибуции — например, воспроизвести мои результаты и сопоставить эффективность Delta с алгоритмом imposters.
  3. Изучить влияние жанра на стилистические профили: наличие двух сбалансированных корпусов (детектив и фэнтези) открывает возможности для анализа жанровых маркеров.

Вывод: опубликованный датасет — это полезный ресурс для всех, кто занимается стилометрией и хочет проводить корректные эксперименты по атрибуции текста на современном английском материале. Он исправляет методологические недостатки встроенного датасета stylo и предлагает более строгую основу для исследований в этой области.

Борис Орехов

Я занимаюсь научными исследованиями и иногда говорю про них в популярном жанре. Еще я пишу код, как полезный, так и развлекательный. https://nevmenandr.github.io/