Новый датасет для стилометрического анализа «Дела Роулинг»
Ссылка на данные: Orekhov, Boris V. 2024. “Stylometry data for the Rowling case.” OSF. July 14.
В июле 2024 года я опубликовал препринт, в котором проверил, насколько надёжно работает метод Барроуза (Burrows’ Delta) для атрибуции романа The Cuckoo’s Calling. Однако ключевой результат этой работы с точки зрения исследовательской инфраструктуры — это не сами выводы, а новый датасет, который я выложил в открытый доступ на платформе OSF.
Почему оригинальный датасет из пакета stylo проблематичен
В популярном R-пакете для стилометрии stylo есть встроенный набор данных galbraith. Он включает частотную таблицу 3000 самых частотных слов из 26 книг 5 авторов, среди которых — сама Роулинг, «подозрительный» роман Галбрейта и тексты-дистракторы: Харлана Кобена, К.С. Льюиса и Дж.Р.Р. Толкина. Этот датасет часто используют для демонстрации возможностей пакета, и на нём Delta действительно уверенно показывает, что Роулинг и Галбрейт — один автор.
Однако при ближайшем рассмотрении обнаруживаются серьёзные методологические проблемы этого набора данных:
- Жанровая неоднородность. The Cuckoo’s Calling — это детектив. А дистракторы включают фэнтези Льюиса и Толкина, которые стилистически очень далеки от детективного жанра. Поскольку Delta чувствительна к жанровым различиям, такое включение заранее упрощает задачу.
- Временнáя дистанция. Льюис и Толкин писали в первой половине XX века, тогда как Роулинг — современный автор. Стиль языка меняется со временем, и Delta тоже улавливает этот сдвиг, что искажает результаты.
- Культурные различия. Кобен — американец, а Роулинг — британка; это дополнительный фактор стилистического расхождения, который не имеет отношения к интересующему нас вопросу авторства.
Иными словами, в оригинальном датасете задача атрибуции была слишком лёгкой, потому что авторы-дистракторы были заведомо непохожи на Роулинг.
Что содержит новый датасет
Я собрал два новых корпуса современных текстов, которые гораздо лучше соответствуют исследовательскому вопросу и учитывают жанровую специфику.
Детективный корпус
В этот корпус вошли романы современных британских и ирландских авторов, работающих в детективном жанре. Сравнение проводится на фоне текстов, близких по жанру и времени создания.
- Тана Френч: The Secret Place (2014), The Trespasser (2016).
- Грэм Макрей Бернет: The Disappearance of Adèle Bedeau (2014), His Bloody Project (2015).
- Стюарт Тертон: The Seven Deaths of Evelyn Hardcastle (2018), The Devil and the Dark Water (2020).
Общий объём корпуса (без текстов Роулинг): 815 749 токенов.
Фэнтезийный корпус
Этот корпус составлен из текстов современных авторов, работающих в жанре фэнтези, что позволяет оценить стиль Роулинг на фоне «коллег по цеху».
- Фреда Уоррингтон: A Blackbird in Silver (1986), The Dark Arts of Blood (2015).
- Брендон Сандерсон: трилогия «Рожденный туманом»: The Final Empire (2006), The Well of Ascension (2007), The Hero of Ages (2008).
- Джонатан Страуд: трилогия «Трилогия Бартимеуса»: The Amulet of Samarkand (2003), The Golem’s Eye (2004), Ptolemy’s Gate (2005).
Общий объём корпуса: 1 327 578 токенов.
Что именно опубликовано и как использовать данные
Сам датасет представляет собой таблицы с частотами слов, полученные с помощью пакета stylo, а не исходные художественные тексты. Это сделано намеренно из-за ограничений, связанных с авторским правом. Такой подход позволяет любому исследователю воспроизвести анализ, не нарушая законодательства.
Технические детали:
- Формат: текстовые файлы
table_with_frequencies.txt. - Структура: матрица относительных частот наиболее частотных слов для каждого текста.
- Инструменты: данные предназначены для загрузки в среду R и использования с пакетом
stylo.
Пример кода для загрузки и анализа:
# Загрузка и анализ данных для детективного корпуса
setwd('путь/к/папке/с/данными')
stylo() # Запуск интерактивного интерфейса stylo
# Или для использования функции imposters (самозванцев)
detective <- read.csv("table_with_frequencies.txt", sep=' ')
df.detective <- t(detective)
imposters(df.detective)
Почему этот датасет важен
Этот датасет даёт исследовательскому сообществу возможность:
- Проверить надёжность метода в более сложных и реалистичных условиях, когда тексты-дистракторы подобраны корректно, с учётом жанра и времени создания.
- Сравнить разные методы атрибуции — например, воспроизвести мои результаты и сопоставить эффективность Delta с алгоритмом
imposters. - Изучить влияние жанра на стилистические профили: наличие двух сбалансированных корпусов (детектив и фэнтези) открывает возможности для анализа жанровых маркеров.
Вывод: опубликованный датасет — это полезный ресурс для всех, кто занимается стилометрией и хочет проводить корректные эксперименты по атрибуции текста на современном английском материале. Он исправляет методологические недостатки встроенного датасета stylo и предлагает более строгую основу для исследований в этой области.
