Культуромика русского языка XX века: датасет лемматизированных биграмм
Опубликован масштабный датасет nevmenandr/russian-20th-century-bigrams, содержащий нормализованные частотности биграмм (пар слов) в русскоязычных текстах за период с 1918 по 2010 год. Этот набор данных, созданный Борисом Ореховым на основе коллекции Google Ngrams и прошедший глубокую обработку, открывает новые возможности для количественных исследований языка, истории и культуры.
От сырых данных к пригодному для анализа формату
Исходные материалы из Google Books представляли собой записи переменной длины, где для каждой биграммы указывались годы употребления и число вхождений. Исследователи провели сложную многоэтапную обработку, чтобы превратить их в унифицированную таблицу:
- Нормализация частот — абсолютные числа вхождений заменены на относительные, нормированные на общее количество биграмм в каждом году. Это позволяет корректно сравнивать данные между десятилетиями.
- Лемматизация — с помощью консольной утилиты Mystem все биграммы приведены к начальным формам (леммам), что группирует словоформы и упрощает семантический анализ.
- Очистка от артефактов — удалены биграммы, содержащие некириллические символы, а также артефакты разметки Mystem (фигурные скобки, вопросительные знаки).
- Дедупликация — повторяющиеся после лемматизации биграммы объединены, их частоты просуммированы с точностью до 10-го знака после запятой.
Структура и масштаб данных
Финальный датасет содержит 87 537 955 уникальных лемматизированных биграмм. Для удобства загрузки данные разбиты на 6 файлов по 15 миллионов строк каждый. Таблица имеет простую структуру: первый столбец — биграмма (два слова через пробел), последующие столбцы — годы с 1918 по 2010, а значения в ячейках — нормированная частота употребления этой биграммы в текстах соответствующего года.
Например, запись (см. рис. показывает, как часто встречалось это сочетание в разные годы, с пиками в 1950-1960-х годах. А биграмма АПН_ссср (Агентство печати «Новости» и СССР) демонстрирует рост в 1970-1980-х, отражая медийный контекст эпохи.
Почему именно XX век?
Временной диапазон выбран не случайно: с 1918 года в русском языке действует современная орфографическая норма. Более ранние тексты (дореволюционные) содержат другую орфографию, что создает проблемы для OCR-распознавания и автоматической обработки. Таким образом, данные представляют консистентный массив, пригодный для диахронических исследований.
Перспективы применения
Этот датасет — ценный ресурс для культуромики (культурной оцифрованной аналитики). С его помощью можно изучать:
- Эволюцию ключевых понятий и дискурсов на протяжении почти века.
- Влияние исторических событий на языковые привычки и частоту употребления слов.
- Динамику лингвистического разнообразия и изменения в стилях письма.
- Связь между частотами биграмм и социально-экономическими показателями.
Для исследователей, знакомых с культуромикой, датасет станет надежной основой для проверки гипотез и построения моделей. В числе рекомендованных работ по теме — классическая статья Michel et al. (2011) из Science, а также публикации А. А. Бонч-Осмоловской, развивающие этот подход на материале русского языка.
Материалы доступны на платформе Hugging Face: https://huggingface.co/datasets/nevmenandr/russian-20th-century-bigrams
