Культуромика русского языка XX века: датасет лемматизированных биграмм

Опубликован масштабный датасет nevmenandr/russian-20th-century-bigrams, содержащий нормализованные частотности биграмм (пар слов) в русскоязычных текстах за период с 1918 по 2010 год. Этот набор данных, созданный Борисом Ореховым на основе коллекции Google Ngrams и прошедший глубокую обработку, открывает новые возможности для количественных исследований языка, истории и культуры.

От сырых данных к пригодному для анализа формату

Исходные материалы из Google Books представляли собой записи переменной длины, где для каждой биграммы указывались годы употребления и число вхождений. Исследователи провели сложную многоэтапную обработку, чтобы превратить их в унифицированную таблицу:

  • Нормализация частот — абсолютные числа вхождений заменены на относительные, нормированные на общее количество биграмм в каждом году. Это позволяет корректно сравнивать данные между десятилетиями.
  • Лемматизация — с помощью консольной утилиты Mystem все биграммы приведены к начальным формам (леммам), что группирует словоформы и упрощает семантический анализ.
  • Очистка от артефактов — удалены биграммы, содержащие некириллические символы, а также артефакты разметки Mystem (фигурные скобки, вопросительные знаки).
  • Дедупликация — повторяющиеся после лемматизации биграммы объединены, их частоты просуммированы с точностью до 10-го знака после запятой.

Структура и масштаб данных

Финальный датасет содержит 87 537 955 уникальных лемматизированных биграмм. Для удобства загрузки данные разбиты на 6 файлов по 15 миллионов строк каждый. Таблица имеет простую структуру: первый столбец — биграмма (два слова через пробел), последующие столбцы — годы с 1918 по 2010, а значения в ячейках — нормированная частота употребления этой биграммы в текстах соответствующего года.

Например, запись (см. рис. показывает, как часто встречалось это сочетание в разные годы, с пиками в 1950-1960-х годах. А биграмма АПН_ссср (Агентство печати «Новости» и СССР) демонстрирует рост в 1970-1980-х, отражая медийный контекст эпохи.

Почему именно XX век?

Временной диапазон выбран не случайно: с 1918 года в русском языке действует современная орфографическая норма. Более ранние тексты (дореволюционные) содержат другую орфографию, что создает проблемы для OCR-распознавания и автоматической обработки. Таким образом, данные представляют консистентный массив, пригодный для диахронических исследований.

Перспективы применения

Этот датасет — ценный ресурс для культуромики (культурной оцифрованной аналитики). С его помощью можно изучать:

  • Эволюцию ключевых понятий и дискурсов на протяжении почти века.
  • Влияние исторических событий на языковые привычки и частоту употребления слов.
  • Динамику лингвистического разнообразия и изменения в стилях письма.
  • Связь между частотами биграмм и социально-экономическими показателями.

Для исследователей, знакомых с культуромикой, датасет станет надежной основой для проверки гипотез и построения моделей. В числе рекомендованных работ по теме — классическая статья Michel et al. (2011) из Science, а также публикации А. А. Бонч-Осмоловской, развивающие этот подход на материале русского языка.

Материалы доступны на платформе Hugging Face: https://huggingface.co/datasets/nevmenandr/russian-20th-century-bigrams

Борис Орехов

Я занимаюсь научными исследованиями и иногда говорю про них в популярном жанре. Еще я пишу код, как полезный, так и развлекательный. https://nevmenandr.github.io/