Новый датасет для культуромики: русские биграммы XX века

На платформе Hugging Face опубликован уникальный датасет nevmenandr/russian-20th-century-bigrams, содержащий частотности лемматизированных русских биграмм за период с 1918 по 2010 год. Этот ресурс открывает новые возможности для количественных исследований культуры, языка и истории на материале русского языка.

От Google Ngrams к структурированным данным

Исходным материалом послужила коллекция Google Ngrams, которая, однако, в сыром виде представляет собой сложные для анализа текстовые файлы. В оригинале записи выглядят так (пример):

( отно. 1924,1,1 1928,1,1 1936,2,2 1953,2,2 1956,2,2 …
( недоразвитие_NOUN 1924,2,1 1925,5,5 1926,1,1 …
( растворим_VERB 1934,1,1 1939,1,1 1945,1,1 …

Как видно, за биграммой следуют данные о годе, числе употреблений и количестве книг. Строки имеют разную длину, так как нулевые значения опущены, что крайне неудобно для статистического анализа. Авторы датасета проделали колоссальную работу по преобразованию этих данных в табличный вид, где каждая строка соответствует одной биграмме, а столбцы — годам с 1918 по 2010.

Ключевые этапы обработки

Создание датасета включало несколько важных шагов, обеспечивающих его качество и пригодность для исследований:

  1. Нормализация частот: Абсолютные числа употреблений были нормированы на общее число биграмм в каждом году. Это позволяет корректно сравнивать частотности в разные годы, нивелируя эффект роста общего объема текстов. Значения меньше 0.0000000001 отбрасывались.
  2. Лемматизация: Для приведения слов к начальной форме (лемме) использовалась консольная утилита Mystem с параметрами ./mystem -dlc. Это критически важно для корректного подсчета биграмм, объединяя разные словоформы (например, “большой дом”, “большого дома”).
  3. Очистка и фильтрация: После лемматизации были удалены артефакты (фигурные скобки, вопросительные знаки), а также все биграммы, содержащие некириллические символы. Это позволило сфокусироваться именно на русском языке.
  4. Дедупликация и слияние: Повторяющиеся после лемматизации биграммы были объединены, а их частотности — просуммированы (с точностью до 10-го знака после запятой).

В результате объем данных сократился с 385 миллионов исходных строк до 87,5 миллионов уникальных лемматизированных биграмм. Для удобства загрузки финальный датасет разбит на 6 файлов по ~15 миллионов строк каждый, что позволяет работать с ним даже на ограниченных вычислительных мощностях.

Почему 1918 год?

Выбор нижней границы периода (1918 год) не случаен. Именно с этого года в русском языке устанавливается современный орфографический режим после реформы 1917–1918 годов. Использование дореформенной орфографии создает серьезные проблемы для систем оптического распознавания (OCR) и последующей обработки естественного языка, делая данные неконсистентными. Таким образом, датасет охватывает весь “чистый” в орфографическом плане XX век и начало XXI века.

📈 Ключевые цифры:

  • Исходный объем: 385 547 647 строк (249.1 Гб)
  • После лемматизации и фильтрации: 270 061 709 строк
  • Финальный объем (уникальные биграммы): 87 537 955 записей
  • Период: 1918 – 2010 гг.
  • Формат: TSV (табуляция как разделитель)

Пример данных

Финальные данные выглядят следующим образом (заголовок и несколько строк):

ngram 1918 1919 1920 … 2010
(см. рис 0 0 0 … 0
-ов/-есть_NOUN и 0 0 0 … 0.0000000009
АПН_NOUN рсфср_NOUN 0 0 0 … 0

В каждой строке — биграмма (два слова в лемматизированной форме с пометой части речи, например NOUN, VERB), а затем частотность за каждый год с 1918 по 2010. Это идеальный формат для построения временных рядов и изучения динамики употребления языковых единиц.

Области применения

Данный датасет является ценным ресурсом для исследований в области культуромики — дисциплины, изучающей эволюцию культуры и языка через количественный анализ больших текстовых корпусов. С его помощью можно:

  • Отслеживать изменения в лексическом составе русского языка на протяжении века.
  • Исследовать, как исторические события (войны, революции, технологические прорывы) отражаются в языке.
  • Анализировать эволюцию понятий и культурных концептов.
  • Изучать стилистические сдвиги в публицистике и научной литературе.
  • Проводить сравнительные исследования с данными по другим языкам.

Рекомендуемая литература

Для более глубокого погружения в методологию и примеры исследований авторы датасета рекомендуют следующие работы:

  • Michel, J. B., et al. (2011). Quantitative analysis of culture using millions of digitized books. Science, 331(6014), 176–182.
  • Бонч-Осмоловская, А. А. (2023). Глава 4. Культуромика: исследование культуры и языка с помощью текстовых данных. В кн.: Цифровые гуманитарные исследования: монография, Красноярск, 57–99.
  • Бонч-Осмоловская, А. А. (2018). Имена времени: эпитеты десятилетий в Национальном корпусе русского языка как проекция культурной памяти. Шаги/Steps, 4(3-4), 115-146.
  • Бонч-Осмоловская, А. А. (2015). Культуромика в национальном корпусе русского языка, к постановке задачи: три века русских дорог. Труды Института русского языка им. В. В. Виноградова, (6), 605-641.

Датасет доступен для загрузки и использования на Hugging Face.

Библиографическая ссылка: Boris Orekhov. ‘Russian-20th-Century-Bigrams (Revision 8ef57d3)’. Hugging Face, 2025. https://doi.org/10.57967/hf/5987

Борис Орехов

Я занимаюсь научными исследованиями и иногда говорю про них в популярном жанре. Еще я пишу код, как полезный, так и развлекательный. https://nevmenandr.github.io/