Новый датасет для культуромики: русские биграммы XX века
На платформе Hugging Face опубликован уникальный датасет nevmenandr/russian-20th-century-bigrams, содержащий частотности лемматизированных русских биграмм за период с 1918 по 2010 год. Этот ресурс открывает новые возможности для количественных исследований культуры, языка и истории на материале русского языка.
От Google Ngrams к структурированным данным
Исходным материалом послужила коллекция Google Ngrams, которая, однако, в сыром виде представляет собой сложные для анализа текстовые файлы. В оригинале записи выглядят так (пример):
( недоразвитие_NOUN 1924,2,1 1925,5,5 1926,1,1 …
( растворим_VERB 1934,1,1 1939,1,1 1945,1,1 …
Как видно, за биграммой следуют данные о годе, числе употреблений и количестве книг. Строки имеют разную длину, так как нулевые значения опущены, что крайне неудобно для статистического анализа. Авторы датасета проделали колоссальную работу по преобразованию этих данных в табличный вид, где каждая строка соответствует одной биграмме, а столбцы — годам с 1918 по 2010.
Ключевые этапы обработки
Создание датасета включало несколько важных шагов, обеспечивающих его качество и пригодность для исследований:
- Нормализация частот: Абсолютные числа употреблений были нормированы на общее число биграмм в каждом году. Это позволяет корректно сравнивать частотности в разные годы, нивелируя эффект роста общего объема текстов. Значения меньше 0.0000000001 отбрасывались.
- Лемматизация: Для приведения слов к начальной форме (лемме) использовалась консольная утилита Mystem с параметрами
./mystem -dlc. Это критически важно для корректного подсчета биграмм, объединяя разные словоформы (например, “большой дом”, “большого дома”). - Очистка и фильтрация: После лемматизации были удалены артефакты (фигурные скобки, вопросительные знаки), а также все биграммы, содержащие некириллические символы. Это позволило сфокусироваться именно на русском языке.
- Дедупликация и слияние: Повторяющиеся после лемматизации биграммы были объединены, а их частотности — просуммированы (с точностью до 10-го знака после запятой).
В результате объем данных сократился с 385 миллионов исходных строк до 87,5 миллионов уникальных лемматизированных биграмм. Для удобства загрузки финальный датасет разбит на 6 файлов по ~15 миллионов строк каждый, что позволяет работать с ним даже на ограниченных вычислительных мощностях.
Почему 1918 год?
Выбор нижней границы периода (1918 год) не случаен. Именно с этого года в русском языке устанавливается современный орфографический режим после реформы 1917–1918 годов. Использование дореформенной орфографии создает серьезные проблемы для систем оптического распознавания (OCR) и последующей обработки естественного языка, делая данные неконсистентными. Таким образом, датасет охватывает весь “чистый” в орфографическом плане XX век и начало XXI века.
📈 Ключевые цифры:
- Исходный объем: 385 547 647 строк (249.1 Гб)
- После лемматизации и фильтрации: 270 061 709 строк
- Финальный объем (уникальные биграммы): 87 537 955 записей
- Период: 1918 – 2010 гг.
- Формат: TSV (табуляция как разделитель)
Пример данных
Финальные данные выглядят следующим образом (заголовок и несколько строк):
(см. рис 0 0 0 … 0
-ов/-есть_NOUN и 0 0 0 … 0.0000000009
АПН_NOUN рсфср_NOUN 0 0 0 … 0
В каждой строке — биграмма (два слова в лемматизированной форме с пометой части речи, например NOUN, VERB), а затем частотность за каждый год с 1918 по 2010. Это идеальный формат для построения временных рядов и изучения динамики употребления языковых единиц.
Области применения
Данный датасет является ценным ресурсом для исследований в области культуромики — дисциплины, изучающей эволюцию культуры и языка через количественный анализ больших текстовых корпусов. С его помощью можно:
- Отслеживать изменения в лексическом составе русского языка на протяжении века.
- Исследовать, как исторические события (войны, революции, технологические прорывы) отражаются в языке.
- Анализировать эволюцию понятий и культурных концептов.
- Изучать стилистические сдвиги в публицистике и научной литературе.
- Проводить сравнительные исследования с данными по другим языкам.
Рекомендуемая литература
Для более глубокого погружения в методологию и примеры исследований авторы датасета рекомендуют следующие работы:
- Michel, J. B., et al. (2011). Quantitative analysis of culture using millions of digitized books. Science, 331(6014), 176–182.
- Бонч-Осмоловская, А. А. (2023). Глава 4. Культуромика: исследование культуры и языка с помощью текстовых данных. В кн.: Цифровые гуманитарные исследования: монография, Красноярск, 57–99.
- Бонч-Осмоловская, А. А. (2018). Имена времени: эпитеты десятилетий в Национальном корпусе русского языка как проекция культурной памяти. Шаги/Steps, 4(3-4), 115-146.
- Бонч-Осмоловская, А. А. (2015). Культуромика в национальном корпусе русского языка, к постановке задачи: три века русских дорог. Труды Института русского языка им. В. В. Виноградова, (6), 605-641.
Датасет доступен для загрузки и использования на Hugging Face.
Библиографическая ссылка: Boris Orekhov. ‘Russian-20th-Century-Bigrams (Revision 8ef57d3)’. Hugging Face, 2025. https://doi.org/10.57967/hf/5987
