Digital Humanities: подходы, методы, перспективы
Докладчик: Борис Орехов (НИУ ВШЭ, ИРЛИ РАН, МГУ)
Семинар: кафедра социальной и цифровой гуманитаристики, МИП
Дата: 11 марта 2026
11 марта 2026 года в рамках семинара кафедры социальной и цифровой гуманитаристики Московского института психоанализа (МИП) состоялась открытая лекция Бориса Орехова «Digital Humanities: подходы, методы, перспективы». Мероприятие собрало исследователей, преподавателей и студентов, интересующихся пересечением гуманитарного знания и вычислительных методов.
1. Что такое Digital Humanities? От термина к дисциплине
Борис Орехов начал с уточнения понятийного аппарата. Digital Humanities — это «зонтичное» название для исследовательского поля на стыке гуманитарных (и отчасти социальных) наук и компьютерного анализа данных. Однако, как отметил докладчик, термину не повезло с переводом на русский язык: humanities не имеет прямого эквивалента. Наиболее адекватный вариант — «гуманитарные науки», а сокращение «гуманитаристика» стилистически не нейтрально, создаёт сниженный эффект (по аналогии с «шагистика», «ерундистика»). При этом давно заимствованные слова вроде «журналистика» или «логистика» воспринимаются иначе.
«Цифровые гуманитарные исследования — это не просто применение инструментов, а переосмысление самих оснований гуманитарного познания».
Особое внимание было уделено запросу на точность и объективность, который часто предъявляют гуманитариям. Орехов подчеркнул, что естественные науки «узурпировали» понятие научности, но объективность и точность — это мифы, которые недостижимы даже в физике или биологии. В DH субъективность проявляется на всех этапах: от постановки задачи и отбора материала до интерпретации результатов.
В этом контексте была введена важная дихотомия data / capta. В отличие от «естественников», гуманитарии никогда не имеют полных данных — их наборы всегда ограничены обстоятельствами и интересами исследователя. Поэтому корректнее говорить не о «данных», а о «взятых» (capta). Тем не менее, DH позволяет измерять и калибровать то, что уже было известно, особенно на больших объёмах текста («великое непрочтённое»), где наиболее выражены надличностные факторы.
2. Исторический контекст: от оцифровки к анализу
Орехов выделил два основных этапа развития цифровых гуманитарных наук. До 2000-х годов дисциплина почти целиком состояла из оцифровки: разработка стандартов (например, TEI), создание электронных библиотек, каталогов, словарей. Со второй половины 2000-х к оцифрованным данным начинают применяться методы автоматической обработки и статистического анализа — это переводит DH на новый уровень.
В качестве ключевой референции была названа статья А. Ю. Володина «Цифровые гуманитарии: от академических племен к эпистемическому сообществу» (2025), в которой прослеживается эволюция сообщества и институциональных практик.
3. Методы компьютерного анализа текста
Основной акцент в лекции был сделан на методах анализа текста — наиболее разработанной области в русскоязычной DH. Докладчик кратко, но ёмко охарактеризовал несколько подходов:
- Стилеметрия и атрибуция — автоматическое определение авторства на основе частотных профилей, синтаксических маркеров и др. (со ссылкой на работы по атрибуции текстов XVIII–XIX вв.).
- Культуромика — анализ частотности слов в синхронии и диахронии для отслеживания эволюции общественного сознания (примеры из англоязычных корпусов и первые опыты на русском материале).
- Тематическое моделирование — способ «узнать, о чём текст, не читая его», на основе вероятностных моделей (LDA, ARTM).
- Векторные модели (word2vec, BERT, novel2vec) — позволяют представлять слова и целые произведения в виде плотных векторов, выявлять смысловые близости и контекстные паттерны.
Отдельно Орехов привёл пример из смежной области (биоинформатики) — спектрально-аналитический подход для выявления повторов в геномных последовательностях, чтобы показать, как методы, разработанные для естественных наук, могут быть адаптированы для гуманитарных задач (и наоборот).
«Мы не стремимся заменить чтение машинным анализом. Мы хотим получить новые оптики, которые позволят увидеть в тексте то, что ускользает от невооружённого глаза».
В качестве базового источника по методам была рекомендована глава 6 «Компьютерный анализ текста» в коллективной монографии «Цифровые гуманитарные исследования» (Красноярск: СФУ, 2023).
4. Русскоязычное сообщество: центры, журналы, конференции
Борис Орехов представил актуальную карту институциональной среды DH в России и странах постсоветского пространства. Среди ключевых центров:
- НИУ ВШЭ — магистерская программа, открытый репозиторий awesome-dh-hse;
- ИТМО (Санкт-Петербург) — магистерская программа, телеграм-канал @dhcenter;
- УрФУ, СФУ, МГУ (историческая информатика), ИРЛИ РАН (Пушкинский Дом), телеграм-каналы @tozhe_nauka и @dhcloud.
С 2024 года выходит рецензируемый журнал «Цифровые гуманитарные исследования» (2 выпуска в год). Регулярные конференции: «СПИЛ» (Смоленск), «Информационные технологии в гуманитарных исследованиях» (Красноярск), конференция Ассоциации «История и компьютер» (АИК, Москва). Также действует регулярный семинар «Цифровая среда» под руководством А. Ю. Володина (dhri.ru/projects/sreda).
Докладчик подчеркнул, что русскоязычная традиция «точных методов» в гуманитарной сфере имеет глубокие корни (от структурализма до математической лингвистики), и современный этап — не разрыв, а продолжение этой линии.
5. Инфраструктура и открытые проекты
Вторая половина лекции была посвящена конкретным инструментам и проектам, разрабатываемым в русскоязычной DH-среде. Орехов представил пакеты для Python, доступные на PyPI и Hugging Face:
preferom2modern— транслитерация старой орфографии в новую;ru-accent-poet— акцентуация русского поэтического текста;direct-speech-extractor-ru— выделение прямой речи персонажей;formularity-rfs— оценка формульности фольклорного текста;TEItransformer— преобразование текстов в формате TEI;- OCR-модель для распознавания текстов в старой орфографии (Serovvans/trocr-preferom-orthography).
Все инструменты агрегированы на портале dhcloud.org/python/.
Особый интерес слушателей вызвали авторские проекты Бориса Орехова:
- Параллельный корпус переводов «Слова о полку Игореве»
- 91-й том: указатель к ПСС Л. Н. Толстого
- Сеть персоналий в Словаре русских писателей XVIII века
- Русский стилеметрический датасет (RSD)
- Векторные романы (novel2vec)
Докладчик подчеркнул, что все разработки распространяются как открытое ПО, что соответствует принципам Open Science и способствует воспроизводимости исследований.
6. Дискуссия и перспективы
В ходе оживлённой дискуссии были затронуты вопросы:
- этики использования ИИ в гуманитарных исследованиях;
- проблемы «чёрного ящика» в нейросетевых моделях и необходимости интерпретируемости;
- развития корпусных ресурсов для малоресурсных языков и диалектов;
- интеграции DH в учебные программы гуманитарных факультетов.
Борис Орехов отметил, что перспективы DH связаны не только с совершенствованием алгоритмов, но и с изменением эпистемологических привычек исследователей. Важно не подменять понимание данных их вычислением, а использовать вычисления как ещё один способ диалога с текстом. Также была подчёркнута необходимость междисциплинарного сотрудничества — лингвистов, историков, литературоведов, программистов, статистиков.
«Мы находимся в точке бифуркации: либо DH останутся маргинальной «модой», либо станут неотъемлемой частью гуманитарного образования и науки. Второе зависит от нас».
Итоги
Лекция Бориса Орехова задала высокую планку для семинара кафедры социальной и цифровой гуманитаристики. Слушатели получили не только панорамный обзор современного состояния DH, но и практические ориентиры для собственных проектов. Особо ценной была признана сбалансированная позиция докладчика: без эйфории от «цифры», но и без скепсиса — с ясным пониманием возможностей и ограничений методов.
Презентация к лекции: https://nevmenandr.github.io/slides/2026-03-11/slides.pdf
Обзор подготовлен по материалам презентации и устного выступления. Точные цитаты сверены с видеозаписью семинара.
Блог кафедры социальной и цифровой гуманитаристики, МИП — март 2026
“`
