Борис Орехов
Кандидат филологических наук (Воронежский государственный университет, 2008), доцент Школы лингвистики НИУ ВШЭ (Москва) и старший научный сотрудник Института русской литературы (Пушкинский Дом) РАН. Специалист в области корпусной лингвистики, стилометрии, цифровой текстологии и применения методов машинного обучения для анализа поэтических и прозаических текстов.
Исследовательские интересы
Охватывают широкий спектр направлений вычислительной филологии: от количественного анализа стиха и исторической поэтики до создания лингвистических корпусов для миноритарных языков и автоматической атрибуции текстов. Значительная часть проектов связана с разработкой инструментов для работы с неструктурированными гуманитарными данными — поэтическими корпусами, параллельными переводами, индексами к классическим собраниям сочинений.
Проекты и цифровые инфраструктуры
- Участник команды Национального корпуса русского языка (https://ruscorpora.ru/)
- Создатель и ведущий разработчик специализированных корпусов:
Башкирского поэтического корпуса,
Параллельного корпуса переводов «Слова о полку Игореве»,
корпуса языков России в Интернете - Автор цифрового индекса к 90-томному собранию сочинений Л. Н. Толстого («91-й том: указатель к Толстому», http://index.tolstoy.ru/)
- Бывший участник международного проекта Greek Drama Corpus (https://dracor.org/greek) по созданию корпуса древнегреческих драм в формате TEI
Ключевые результаты и вклад в Digital Humanities
Разрабатывает и применяет методы количественной атрибуции для решения спорных случаев авторства в истории литературы (в том числе для текстов, связанных с «бахтинским кругом» и романом «Тихий Дон»).
Исследует возможности нейросетевых моделей для генерации и анализа поэтических текстов, а также изучает влияние стилеметрических параметров на распознавание авторского стиля (включая эксперименты с «мнимыми авторами»). Активно использует географическое моделирование и картирование литературного пространства для изучения динамики русской прозы XIX века.
Технические компетенции
- Языки программирования: Python, R, Perl, PHP (разработка веб-интерфейсов для корпусов и парсеров)
- Стандарты: TEI, XML, создание шрифтов и типографика в LATEX
- Опыт работы с большими данными, статистическими пакетами и библиотеками для NLP (стилометрия, векторизация текстов, кластерный анализ)
Приглашенные позиции и коллаборации
Работал в качестве приглашенного исследователя в Университете Осло (создание RuN-Euro Corpus), Университете Ниццы, а также в РАНХиГС и СПбГУ. В разное время читал курсы по цифровым гуманитарным исследованиям, формальному анализу стиха и программированию для филологов в НИУ ВШЭ, Европейском университете в Санкт-Петербурге, Московском институте психоанализа.
Редакторская деятельность
Главный редактор журнала «Цифровые гуманитарные исследования» (с 2024), член редколлегии «Квантитативная филология». Ранее — главный редактор «Назировского архива» и ответственный секретарь журнала «Диалог. Карнавал. Хронотоп». Ведет научно-популярный канал о риторике и языковых явлениях, выступает с лекциями и популяризаторскими материалами на платформах ПостНаука и Системный Блокъ.
Публикационная активность
Автор более 200 работ, включая монографии «Электронная лира. Как и зачем искусственный интеллект пишет стихи?» (2026) и «Башкирский стих XX века. Корпусное исследование» (2019), а также статей в ведущих международных журналах по цифровой филологии (Digital Scholarship in the Humanities, Journal of Computational Literary Studies, Orbis Litterarum).
Контакты и профили
- Персональный сайт: https://nevmenandr.github.io/
- GitHub: https://github.com/nevmenandr/
- ORCID: 0000-0002-9099-0436
- Academia.edu: https://hse-ru.academia.edu/BorisOrekhov
- CV
