Датасет: немецкие поэтические тексты, сгенерированные нейросетью

Новый датасет: немецкие поэтические тексты, сгенерированные нейросетью

Представляем вашему вниманию датасет German Generated Poetic Texts (GGPT), подготовленный Борисом Ореховым. Это коллекция стихотворных текстов на немецком языке, созданных с помощью символьных рекуррентных нейронных сетей (многослойные LSTM).

Зачем публиковать сгенерированные тексты?

На первый взгляд, идея может показаться неочевидной, ведь компьютер может генерировать такие тексты бесконечно. Однако для исследователей, особенно в гуманитарных науках, этот датасет представляет практическую ценность. Получение готовых сгенерированных текстов “на лету” для старых моделей затруднено, они требуют настройки специализированного программного обеспечения, конкретных версий фреймворков глубокого обучения и технических навыков. Наличие же готового, структурированного набора данных открывает широкие возможности для анализа без необходимости преодолевать эти технические барьеры.

Как создавался датасет

Модели обучались на текстах четырех различных корпусов:

  • Фридрих Гёльдерлин (415,516 знаков, 10,677 строк)
  • Теодор Фонтане (365,360 знаков, 10,327 строк)
  • Пауль Целан (267,521 знак, 9,757 строк)
  • Гекзаметр (605,627 знаков, 12,516 строк) — извлечены из большой коллекции немецких стихов Томаса Хайдера.

Для каждого обучающего корпуса было обучено несколько моделей с разным количеством эпох и, соответственно, разными значениями функции потерь (loss). С каждой модели было сгенерировано по десять выборок длиной не менее 28,000 знаков каждая. Ключевым параметром генерации выступала температура — от 0.1 до 1.0 с шагом 0.1, что позволяет получить тексты с разной степенью “случайности” и отклонения от исходного стиля.

Состав и структура данных

Датасет включает в себя четыре основных каталога (по одному на каждого автора и гекзаметр), внутри которых сгенерированные тексты организованы по моделям и значениям температуры. Общий объем набора данных составляет около 819 КБ. Помимо самих текстов, в репозитории представлена мета-информация в формате TSV, а также модели, опубликованные на платформе Hugging Face.

Научный контекст

Генерация текстов в стиле Гёльдерлина была приурочена к 250-летию поэта в 2020 году. Результаты этой работы нашли отражение в публикациях, включая статью в журнале Orbis Litterarum (2020), где исследуются возможности нейросетевого анализа поэзии. Автор отмечает, что подобные датасеты открывают новые перспективы для исследований в области цифровых гуманитарных наук.

Цитирование

При использовании датасета в своих работах можно ссылаться на него следующим образом:

Orekhov, Boris. (2022). German Generated Poetic Texts (v1.0) [Data set]. Zenodo. https://doi.org/10.5281/zenodo.7114238

Ссылка на датасет: https://doi.org/10.5281/zenodo.7114238
Репозиторий проекта: https://github.com/nevmenandr/german-generated-poetic-texts

Датасет будет полезен исследователям в области цифровой поэтики, стилеметрии, а также всем, кто интересуется пересечением гуманитарных наук и искусственного интеллекта.

Борис Орехов

Я занимаюсь научными исследованиями и иногда говорю про них в популярном жанре. Еще я пишу код, как полезный, так и развлекательный. https://nevmenandr.github.io/