Датасет: немецкие поэтические тексты, сгенерированные нейросетью
Новый датасет: немецкие поэтические тексты, сгенерированные нейросетью
Представляем вашему вниманию датасет German Generated Poetic Texts (GGPT), подготовленный Борисом Ореховым. Это коллекция стихотворных текстов на немецком языке, созданных с помощью символьных рекуррентных нейронных сетей (многослойные LSTM).
Зачем публиковать сгенерированные тексты?
На первый взгляд, идея может показаться неочевидной, ведь компьютер может генерировать такие тексты бесконечно. Однако для исследователей, особенно в гуманитарных науках, этот датасет представляет практическую ценность. Получение готовых сгенерированных текстов “на лету” для старых моделей затруднено, они требуют настройки специализированного программного обеспечения, конкретных версий фреймворков глубокого обучения и технических навыков. Наличие же готового, структурированного набора данных открывает широкие возможности для анализа без необходимости преодолевать эти технические барьеры.
Как создавался датасет
Модели обучались на текстах четырех различных корпусов:
- Фридрих Гёльдерлин (415,516 знаков, 10,677 строк)
- Теодор Фонтане (365,360 знаков, 10,327 строк)
- Пауль Целан (267,521 знак, 9,757 строк)
- Гекзаметр (605,627 знаков, 12,516 строк) — извлечены из большой коллекции немецких стихов Томаса Хайдера.
Для каждого обучающего корпуса было обучено несколько моделей с разным количеством эпох и, соответственно, разными значениями функции потерь (loss). С каждой модели было сгенерировано по десять выборок длиной не менее 28,000 знаков каждая. Ключевым параметром генерации выступала температура — от 0.1 до 1.0 с шагом 0.1, что позволяет получить тексты с разной степенью “случайности” и отклонения от исходного стиля.
Состав и структура данных
Датасет включает в себя четыре основных каталога (по одному на каждого автора и гекзаметр), внутри которых сгенерированные тексты организованы по моделям и значениям температуры. Общий объем набора данных составляет около 819 КБ. Помимо самих текстов, в репозитории представлена мета-информация в формате TSV, а также модели, опубликованные на платформе Hugging Face.
Научный контекст
Генерация текстов в стиле Гёльдерлина была приурочена к 250-летию поэта в 2020 году. Результаты этой работы нашли отражение в публикациях, включая статью в журнале Orbis Litterarum (2020), где исследуются возможности нейросетевого анализа поэзии. Автор отмечает, что подобные датасеты открывают новые перспективы для исследований в области цифровых гуманитарных наук.
Цитирование
При использовании датасета в своих работах можно ссылаться на него следующим образом:
Orekhov, Boris. (2022). German Generated Poetic Texts (v1.0) [Data set]. Zenodo. https://doi.org/10.5281/zenodo.7114238
Ссылка на датасет: https://doi.org/10.5281/zenodo.7114238
Репозиторий проекта: https://github.com/nevmenandr/german-generated-poetic-texts
Датасет будет полезен исследователям в области цифровой поэтики, стилеметрии, а также всем, кто интересуется пересечением гуманитарных наук и искусственного интеллекта.
