В пресс-службе Сбербанка объявили о завершении масштабного проекта по воссозданию неоконченного произведения Николая Гоголя. С помощью нейросети ГигаЧат специалистам удалось дописать второй том легендарного романа, получивший название Мертвые души. Второй том. Возрождение.
Работа над этим литературным воплощением длилась более года. В процессе создания текста объединили усилия инженеры Сбера, лингвисты, историки и литературоведы. Чтобы обучить модель максимально точно имитировать стиль классика, разработчики использовали широкий массив данных: от полного собрания сочинений Николая Гоголя и его личных писем до черновиков, записных книжек и библейских текстов, а также трудов его современников.
Качество итогового материала проверялось по строгой методике, включающей 11 критериев. Эксперты анализировали синтаксическую структуру, лексический состав, использование гротеска, мастерство построения диалогов и наличие характерного авторского голоса. Кроме того, каждый отдельный эпизод проходил проверку на уникальность.
Представители Сбербанка подчеркивают, что итоговый результат не является прямой заменой подлинного Гоголя. Однако созданный текст функционирует в рамках правил, заложенных в гоголевском повествовании, что стало возможным только благодаря тесному взаимодействию человека и технологий искусственного интеллекта.
Книга уже поступила в продажу через интернет-магазины Читай-город и Буквоед. В ближайшее время издание можно будет найти на различных маркетплейсах и в Московском доме книги.
История оригинального произведения трагична: первый том был опубликован в 1842 году, а над вторым писатель работал долгие годы. Перед смертью, в феврале 1852 года, Николай Гоголь уничтожил основную часть рукописи. На сегодняшний день исследователям доступны лишь пять глав, существующие в разных редакциях и незавершенном виде.
Технологии ИИ уже демонстрируют успехи и в других классических текстах. Так, в марте технический директор компании Смарт Энджинс Дмитрий Николаев и филолог Николай Перцов из Института русского языка им. В.В. Виноградова РАН использовали нейросети для расшифровки черновиков Александра Пушкина к роману в стихах Евгений Онегин.
Для этой задачи программисты и филологи обучили две модели: одна имитировала процесс зачеркивания слов, а вторая училась отличать настоящие правки автора от случайных. Благодаря этому подходу удалось восстановить несколько нечитаемых ранее фрагментов. Например, выяснилось, что в описании рождения Онегина Пушкин изначально мог использовать эпитет патриархальный, а в восьмой главе слово таинственному было заменено на первоначальный вариант к погибельному древу.
