Искусственный интеллект
# общение

Революция в общении: Сбер готовит голосовой ИИ, способный вести диалог без пауз и перебиваний

Революция в общении: Сбер готовит голосовой ИИ, способный вести диалог без пауз и перебиваний
Сбербанк разрабатывает технологию «фулл-дуплекс» для создания более естественного голосового ИИ. Новая модель позволит искусственному интеллекту одновременно слушать и говорить, имитируя живой диалог без пауз.

Технология «фулл-дуплекс», позволяющая искусственному интеллекту одновременно воспринимать речь и генерировать собственную, находится в активной разработке у Сбербанка. Как сообщил в интервью РБК Сергей Марков, отвечающий за развитие ИИ-технологий в финансовой группе, новая модель стремится имитировать естественную телефонную беседу, где собеседники не ждут завершения фразы друг друга.

Существующий на данный момент стандарт работы голосовых помощников основан на последовательных процессах: система фиксирует окончание человеческой речи, обрабатывает данные и лишь после этого выдает реакцию. В основе текущих решений лежит цепочка из нескольких нейросетей, где каждая отвечает за свой этап — от распознавания звука до синтеза голоса. Марков подчеркнул, что принципиальное новшество «фулл-дуплекса» заключается в использовании единой модели. Такая архитектура позволяет ИИ не только непрерывно слушать, но и говорить, а при интеграции с видеоданными — полноценно видеть партнера по диалогу и синхронизировать движения цифрового аватара с контекстом беседы.

Глобальные игроки рынка уже представили подобные продукты: в 2024 году французский стартап Kyutai презентовал модель Moshi, а вслед за ними свои аналоги в рамках Live-режимов выпустили Google (Gemini Live) и OpenAI (GPT-Live). Главным достижением технологии стало радикальное снижение задержек: время реакции сократилось с многосекундных пауз до невероятных 160–320 миллисекунд, что сопоставимо с темпом живого человеческого общения.

На российском рынке подобные амбициозные проекты пока не афишируются. Несмотря на наличие у «Яндекса» инструмента Realtime API, который позволяет быстро отвечать и даже прерывать ассистента, Марков отмечает фундаментальную разницу. Решение от «Яндекса» все еще функционирует в режиме ожидания смены реплики, в то время как концепция «фулл-дуплекса» подразумевает непрерывный процесс аудирования даже в моменты собственной речи. Подробности о планах Сбера по внедрению первых прототипов и потенциальных сферах применения этой прорывной технологии читайте в материале РБК.

Видео для новости

Похожие новости