Голосовой ИИ ещё не пережил свой «момент ChatGPT», считают руководители отрасли
Руководители PolyAI и Otter считают, что голосовой ИИ, несмотря на появление полнодуплексных моделей, пока не достиг своего «момента ChatGPT». Главные задачи — быстрое рассуждение, точное распознавание речи и прозрачность.

Инвесторы вложили миллиарды долларов в стартапы, занимающиеся голосовым искусственным интеллектом (ИИ): от разработчиков моделей и платформ для клиентского сервиса до приложений для записи встреч и диктовки. Тем не менее двое руководителей отрасли полагают, что технология ещё не достигла перелома, подобного тому, который ChatGPT совершил для текстового ИИ.
На конференции HumanX в прошлом месяце технический директор PolyAI, платформы голосового ИИ для клиентского обслуживания компаний, Шон Вэнь (Shawn Wen) заявил, что отрасль достигла рубежа в создании полнодуплексных моделей, способных говорить и одновременно слушать собеседника. По его мнению, следующая задача — обеспечить очень быстрое рассуждение, чтобы модели оперативно находили ответы, а разговор казался естественным.
Доверие в клиентском сервисе
Вэнь подчеркнул, что ИИ-агенты в службе поддержки не должны звучать роботизированно и должны внушать звонящим уверенность, что их проблему можно решить. По его словам, когда голос достаточно хорош и клиент готов общаться первые две-три реплики, начинает формироваться доверие, и со временем люди понимают, что обращаться к человеку, возможно, не нужно.
Директор по маркетингу сервиса для записи встреч Otter Алекс Гэй (Alex Gay) отметил, что определение говорящих, фиксация намерений и связывание их со знаниями организации — важный шаг к автоматизации. Компания также работает над цифровыми двойниками, которые могли бы представлять людей на встречах. Для этого, по словам Гэя, голос должен передавать те же эмоции, что и человек, иначе это лишь чат-бот для вопросов и ответов.
Точность распознавания и прозрачность
Вэнь считает, что модели автоматического распознавания речи (ASR) часто пропускают важные ключевые слова, из-за чего теряется контекст. Гэй согласился: Otter продолжает улучшать транскрибацию, так как ошибки делают все последующие действия ошибочными и подрывают доверие к платформе. Он также назвал язык областью, где голосовым моделям нужно совершенствоваться.
Оба руководителя затронули и тему прозрачности: клиентов нужно предупреждать о записи разговора или о том, что они общаются с ИИ. Otter хочет применять это и на встречах, где нет его бота, например уведомляя участников в чате о ведущейся записи.
