воскресенье, 11 октября 2026 г.
Rīga TV

Мировые и латвийские новости в одном месте

ТехнологииОпубликовано: 11 октября 2026 г. в 17:59

Голосовой ИИ ещё не пережил свой «момент ChatGPT», считают руководители отрасли

Руководители PolyAI и Otter считают, что голосовой ИИ, несмотря на появление полнодуплексных моделей, пока не достиг своего «момента ChatGPT». Главные задачи — быстрое рассуждение, точное распознавание речи и прозрачность.

Foto: TechCrunch

Инвесторы вложили миллиарды долларов в стартапы, занимающиеся голосовым искусственным интеллектом (ИИ): от разработчиков моделей и платформ для клиентского сервиса до приложений для записи встреч и диктовки. Тем не менее двое руководителей отрасли полагают, что технология ещё не достигла перелома, подобного тому, который ChatGPT совершил для текстового ИИ.

На конференции HumanX в прошлом месяце технический директор PolyAI, платформы голосового ИИ для клиентского обслуживания компаний, Шон Вэнь (Shawn Wen) заявил, что отрасль достигла рубежа в создании полнодуплексных моделей, способных говорить и одновременно слушать собеседника. По его мнению, следующая задача — обеспечить очень быстрое рассуждение, чтобы модели оперативно находили ответы, а разговор казался естественным.

Доверие в клиентском сервисе

Вэнь подчеркнул, что ИИ-агенты в службе поддержки не должны звучать роботизированно и должны внушать звонящим уверенность, что их проблему можно решить. По его словам, когда голос достаточно хорош и клиент готов общаться первые две-три реплики, начинает формироваться доверие, и со временем люди понимают, что обращаться к человеку, возможно, не нужно.

Директор по маркетингу сервиса для записи встреч Otter Алекс Гэй (Alex Gay) отметил, что определение говорящих, фиксация намерений и связывание их со знаниями организации — важный шаг к автоматизации. Компания также работает над цифровыми двойниками, которые могли бы представлять людей на встречах. Для этого, по словам Гэя, голос должен передавать те же эмоции, что и человек, иначе это лишь чат-бот для вопросов и ответов.

Точность распознавания и прозрачность

Вэнь считает, что модели автоматического распознавания речи (ASR) часто пропускают важные ключевые слова, из-за чего теряется контекст. Гэй согласился: Otter продолжает улучшать транскрибацию, так как ошибки делают все последующие действия ошибочными и подрывают доверие к платформе. Он также назвал язык областью, где голосовым моделям нужно совершенствоваться.

Оба руководителя затронули и тему прозрачности: клиентов нужно предупреждать о записи разговора или о том, что они общаются с ИИ. Otter хочет применять это и на встречах, где нет его бота, например уведомляя участников в чате о ведущейся записи.

Комментарии

0/1500

Комментарии модерируются автоматически. Запрещены ненависть, угрозы, личные данные и спам.

Загрузка комментариев…

Ещё в этой категории

Технологии

NASA выложила в сеть более 800 ГБ данных миссии Artemis II

Американское космическое агентство NASA опубликовало более 800 гигабайт изображений, видео, аудио и научных данных пилотируемой миссии Artemis II к Луне. В архиве есть снимки с пометками экипажа и запись сообщения о вспышках от ударов на обратной стороне Луны.

The Verge · 6 мин назад

Технологии

Как долго смартфоны Google Pixel будут получать обновления

Google гарантирует семь лет обновлений для Pixel 8 и более новых моделей и пять лет для более старых. Срок поддержки отсчитывается с месяца, когда телефон поступил в продажу в магазине Google в США.

Engadget · 6 мин назад

Технологии

Почему стоит делать резервные копии данных со старых USB-флешек

Технологическое издание Engadget объясняет, почему файлы со старых USB-флешек стоит копировать в другое место: им угрожают физические повреждения, потеря и порча данных. Рекомендуется правило резервного копирования 3-2-1.

Engadget · 1 ч назад