Голосовой ИИ пока не достиг переломного момента уровня ChatGPT
Руководители PolyAI и Otter считают, что голосовым ИИ еще предстоит научиться быстрее рассуждать, точнее понимать пользователей и поддерживать естественное общение
Один основной источник · Как мы проверяем новости

Что произошло
Интерес к голосовому ИИ как к следующему крупному интерфейсу растет, а каждую неделю появляются новые модели и инструменты, обещающие человеческое звучание и естественный диалог. Однако на практике эти системы пока не всегда соответствуют заявленным возможностям.
Shawn Wen из PolyAI отметил, что индустрия уже достигла этапа создания моделей, которые могут говорить, одновременно слушая собеседника. Но голосовому ИИ еще нужно научиться быстро рассуждать и выдавать ответы без заметных задержек.
Какие проблемы остаются
В клиентском обслуживании голосовые агенты не должны звучать роботизированно. Им также нужно вызывать у пользователей достаточно доверия, чтобы те были готовы продолжать разговор и обращаться к системе вместо человека, если она действительно решает их проблему.
Alex Gay из Otter считает важным, чтобы системы корректно определяли участников встречи, понимали намерения и связывали расшифровку с корпоративными знаниями. Otter также работает над цифровыми двойниками, которые могут представлять людей на встречах.
Для таких цифровых двойников, по словам Gay, важна передача эмоциональных оттенков человеческой речи. Без возможности вести спор, обсуждать стратегические вопросы и поддерживать ощущение отношений цифровой аватар рискует остаться лишь чат-ботом с вопросами и ответами.
Почему это важно
Улучшение моделей голосового ИИ пока не устранило базовые ошибки: голосовые помощники могут неправильно понимать пользователей, а сервисы для заметок — выдавать неверную расшифровку или сводку встречи. Это ограничивает надежность технологии в клиентском обслуживании и корпоративной работе.
Источники
Один основной источник. Как мы проверяем новости


