Корпоративный голосовой ИИ получил полнодуплексные модели, способные говорить и слушать одновременно, но пока не достиг ChatGPT-момента естественного и надежного диалога. Такую оценку дали технический директор PolyAI Шон Вен и директор по маркетингу Otter Алекс Гей на конференции HumanX в прошлом месяце. Инвесторы вкладывают миллиарды долларов в разработчиков моделей, сервисы для клиентской поддержки, конспектчики встреч и диктовку, однако еженедельные релизы с обещанием человеческой речи на практике пока не дотягивают.

Голосовой ИИ пока не дождался своего ChatGPT-момента

Почему полнодуплексности мало для диалога

PolyAI развивает корпоративную голосовую платформу для клиентского сервиса, а Otter создает конспектчик встреч с транскрибацией и резюме. Вен заявил, что рубеж полнодуплексных моделей уже пройден, а следующая задача — очень быстрые рассуждения, чтобы модели быстро находили ответы. Гей назвал ключевым слоем для автоматизации распознавание спикеров, фиксацию намерений и связку транскрипта с корпоративными знаниями. Кроме того, Otter работает над цифровыми двойниками, которые смогут представлять людей на встречах.

Механика отставания связана с распознаванием и скоростью. Вен отметил, что модели ASR часто пропускают важные ключевые слова, из-за чего система теряет полный контекст. Гей согласился, что для Otter транскрибация никогда не была конечной целью, а была лишь основой для роста продуктивности и последующих действий. При недостаточной точности резюме и автоматические действия оказываются ошибочными, а одна неверная операция подрывает доверие к платформе. Поэтому быстрое извлечение ответов и точная транскрибация — обязательные условия для делегирования задач.

Обсуждение проходит на фоне активного финансирования голоса как следующего интерфейса. Капитал идет разработчикам моделей, поставщикам решений для контакт-центров, продуктам для заметок и стартапам диктовки, причем почти каждую неделю выходят релизы с человеческой манерой речи. Одновременно ассистенты по-прежнему неверно понимают пользователей, а конспектчики выдают ошибочные транскрипты и резюме. Именно разрыв между маркетинговыми обещаниями и операционной надежностью заставляет руководителей говорить о постепенном прогрессе, а не о трансформации.

Что это меняет для бизнеса

Для компаний, использующих голосовых агентов в сервисе и продажах, практическим тестом остаются первые два-три реплики звонка. По словам Вена, агенты не должны звучать механически и обязаны внушать звонящим уверенность в решении проблемы. Если качество голоса удерживает это начало, клиенты постепенно укрепляют доверие и могут перестать требовать перевода на человека. Такое изменение штата и маршрутизации возможно лишь при устойчивом решении без эскалации, поэтому крупные контакт-центры ощутят эффект раньше, а небольшие команды — после появления проверенных шаблонов.

Второе следствие касается встреч, записей и раскрытия информации. Гей сказал, что цифровым двойникам нужна та же эмоциональная выразительность, что и у человеческого обсуждения, иначе дебаты и стратегический разговор превратятся в чат-бот вопросов и ответов. Otter хочет уведомлять всех участников в чате о продолжении записи, даже если бот отсутствует, а Вен подчеркнул, что собеседники в корпоративных звонках должны знать о разговоре с ИИ. Поэтому покупателям стоит проверять точность ключевых слов, языковую поддержку, атрибуцию спикеров и настройки уведомлений до включения автономных действий.

Признаком перелома станет демонстрация быстрых рассуждений вместе с измеримой точностью транскрибации в живых внедрениях. Дополнительные сигналы — устойчивое удержание диалога после трех реплик в сервисных звонках, раскрытие ИИ-статуса и уведомления о записи на встречах. Если эти элементы сойдутся в платформах типа PolyAI и ассистентах типа Otter, голос перейдет из демонстраций в надежную бизнес-инфраструктуру.