Сиэтлский стартап Nuance Labs, который строит AI-модели для общения лицом к лицу, закрыл ранний раунд на $50 млн. Series A возглавила Lightspeed Venture Partners, уже финансировавшая seed-раунд компании; Accel и South Park Commons вернулись, а Nvidia Corp. и Define Ventures вошли как новые инвесторы. Деньги пойдут на модель, которая позволяет аватару отвечать, пока человек ещё говорит, а не после паузы.
Что строит компания
Это второй чек Lightspeed для Nuance, и в списке инвесторов теперь есть производитель чипов, на оборудовании которого работает большинство AI-нагрузок. Сооснователь и генеральный директор Фанчан Ма, ранее исследователь AI в Apple Inc., говорит, что компания создаёт human foundation model, а не очередной слой поверх существующих чат-ботов. Команда опубликовала демо модели, которую Ма называет незавершённой. Продукт пока не выпущен: Nuance рассчитывает открыть первый research preview для публики позже в этом году, а новые средства ускорят разработку и оплатят наём дополнительных исследователей.
Существующие голосовые боты и аватары собираются из отдельных частей, рассказал Ма Business Insider: модель распознавания речи в текст, большая языковая модель, которая пишет ответ, и модель синтеза речи, превращающая его обратно в аудио. Каждая передача добавляет задержку, а аватару нужен четвёртый шаг — анимация лица под произносимые слова. Nuance вместо этого использует одну full-duplex систему: она принимает аудио и видео пользователя и одновременно отдаёт аудио и видео обратно. Модель считывает слова, взгляд, жесты, тон и тайминг и отвечает мимикой и голосом в реальном времени, обучаясь на том, как ведут себя люди во время разговора.
Неловкость, о которой говорит Ма, — известное ограничение текущего стека. Поскольку части работают последовательно, аватар, который слушает, никак не реагирует, и ощущение разговора с человеком пропадает. Ставка Nuance в том, что восприятие и ответ должны жить в одной модели, а не в конвейере. Компания называет целевыми сценариями продажи и клиентский сервис, коучинг, профессиональное обучение и образование, где выражение лица влияет на результат, — например, видеозвонок для практики языка или репетиции собеседования.
Что это значит для бизнеса
Для компаний, которые уже используют AI-агентов в поддержке или продажах, практическое изменение касается формы взаимодействия, а не оценок модели на бенчмарках. Система, реагирующая, пока клиент ещё говорит, может сократить звонок и убрать паузы, из-за которых голосовые боты кажутся механическими. Небольшие команды, покупающие готовые инструменты для аватаров, заметят это первыми в клиентских звонках; крупные организации будут сравнивать это с затратами на перестройку существующих конвейеров, где текстовый агент уже обрабатывает большинство запросов вообще без видео.
Новость не означает, что естественные аватары доступны уже сейчас. У Nuance нет продукта — только демо и заявленный план выпустить research preview позже в этом году, поэтому решение о внедрении зависит от этого релиза и от того, как модель поведёт себя вне контролируемых условий. Покупателям стоит спросить, как система работает с акцентами и плохим звуком, как обеспечивается приватность видеопотока и совместима ли она с существующим ПО контакт-центров. $50 млн финансируют исследования, а не график выпуска с датами.
Следить стоит за research preview, обещанным на конец этого года: если он откроется для сторонних разработчиков через API и выдержит реальные разговоры, подход full-duplex станет слоем, на котором будут строить другие, как ожидает Ннамди Ирегбулем из Lightspeed. Если preview сдвинется или останется закрытым, аватары по-прежнему будут конвейером из отдельных моделей, и описанная Ма задержка останется частью продукта.
