Microsoft расширил семейство MAI тремя голосовыми моделями для агентов, которые слушают и отвечают без длинных пауз. Центральный выпуск — это MAI-Transcribe-2-Streaming по цене 54 цента за час аудио, который выдает первые гипотезы транскрипта в среднем за 320 миллисекунд. Модель поддерживает более 60 языков с автоматическим определением языка говорящего. Для бизнеса это важно, поскольку живая транскрибация позволяет агенту показывать субтитры или начинать работу до конца фразы клиента.

Microsoft выпустил потоковую транскрибацию и голосовые модели для агентов

Потоковая транскрибация и две речевые модели

MAI-Transcribe-2-Streaming принимает речь через WebSocket и непрерывно обновляет транскрипт, пока продолжает поступать аудио. Когда говорящий останавливается, модель помечает транскрипт как окончательный, что подходит для живых субтитров и ранней обработки запроса. Microsoft разместил модель на Vercel AI Gateway, где опубликованы цена и языковое покрытие. Компания предупреждает, что фактическая скорость ответа зависит также от сетевого соединения и системы генерации ответа. Эта оговорка важна для контакт-центров и приложений с разной инфраструктурой.

Конвейер транскрибации отличается от пакетной обработки тем, что возвращает предварительные результаты во время речи, а не ждет паузы. В прошлом месяце Microsoft представил MAI-Transcribe-2 за 10 центов за час аудио, что более чем в пять раз дешевле потокового варианта. Разница в цене отражает дополнительные вычисления для непрерывного обновления, пока аудио еще поступает. Прежний подход начинается только после конца высказывания, что снижает затраты, но добавляет ожидание. Поэтому разработчики выбирают между низкой стоимостью транскрибации и быстрым ведением диалога.

Два сопутствующих выпуска закрывают сторону генерации ответа голосового агента. MAI-Voice-2.1 рассчитан на более выразительную речь с высокой точностью, а MAI-Voice-2.1-Flash уступает в выразительности ради более быстрого ответа и низкой цены. На Vercel AI Gateway MAI-Voice-2.1 стоит $22 за миллион символов, а версия Flash — $15 за миллион символов. Обе модели синтеза речи поддерживают 23 языка. Microsoft выстраивает трио вокруг рассуждающей модели Mai-Thinking-1, которая читает транскрипты и определяет следующее действие агента.

Что это меняет для компаний с голосовыми агентами

Для компаний с линиями поддержки, ассистентами бронирования или голосовым управлением в приложении стек разделяет три настройки: качество распознавания, рассуждение и голосовой вывод. Команда может оставить потоковую транскрибацию ради отзывчивости, выбрав голос Flash для сдерживания затрат на символы, либо взять более точный голос для премиальных клиентских сценариев. Языковое покрытие влияет на запуск: более 60 языков на входе против 23 на выходе означает, что на части рынков понимание появится раньше естественных ответов. Небольшие пилоты могут начать с одного языка и голоса, а крупные операции — комбинировать модели по задачам.

Решения о затратах и задержках нужно проверять на реальном трафике, а не только по прайсу. Потоковая транскрибация стоит 54 цента за час аудио против 10 центов за пакетную, поэтому массовая запись без нужды в мгновенной реакции может остаться на пакетной модели. Голосовой вывод оплачивается за миллион символов, из-за чего длинные подтверждения, дисклеймеры и повторы обходятся дороже коротких ответов. Покупателям следует спросить поставщиков, как стабильность WebSocket, ошибки автоопределения языка и задержки downstream-модели влияют на показатель 320 миллисекунд. Сама новость не гарантирует естественный диалог в любой сетевой среде.

Практическим маркером станет перевод агентов Copilot в Excel, Outlook и смежных продуктах на модели MAI. Глава Microsoft AI Мустафа Сулейман связал развитие MAI со снижением платежей Anthropic и OpenAI, несмотря на инвестиции Microsoft в обе компании. Переход флагманских ассистентов на внутреннюю транскрибацию, рассуждение и голос станет сигналом уверенности в качестве и юнит-экономике. До этого момента внешние разработчики дадут раннюю проверку надежности в масштабе.