Google вывела на облачную платформу две новые модели синтеза речи — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS заняли первое и второе места в тесте качества звука от Hume AI. Модели поддерживают 130 и 101 язык соответственно и используют общую библиотеку из более чем 2 000 готовых голосов. Для бизнеса это важно, поскольку выразительный синтез речи превращается из экспериментальной функции в рабочий канал контента и взаимодействия с клиентами.
Две модели с общим интерфейсом и разными ролями
Обе модели используют очень похожие программные интерфейсы, поэтому разработчики могут запускать их параллельно без перестройки логики интеграции. Flash-Lite TTS рассчитана на экономичность и скорость вывода, а Flash TTS обменивает более высокую цену на лучшее качество звука. Google называет создание аудиокниг естественным применением более качественного варианта. Разрыв в охвате заметен уже на старте: 130 языков у Flash TTS против 101 у Flash-Lite TTS. Такое разделение задает выбор между качеством и охватом с одной стороны и пропускной способностью и затратами с другой.
Дизайн голоса начинается с общей библиотеки из более чем 2 000 готовых голосов, которые настраиваются текстовыми запросами на тембр, акцент и темп. Второй путь строит синтетический голос по 30-секундному образцу аудио, причем Google требует согласия диктора перед созданием копии. Третий путь пока только заявлен: создание нового голоса путем изменения готового варианта. Подачу тоже можно задавать построчно с помощью ораторских подсказок, которые управляют нелексическими вокализациями и сменами темпа.
На тесте качества звука Hume AI модель Flash TTS заняла первое место, а Flash-Lite TTS — второе. Обе модели также обошли конкурирующие системы в нескольких языковых версиях Voice Arena, где качество оценивается по отзывам людей. Сотрудники Google Leland Rechis и Alan Cowen связали модели с более богатым звуком для авторов и корпораций, включая применение в Gemini Notebook и Google Vids. Выпуск расширяет существующую линейку аудио для голосовых агентов, транскрибации и перевода.
Что это меняет для голосовых проектов бизнеса
Для операционных команд практический эффект — двухуровневая поставка синтетической речи внутри одной облачной экосистемы. Небольшая компания может держать массовые подсказки и черновую озвучку на Flash-Lite TTS и переносить на Flash TTS только клиентские материалы, где голос влияет на удержание. Крупное издательство может стандартизировать аудиокниги на более качественной модели, оставив вспомогательный контент на облегченной. Поскольку интерфейсы совпадают, распределение по типам контента обходится без отдельных контрактов с вендорами и параллельных конвейеров.
Google раскрывает обмен качества на цену, но не дает ценовых значений, поэтому экономику длинных аудио придется считать по тарифам облака. Согласие на реплики голоса по 30-секундным образцам и согласование клонированных голосов требуют регламентов до внедрения. Вывод содержит неслышимый водяной знак SynthID, распознаваемый инструментами ИИ, плюс запись C2PA с указанием времени создания файла и фактов изменения. Покупателям стоит проверять целевые языки на собственных сценариях, поскольку лидерство в тестах не гарантирует равных результатов на специальной терминологии.
Конкретным маркером станет выход обещанной третьей опции настройки через изменение готовых голосов, а также сохранение позиций обеих моделей в рейтингах Hume AI и Voice Arena. Если опция редактирования выйдет и корпоративный контент появится в Gemini Notebook и Google Vids на этих голосах, линейка перейдет от успеха в тестах к обычному промышленному использованию. Такое сочетание подтвердит спрос за пределами тестирования.
