ElevenLabs выпустила речевую модель Eleven v4, которая точнее выполняет режиссерские указания и сохраняет голос стабильным в длинных проектах. Вместе с ней вышел вариант v4 Turbo для голосовых агентов в реальном времени, который начинает говорить примерно через 150 миллисекунд. Для бизнеса это смягчает выбор между выразительностью голоса и скоростью ответа в клиентской автоматизации.
Режиссерские теги, стабильность и задержка Turbo
Eleven v4 надежнее предшественника передает смех, шепот и неречевые звуки, например хлопок двери. Модель Eleven v3, вышедшая чуть больше года назад, уже поддерживала такие звуковые теги, но следовала им менее точно. Пользователи могут задавать подачу тегами или обычными фразами, а произношение имен и терминов настраивать фонетическим написанием. Компания сообщает, что управление произношением стало работать надежнее.
Рассказчики и персонажи должны звучать одинаково на протяжении всего проекта, даже если отдельные реплики перегенерируют несколько раз. Один запрос обрабатывает до 10 000 символов, это примерно десять минут аудио, а длинные произведения вроде аудиокниг собираются из нескольких фрагментов с единым темпом на стыках. В диалогах ИИ-спикеры учитывают контекст всей сцены, а не произносят каждую реплику изолированно.
Модель поддерживает более 90 языков против примерно 70 в v3. Клонированные голоса должны говорить на других языках с родным акцентом и со временем не возвращаться к исходному акценту. Поддержка Professional Voice Clones вернулась после отсутствия в v3, а для Instant Voice Clone достаточно десяти секунд аудио. ElevenLabs лицензирует голоса у их владельцев, включая голоса знаменитостей, например Michael Caine, через отдельный marketplace.
Что это меняет для покупателей голосовой автоматизации
Для компаний, использующих звонки поддержки, продажи и встроенных ассистентов, Turbo нацелен на сочетание выразительности и низкой задержки. ElevenLabs заявляет 150 миллисекунд до слышимой речи у Turbo против 262 миллисекунд у Cartesia Sonic 3.6 и 814 миллисекунд у OpenAI GPT-4o mini TTS. Turbo оптимизирован вместе с платформой ElevenAgents, обе модели доступны в ElevenAgents, ElevenCreative и через API. Небольшие команды быстрее запускают естественно звучащих агентов, а крупные контакт-центры могут тестировать выразительные голоса без отдельной потери в скорости.
Заявления о качестве перед закупкой стоит проверять независимо. Eleven v4 опережает Cartesia Sonic 3.6 и Google Gemini 3.8 Flash TTS в рейтинге Artificial Analysis Provider Voice Arena и набирает 91,7% в тесте произношения против 85,6% у v3. В слепых тестах самой компании около трех четвертей слушателей предпочли v4 моделям Cartesia, Inworld и Google. Покупателям стоит проверить на своих сценариях стабильность акцента, произношение отраслевых терминов и постоянство голоса после перегенерации строк.
Контрольной точкой станут цены после 12 октября. Стандартная цена API составляет $80 за миллион символов для v4 и $40 для Turbo, а до этой даты снижена до $22 и $11, тогда как Artificial Analysis указывает $49 для Sonic 3.6 и $16,49 для Gemini 3.8 Flash TTS. Пользователи тарифа Creator за $22 в месяц и выше могут две недели использовать v4 в ElevenCreative без доплаты, в пределах удвоенного объема месячных кредитов. Сохранение базовых тарифов покажет, как ElevenLabs оценивает качество на фоне более дешевых массовых альтернатив.
