AudioShake запустила The Refinery — систему, которая превращает смешанные записи в разделенные по голосам данные для обучения голосового ИИ. Она делит разговоры на синхронизированные дорожки отдельных спикеров и отделяет диалог от музыки и фонового шума. Компания сообщает о более чем 100 млн обработанных минут аудио и ранних внедрениях в ведущих ИИ-лабораториях. Для бизнеса это важно, поскольку существующие аудиоархивы могут стать учебным материалом без записи новых разговоров.

AudioShake выпустила The Refinery для разделения речи в ИИ-датасетах

Как The Refinery разделяет пересекающуюся речь

По данным анонса, The Refinery работает напрямую с готовыми записями и не требует исходных сессий или отдельно записанных дорожек. Когда два человека говорят одновременно, система стремится восстановить каждый голос отдельно, сохраняя временную структуру пересечения. Результат можно представить как синхронизированные дорожки: один спикер на одной дорожке, второй — на другой, а общее время показывает перебивания и короткие реплики. AudioShake заявляет, что система не генерирует и не реконструирует речь: разделенные голоса и частоты берутся из исходной записи.

Продукт сочетает разделение спикеров и диаризацию, и это разные операции. Диаризация определяет, когда активны разные говорящие, а разделение создает независимо используемые звуковые сигналы каждого голоса. AudioShake описывает базовую систему как акустическую, а не зависящую от языковой модели, и заявляет поддержку разных частот дискретизации и условий записи. The Refinery также оценивает результат по качеству и уверенности, разделяя правильное назначение голоса и чистоту разделения. Это позволяет сортировать крупные коллекции на пригодный, исправимый и неподходящий материал.

Запуск опирается на опыт AudioShake в музыке и медиопроизводстве, включая сведение, локализацию, анализ аудио и аудиовизуальный монтаж. На сайте компании среди клиентов указаны ESPN, Universal Music Group и Warner Bros. Studios, где разделение делает готовый микс полезным для другого производственного процесса. The Refinery переносит тот же принцип в разработку ИИ, дополняя его подготовкой датасетов из контента заказчиков и специализированными моделями под отдельные каталоги. Ранние версии год использовались в закрытых внедрениях, среди названных клиентов — Luel и Rime, а также неназванные лаборатории и маркетплейсы данных.

Что это меняет для разработки голосового ИИ

Для компаний, создающих голосовых помощников, транскрибацию и аналитику звонков, разделенные дорожки упрощают разметку, проверку и привязку транскрипта к спикеру. Команды могут отдельно оценивать личность говорящего, чистоту дорожки и точность транскрипта, а не рассматривать датасет как единый результат. Оценки качества направляют ручную проверку на сложные фрагменты, где тихий голос трудно отличить в общем разговоре. Небольшие компании получают структурированные диалоги без студийной записи, а крупные могут обрабатывать большие архивы через API или локальное внедрение.

У подхода есть ограничения, которые покупателям следует проверять на собственных записях. AudioShake сообщает об ошибке 9,17% concatenated minimum-permutation word error rate на LibriCSS против 37,75% у проверенного чекпоинта MERL TF-Locoformer в связке с Whisper large-v3, однако базовая модель тестировалась вне своего обучающего домена. Компания называет это сравнением готовых решений, а не доказательством превосходства архитектуры при равных условиях. Точность также снижается при длительных наложениях речи и росте числа спикеров, а более чистый корпус сам по себе не показывает, насколько улучшится разговорная модель.

Индикатором подтверждения тренда станут результаты репрезентативных пилотов: сохранение тихих голосов после разделения, точная синхронизация перебиваний и измеримый прирост качества целевого голосового приложения. Дальнейшие внедрения в ведущих лабораториях, на маркетплейсах данных и локальные развертывания для чувствительных записей подтвердят операционную ценность. Если такие кейсы появятся, архивы с очищенными правами станут более практичной основой для моделей, понимающих живую речь.