whynotAI Lab

Open TTS Leaderboard: оценка текста в речь и клонирования голоса

Опубликовано Oct 1, 20262 мин чтенияНачальный

Что произошло

Hugging Face запустил Open TTS Leaderboard — платформу для оценки мультиязычных моделей преобразования текста в речь (TTS) и клонирования голоса. Эта инициатива направлена на стандартизацию оценки моделей, которые ранее оценивались фрагментарно и без единого подхода.

Детали

Лидерборд использует три основные метрики:

  1. Разборчивость: измеряется через процент ошибок в словах (WER) или символах (CER) между исходным текстом и транскрипцией сгенерированного аудио.
  2. Скорость: оценивается через обратный коэффициент реального времени (RTFx) для пакетной обработки и время до первого аудио (TTFA) для потоковой обработки.
  3. Сходство голоса: вычисляется через косинусное сходство между эмбеддингами WavLM сгенерированного аудио и эталонного клипа.

Модели оцениваются на нескольких языках, включая английский, китайский, японский и корейский. Для китайского, японского и корейского языков используется CER, так как они основаны на символах.

Почему это важно

Текущие методы оценки TTS моделей, основанные на человеческих предпочтениях, не могут масштабироваться из-за большого количества выпускаемых моделей. Open TTS Leaderboard предлагает объективные метрики, которые позволяют быстро оценивать модели, сокращая время оценки с нескольких недель до нескольких часов.

Важно

Лидерборд не заменяет оценку на основе человеческих предпочтений, но помогает определить, какие модели стоит включить в такие оценки.

Что дальше

Hugging Face планирует открыть исходные коды скриптов для оценки, чтобы сообщество могло вносить свои предложения и улучшения. Это позволит сделать процесс оценки ещё более прозрачным и адаптированным под нужды пользователей.

«Цель Open TTS Leaderboard — не только успевать за стремительным развитием TTS моделей, но и быть сформированным сообществом».

Лидерборд уже включает несколько ведущих моделей, таких как Kokoro-82M, supertonic-3 и s2-pro, которые показывают высокие результаты по разборчивости и скорости обработки. Сообществу предлагается активно участвовать в оценке и голосовании за лучшие модели.

Это разбор
Самостоятельный разбор новости. Оригинал на huggingface.co — по ссылке ниже.

Источники

Белая ракета с лаймовым огнём

Научись использовать Claude и Codex в своих проектах и бизнесе и стань в 10 раз эффективнее

Без опыта и без кода. Первого агента соберёшь за вечер, дальше он работает на тебя: клиенты, продажи, рутина.

Было полезно?