Что произошло
Hugging Face совместно с проектом Voice Arena представил первые наборы данных для оценки систем автоматического распознавания речи (ASR) на хинди и индийском английском. Эти языки стали первыми в Open ASR Leaderboard, которые представляют глобальный Юг — регионы за пределами Европы и Северной Америки.
Новые датасеты под названием Monsoon содержат:
- 5.62 часа индийского английского (1444 говорящих)
- 1.33 часа хинди (468 говорящих)
- Плюс дополнительные приватные наборы для контроля за «подгонкой» под бенчмарк
Детали
Особенность новых данных — не в объёме записей, а в их разнообразии. Вместо длинных записей небольшого числа дикторов Monsoon содержит короткие фрагменты от тысяч разных людей:
- География: записи из 428 округов Индии для английского и 202-295 для хинди
- Устройства: использовано 315-582 разных моделей телефонов
- Демография: сбалансированное представительство по полу, возрасту, доходу
Каждая запись сопровождается 18 параметрами метаданных — от образования говорящего до марки его телефона. Для хинди учтены разные орфографические варианты написания одних и тех же слов.
Участники записывали спонтанные диалоги на повседневные темы через специальное приложение, используя свои смартфоны. Это обеспечило естественное звучание речи с разным акцентом и в разных акустических условиях.
Почему это важно
Текущие системы ASR часто показывают разную точность для разных групп людей. Исследования выявляли:
- Вдвое больше ошибок для чернокожих носителей английского
- Заметные различия по возрасту, полу и акценту
Но стандартные бенчмарки не показывают эти различия — они дают лишь усреднённый показатель. Monsoon меняет ситуацию:
«Тестовый набор может выявить только те проблемы, вариации которых он сам содержит. Большинство бенчмарков собирают из того аудио, что было под рукой»
Новые данные позволяют увидеть, как модель работает для:
- Жителей разных регионов
- Людей разного возраста и пола
- Пользователей дешёвых и дорогих телефонов
- Речи с разным темпом и в разных акустических условиях
Уже первые тесты показали: модели с почти одинаковым средним WER могут сильно различаться в точности для разных групп. Например, одна система делала в 1.5 раза больше ошибок для носителей из восточных регионов Индии по сравнению с центральными.
Что дальше
Добавление хинди и индийского английского — только начало. Подход Voice Arena и Hugging Face задаёт новый стандарт для оценки ASR-систем:
- Акцент на разнообразии, а не только на объёме данных
- Прозрачность метаданных для анализа работы моделей в разных условиях
- Включение языков, на которых говорят сотни миллионов людей, но которые мало представлены в технологиях
В перспективе это может привести к появлению более адаптивных и справедливых систем распознавания речи, одинаково хорошо работающих для разных групп пользователей.
Источники
- Оригинал: huggingface.co — © huggingface.co
