whynotAI Lab

Hugging Face добавил хинди и индийский английский в Open ASR Leaderboard

Опубликовано Aug 31, 20262 мин чтенияНачальный

Что произошло

Hugging Face совместно с проектом Voice Arena представил первые наборы данных для оценки систем автоматического распознавания речи (ASR) на хинди и индийском английском. Эти языки стали первыми в Open ASR Leaderboard, которые представляют глобальный Юг — регионы за пределами Европы и Северной Америки.

Новые датасеты под названием Monsoon содержат:

  • 5.62 часа индийского английского (1444 говорящих)
  • 1.33 часа хинди (468 говорящих)
  • Плюс дополнительные приватные наборы для контроля за «подгонкой» под бенчмарк

Детали

Особенность новых данных — не в объёме записей, а в их разнообразии. Вместо длинных записей небольшого числа дикторов Monsoon содержит короткие фрагменты от тысяч разных людей:

  • География: записи из 428 округов Индии для английского и 202-295 для хинди
  • Устройства: использовано 315-582 разных моделей телефонов
  • Демография: сбалансированное представительство по полу, возрасту, доходу

Каждая запись сопровождается 18 параметрами метаданных — от образования говорящего до марки его телефона. Для хинди учтены разные орфографические варианты написания одних и тех же слов.

Как собирали данные

Участники записывали спонтанные диалоги на повседневные темы через специальное приложение, используя свои смартфоны. Это обеспечило естественное звучание речи с разным акцентом и в разных акустических условиях.

Почему это важно

Текущие системы ASR часто показывают разную точность для разных групп людей. Исследования выявляли:

  • Вдвое больше ошибок для чернокожих носителей английского
  • Заметные различия по возрасту, полу и акценту

Но стандартные бенчмарки не показывают эти различия — они дают лишь усреднённый показатель. Monsoon меняет ситуацию:

«Тестовый набор может выявить только те проблемы, вариации которых он сам содержит. Большинство бенчмарков собирают из того аудио, что было под рукой»

Новые данные позволяют увидеть, как модель работает для:

  • Жителей разных регионов
  • Людей разного возраста и пола
  • Пользователей дешёвых и дорогих телефонов
  • Речи с разным темпом и в разных акустических условиях

Уже первые тесты показали: модели с почти одинаковым средним WER могут сильно различаться в точности для разных групп. Например, одна система делала в 1.5 раза больше ошибок для носителей из восточных регионов Индии по сравнению с центральными.

Что дальше

Добавление хинди и индийского английского — только начало. Подход Voice Arena и Hugging Face задаёт новый стандарт для оценки ASR-систем:

  1. Акцент на разнообразии, а не только на объёме данных
  2. Прозрачность метаданных для анализа работы моделей в разных условиях
  3. Включение языков, на которых говорят сотни миллионов людей, но которые мало представлены в технологиях

В перспективе это может привести к появлению более адаптивных и справедливых систем распознавания речи, одинаково хорошо работающих для разных групп пользователей.

Это разбор
Самостоятельный разбор новости. Оригинал на huggingface.co — по ссылке ниже.

Источники

Белая ракета с лаймовым огнём

Научись использовать Claude и Codex в своих проектах и бизнесе и стань в 10 раз эффективнее

Без опыта и без кода. Первого агента соберёшь за вечер, дальше он работает на тебя: клиенты, продажи, рутина.

Было полезно?