Что произошло
Google анонсировала Gemini 3.5 Transcribe — новую модель для транскрибации речи, которая обещает быть самой точной и интеллектуальной среди существующих решений. Модель предназначена для работы в реальном времени и способна справляться с шумом, сложной терминологией и речевыми ошибками.
Детали
Gemini 3.5 Transcribe доступна через два API:
- Real-time streaming: Обеспечивает потоковую транскрибацию с задержкой менее секунды.
- Pre-recorded audio processing: Обрабатывает заранее записанные аудиофайлы, добавляя метки времени и идентификацию говорящих.
Модель поддерживает более 85 языков, автоматически распознает региональные акценты и диалекты. Она также умеет удалять слова-паразиты (например, "эээ" и "ммм") и адаптироваться к специализированной лексике.
"Gemini 3.5 Transcribe преобразует сырое аудио напрямую в точный, отформатированный текст."
Почему это важно
Gemini 3.5 Transcribe может стать полезным инструментом для разработчиков, создающих голосовые интерфейсы, инструменты для транскрибации встреч или анализа аудио. Модель уже интегрирована в продукты Google, такие как Gemini app и Android, где она используется для новых функций, таких как "Rambler".
Что дальше
Модель будет доступна в публичной превью через Google AI Studio и Gemini Enterprise Agent Platform. В будущем ожидается интеграция с Chrome, что позволит пользователям диктовать текст прямо в веб-полях.
Gemini 3.5 Transcribe уже доступна через API в Google AI Studio и Google Antigravity.
Источники
- Оригинал: blog.google — © blog.google
