whynotAI Lab

Gemini 3.5 Transcribe: новая модель для транскрибации

Опубликовано Aug 28, 20261 мин чтенияНачальный

Что произошло

Google анонсировала Gemini 3.5 Transcribe — новую модель для транскрибации речи, которая обещает быть самой точной и интеллектуальной среди существующих решений. Модель предназначена для работы в реальном времени и способна справляться с шумом, сложной терминологией и речевыми ошибками.

Детали

Gemini 3.5 Transcribe доступна через два API:

  • Real-time streaming: Обеспечивает потоковую транскрибацию с задержкой менее секунды.
  • Pre-recorded audio processing: Обрабатывает заранее записанные аудиофайлы, добавляя метки времени и идентификацию говорящих.

Модель поддерживает более 85 языков, автоматически распознает региональные акценты и диалекты. Она также умеет удалять слова-паразиты (например, "эээ" и "ммм") и адаптироваться к специализированной лексике.

"Gemini 3.5 Transcribe преобразует сырое аудио напрямую в точный, отформатированный текст."

Почему это важно

Gemini 3.5 Transcribe может стать полезным инструментом для разработчиков, создающих голосовые интерфейсы, инструменты для транскрибации встреч или анализа аудио. Модель уже интегрирована в продукты Google, такие как Gemini app и Android, где она используется для новых функций, таких как "Rambler".

Что дальше

Модель будет доступна в публичной превью через Google AI Studio и Gemini Enterprise Agent Platform. В будущем ожидается интеграция с Chrome, что позволит пользователям диктовать текст прямо в веб-полях.

Для разработчиков

Gemini 3.5 Transcribe уже доступна через API в Google AI Studio и Google Antigravity.

Это разбор
Самостоятельный разбор новости. Оригинал на blog.google — по ссылке ниже.

Источники

Белая ракета с лаймовым огнём

Научись использовать Claude и Codex в своих проектах и бизнесе и стань в 10 раз эффективнее

Без опыта и без кода. Первого агента соберёшь за вечер, дальше он работает на тебя: клиенты, продажи, рутина.

Было полезно?