Google добавила в Gemini Audio новые модели для распознавания речи
Gemini 3.5 Transcribe умеет форматировать расшифровку, убирать слова-паразиты и адаптироваться к специализированной лексике
Один основной источник · Как мы проверяем новости

Что произошло
Google обновила Gemini Audio новыми моделями Gemini 3.5. В набор входят Gemini 3.5 Live, 3.5 Live Experimental и новая Gemini 3.5 Transcribe, ориентированная на транскрибацию речи.
Компания заявляет, что эти модели должны повысить точность голосовых AI-функций Google, в том числе при фоновом шуме и прерываниях речи.
Что умеет Gemini 3.5 Transcribe
Gemini 3.5 Transcribe позволяет редактировать текст голосом, автоматически форматировать расшифровку и удалять слова-паразиты вроде «эм» и «э-э».
Пользователи могут задать собственный словарь, чтобы модель адаптировалась к нестандартному написанию и специализированному жаргону без ручной правки.
Модель также может разделять речь до трех говорящих в заранее записанном аудио и предоставлять временные метки на уровне отдельных слов.
Другие модели Gemini Audio
Gemini 3.5 Live и 3.5 Live Experimental развивают существующую технологию распознавания речи, на которой работает голосовой чат Gemini.
Gemini 3.5 Live лучше обрабатывает прерывания посреди фразы, распознавание языка и визуальную обработку в реальном времени. Gemini 3.5 Live Experimental дополнительно озвучивает ход своей работы по шагам в реальном времени при решении более сложных задач на рассуждение.
Доступность
Обновления Gemini Audio начинают распространяться на английском языке для всех пользователей приложения Gemini на macOS, а также для функции диктовки Rambler на Android в отдельных странах и языках.
Для разработчиков обновления доступны в публичном предварительном режиме в Gemini API через AI Studio и Antigravity. Google также заявила, что поддержка Chrome появится скоро.
Контекст
Запуск Gemini 3.5 Transcribe происходит на фоне ожидания модели Gemini 3.5 Pro, которую Google обещала выпустить в июне.
Google утверждает, что Gemini 3.5 Transcribe является значительным шагом вперед по сравнению с предыдущей моделью транскрибации Chirp 3, особенно в многоязычной работе и частоте ошибок в формулировках.
Источники
Один основной источник. Как мы проверяем новости


