Новость

Google представила Gemini 3.5 Transcribe: распознавание речи с ошибкой в 2,6%

Фото: Google

«Давай встретимся во вторник — нет, в среду» — фразу с самоисправлением обычная программа распознавания речи запишет буквально, с оговоркой и всем остальным мусором. Новая модель Google, Gemini 3.5 Transcribe, должна такие правки вычищать сама и сразу выдавать чистый, отформатированный текст.

Точность на потоковом распознавании — 4% ошибок на слово, при работе с уже записанным звуком — 2,6%: цифры получены независимой Artificial Analysis. Модель уверенно справляется с шумом, специфическим жаргоном и такими вещами, как индекс или номер заказа, произнесённые вслух буквами и цифрами. Она также понимает больше 85 языков, распознаёт региональные акценты и диалекты, а в записях с несколькими говорящими умеет расставлять реплики по спикерам с таймкодами — пока уверенно для троих участников разговора, для большего числа — экспериментально.

Разработчикам модель доступна через два разных API: для потокового распознавания с задержкой меньше секунды — через Live API, для расшифровки уже готовых записей, звонков и совещаний — через Interactions API с привязкой реплик к говорящим. Модель также умеет делегировать сложные задачи — например, генерацию изображения или анализ файла — другим моделям Gemini через вызов функций; пока это доступно в приложении Gemini для macOS.

Уже работает без API

Часть возможностей уже добралась до обычных пользователей. Функция Rambler в Gboard на Android превращает устную речь в чистый форматированный текст, убирая слова-паразиты, — голосом можно даже вносить правки и менять стиль написанного. В Google Antigravity модель учитывает контекст экрана и историю переписки, чтобы точнее распознавать имена файлов и техническую терминологию. В Google AI Studio с её помощью можно писать код голосом прямо в режиме сборки приложений. А в приложении Gemini для macOS модель не просто расшифровывает речь, а исполняет голосовые команды с учётом того, что происходит на экране — суммирует локальные файлы, перекладывает текст между приложениями или генерирует картинку прямо в месте курсора.

По сравнению с предыдущей моделью Chirp 3 время до финальной расшифровки сократилось на 70%. В Chrome голосовой ввод текста в любое веб-поле обещают в ближайшее время — то есть диктовать ответы и черновики постов можно будет прямо в браузере, без сторонних расширений.

Для разработчиков голосовых интерфейсов — таких платформ, как Agora, LiveKit, Pipecat или LangChain, — модель уже доступна через Live API. Это тот случай в ИИ-гонке, когда прогресс измеряется не эффектным демо, а тем, насколько меньше раздражения вызывает диктовка сообщения на бегу.

Фото: Google

Ещё новости

Все новости →