Сбер открыл исходный код моделей распознавания речи GigaAM Multilingual и GigaChat Audio, при этом статьи с описанием архитектуры уже приняты на международную конференцию Interspeech. Публикация исследований на профильной площадке такого уровня фиксирует техническую состоятельность выбранного подхода перед глобальным сообществом разработчиков.
Релиз направлен на устранение системных проблем открытых решений Speech AI, среди которых выделяется слабая поддержка языков стран СНГ и деградация качества транскрибации на длинных аудиозаписях. Модель GigaAM Multilingual представляет собой стек для работы с русским, казахским, киргизским, узбекским и английским языками, который структурно состоит из базового аудиоэнкодера и CTC ASR.
Аудиоэнкодер проходил предварительное обучение на массиве данных из двух миллионов часов речи на семидесяти языках, что в результате обеспечивает высокую скорость его адаптации к новым акустическим условиям. Подобная архитектура позволяет нивелировать разрыв в точности распознавания между широко распространенными и менее представленными в цифровой среде языковыми группами.
Поделиться:
Кинематографичный саспенс в сумеречной живописи Арона Визенфельда
Выпуск псевдоготического шрифта Backslanted Blackletter в рамках исследования обратного наклона