DeepL научил голосовой переводчик сохранять тембр и интонации говорящего

Когда переводчик в Zoom говорит голосом Siri, разговор с иностранным партнёром звучит как разговор с роботом, даже если слова переведены безупречно. DeepL решила зайти с другой стороны: важны не одни слова — важно и то, как их произносят.
Компания выпустила новые голосовые модели для DeepL Voice, которые сохраняют тембр, темп и интонацию каждого говорящего при переводе речи в реальном времени. Раньше все переведённые реплики звучали одним и тем же синтетическим голосом — теперь даже в разговоре с несколькими участниками каждый остаётся узнаваем. Вопрос по-прежнему звучит как вопрос, воодушевление — как воодушевление, а сомнение или срочность не теряются в переводе.
По данным независимого тестирования агентства Slator, DeepL Voice ошибается в переводе в 4% случаев — против 17% в среднем у встроенных переводчиков Microsoft Teams, Google Meet и Zoom. Разрыв большой, и он объясняет, почему компания вообще взялась за следующий слой качества — не точность, а живость звучания.
Технически всё происходит без записи образцов голоса и без создания голосовых профилей — DeepL подчёркивает, что данные не сохраняются для повторного использования, и это скорее забота о доверии корпоративных клиентов, чем техническая деталь. Сохранение голоса пока работает для 12 языков, список обещают расширять.
Вместе с моделями вышло второе важное обновление — единое десктопное приложение для Windows и Mac, которое работает поверх Zoom, Microsoft Teams и Google Meet сразу, без привязки к одной платформе. Оно само распознаёт начало встречи и включает перевод в один клик — что удобно, если утренний созвон идёт в Teams, обед с клиентом — в Zoom, а вечером партнёры присылают ссылку на Google Meet. Пользователь сам решает, как воспринимать перевод: читать субтитры в полупрозрачном оверлее, слушать голосовой перевод или переключаться между двумя режимами на ходу.
Перевод «голос в голос» для онлайн-встреч через десктопное приложение теперь доступен всем пользователям — до этого в таком режиме DeepL Voice работал только для очных разговоров и через API. Для внешних участников встречи без установленного приложения похожая функция в браузере пока остаётся в бета-версии.
Идея, что за переведёнными словами должен угадываться живой человек, а не голый смысл, звучит очевидно — ровно до тех пор, пока не попробуешь любой другой голосовой переводчик и не услышишь ту самую усталую механическую монотонность. DeepL, судя по всему, ставит на то, что деловые встречи станут куда менее неловкими, если акцент и эмоции долетают до собеседника вместе со словами.


