Разработчик Джейми Пайн выпустил Voicebox — открытую десктопную ИИ-студию для работы с голосовым вводом и выводом. Платформа объединяет функции клонирования голоса по короткому аудиофрагменту, синтеза речи и глобальной диктовки текста, работая полностью локально на устройстве пользователя. Архитектура включает собственную языковую модель для постобработки текста и формирования персонажей, что исключает необходимость передачи данных на внешние серверы.
Система предоставляет доступ к семи движкам синтеза речи, среди которых Qwen3-TTS, Kokoro и HumeAI TADA, охватывающих 23 языка. Выбор движка определяет специфику генерации: например, модель Chatterbox Turbo способна интерпретировать паралингвистические теги вида [laugh] или [sigh], интегрируя неречевые звуки непосредственно в аудиопоток. Ограничения на длину исходного текста обходятся за счет автоматического разбиения на фрагменты с последующим наложением кроссфейда, что позволяет непрерывно озвучивать длинные статьи или главы аудиокниг.
Помимо базового синтеза, в приложение встроен многодорожечный редактор для сведения диалогов и система постобработки с эффектами реверберации, компрессии и изменения тона. Наличие встроенного сервера MCP и REST API позволяет интегрировать созданные профили в сторонние инструменты разработки, в результате чего ИИ-агенты вроде Claude Code или Cursor могут транслировать ответы синтезированным голосом. Клиент написан на Rust с использованием фреймворка Tauri и задействует аппаратное ускорение вычислений через Metal на macOS и CUDA на Windows.
Поделиться:
Студия Vantage открыла набор AI-художников и VFX-специалистов для коммерческих проектов
Локальная генерация видео требует компромиссов. Разбор GGUF-квантизаций MiniMax H3