РазноеплатноOpenAI

GPT-Live-1

Голосовая модель для API, которая умеет говорить и слушать собеседника одновременно.

Фото: OpenAI

Знакомая сцена: вы пытаетесь перебить голосового бота, а он монотонно дочитывает длинный ответ, будто вас рядом нет. Классическая цепочка из распознавания речи, языкового ядра и синтезатора постоянно спотыкается о задержки и паузы. OpenAI открыла в API модель GPT-Live-1, убрав эту связку: одна архитектура одновременно слушает входящий звук и выдает голос, работая в полноценном дуплексном режиме.

Что умеет

  • Естественно реагировать на перебивания. Модель моментально подстраивается под смену темы, смех или короткие реплики прямо посреди своей фразы.
  • Игнорировать посторонний шум. Ассистент не сбивается из-за чужих голосов рядом, уличного гула или паузы на раздумья, не озвучивая лишние технические шаги.
  • Делегировать тяжелую логику. Пока голосовой интерфейс поддерживает контакт, фоновые вычисления и вызовы инструментов можно передавать внешним моделям вроде Astra, Codex или Luna.
  • Настраивать интонации. Скорость речи, характер и стиль общения задаются разработчиком через системный промпт.
  • Работать с телефонией и длинными сессиями. Держит контекст в затяжных беседах и разворачивается на телефонных линиях.
  • Отдавать расшифровку. Нативно предоставляет текстовые транскрипты ASR, понимает буквенно-цифровые конструкции и поддерживает приоритет ключевых слов.
  • Говорить с акцентами. Каталог голосов расширили вариантами с разными диалектами и акцентами, включая австралийский английский.

Цены и доступ

Модель открыта в API. Голосовой слой интерфейса стоит 0,05 доллара за минуту разговора, а кастомные голоса подключаются через запрос в отдел продаж.

Нас подкупило, как чисто модель разделяет роли: сама держит живой темп диалога, а вычисления оставляет бэкенду. Для интерактивных витрин, выставочных инсталляций и голосовых сервисов это готовый способ сделать диалог человечным, избавившись от раздражающих пауз.

Сайт GPT-Live-1
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд