GPT-Live-1
Голосовая модель для API, которая умеет говорить и слушать собеседника одновременно.

Знакомая сцена: вы пытаетесь перебить голосового бота, а он монотонно дочитывает длинный ответ, будто вас рядом нет. Классическая цепочка из распознавания речи, языкового ядра и синтезатора постоянно спотыкается о задержки и паузы. OpenAI открыла в API модель GPT-Live-1, убрав эту связку: одна архитектура одновременно слушает входящий звук и выдает голос, работая в полноценном дуплексном режиме.
Что умеет
- Естественно реагировать на перебивания. Модель моментально подстраивается под смену темы, смех или короткие реплики прямо посреди своей фразы.
- Игнорировать посторонний шум. Ассистент не сбивается из-за чужих голосов рядом, уличного гула или паузы на раздумья, не озвучивая лишние технические шаги.
- Делегировать тяжелую логику. Пока голосовой интерфейс поддерживает контакт, фоновые вычисления и вызовы инструментов можно передавать внешним моделям вроде Astra, Codex или Luna.
- Настраивать интонации. Скорость речи, характер и стиль общения задаются разработчиком через системный промпт.
- Работать с телефонией и длинными сессиями. Держит контекст в затяжных беседах и разворачивается на телефонных линиях.
- Отдавать расшифровку. Нативно предоставляет текстовые транскрипты ASR, понимает буквенно-цифровые конструкции и поддерживает приоритет ключевых слов.
- Говорить с акцентами. Каталог голосов расширили вариантами с разными диалектами и акцентами, включая австралийский английский.
Цены и доступ
Модель открыта в API. Голосовой слой интерфейса стоит 0,05 доллара за минуту разговора, а кастомные голоса подключаются через запрос в отдел продаж.
Нас подкупило, как чисто модель разделяет роли: сама держит живой темп диалога, а вычисления оставляет бэкенду. Для интерактивных витрин, выставочных инсталляций и голосовых сервисов это готовый способ сделать диалог человечным, избавившись от раздражающих пауз.


