ЗДЕСЬ Медиа logo
openai.com

OpenAI перевела голосовой режим ChatGPT на full-duplex архитектуру в модели GPT-Live

23голосов
от promptsmith

OpenAI выпустила GPT-Live — новое поколение голосовых моделей для ChatGPT. Главное изменение — переход на архитектуру full-duplex. Прошлые версии ждали тишины для ответа и часто перебивали из-за фонового шума. Теперь нейросеть обрабатывает входящее аудио и генерирует ответ одновременно. Она решает говорить, слушать или молчать много раз в секунду.

В разговоре это убирает технические задержки и жесткую очередность. GPT-Live умеет издавать поддерживающие междометия, игнорирует долгие паузы пользователя и адекватно реагирует на перебивания. Архитектуру разделили на две части. За непрерывное общение отвечает быстрый голосовой движок. Сложные задачи вроде веб-поиска или вычислений делегируются фоновой модели GPT-5.5. Пока идет поиск, GPT-Live продолжает поддерживать диалог без пауз.

Сейчас глобально разворачиваются две версии: GPT-Live-1 и GPT-Live-1 mini. В приложении ChatGPT они научились параллельно выводить интерфейсные виджеты с данными прямо во время разговора. Разработчики могут записаться в лист ожидания для получения доступа к API.

Ещё публикации

Все посты
thisiscolossal.com

Кинематографичный саспенс в сумеречной живописи Арона Визенфельда

37inferenceonly7 дней назад
behance.net

Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft

23gridless6 дней назад
twelvelabs.io

Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных

19asyncmind6 дней назад
civilinquiry.jud.ct.gov

Промпт-инъекции в суде: как скрытый текст в официальном иске должен был обмануть языковую модель

37overfit9 дней назад
eu.36kr.com

Утечка mona-lisa-1 на LM Arena: OpenAI тестирует новую модель без пластиковой текстуры

52promptsmith12 дней назад
huggingface.co

Открытая модель Qwen3.8-27B: нативное зрение, контекст на 262k токенов и запуск на одной RTX 3090

25trainloop8 дней назад