Новость

GPT-Live-1 научилась слушать и говорить одновременно — и вышла в открытый API

Фото: OpenAI

Языковой репетитор сервиса Speak начал давать ученикам паузу подумать вместо того, чтобы перебивать их через полсекунды молчания. Причина простая: голосовую часть сервиса пересадили на новую модель OpenAI GPT-Live-1, которая слушает и говорит одновременно, а не по очереди, — и количество перебиваний во время пауз на раздумье упало почти на 80%.

До сих пор голосовые ассистенты в большинстве продуктов собирали из трёх кусков: распознавание речи, языковая модель для ответа и синтез голоса обратно в звук. Каждая передача между этими кусками добавляла задержку и создавала риск потерять контекст или естественный ритм разговора, а разбираться с этим приходилось разработчикам вручную. GPT-Live-1, ранее доступная только в ChatGPT, теперь открыта в API и объединяет слушание и говорение в одну модель, которая распознаёт паузу, смех, самоперебивку или смену темы прямо по ходу разговора.

При этом глубокие рассуждения и вызовы инструментов модель делегирует текстовому движку на усмотрение разработчика — например, простые задачи вроде записи на приём можно отдать более дешёвой модели, а сложный клиентский случай передать на Astra. Разработчики управляют тоном, темпом и манерой речи ассистента прямо через системный промпт, а модель сама справляется с фоновым шумом и паузами, не комментируя вслух каждое своё действие.

Первые клиенты уже отчитались о результатах. Yelp подключила GPT-Live-1 к сервисам Host и Hatch, которые принимают звонки на бронирование и заказ еды, — и заметила, что звонящие стали формулировать более полные, естественные фразы, а обработка звонков заметно ускорилась. Компания Fin отметила, что голос модели звучит как реальный телефонный разговор, а не диалог по сценарию «вопрос-ответ». Один из клиентов в здравоохранении, сооснователь и технический директор своей компании Тони Стоянов, рассказал, что переход с прежней каскадной архитектуры на GPT-Live-1 сократил их кодовую базу на 80%, убрав 23 тысячи строк кода, и освободил команду для работы над самим клиентским опытом. В Cognition, которая делает агента-программиста Devin, соединение с GPT-Live-1 описали как разговор с коллегой, а не работу с инструментом — можно обсудить идею вслух или просто передать задачу и отойти от компьютера.

По измерениям OpenAI, модель обгоняет предыдущую GPT-Realtime-2.1 на 30 процентных пунктов на тесте естественности диалога с перебиваниями, а в связке со средним уровнем рассуждений Astra занимает первое место на бенчмарке, который меряет интеллект голосовых агентов на end-to-end задачах вроде бронирования авиабилетов или банковской поддержки. Вместе с моделью OpenAI расширила линейку голосов — раньше их было немного, теперь разработчики выбирают из полутора десятков вариантов с разными акцентами.

Цена — 5 центов за минуту за голосовой слой, поверх которого можно поставить любую текстовую модель и любой сценарий: от заказа столика в ресторане до банковской линии поддержки, где раньше звонящему приходилось терпеливо ждать своей очереди сказать хоть слово.

Ещё новости

Все новости →