РазноеплатноOpenAI

GPT-Realtime-2

Голосовая модель с рассуждениями для живых ассистентов, вызова инструментов и синхронного перевода

Фото: OpenAI

Живой голосовой интерфейс обычно ломается на первой же паузе или перебивании: собеседник замолкает, а машина либо зависает, либо теряет контекст. GPT-Realtime-2 справляется с этой задачей благодаря рассуждениям класса GPT-5. Модель поддерживает связный разговор в реальном времени, умеет подстраивать интонацию под собеседника и вызывает внешние инструменты прямо по ходу фразы.

Что умеет

  • Рассуждать на лету. Уровень глубины размышлений настраивается от минимального до сверхвысокого (базовый уровень — low), позволяя выбирать между скоростью отклика и проработкой трудных задач.
  • Озвучивать паузы. Модель умеет использовать короткие реплики вроде «минуту, проверяю», чтобы заполнить техническую задержку перед ответом.
  • Параллельно запускать инструменты. Ассистент выполняет несколько служебных вызовов одновременно, вслух проговаривая свои шаги, и корректно сообщает об ошибках вместо неловкого молчания.
  • Удерживать контекст до 128 000 токенов. Лимит окна увеличили с прежних 32K, поэтому модель держит долгие диалоги и надежнее запоминает узкую терминологию.
  • Управлять подачей. Тон ответа можно менять: звучать подчеркнуто спокойно при решении проблемы, эмпатично или бодро.
  • Работать вместе с переводом и транскрипцией. В линейку также вошли потоковый переводчик GPT-Realtime-Translate (более 70 входных и 13 выходных языков) и быстрый стенографист GPT-Realtime-Whisper.

Цены и доступ

Модели открыты через Realtime API и в веб-среде Playground. Стоимость GPT-Realtime-2 составляет $32 за 1 миллион входных аудиотокенов ($0,40 для кэшированных) и $64 за 1 миллион выходных. Минута синхронного перевода обойдется в $0,034, а потоковая расшифровка речи — в $0,017 за минуту.

Находка для креативных технологов и продуктовых команд, которые собирают голосовые сервисы, интерактивные инсталляции или живую озвучку для международных событий. Нас подкупило, что модель научилась человеческим оговоркам и больше не притворяется, будто моментально знает ответ на любой заковыристый вопрос.

Сайт GPT-Realtime-2
Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд

Разное

Eleven v4

Новая модель озвучки ElevenLabs, которая слышит паузы и эмоции сценария, а не просто читает текст