Grok Voice Agent API
Речевой API от xAI: диалоговые агенты с задержкой до секунды, живыми вздохами и поиском по вебу

Голосовой движок, который xAI обкатала в мобильных приложениях и миллионах электрокаров Tesla, теперь открыт разработчикам через программный интерфейс. Команда собрала всю цепочку внутри — от детектора речевой активности до собственных аудиомоделей. За счет этого задержка до первого слышимого ответа держится в пределах одной секунды: диалог не превращается в неловкую паузу у рации.
Что умеет
- Быстро отвечать и рассуждать. На бенчмарке Big Bench Audio архитектура заняла первую строчку, реагируя почти в пять раз быстрее ближайших конкурентов.
- Свободно переключать языки. Модель говорит на десятках языков, передает нюансы акцентов и диалектов, а также переходит на другой язык прямо во время беседы, если собеседник сделал то же самое. При необходимости язык можно зафиксировать в системном промпте.
- Изображать живые интонации. Доступны голоса Ara, Eve и Leo, обученные чисто произносить термины из медицины, права и финансов. По текстовой подсказке в промпте модель умеет использовать звуковые маркеры — например,
[whisper],[sigh]или[laugh]. - Работать с внешними данными. Агент запускает сторонние инструменты, ищет свежую информацию в веб-поиске и постах сети X, строит маршруты и считывает телеметрию.
- Интегрироваться в привычный пайплайн. Решение совместимо со спецификацией OpenAI Realtime API и подключается через официальный плагин для LiveKit.
Цены и доступ
Проверить голоса можно в браузерной песочнице xAI Cloud Console. Действует единая фиксированная ставка: $0,05 за минуту аудио без запутанного подсчета входных и выходных токенов. В ближайшие недели разработчики обещают открыть отдельные эндпоинты для синтеза и транскрипции речи.
Инструмент пригодится тем, кто проектирует интерактивные голосовые интерфейсы, клиентские сервисы и виртуальных персонажей, способных без запинки отвечать на узкоспециальные темы и реагировать естественными вздохами или смехом.


