ByteDance выпустила SeedRealtime — нативную аудиовизуальную full-duplex модель. В отличие от привычных каскадных систем, где модули распознавания речи, зрения и генерации ответа работают по очереди, здесь всё собрано в единую архитектуру. Модель непрерывно анализирует видеопоток и звук, параллельно принимая решения о происходящем в кадре, без использования внешних детекторов голосовой активности (VAD) для определения пауз.
Главное техническое отличие кроется в совместном моделировании звука, картинки и времени. Если пользователь указывает на предмет и спрашивает «как это работает», нейросеть считывает жесты и визуальный контекст для понимания отсылки. В шумной комнате система способна сопоставить голоса с лицами спикеров и удерживать этот контекст. При этом модель не ждет прямой команды: она может сама инициировать диалог, заметив нужный объект в камере, или прервать пользователя в реальном времени, если тот совершает ошибку при работе с оборудованием.
Отказ от жесткой очередности «вопрос-ответ» решает базовую проблему современных ассистентов — рваный темп беседы. SeedRealtime игнорирует фоновый шум, отличает обращение к себе от разговора людей между собой и умеет вовремя вступать в диалог. По данным разработчиков, энтузиастам больше не придется ждать окончания генерации ответа: архитектура позволяет нейросети слушать, смотреть и говорить одновременно, переводя интерфейсы из режима пассивного реагирования в формат активного соучастия.
Поделиться:
Студия Vantage открыла набор AI-художников и VFX-специалистов для коммерческих проектов
Локальная генерация видео требует компромиссов. Разбор GGUF-квантизаций MiniMax H3