ЗДЕСЬ Медиа logo
seed.bytedance.com

ByteDance показала SeedRealtime — end-to-end модель, которая видит, слышит и говорит одновременно

7голосов
от tokenlimit

ByteDance выпустила SeedRealtime — нативную аудиовизуальную full-duplex модель. В отличие от привычных каскадных систем, где модули распознавания речи, зрения и генерации ответа работают по очереди, здесь всё собрано в единую архитектуру. Модель непрерывно анализирует видеопоток и звук, параллельно принимая решения о происходящем в кадре, без использования внешних детекторов голосовой активности (VAD) для определения пауз.

Главное техническое отличие кроется в совместном моделировании звука, картинки и времени. Если пользователь указывает на предмет и спрашивает «как это работает», нейросеть считывает жесты и визуальный контекст для понимания отсылки. В шумной комнате система способна сопоставить голоса с лицами спикеров и удерживать этот контекст. При этом модель не ждет прямой команды: она может сама инициировать диалог, заметив нужный объект в камере, или прервать пользователя в реальном времени, если тот совершает ошибку при работе с оборудованием.

Отказ от жесткой очередности «вопрос-ответ» решает базовую проблему современных ассистентов — рваный темп беседы. SeedRealtime игнорирует фоновый шум, отличает обращение к себе от разговора людей между собой и умеет вовремя вступать в диалог. По данным разработчиков, энтузиастам больше не придется ждать окончания генерации ответа: архитектура позволяет нейросети слушать, смотреть и говорить одновременно, переводя интерфейсы из режима пассивного реагирования в формат активного соучастия.

Ещё публикации

Все посты
forms.gle

Студия Vantage открыла набор AI-художников и VFX-специалистов для коммерческих проектов

6overfit4 минуты назад
huggingface.co

Локальная генерация видео требует компромиссов. Разбор GGUF-квантизаций MiniMax H3

3losttoken24 минуты назад
youtube.com

Доклад Саши Лыгина о кризисе концептуального мышления в современном дизайне

7colorblind1 час назад
github.com

Команда Firecrawl выпустила anydoc — библиотеку на Rust для быстрой конвертации 14 форматов документов в Markdown

8devnull1 час назад
businessinsider.com

Anthropic начинает проектировать собственные ИИ-чипы для моделей Claude

3finetuned35 минут назад
bfl.ai

FLUX 3 Video вышел в API: генерация 20-секундных роликов с нативным звуком, мультишотами и драфт-режимом

6batchnorm2 часа назад
ByteDance показала SeedRealtime — end-to-end модель, которая видит, слышит и говорит одновременно - ЗДЕСЬ Медиа