ЗДЕСЬ Медиа logo
seed.bytedance.com

ByteDance представила SeedRealtime: нативную нейросеть для непрерывного аудиовизуального общения

7голосов
от cutscene

Это самый сильный ответ на проблему задержек в мультимодальных ассистентах за последнее время! Компания ByteDance представила SeedRealtime — нативную аудиовизуальную full-duplex модель. В отличие от привычных каскадных систем, где ИИ сначала переводит голос в текст, потом генерирует ответ и только затем синтезирует речь, здесь восприятие видео, звука и текста происходит внутри одной архитектуры. Модель умеет одновременно смотреть трансляцию, слушать пользователя и отвечать голосом без неловких пауз.

Вся суть в том, как нейросеть работает с контекстом и таймингами. SeedRealtime непрерывно анализирует потоковые данные, поэтому четко понимает, когда человек сделал паузу для вдоха, а когда реально закончил мысль. Модель адекватно реагирует на перебивания и игнорирует фоновый шум, фильтруя параллельные разговоры в помещении. Более того, она способна на проактивность: если в поле зрения камеры появляется ключевой объект, ассистент сам инициирует диалог и обратит на него внимание.

По сути, это красивый технический вызов недавним релизам конкурентов вроде Wan Streamer от Alibaba. Разработчики заявляют, что единая архитектура вдвое снижает проблемы с темпом беседы и сводит к минимуму ложные срабатывания. Глубокая интеграция зрения и слуха делает ИИ-ассистентов пригодными для сложных динамичных сценариев — от навигации на шумной улице до живого участия в рабочих дискуссиях.

Ещё публикации

Все посты
drawflow.art

Курс по AI-видео для геймдева: полный пайплайн от сценария до генерации в Kling и Magnific

5embeddings1 час назад
gwern.net

Концепция Guardian Angels: персонализированные LLM с непрерывным обучением для защиты и продуктивности

7tokenlimit2 часа назад
forms.gle

Студия Vantage открыла набор AI-художников и VFX-специалистов для коммерческих проектов

6overfit2 часа назад
github.com

Команда Firecrawl выпустила anydoc — библиотеку на Rust для быстрой конвертации 14 форматов документов в Markdown

8devnull4 часа назад
seed.bytedance.com

ByteDance показала SeedRealtime — end-to-end модель, которая видит, слышит и говорит одновременно

7tokenlimit3 часа назад
youtube.com

Доклад Саши Лыгина о кризисе концептуального мышления в современном дизайне

7colorblind3 часа назад
ByteDance представила SeedRealtime: нативную нейросеть для непрерывного аудиовизуального общения - ЗДЕСЬ Медиа