Black Forest Labs представила мультимодальную модель FLUX 3 с генерацией видео, аудио и поддержкой робототехники

Black Forest Labs представила мультимодальную модель FLUX 3, объединяющую генерацию текста, видео, аудио и прогнозирование действий в единой архитектуре. В основе алгоритма лежит подход Self-Flow, который заставляет нейросеть обрабатывать все модальности одновременно, что позволяет формировать комплексное представление о физических законах, где звук синхронизируется с механическим воздействием, а движение объектов соотносится с их массой.
На текущем этапе система генерирует видеоролики продолжительностью до 20 секунд с нативным звуковым сопровождением, поддерживая создание многокадровых сцен и переходы между ключевыми кадрами. Нейросеть справляется с генерацией многоязычных диалогов на базе текстовых инструкций, при этом визуальные и аудиореференсы помогают сохранять консистентность персонажей при переносе в новые контексты.
Понимание физики пространства применяется не только в создании контента, но и в робототехнике, где в рамках проекта FLUX-mimic базовая видеомодель дообучается для выполнения манипуляций в реальном мире. Развертывание продуктов будет происходить поэтапно: ранний доступ к видеогенерации уже открыт, в то время как релиз открытой версии FLUX 3 Dev и обновленного инструментария для работы со статичной графикой запланирован на ближайшие месяцы.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад