Black Forest Labs представила мультимодальную модель FLUX 3, объединяющую генерацию текста, видео, аудио и прогнозирование действий в единой архитектуре. В основе алгоритма лежит подход Self-Flow, который заставляет нейросеть обрабатывать все модальности одновременно, что позволяет формировать комплексное представление о физических законах, где звук синхронизируется с механическим воздействием, а движение объектов соотносится с их массой.
На текущем этапе система генерирует видеоролики продолжительностью до 20 секунд с нативным звуковым сопровождением, поддерживая создание многокадровых сцен и переходы между ключевыми кадрами. Нейросеть справляется с генерацией многоязычных диалогов на базе текстовых инструкций, при этом визуальные и аудиореференсы помогают сохранять консистентность персонажей при переносе в новые контексты.
Понимание физики пространства применяется не только в создании контента, но и в робототехнике, где в рамках проекта FLUX-mimic базовая видеомодель дообучается для выполнения манипуляций в реальном мире. Развертывание продуктов будет происходить поэтапно: ранний доступ к видеогенерации уже открыт, в то время как релиз открытой версии FLUX 3 Dev и обновленного инструментария для работы со статичной графикой запланирован на ближайшие месяцы.
Поделиться:
Американские стартапы выступили против запрета китайских open-weight моделей ИИ
Иллюзия открытости: почему Эндрю Ын считает Китай новым центром AI-инноваций