TwelveLabs запустила Rodeo для сборки видеомонтажа по текстовому запросу

Знакомая рутина любого постпродакшена: проект горит, а монтажер третий час отсматривает терабайты исходников в поисках пятисекундного дубля, где актер поворачивает голову на закате и улыбается в полутьме. Десятки папок с безымянными файлами, бесконечный скраббинг по таймлайну и потерянный рабочий день ради пары склеек. TwelveLabs решила вмешаться в этот процесс напрямую: компания показала Rodeo — автономного ИИ-агента, который превращает поиск нужных кадров и черновую сборку видео в диалог на обычном человеческом языке.
До сих пор TwelveLabs держалась на дистанции от конечных креаторов, поставляя разработчикам инфраструктурные модели компьютерного зрения через API. Rodeo — первый в истории компании самостоятельный продукт прикладного уровня, созданный специально для продакшен-команд. Это уже не абстрактная нейросетевая база данных, а полноценный инструмент, который садится рядом с монтажером в качестве соавтора и ассистента.
Как Rodeo разбирает архивы футажей
Главная идея инструмента — избавить авторов от монотонной сортировки материала. Rodeo принимает текстовый запрос на естественном языке, сканирует подключенное хранилище и моментально собирает подходящие сцены в готовые связки. При этом система ищет не по формальным тегам или распознанным объектам вроде «машина» или «дерево». Алгоритмы оценивают драматический и смысловой контекст сцены, понимая, почему именно это действие или ракурс имеют значение в рамках вашей истории.

В основе архитектуры Rodeo лежат две флагманские модели компании, заточенные под разные аспекты анализа медиа:
- Marengo 3.0 — фундаментальная нейросеть, воспринимающая видеоряд как живую динамическую систему. Она сводит воедино визуальный поток, аудиодорожку, диалоги, характер движения в кадре и общий контекст происходящего. Модель буквально слышит интонации, считывает ритм монтажа и ориентируется в гигантских массивах футажей без потери точности.
- Pegasus 1.5 — модель, оптимизированная под глубокий анализ длинных исходников. Она без труда переваривает часовые непрерывные видеозаписи с минимальной задержкой, удерживая причинно-следственные связи сюжета на всей дистанции хронометража.
Вся эта связка развернута через серверы MCP и современную агентную экосистему. Для пользователя это значит главное: чтобы начать работу с ИИ-ассистентом, не нужно настраивать окружение, писать скрипты или продираться сквозь технические дебри интеграций. Агент готов к диалогу сразу из коробки.
Позицию создателей точно выразил генеральный директор и основатель TwelveLabs Jae Lee: «Видео по своей природе — творческая среда, поэтому мы хотели перенести всю мощь фундаментальных моделей и инноваций непосредственно в творческие рабочие процессы без каких-либо технических барьеров».
Для кого собран инструмент
Продукт ориентирован на тех, кто ежедневно тонет в часах отснятого материала:
- Режиссеры монтажа и видеоредакторы, которым нужно быстро выловить удачные дубли или собрать первичный черновой драфт;
- Продюсеры и креативные директоры, формулирующие визуальные гипотезы и собирающие референсные тритменты прямо во время брифинга;
- Документалисты и авторы расследований, работающие с гигантскими архивами хроники, интервью и репортажных съемок, где ручной поиск одного факта может занять неделю.

Интерфейс Rodeo спроектирован так, чтобы автор взаимодействовал с материалом без посредников: текстовый ввод, автоматическая компоновка клипов из библиотеки и последующая тонкая настройка готовой визуальной истории на таймлайне.
Нас в редакции подкупает прагматичный сдвиг: нейросети наконец-то перестают плодить бессмысленный галлюциногенный контент и берутся за самую неблагодарную часть профессии. Rodeo не пытается заменить режиссера или навязать свой художественный вкус — он просто берет на себя черную работу по сортировке сотен часов сырых записей, отдавая человеку чистое право отбора. Если обещания разработчиков подтвердятся на реальных студийных объемах, монтаж перестанет начинаться с тоски по утерянному файлу.


