Принято считать, что работа с видеоархивами всегда будет сводиться к ручному прописыванию тегов и бесконечному скроллингу таймлайнов на монтаже. Агент Jockey от стартапа TwelveLabs пытается изменить этот паттерн, превращая сырой футаж в размеченную базу данных. Инструмент не просто ищет файлы по названиям, а индексирует визуальный ряд, аудио и текст. В теории это позволяет находить конкретные кадры по абстрактному описанию сцены, объекту или произнесенной реплике.
Под капотом работают проприетарные мультимодальные модели Pegasus и Marengo. Доступ к агенту реализован через протокол MCP — можно подключить медиабиблиотеку к Claude и просить нейросеть собрать нарезку по теме или найти случайные упоминания брендов в кадре. Для разработчиков есть API, который умеет отдавать структурированные данные по заранее заданной JSON-схеме с точными таймкодами вплоть до кадра.
Создатели обещают автоматическое определение удачных хуков, анализ трендов и генерацию черновиков для видео. Но реальная эффективность таких систем часто разбивается о контекст. Способность алгоритма понять, почему именно эти три секунды удерживают внимание живого зрителя, вызывает сомнения. Правда, даже если Jockey пока справится лишь с базовым семантическим поиском по исходникам, это уже избавит от часов монотонной работы. Вопрос лишь в том, какими окажутся реальные затраты на облачный процессинг терабайтов тяжелого видео.
Поделиться:
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
Итоги Pure Street Photography Awards: 8 победителей из 1600 заявок