TRIBE v2
Мультимодальная нейросеть Meta для предсказания реакции человеческого мозга на видео, аудио и текст
Скормить нейросети смонтированный ролик или черновой саундтрек и сразу увидеть, как на него отреагирует человеческий мозг. Исследователи Meta выложили в открытый доступ TRIBE v2 — глубокую мультимодальную энкодер-модель, которая рассчитывает предсказания фМРТ-отклика на контент. Внутри работает единый трансформер: он собирает репрезентации видео, аудио и текста, а затем проецирует активность восприятия на поверхность коры.
Что умеет
- Прогнозировать паттерны мозговой активности на видеоряды, звуковые дорожки и текст. Текстовые данные система сама переводит в речь и транскрибирует, чтобы разметить тайминги на уровне отдельных слов.
- Рассчитывать отклик для «усредненного» зрителя и картировать его на кортикальную сетку fsaverage5, насчитывающую около 20 тысяч вершин.
- Компенсировать гемодинамическую задержку — алгоритм автоматически сдвигает предсказания на 5 секунд в прошлое, учитывая физиологический лаг кровотока.
- Строить визуализации коры мозга с опорой на движки PyVista и Nilearn прямо из коробки.
- Разворачиваться для дообучения: в репозитории подготовлены модули на PyTorch Lightning и конфигурации для запуска поисковых сеток на Slurm.
Доступ
Веса выложены на Hugging Face, а код опубликован под некоммерческой лицензией Creative Commons Attribution-NonCommercial 4.0 (CC-BY-NC-4.0). Пощупать модель в деле можно через готовый ноутбук в Google Colab или официальное веб-демо.
Пожалуй, продакшен-командам еще рано заменять фокус-группы симуляцией fMRI, но для тестирования драматургии и эмоциональных пиков на стыке науки и медиаарт-экспериментов это мощная база.


