ERNIE 5.0
Мультимодальная модель на 2,4 трлн параметров для сквозной работы с текстом, визуалом и звуком

ERNIE 5.0 отказывается от привычного лоскутного принципа, когда к готовой текстовой модели пришивают отдельные генераторы картинок или аудио. Архитектура создана с нуля как единое авторегрессионное пространство на 2,4 триллиона параметров. Текст, статичные кадры, видео и аудиопоток приводятся к общей системе токенов, поэтому система учится удерживать сквозной смысл задачи на всех этапах продакшена.
Что умеет
- Сквозная визуальная генерация: статичные изображения модель воспринимает как однокадровые видеоряды, параллельно выстраивая композицию, масштаб и межкадровую динамику.
- Обработка и синтез звука: архитектура поэтапно разбирает аудиодорожку от общего семантического контекста до мельчайших акустических деталей, озвучивая текст и считывая входящий звук.
- Работа с длинным контекстом: контекстное окно масштабируется от 8K до 128K токенов с поддержкой многоязычного корпуса данных.
- Экономный расход мощностей: архитектура смеси экспертов (MoE) не делит блоки на чисто текстовые или визуальные и активирует менее 3% параметров на токен.
- Адаптация под окружение: механизм эластичного обучения позволяет разворачивать облегченные версии модели с изменяемой глубиной и шириной без повторного цикла обучения.
- Логика и код: модель уверенно решает задачи на рассуждение, исполнение инструкций, написание программного кода и управление инструментами.
Командам визуального продакшена и арт-директорам эта система интересна отказом от зоопарка разрозненных сервисов. Когда одна модель одновременно держит в фокусе драматургию текста, пластику кадра и акустику, путь от синопсиса до готовой сцены заметно сокращается.

