MiniMax готовит модель на 2.7 трлн параметров: зачем Китаю новый ИИ-монстр

Принято считать, что гонка параметров в языковых моделях постепенно уступает место оптимизации архитектуры. Но китайские разработчики, похоже, видят ситуацию иначе. По данным The Information, стартап MiniMax готовит к релизу модель M3 Pro на колоссальные 2.7 трлн параметров. Это в шесть раз больше их текущего флагмана и абсолютный рекорд для местного рынка, а запуск ожидается уже в третьем квартале.
Но оправдан ли такой объем в условиях жестких экспортных ограничений на серверное оборудование? Обучить систему на почти три триллиона параметров — это лишь половина задачи. Настоящей проблемой станет обслуживание пользовательских запросов. Даже при использовании архитектуры Mixture of Experts для активации только нужных сегментов сети, требования к видеопамяти и пропускной способности останутся заоблачными.
Правда, если слухи об открытом исходном коде подтвердятся, это создаст нетипичную динамику. Пока западные корпорации полируют компактные модели под локальный запуск, китайские лаборатории продолжают масштабировать системы в лоб. Остается дождаться тестов и посмотреть, конвертируются ли эти триллионы в реальную логику, а не только в красивые цифры на бумаге.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад