Kimi K3: открытая модель на 2.8 трлн параметров с архитектурой LatentMoE и контекстом в миллион токенов

Moonshot открыли доступ к Kimi K3 — на данный момент это самая крупная открытая языковая модель. С базой в 2.8 триллиона параметров она стала первой опенсорсной нейросетью класса 3T. В тестах архитектура уверенно обходит Opus 4.8, хотя пока уступает закрытым флагманам вроде Claude Fable 5 и GPT 5.6 Sol. Нейросеть нативно обрабатывает визуальные данные и удерживает окно контекста до миллиона токенов.
Технический скачок обеспечили кастомные модули Kimi Delta Attention и Attention Residuals. Разработчики агрессивно масштабировали разреженность Mixture of Experts: в связке с фреймворком Stable LatentMoE при генерации активируются лишь 16 из 896 экспертов. Это увеличило общую эффективность вычислений в 2.5 раза по сравнению с прошлой версией. В платформе API стоимость установили на уровне конкурентного Sonnet — $3/$15 за миллион токенов. При этом работает автоматическое кэширование, которое режет цену на обработанные куски контекста на 90%.
Основной профиль K3 — долгосрочное планирование и сложная инженерия с минимальным вмешательством человека. В качестве пруф-оф-концепта модель автономно написала GPU-компилятор MiniTriton с собственным пайплайном кодогенерации и за 48 часов спроектировала чип для запуска нано-модели. Сами веса опубликуют в конце июля, но агентские сценарии и написание кода уже можно тестировать в Kimi Work и Kimi Code.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад