Kimi открыли доступ к Kimi K3 — модели на 2.8 триллиона параметров. Главная деталь релиза скрыта в архитектуре. Вместо классического механизма внимания разработчики внедрили Kimi Delta Attention (KDA). Стандартный attention работает как поиск по таблице: каждый токен генерирует и хранит пары key-value, что приводит к взрывному потреблению памяти на длинных текстах. Механизм KDA не хранит постоянно растущий KV-кеш, что позволяет модели обрабатывать окно в миллион токенов без экспоненциального роста требований к VRAM.
Архитектура дополнена сильно разреженным Mixture of Experts (MoE) в связке с фреймворком Stable LatentMoE — из 896 экспертов при генерации активируются только 16. Это дало прирост эффективности вычислений в 2.5 раза по сравнению с прошлым поколением. На практике K3 заточена под хардкорную автономную инженерию: модель способна писать компиляторы для GPU с нуля (с собственным IR-слоем поверх MLIR и генерацией PTX-кода) и оптимизировать ядра под ускорители NVIDIA Hopper, выдавая результаты на уровне проприетарной Claude Fable 5.
В качестве внутреннего теста K3 самостоятельно спроектировала чип для запуска нано-модели на собственной архитектуре. За 48 часов автономной работы агент собрал и верифицировал кристалл на 4 мм² с пропускной способностью более 8700 токенов в секунду, используя открытые инструменты EDA. Веса модели опубликуют 27 июля, а сейчас K3 доступна через API с включенным по умолчанию режимом максимальных вычислительных затрат.
Поделиться:
Унификация айдентики Coca-Cola: возврат к Arden Square и вертикальный логотип на банках
GenPeach AI ищет Founding GTM Lead для продвижения моделей генерации людей