Все ждали от Meta очередного гиганта, но компания внезапно вернулась в категорию 30B, которую игнорировала со времен Code Llama. Muse Glimmer-30B позиционируется как движок для локальных автономных агентов. Разработчики заявляют мультимодальность, работу с инструментами и самовосстановление после ошибок прямо на домашнем железе. Но окно контекста всего в 131 тысячу токенов заставляет задуматься, насколько долгими могут быть эти агентские цепочки на самом деле.
Под капотом это классическая dense-архитектура, к которой добавили отдельный perception encoder на 1.8B параметров для работы с визуальными данными. Чтобы уместить модель в 24-32 ГБ видеопамяти, Meta использует 4-битную квантизацию, ужимая веса до 17 ГБ. Технический интерес здесь представляет встроенный драфтер на базе DFlash. Это спекулятивное декодирование предсказывает блоки по 16 токенов за проход, что на RTX 5090 дает прирост скорости в три раза — до 233 токенов в секунду. Правда, на чипах Apple M-серии ускорение выглядит куда скромнее, не превышая двукратного значения.
Согласно бенчмаркам, новинка действительно обходит Qwen3.6-27B и Gemma4-31B в профильных тестах вроде SWE-Bench Pro и MCP Atlas. Однако в метриках взаимодействия с операционной системой и терминалом китайские конкуренты всё еще удерживают лидерство. Meta делает ставку на скорость генерации и способность модели исправлять собственные ошибки вызовов на лету. Вопрос лишь в том, хватит ли разработчикам жестко ограниченного контекста для построения сложных систем без постоянного сброса памяти агента.
Поделиться:
Meta выпустила мультимодальную модель Muse Glimmer 30B с фокусом на локальный запуск
3D-персонажи полного цикла: как моушн-бэкграунд меняет подход к моделингу