Meta выпустила Muse Glimmer — 30-миллиардную мультимодальную модель, адаптированную для работы на потребительском железе. Это первый крупный открытый релиз компании за долгое время. В бенчмарках модель обходит прямых конкурентов вроде Qwen 3.6 27B и Gemma 4 31B. Архитектурно это dense-модель с отдельным энкодером восприятия. Она дистиллирована из старшей версии Muse Spark, веса которой Meta также пообещала открыть.
Главная задача Muse Glimmer — автономная работа агентов, многошаговый ризонинг и использование инструментов без доступа к облаку. Базовая квантованная версия на 16.8 ГБ помещается в 24 ГБ видеопамяти. Для обработки изображений нужен дополнительный модуль mmproj (1.4 ГБ), а для ускорения генерации через спекулятивное декодирование — драфтер dflash (1.6 ГБ). Из очевидных ограничений — окно контекста вмещает 131 тысячу токенов, что заметно меньше актуальных стандартов.
Для локального запуска потребуется свежий билд llama.cpp (начиная с версии b10353). При старте сервера критично использовать флаг --jinja — шаблон чата вшит в GGUF, без него парсер выдаст ошибку. Текстовые промпты обрабатывает llama-cli, а для мультимодальных задач нужен llama-mtmd-cli. Важный технический нюанс: нельзя использовать токен <|eom|> для принудительной остановки генерации. Он обозначает только конец сообщения, и его жесткая привязка к остановке ломает параллельный вызов инструментов.
Поделиться:
Айдентика RSquad Blockchain Lab: метафора алхимии для Web3-инфраструктуры
Интеграция 3D Gaussian Splatting в Houdini 22: процедурный подход к новым форматам