Разработчик выпустил TurboFieldfare — кастомный инференс-движок на базе Swift и Metal для запуска модели Gemma 4 26B-A4B на компьютерах Mac с процессорами семейства Apple Silicon. Проект примечателен тем, что позволяет запускать языковую модель на 26 миллиардов параметров, используя всего около 2 ГБ оперативной памяти. Это означает, что инференс возможен даже на базовых версиях MacBook с 8 ГБ объединенной памяти, при этом движок является самостоятельной разработкой, а не надстройкой над MLX или llama.cpp.
Для достижения таких показателей потребления памяти система не загружает весь архив весов объемом 14.3 ГБ в RAM. Вместо этого в оперативной памяти постоянно удерживается только общее ядро размером 1.35 ГБ и KV cache в формате FP16. Остальные данные, представляющие собой веса специфических экспертов нейросети, подгружаются с SSD-накопителя только в тот момент, когда они требуются для генерации конкретного токена. В результате архитектура минимизирует постоянную нагрузку на память, опираясь на скорость работы дисковой подсистемы macOS.
Техническая реализация включает в себя кастомные fused kernels для Metal, предварительную перепаковку весов в оптимизированный формат, кэширование экспертов и параллельное выполнение операций ввода-вывода с вычислениями. На базовом чипе M2 скорость декодирования составляет от 5.1 до 6.3 токенов в секунду, в то время как на M5 Pro показатель достигает 35 токенов. Пользователям доступны как консольная утилита TurboFieldfareCLI для работы со скриптами, так и нативное macOS-приложение со встроенным установщиком, который скачивает необходимые части модели напрямую с Hugging Face без сохранения полного исходного чекпоинта на диск.
Поделиться:
ODS: запуск локальной LLM, Open WebUI и RAG одной командой
AI-ответы в HTML вместо Markdown: зачем Anthropic предлагает менять стандарты разметки