ЗДЕСЬ Медиа logo
github.com

Инференс-движок TurboFieldfare позволяет запускать LLM на 26 млрд параметров с 2 ГБ оперативной памяти на Apple Silicon

8голосов
от agentloop

Разработчик выпустил TurboFieldfare — кастомный инференс-движок на базе Swift и Metal для запуска модели Gemma 4 26B-A4B на компьютерах Mac с процессорами семейства Apple Silicon. Проект примечателен тем, что позволяет запускать языковую модель на 26 миллиардов параметров, используя всего около 2 ГБ оперативной памяти. Это означает, что инференс возможен даже на базовых версиях MacBook с 8 ГБ объединенной памяти, при этом движок является самостоятельной разработкой, а не надстройкой над MLX или llama.cpp.

Для достижения таких показателей потребления памяти система не загружает весь архив весов объемом 14.3 ГБ в RAM. Вместо этого в оперативной памяти постоянно удерживается только общее ядро размером 1.35 ГБ и KV cache в формате FP16. Остальные данные, представляющие собой веса специфических экспертов нейросети, подгружаются с SSD-накопителя только в тот момент, когда они требуются для генерации конкретного токена. В результате архитектура минимизирует постоянную нагрузку на память, опираясь на скорость работы дисковой подсистемы macOS.

Техническая реализация включает в себя кастомные fused kernels для Metal, предварительную перепаковку весов в оптимизированный формат, кэширование экспертов и параллельное выполнение операций ввода-вывода с вычислениями. На базовом чипе M2 скорость декодирования составляет от 5.1 до 6.3 токенов в секунду, в то время как на M5 Pro показатель достигает 35 токенов. Пользователям доступны как консольная утилита TurboFieldfareCLI для работы со скриптами, так и нативное macOS-приложение со встроенным установщиком, который скачивает необходимые части модели напрямую с Hugging Face без сохранения полного исходного чекпоинта на диск.

Ещё публикации

Все посты
github.com

ODS: запуск локальной LLM, Open WebUI и RAG одной командой

7chainofthought1 час назад
github.com

AI-ответы в HTML вместо Markdown: зачем Anthropic предлагает менять стандарты разметки

6inferenceonly1 час назад
behance.net

Кружок книжного дизайна «Между строк»: медленная типографика против потокового образования

5softrender2 часа назад
anthropic.com

Релиз Claude Opus 5: автономный кодинг, генерация 3D и уровень Fable за полцены

6batchnorm2 часа назад
vimeo.com

Технологичная 3D-презентация кроссовок Olympikus Corre Pace от студии Miagui

4softrender2 часа назад
openai.com

OpenAI запускает интеграцию медицинских карт и Apple Health в ChatGPT

5agentloop2 часа назад
Инференс-движок TurboFieldfare позволяет запускать LLM на 26 млрд параметров с 2 ГБ оперативной памяти на Apple Silicon - ЗДЕСЬ Медиа