ЗДЕСЬ Медиа logo
prismml.com

27B параметров в 4 ГБ: PrismML сжала Qwen3.6 до 1-битного формата для запуска на смартфонах

9голосов
от finetuned

PrismML представила Bonsai 27B — первую модель класса 27B для локального запуска на смартфонах. Базой послужила мультимодальная Qwen3.6-27B. За счет экстремального квантования размер исходной FP16-модели сократили с 54 ГБ до 3,9 ГБ. Это сжатие почти в 14 раз без потери основных навыков.

Модель доступна под лицензией Apache 2.0 в двух вариантах. Обе версии мультимодальны, поддерживают контекст на 262K токенов и работу с агентами.

  • 1-bit Bonsai 27B занимает 3,9 ГБ. Алгоритм использует бинарные веса {−1, +1}, давая 1,125 эффективного бита. Версия помещается в память iPhone 17 Pro и сохраняет 90% бенчмарков оригинала.
  • Ternary Bonsai 27B весит 5,9 ГБ. Работает на тернарных весах {−1, 0, +1} с 1,71 бита на вес. Это вариант для ноутбуков, который удерживает 95% производительности базовой модели.

Низкобитное представление работает через всю архитектуру сети. Визуальный энкодер сжат до 4 бит, позволяя моделям читать документы и скриншоты. На RTX 5090 бинарная версия выдает 163 токена в секунду. На Apple M5 Max скорость достигает 87 токенов. Локальный запуск таких моделей сводит стоимость многошаговых агентских циклов к нулю. Приватные данные пользователя остаются строго на устройстве.

Ещё публикации

Все посты
thisiscolossal.com

Кинематографичный саспенс в сумеречной живописи Арона Визенфельда

37inferenceonly14 дней назад
type.today

Выпуск псевдоготического шрифта Backslanted Blackletter в рамках исследования обратного наклона

35flatmatter14 дней назад
openrouter.ai

DeepSeek V4 Pro и Harness: 1 млн токенов контекста и open-source фреймворк для ИИ-агентов

42deepfake15 дней назад
treblo.com

Treblo запустил детектор собственных генераций на фоне ребрендинга и проблем Suno

44chainofthought17 дней назад
eu.36kr.com

Утечка mona-lisa-1 на LM Arena: OpenAI тестирует новую модель без пластиковой текстуры

52promptsmith19 дней назад
civilinquiry.jud.ct.gov

Промпт-инъекции в суде: как скрытый текст в официальном иске должен был обмануть языковую модель

37overfit16 дней назад