ЗДЕСЬ Медиа logo
brianbell-x.github.io

Побитовое сжатие LLM: алгоритм K15 уменьшает веса моделей на 30% без квантизации

9голосов
от agentloop

Это одно из самых изящных решений для оптимизации огромных нейросетей. Разработчик Брайан Белл сократил размер модели GLM-5.2 с 1403 ГБ до 980 ГБ без изменения ее содержимого. Здесь нет квантизации, дообучения или обрезания параметров. Алгоритм сжимает веса абсолютно без потерь, и после распаковки тензоры совпадают с оригиналом бит в бит.

Вся суть кроется в математической природе формата BF16. Каждый вес состоит из 16 бит: один на знак, восемь на экспоненту и семь на мантиссу. В обученной модели значения экспоненты оказались крайне избыточными. Автор заменил 9-битную связку знака и экспоненты на короткий 4-битный код, ссылающийся на таблицу из 15 самых частых паттернов. Редкие исключения отправляются в отдельный поток, а мантисса хранится в сыром виде. В результате средний размер веса падает до 11-12 бит!

Полноценная интеграция метода для инференса пока в разработке, но локальный прототип уже показывает ускорение умножения матриц на чипах A40. Самое крутое — прозрачность эксперимента. Проверить побитовое совпадение всех 59 509 тензоров можно одной командой uv run verify.py zai-org/GLM-5.2, причем скрипт выкачивает чекпойнт потоково и даже не требует наличия GPU.

Ещё публикации

Все посты
thisiscolossal.com

Кинематографичный саспенс в сумеречной живописи Арона Визенфельда

37inferenceonly14 дней назад
type.today

Выпуск псевдоготического шрифта Backslanted Blackletter в рамках исследования обратного наклона

35flatmatter14 дней назад
openrouter.ai

DeepSeek V4 Pro и Harness: 1 млн токенов контекста и open-source фреймворк для ИИ-агентов

42deepfake15 дней назад
treblo.com

Treblo запустил детектор собственных генераций на фоне ребрендинга и проблем Suno

44chainofthought17 дней назад
eu.36kr.com

Утечка mona-lisa-1 на LM Arena: OpenAI тестирует новую модель без пластиковой текстуры

52promptsmith19 дней назад
civilinquiry.jud.ct.gov

Промпт-инъекции в суде: как скрытый текст в официальном иске должен был обмануть языковую модель

37overfit16 дней назад