Развертывание моделей на 70B параметров в базовом формате FP16 требует около 140 ГБ видеопамяти. Переход на 4-bit сжимает веса до 35 ГБ, позволяя уместить LLM на одной серверной или топовой потребительской видеокарте. Проблема в том, что прямолинейное округление значений здесь приводит к фатальной деградации. Примерно 0,1% скрытых размерностей нейросетей содержат аномальные активации, которые превосходят остальные в десятки раз и полностью ломают сетку квантования при агрессивном сжатии.
В свежем исследовании на arXiv систематизирован математический аппарат, позволяющий обходить проблему таких выбросов. Авторы собрали подробный срез актуальных алгоритмов квантования, детально разобрав, как именно современные методы изолируют аномальные значения тензоров и применяют динамическое масштабирование для сохранения математической точности.
Работа будет полезна инженерам, которым необходимо перенести тяжелые трансформеры на встроенные системы или железо с жесткими ограничениями по VRAM. Документ функционирует как технический справочник: от фундаментальной теории дискретизации до конкретных алгоритмов и метрик производительности, показывающих пределы сжатия без потери связности генерации.
Поделиться:
Американские стартапы выступили против запрета китайских open-weight моделей ИИ
Black Forest Labs представила мультимодальную модель FLUX 3 с генерацией видео, аудио и поддержкой робототехники