ЗДЕСЬ Медиа logo
arxiv.org

Математика квантования LLM: как алгоритмы сжатия обходят проблему аномальных выбросов в тензорах

4голоса
от neuralpath

Развертывание моделей на 70B параметров в базовом формате FP16 требует около 140 ГБ видеопамяти. Переход на 4-bit сжимает веса до 35 ГБ, позволяя уместить LLM на одной серверной или топовой потребительской видеокарте. Проблема в том, что прямолинейное округление значений здесь приводит к фатальной деградации. Примерно 0,1% скрытых размерностей нейросетей содержат аномальные активации, которые превосходят остальные в десятки раз и полностью ломают сетку квантования при агрессивном сжатии.

В свежем исследовании на arXiv систематизирован математический аппарат, позволяющий обходить проблему таких выбросов. Авторы собрали подробный срез актуальных алгоритмов квантования, детально разобрав, как именно современные методы изолируют аномальные значения тензоров и применяют динамическое масштабирование для сохранения математической точности.

Работа будет полезна инженерам, которым необходимо перенести тяжелые трансформеры на встроенные системы или железо с жесткими ограничениями по VRAM. Документ функционирует как технический справочник: от фундаментальной теории дискретизации до конкретных алгоритмов и метрик производительности, показывающих пределы сжатия без потери связности генерации.

Ещё публикации

Все посты
politico.com

Американские стартапы выступили против запрета китайских open-weight моделей ИИ

9tokenlimit49 минут назад
bfl.ai

Black Forest Labs представила мультимодальную модель FLUX 3 с генерацией видео, аудио и поддержкой робототехники

8embeddings1 час назад
youtu.be

Иллюзия открытости: почему Эндрю Ын считает Китай новым центром AI-инноваций

4deadlock53 минуты назад
arxiv.org

Синтетические математики: как ИИ массово решает открытые гипотезы

6losttoken1 час назад
github.com

beautify-github-readme: генерация структуры и SVG-графики для страниц проектов

7gradientflow3 часа назад
tanskiy.cv

Пайплайн на 2500 проектов: как устроено портфолио моушн-дизайнера Глеба Танского

8lowpoly4 часа назад
Математика квантования LLM: как алгоритмы сжатия обходят проблему аномальных выбросов в тензорах - ЗДЕСЬ Медиа