Gemma 4
Открытые мультимодальные модели разного калибра — от смартфона до локальных рабочих станций.

Google выкатила линейку открытых генеративных моделей Gemma 4, охватывающую диапазон от легковесных решений под мобильные чипы до плотных конфигураций для локальных серверов. Для тех, кто строит автономные пайплайны и экспериментирует с ИИ на собственном железе, здесь заложена редкая гибкость: пять размеров (E2B, E4B, 12B, 26B A4B и 31B) позволяют точно сопоставить запросы по качеству с доступным объёмом видеопамяти.
Что умеет
- Разбирать разные типы медиа: все версии воспринимают текст и изображения с любым соотношением сторон и разрешением. Модификации E2B, E4B и 12B также нативно обрабатывают звук и видео.
- Держать объёмный контекст: компактным моделям доступно окно в 128 тысяч токенов, а средним — до 256 тысяч.
- Рассуждать и писать код: предусмотрены настраиваемые режимы рассуждений (thinking modes), поддержка системных промптов и вызов функций (function-calling) для сборки автономных агентов.
- Ускорять выдачу: механизм Multi-Token Prediction использует вспомогательную драфт-модель для спекулятивного декодирования, заметно повышая скорость генерации без деградации ответов.
- Вставать на потребительские видеокарты: с помощью официальных чекпоинтов QAT (квантование, встроенное в процесс обучения) модели доступны в форматах GGUF под llama.cpp и LM Studio, а также в мобильных сборках под LiteRT-LM.
Цены и доступ
Веса Gemma 4 распространяются бесплатно и допускают ответственное коммерческое использование. Загрузить чекпоинты и квантованные версии можно через Kaggle и Hugging Face.
Нас подкупило, что архитектуру Mixture-of-Experts и мультимодальный 12B-вариант оптимизировали под прикладной локальный запуск. Инструмент оценят технические дизайнеры и арт-директоры, собирающие собственных локальных ассистентов для разбора референсов, анализа видеоматериалов и генерации пайплайн-скриптов прямо на рабочей машине.

