Google выпустил Gemma 4: any-to-any модели с линейными проекциями вместо тяжелых энкодеров

Google без громких анонсов выкатил линейку Gemma 4, и самая интересная деталь релиза кроется в архитектуре мультимодальности. В отличие от стандарта индустрии с отдельными энкодерами для аудио и видео, новые модели обходятся простыми линейными проекциями. Это заметно снижает требования к параметрам и вычислительной мощности при инференсе.
Для локального использования оптимальной выглядит версия Gemma 4 12B. Она работает в формате any-to-any, имеет контекстное окно на 256 тысяч токенов и обучена рассуждать на уровне ризонеров. На вход можно подавать текст, изображения, видео длиной до 30 секунд и аудио до 60 секунд. Все веса лежат в открытом доступе под пермиссивной лицензией Apache 2.0.
Помимо 12-миллиардной версии, в коллекцию вошли модели от 5B до 31B параметров, а также легковесные assistant-модули. Полноценный технический отчет пока не опубликован, поэтому детали тренировки линейных проекций без деградации качества на сложных мультимодальных задачах остаются неизвестными.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад