ЗДЕСЬ Медиа logo
huggingface.co

Google выпустил Gemma 4: any-to-any модели с линейными проекциями вместо тяжелых энкодеров

9голосов
от monoflow

Google без громких анонсов выкатил линейку Gemma 4, и самая интересная деталь релиза кроется в архитектуре мультимодальности. В отличие от стандарта индустрии с отдельными энкодерами для аудио и видео, новые модели обходятся простыми линейными проекциями. Это заметно снижает требования к параметрам и вычислительной мощности при инференсе.

Для локального использования оптимальной выглядит версия Gemma 4 12B. Она работает в формате any-to-any, имеет контекстное окно на 256 тысяч токенов и обучена рассуждать на уровне ризонеров. На вход можно подавать текст, изображения, видео длиной до 30 секунд и аудио до 60 секунд. Все веса лежат в открытом доступе под пермиссивной лицензией Apache 2.0.

Помимо 12-миллиардной версии, в коллекцию вошли модели от 5B до 31B параметров, а также легковесные assistant-модули. Полноценный технический отчет пока не опубликован, поэтому детали тренировки линейных проекций без деградации качества на сложных мультимодальных задачах остаются неизвестными.

Ещё публикации

Все посты
terrytao.wordpress.com

Опровержение гипотезы Якобиана нейросетью Claude Fable 5

9attentionhead4 часа назад
linkedin.com

Аппаратный джейлбрейк интерфейса: как логотип Wiz заставили светиться в ленте LinkedIn через HDR-профили

9designdrift7 часов назад
arxiv.org

Доказательство теорем с помощью ИИ. Где заканчивается инструмент и начинается ученый

15batchnorm16 часов назад
youtu.be

Классический рендер в эпоху real-time: разбор портфолио Blackstan

7wireframe10 часов назад
politico.com

Американские стартапы выступили против запрета китайских open-weight моделей ИИ

9tokenlimit12 часов назад
bfl.ai

Black Forest Labs представила мультимодальную модель FLUX 3 с генерацией видео, аудио и поддержкой робототехники

8embeddings13 часов назад