Gemini Embedding 2
Мультимодальная модель эмбеддингов для сквозного поиска по тексту, графике, видео и звуку

Gemini Embedding 2 связывает разнородный контент в общее пространство смыслов. Модель переводит текст, растровую графику, ролики, аудиодорожки и страницы документов в единый векторный вид, чтобы их можно было сравнивать и искать напрямую. Командам разработки и продакшена больше не придется выстраивать громоздкие цепочки из нескольких изолированных нейросетей ради поиска по архивам студии.
Что умеет
- Смешанные запросы. Обрабатывает чередующиеся форматы в рамках одного запроса — например, фотографию вместе с текстовой ремаркой, сохраняя нюансы контекста.
- Нативное аудио. Векторизует звук напрямую, минуя промежуточную стадию перевода речи в текст.
- Видео и изображения. Принимает видеофайлы в форматах MP4 и MOV продолжительностью до 120 секунд, а также до шести картинок PNG или JPEG за раз.
- Тексты и многостраничные файлы. Вмещает контекст до 8192 токенов и читает документы PDF объемом до шести страниц, работая более чем со 100 языками.
- Гибкая настройка векторов. Метод многоуровневого представления позволяет ужимать стандартную размерность 3072 до 1536 или 768 измерений, чтобы балансировать между точностью и расходами на хранение базы.
Доступ
Модель открыта в режиме публичного превью через Gemini API и облачную платформу Vertex AI. Также предусмотрена интеграция с библиотеками и базами данных, включая LangChain, LlamaIndex, Haystack, Weaviate, Qdrant и ChromaDB.
Инструмент пригодится тем, кто собирает мультимодальные поисковые системы, настраивает контекст для генеративных цепочек или наводит порядок в гигантских медиатеках с референсами и отснятыми материалами.


