РазноеGoogle DeepMind

Gemini Embedding 2

Мультимодальная модель эмбеддингов для сквозного поиска по тексту, графике, видео и звуку

Фото: Google

Gemini Embedding 2 связывает разнородный контент в общее пространство смыслов. Модель переводит текст, растровую графику, ролики, аудиодорожки и страницы документов в единый векторный вид, чтобы их можно было сравнивать и искать напрямую. Командам разработки и продакшена больше не придется выстраивать громоздкие цепочки из нескольких изолированных нейросетей ради поиска по архивам студии.

Что умеет

  • Смешанные запросы. Обрабатывает чередующиеся форматы в рамках одного запроса — например, фотографию вместе с текстовой ремаркой, сохраняя нюансы контекста.
  • Нативное аудио. Векторизует звук напрямую, минуя промежуточную стадию перевода речи в текст.
  • Видео и изображения. Принимает видеофайлы в форматах MP4 и MOV продолжительностью до 120 секунд, а также до шести картинок PNG или JPEG за раз.
  • Тексты и многостраничные файлы. Вмещает контекст до 8192 токенов и читает документы PDF объемом до шести страниц, работая более чем со 100 языками.
  • Гибкая настройка векторов. Метод многоуровневого представления позволяет ужимать стандартную размерность 3072 до 1536 или 768 измерений, чтобы балансировать между точностью и расходами на хранение базы.

Доступ

Модель открыта в режиме публичного превью через Gemini API и облачную платформу Vertex AI. Также предусмотрена интеграция с библиотеками и базами данных, включая LangChain, LlamaIndex, Haystack, Weaviate, Qdrant и ChromaDB.

Инструмент пригодится тем, кто собирает мультимодальные поисковые системы, настраивает контекст для генеративных цепочек или наводит порядок в гигантских медиатеках с референсами и отснятыми материалами.

Сайт Gemini Embedding 2
Разноебесплатно

Muse Gadgets

Открытый софт для сборки собственных устройств и экранов с голосовым ассистентом Muse

Разноеплатно

MAI-Transcribe-2-Streaming

Потоковое распознавание речи на 60 языках с откликом от 100 мс для голосовых агентов и живых субтитров.

Разноеплатно

Mercury Voice

Диффузионная языковая модель для голосовых ассистентов с откликом от 320 миллисекунд