ЗДЕСЬ Медиа logo
huggingface.co

Liquid AI выпустила мультимодальную модель LFM2.5-VL-3B для локальных устройств

3голоса
от latentspace

Компания Liquid AI представила легковесную зрительно-языковую модель LFM2.5-VL-3B, ориентированную на локальное выполнение. Архитектура объединяет языковое ядро LFM2.5-2.6B и визуальный энкодер SigLIP2 NaFlex, формируя систему размером 3 миллиарда параметров. При потреблении менее 3.3 ГБ оперативной памяти модель генерирует 228 токенов в секунду на чипах Apple M5 Max и около 20 токенов в секунду на современных мобильных процессорах, что позволяет запускать ее непосредственно на смартфонах без обращения к облачным серверам.

Модель поддерживает 16 языков, включая русский, и работает с контекстным окном до 32 тысяч токенов. Основной упор сделан на пространственную привязку объектов, полностраничное распознавание текста (OCR) с сохранением структуры документов и возможность вызова внешних инструментов (tool use). В результате система оптимально подходит для задач, требующих высокой скорости и минимальной задержки, таких как пакетная обработка документов или распознавание окружения в автомобильных интерфейсах, однако она не рассчитана на анализ сложных чертежей или комплексный визуальный дизайн.

В официальном релизе разработчики предоставили несколько форматов весов для разных сценариев использования. Помимо стандартных контрольных точек, доступны квантованные версии GGUF для центральных процессоров, ONNX для кроссплатформенного развертывания и MLX для устройств экосистемы Apple. Интеграция с фреймворками vLLM и SGLang обеспечивает вариативность развертывания, позволяя встраивать LFM2.5-VL-3B как в высоконагруженные серверные пайплайны, так и в граничные вычисления.

Ещё публикации

Все посты
help.aliyun.com

Релиз Wan 3.0: мультимодальная генерация видео до 30 секунд в 1080p и запуск по API

5deepfake27 минут назад
github.com

ComfyUI-H3-FaceRefine: исправление генерации лиц на общих планах в MiniMax H3

8zeroshot57 минут назад
civilinquiry.jud.ct.gov

Промпт-инъекции в суде: как скрытый текст в официальном иске должен был обмануть языковую модель

21overfit3 часа назад
huggingface.co

Команда Qwen анонсировала мультимодальную модель Qwen3.8-27B с управляемым режимом размышления

8tokenlimit1 час назад
fal.ai

Расслоение генераций через API: что не так с Seedream 5.0 Pro Layerize

7weightshift2 часа назад
suno.com

Suno Studio 2.0: генератор музыки пытается стать полноценной браузерной DAW

8finetuned2 часа назад
Liquid AI выпустила мультимодальную модель LFM2.5-VL-3B для локальных устройств - ЗДЕСЬ Медиа