Компания Liquid AI представила легковесную зрительно-языковую модель LFM2.5-VL-3B, ориентированную на локальное выполнение. Архитектура объединяет языковое ядро LFM2.5-2.6B и визуальный энкодер SigLIP2 NaFlex, формируя систему размером 3 миллиарда параметров. При потреблении менее 3.3 ГБ оперативной памяти модель генерирует 228 токенов в секунду на чипах Apple M5 Max и около 20 токенов в секунду на современных мобильных процессорах, что позволяет запускать ее непосредственно на смартфонах без обращения к облачным серверам.
Модель поддерживает 16 языков, включая русский, и работает с контекстным окном до 32 тысяч токенов. Основной упор сделан на пространственную привязку объектов, полностраничное распознавание текста (OCR) с сохранением структуры документов и возможность вызова внешних инструментов (tool use). В результате система оптимально подходит для задач, требующих высокой скорости и минимальной задержки, таких как пакетная обработка документов или распознавание окружения в автомобильных интерфейсах, однако она не рассчитана на анализ сложных чертежей или комплексный визуальный дизайн.
В официальном релизе разработчики предоставили несколько форматов весов для разных сценариев использования. Помимо стандартных контрольных точек, доступны квантованные версии GGUF для центральных процессоров, ONNX для кроссплатформенного развертывания и MLX для устройств экосистемы Apple. Интеграция с фреймворками vLLM и SGLang обеспечивает вариативность развертывания, позволяя встраивать LFM2.5-VL-3B как в высоконагруженные серверные пайплайны, так и в граничные вычисления.
Поделиться:
Релиз Wan 3.0: мультимодальная генерация видео до 30 секунд в 1080p и запуск по API
ComfyUI-H3-FaceRefine: исправление генерации лиц на общих планах в MiniMax H3