Команда Liquid AI выпустила LFM2.5-VL-3B — зрительно-языковую модель на 3 миллиарда параметров, оптимизированную для работы на конечных устройствах. При объеме занимаемой оперативной памяти около 3 ГБ модель способна локально обрабатывать данные на смартфонах, выдавая скорость до 20 токенов в секунду на устройствах уровня Galaxy S26 Ultra. На десктопных процессорах вроде Apple M5 Max этот показатель достигает 228 токенов в секунду, что делает архитектуру применимой для задач реального времени, где критична скорость отклика.
Ключевым фокусом новой версии стало распознавание цифровых интерфейсов и способность взаимодействовать с инструментами. В бенчмарке ScreenSpot-v2, который оценивает навигацию по мобильным, веб- и десктопным экранам, модель набирает 80,7 балла, обходя 8-миллиардную Gemma-4, чей результат составил 51,2. Одновременно с этим разработчики улучшили механизм пространственной привязки объектов к координатам, повысив точность в тестах RefCOCO почти на 30 пунктов за счет масштабирования синтетических обучающих данных.
В основе LFM2.5-VL-3B лежит базовая текстовая модель, предварительно обученная на 34 триллионах токенов, и визуальный энкодер SigLIP2. Архитектурно это система прямого ответа без скрытых цепочек рассуждений, что минимизирует вычислительную задержку до генерации первого токена. Открытые веса уже доступны на Hugging Face, а для интеграции в локальные и серверные пайплайны заявлена нативная поддержка llama.cpp, MLX, vLLM и ONNX.
Поделиться:
DeepSeek-V4-Pro вышел из превью вместе с агентным фреймворком Harness. Что скрывается за новыми бенчмарками
Как изменился базовый английский: от вилок и яблок к ипотеке и аналитике