12 августа 2026 года Liquid AI выпустила LFM2.5-VL-3B — открытую мультимодальную зрительно-языковую модель на 3.1B параметров для работы на устройствах. По данным компании, на наборе из 28 vision-бенчмарков модель достигает уровня более крупных 4B-моделей, а самые крупные скачки показаны на понимании экранов и function calling.

image
image

Что произошло

Вместе с релизом компания опубликовала подробный пост в блоге и модельную карточку, в которых цифры совпадают. Модель построена на текстовой базе LFM2.5-2.6B и визуальном энкодере SigLIP2 400M NaFlex, суммарно 3.1B параметров; контекст составляет 32 768 токенов, поддерживаются 16 языков, включая русский. LFM2.5-VL-3B — не-инференциальная (non-reasoning) модель: она отвечает сразу, без цепочки рассуждений. По заявлению вендора, среднее по 28 vision-бенчмаркам — 69.4 против 57.2 у прежней LFM2-VL-3B, то есть уровень более крупной InternVL 3.5 4B (69.4) и на 0.7 балла ниже Qwen3.5-4B (70.1). Крупнейший скачок — понимание экранов: ScreenSpot-v2 80.7 (desktop 78.7, mobile 81.2, web 82.2) против 2.5–7.6 у предшественницы. Прочие ключевые метрики: grounding RefCOCO precision@1 вырос с 57.1 до 87.9, function calling ToolSandbox — с 26.4 до 59.5, по заявлению вендора на уровне Gemma-4-E2B, BLINK — с 50.2 до 61.5, MUIRBench — с 34.9 до 58.3. Скорость генерации — 228 токенов в секунду на Apple M5 Max и 116 токенов в секунду на AMD Ryzen AI Max+ 395. Веса опубликованы на Hugging Face.

Контекст

LFM2 — собственная серия компактных моделей Liquid AI для работы на устройствах, и LFM2.5-VL-3B — обновлённое поколение зрительно-языковой модели компании. Комбинация компактной LLM-базы с современным визуальным энкодером класса SigLIP2 — не новая схема для рынка, но заявленная эффективность на единицу параметра, когда модель класса 3B дотягивает до уровня 4B-моделей, — новый для класса показатель. Для чтения цифр важно, что измеряют бенчмарки: ScreenSpot-v2 — способность понимать и локализовать элементы на скриншотах интерфейсов, ToolSandbox — точность function calling, RefCOCO — grounding, локализацию объектов на изображении. Не-инференциальный формат — осознанный trade-off: модель жертвует цепочкой рассуждений ради скорости, и потолок на задачах сложного зрительного рассуждения виден по тому, что скачки между поколениями на reasoning-бенчмарках заметно слабее, чем на экранных.

Почему это важно для индустрии

Для отрасли LFM2.5-VL-3B задаёт новый референс для on-device VLM: впервые класс 3B показывает уровень 4B на понимании экранов и function calling, что делает локальных UI-агентов — работающих с мобильными, веб и десктопными интерфейсами без облака — практически реализуемой продуктовой фичей. Слой «прочитать экран и выполнить действие» коммодитизируется: стартап, которому раньше требовалось облако для GUI-агента, теперь может прототипировать на ноутбуке или прямо в браузере через WebGPU. Модель сразу доступна в форматах GGUF, ONNX и MLX и попадает в экосистему llama.cpp, LM Studio, Ollama и Jan, то есть дистрибуция идёт через стандартные открытые рантаймы без привязки к API вендора. Для исследовательского сообщества это возможность быстро воспроизвести заявленную сетку бенчмарков на собственных стендах — первый реальный тест claims компании. Если независимые воспроизведения подтвердят цифры, on-prem-пайплайны UI-автоматизации и понимания документов начнут мигрировать с облачных API на локальные модели, а моделям 4–5B придётся доказывать свою прибавку сверх размера.

Почему это важно для пользователей

Попробовать модель можно прямо сейчас без своего железа: WebGPU-демо работает в браузере, есть Liquid AI Playground. На собственном железе барьер входа практически нулевой: модель занимает около 3 ГБ памяти, а на смартфоне Galaxy S26 Ultra держит около 20 токенов в секунду. На её базе сегодня уже собирается рабочий пилот — локальный UI-агент, который по скриншоту находит элементы интерфейса, выполняет нажатия и вызывает инструменты, или on-device OCR-копилот.

Что пока неизвестно / ограничения

Все бенчмарк-цифры предоставлены самой Liquid AI — в официальном блоге и модельной карточке, где они совпадают, но научной статьи и независимого воспроизведения пока нет. Размах скачка между поколениями на ScreenSpot-v2 — аномалия, которую стоит проверить независимым eval'ом на внешних стендах. Задокументированные сравнения ведутся только с 4B-моделями — InternVL 3.5 4B и Qwen3.5-4B, — ни одна 5B-модель в заявленных бенчмарках не участвует, поэтому экстраполяция «3B догоняет 4–5B» пока остаётся допущением. API, цен и production-данных о развёртывании нет, так что для использования в продукте потребуется внутренний eval на собственных скриншотах и задачах.

Источники

Автор

Look at AI, редакция