Hero-карточка с надзаголовком «ДВЕ РАЗНЫЕ РАБОТЫ» и заголовком «DSpark против UI-Venus 2.9B», подзаголовком «Ускоритель скорости на 279,5M против 9B GUI-агента — сравнение имеет смысл, только если перестать считать их взаимозаменяемыми». На трёх карточках написано: «Драфтер на 279,5M — делает LFM2.5-VL-3B быстрее; сам по себе ничего не создаёт», «GUI-агент на 9B — inclusionAI от Ant Group; кликает, печатает, навигирует» и «Не взаимозаменяемы — один — оптимизация времени выполнения, другой — политика». В подвале указано: «Показатели скорости измерены вендором Liquid AI; оценки агента заявлены вендором Ant Group. Ни то, ни другое не было воспроизведено независимо». Логотип OrcaRouter наложен в правом нижнем углу.
Engineering & Research

LFM2.5-VL-3B-DSpark против UI-Venus 2.9B: множитель скорости против GUI-агента

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

LFM2.5-VL-3B-DSpark и UI-Venus 2.9B относят к одной и той же расплывчатой категории — небольшие визуальные модели — а затем сравнивают друг с другом, и это категориальная ошибка, которую стоит исправить, прежде чем она кому-то обойдётся в неделю интеграции. LFM2.5-VL-3B-DSpark — это драфт-модель с 279,5 млн параметров, которая ускоряет LFM2.5-VL-3B от Liquid AI. UI-Venus 2.9B из лаборатории inclusionAI компании Ant Group — это GUI-агент с 9 млрд параметров, который читает скриншоты, выбирает действие и выполняет его в мобильных, веб- и настольных средах. Одна ускоряет существующую модель. Другой — это то, что выполняет работу. Если вам нужен GUI-агент, драфт-модель — не вариант подешевле, это вообще не вариант.

Полезное сравнение — не в том, что лучше, а в том, какую задачу решает каждое из них и чего каждое из них стоит вам в процессе. Кроме того, оба появились недавно, и более широкая экосистема ещё не успела за ними угнаться, а разрыв между тем, что заявляют их репозитории, и тем, что подтвердил кто-либо ещё, у одного из них больше, чем у другого.

Что именно представляет собой каждый из них

Начните с фигур, потому что они объясняют большую часть остального.

• Что это — LFM2.5-VL-3B-DSpark — это драфтер спекулятивного декодирования; UI-Venus 2.9B — это политика универсального GUI-агента

• Параметры — 279,5 млн BF16 для драфтера против 9 млрд у UI-Venus 2.9B с инициализацией из Qwen3.5-9B

• Автономная работа — драфтер сам по себе не генерирует ничего пригодного к использованию, и его нельзя оценить изолированно; UI-Venus 2.9B работает как полноценный агент

• Входные данные — драфтер никогда не видит само изображение, только скрытые состояния целевой модели; UI-Venus 2.9B напрямую потребляет скриншоты и полностью построена вокруг них

• Выходные данные — модуль-составитель предлагает токены для проверки; UI-Venus 2.9B генерирует привязанные к интерфейсу действия с ограничивающими рамками на живом интерфейсе

• База — драфтер привязан к LiquidAI/LFM2.5-VL-3B в собственных метаданных; UI-Venus 2.9B построен на Qwen3.5-9B

• Контекст — драфтер наследует всё, что предоставляет целевая модель; UI-Venus 2.9B обслуживается с максимальным размером 262 144 токена в собственном рецепте vLLM от вендора.

• Лицензия — обе остаются нерешёнными, но по-разному; Liquid поставляется под лицензией LFM1.0, а карточка UI-Venus 2.9B прямо заявляет, что лицензия на её веса ожидает окончательного подтверждения

A two-panel card titled 'Drafter vs agent - different units', subtitled 'One column measures seconds saved. The other measures tasks completed. They are not on the same axis.' The left panel 'LFM2.5-VL-3B-DSpark' has rows: What it is 'Speculative-decoding drafter', Parameters '279.5M BF16', Base 'LiquidAI/LFM2.5-VL-3B', Runs alone 'No, by construction', Its number '2.04x-3.13x decode', License 'LFM1.0, not OSI'. The right panel 'UI-Venus 2.9B' has rows: What it is 'GUI agent policy', Parameters '9B, from Qwen3.5-9B', Base 'Ant Group inclusionAI', Runs alone 'Yes - a complete agent', Its number '80.2 AndroidWorld', License 'Pending final confirmation'. A strip beneath reads 'Neither figure has been reproduced outside the lab that published it. Treat both as ceilings, not expectations.' The OrcaRouter logo is composited in the bottom-right corner.

Последний пункт — тот, на котором стоит не торопиться. В нашем собственном материале об UI-Venus-2-9B в конце августа выпуск описывался как Apache-2.0, потому что именно это было указано в материалах проекта на тот момент. Сегодня карточка модели говорит нечто иное и более строгое: что лицензия на веса модели ожидает окончательного подтверждения и будет добавлена до публичного релиза, а также что заявление об Apache-2.0 намеренно не было перенесено, поскольку текущие материалы upstream содержат противоречивые утверждения о лицензии. Если вы планируете коммерческое развёртывание UI-Venus 2.9B, вопрос лицензии остаётся открытым по собственному признанию поставщика, и это существенный риск, а не сноска.

Цифры, которые фактически опубликовала каждая сторона

Эти два репозитория измеряют разные вещи — в этом и суть. Liquid публикует пропускную способность; Ant Group публикует успешность выполнения задач.

Для драфтера, согласно собственному стенду Liquid: ускорение декодирования до 2,66× на одном H100 80 ГБ в BF16 через SGLang, до 3,13× с MLX-VLM на Apple M5 Max и до 2,14× с llama.cpp на M3 Ultra. В сквозном режиме те же прогоны дают от 1,30× до 2,62× в зависимости от стека и задачи. Принятие черновика составляет около 3,2–4,5 токена за проход верификации. Все эти показатели измерены производителем и не воспроизведены независимо.

Для UI-Venus 2.9B собственные таблицы карты сообщают 80.2 на AndroidWorld, 65.8 на MobileWorld при бюджете в 50 шагов, 70.8 на OSWorld-Verified, 48.0 на DeskCraft, 90.8 на WebVoyager по обновлённому разбиению из 595 задач, 74.0 на Online-Mind2Web, 73.0 на ScreenSpot-Pro и 77.1 на VenusBench-GD. По CAPTCHA он сообщает 78.1 на VenusBench-CAPTCHA и 75.7 на MCA-Bench. В плане безопасности он сообщает о 11.3% успешных атак на OSHarm против 25.3% для его базы Qwen3.5-9B. Все эти данные предоставлены производителем, некоторые базовые значения отмечены звёздочкой, что означает, что авторы UI-Venus оценивали их по указанному протоколу, и сама карта предупреждает, что сравнения OSWorld-Verified используют специфичные для модели каркасы действий, и их следует рассматривать как ссылки на уровне бенчмарка, а не как контролируемые абляции.

Обратите внимание, чего нет в обоих списках: любых показателей, измеренных третьей стороной. Для драфтера это потому, что чекпойнту всего несколько дней. Для UI-Venus 2.9B — потому, что бенчмарки для GUI-агентов дорого воспроизводить, а результаты в живой среде меняются вместе с состоянием среды на дату оценки; эту оговорку карточка приводит по собственной инициативе.

Где эти двое на самом деле встречаются

A screenshot of the Hugging Face model card for inclusionAI/UI-Venus-2-9B showing 'Like 34' and 'Downloads last month 8,423'. The card describes UI-Venus-2 as a general-purpose foundation GUI agent covering 170+ multilingual apps and 4,000+ domains across 19 categories, evaluated on OSWorld, AndroidWorld and MobileWorld, and reports an OSHarm attack success rate of 11.3% against 25.3% for its Qwen3.5-9B base and an OSBlind figure of 48.8% against 79.4% for that base.

Пересечение действительно есть, и оно уже, чем предполагает название категории. Оба варианта актуальны, если вы создаёте визуального агента, работающего на устройстве или на периферии, и оба касаются затрат на пропуск пикселей через модель. Они решают эту проблему с противоположных сторон.

UI-Venus 2.9B атакует это с помощью обучения: трёхэтапный конвейер мультимодального промежуточного обучения на симулированных мобильных, веб- и ОС-средах, затем офлайн-RL по каждому домену, а затем дистилляция on-policy с несколькими учителями в единую политику. Опубликованная возможность и есть результат. Модель содержит 9B параметров — это мало для GUI-агента и много для граничного устройства, а предполагаемая конфигурация обслуживания в карточке — развёртывание на vLLM. Та же документация отмечает, что эта конфигурация не была валидирована в режиме live-canary в рамках обновления карточки, и советует зафиксировать и проверить вашу версию vLLM для Qwen3.5 перед развёртыванием.

LFM2.5-VL-3B-DSpark атакует эту проблему на уровне рантайма: он не трогает веса целевой модели и покупает скорость за счёт генерации черновых токенов и их проверки. На устройстве телефонного класса этот компромисс односторонний в пользу черновика, потому что выход доказуемо принадлежит целевой модели, а дополнительная память составляет менее одной десятой размера модели.

Последствие для любого, кто выбирает: агентный цикл совершает множество вызовов модели на одну задачу, и каждый вызов оплачивает prefill за новый скриншот. Кодирование изображений и prefill — это ровно те этапы, которые спекулятивное декодирование не ускоряет; само объявление Liquid приводит этот аргумент против безоговорочной трактовки его главных цифр. Поэтому преимущество драфтера сужается ровно в той рабочей нагрузке, в которой живёт UI-Venus 2.9B. И наоборот, преимущество UI-Venus 2.9B — фактическое выполнение задачи — не то, что драфтер обеспечивает при любой скорости.

Запуск двух

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B-DSpark showing 'Like 6', the license 'lfm1.0' and 'Model size 0.3B params  Tensor type BF16'. The card text specifies 'Target model: LiquidAI/LFM2.5-VL-3B', 'Draft parameters: 279.5M (BF16)', a backbone of 4 full attention layers at hidden_size=2048 with grouped-query attention plus a Markov head and a confidence head, 'Block size: 9 during training; 8 or 9 at inference', a vocabulary of 128,000, and the notes 'On Apple silicon the drafter is run at block size 8 rather than 9' and 'Use each drafter checkpoint with its corresponding target model'.

Ни один из них не является хостируемым эндпоинтом на OrcaRouter. LFM2.5-VL-3B-DSpark и UI-Venus 2.9B требуют, чтобы вы сами скачали веса и запустили их обслуживание, а то, как их обслуживать, определяется их совершенно разными ролями. Драфтеру нужен SGLang v0.5.19 или новее с флагом спекулятивного алгоритма DSPARK и размером блока 9, либо MLX-VLM v0.7.2 или новее, где драфтер передаётся как draft-модель, а температура принудительно установлена в ноль, либо llama.cpp с F16 GGUF размером 567 МБ в паре с квантованной целевой моделью. UI-Venus 2.9B нужен сервер vLLM, достаточно большой для модели на 9B с максимальной длиной в 262 144 токена, а также эталонные промпты и парсеры действий из репозитория с кодом проекта — в карточке прямо указано, что одного запуска сервера недостаточно, чтобы получить работающего GUI-агента с замкнутым контуром.

Оба также оставляют одинаковый разрыв на границах своих возможностей. Небольшая визуально-языковая модель в паре с драфтером всё ещё сталкивается с экранами и задачами, которые не может обработать, а GUI-агент всё ещё даёт сбои в средах за пределами своего обучающего распределения. Запросы, которые не проходят, куда-то попадают, и в большинстве продакшен-архитектур это более крупная универсальная модель. Маршрутизация их через единую конечную точку, охватывающую 200+ моделей по прейскурантной цене каждого провайдера, с автоматическим переключением при деградации провайдера, избавляет резервный путь от необходимости попадать в список критически важных интеграций, а не превращает его во второй проект развертывания с собственными ключами и контрактами.

Как принять решение за одну минуту

Если вам нужна программа, которая управляет пользовательским интерфейсом — кликает, печатает, перемещается по приложению, которого никогда не видела, — вы покупаете политику, и это UI-Venus 2.9B. Предусмотрите бюджет на развертывание 9B vLLM, изучите нерешенный вопрос лицензии, прежде чем брать на себя коммерческие обязательства, и относитесь к таблице бенчмарков поставщика как к сильной исходной гипотезе, а не к окончательному результату, особенно к сравнениям OSWorld-Verified, которые сама карточка отмечает как зависящие от скаффолда.

Если вы уже запускаете LFM2.5-VL-3B и хотите ускорить её на вашем собственном оборудовании, вы покупаете рантайм, и это LFM2.5-VL-3B-DSpark. Сначала три вещи: что в ваших рабочих нагрузках преобладает декодирование, а не префилл, что вы обслуживаете в 16-битном формате, а не в 4-битном экспорте, и что ваш рантайм соответствует минимальным версиям. Если все три условия выполняются, потребление памяти составляет 8,9 %, а выходные данные не изменяются по построению.

Единственное, что не выдерживает соприкосновения ни с одним из этих двух репозиториев, — это отношение к ним как к взаимозаменяемым вариантам. Они — ускоритель и агент, и единственный сценарий, в котором они конкурируют, — тот, где вы уже решили, что именно строите, и ищете причину построить вместо этого что-нибудь подешевле.

OrcaRouter предоставляет доступ к более чем 200 моделям через один ключ по прейскурантной цене провайдера с наценкой 0%, с политикой маршрутизации и автоматическим переключением при сбое для запросов, которые не должна обрабатывать периферийная модель или агент.один API для резервного путиНи одна из моделей на этой странице там не размещена — обе работают на ваших собственных весах — но резервный путь — это та часть, которую вам не нужно создавать.