キッカー「2つの異なる仕事」、見出し「DSpark vs UI-Venus 2.9B」、サブタイトル「279.5Mの速度倍率と9BのGUIエージェント——両者を代替品として扱うのをやめて初めて、この比較は意味を持つ」を備えたヒーローカード。3枚のカードには「279.5Mドラフター——LFM2.5-VL-3Bを高速化するが、単体では何も生み出さない」「9B GUIエージェント——Ant GroupのinclusionAI。クリックし、入力し、操作する」「代替品ではない——一方はランタイム最適化、もう一方はポリシー」と書かれている。フッターには「速度の数値はLiquid AIによるベンダー測定。エージェントのスコアはAnt Groupによるベンダー報告。どちらも独立した再現はされていない」とある。OrcaRouterのロゴが右下隅に合成されている。
Engineering & Research

LFM2.5-VL-3B-DSpark vs UI-Venus 2.9B:GUIエージェントに対する速度倍率

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

LFM2.5-VL-3B-DSpark と UI-Venus 2.9B は「小規模ビジョンモデル」という同じ曖昧な見出しの下に分類され、そのうえで互いに比較されますが、これはカテゴリーエラーであり、誰かが統合に一週間を無駄にする前に正しておく価値があります。LFM2.5-VL-3B-DSpark は 279.5M パラメータのドラフトモデルで、Liquid AI の LFM2.5-VL-3B を高速化します。Ant Group の inclusionAI ラボによる UI-Venus 2.9B は、スクリーンショットを読み取り、操作を判断し、モバイル・ウェブ・デスクトップ環境でそれを実行する 9B の GUI エージェントです。一方は既存のモデルを速くするもの。もう一方は実際に作業を行う当のものです。必要なものが GUI エージェントなのであれば、ドラフターはより安価な選択肢ではありません——そもそも選択肢にすらなりません。

有益な比較は、どちらが優れているかではなく、それぞれがどの問題を解決するのか、そしてその過程でそれぞれがあなたに何を犠牲にさせるかだ。どちらもまた、より広いエコシステムがまだ追いついていない新参であり、それぞれのリポジトリが主張していることと、他の誰かが検証したこととのギャップは、一方のほうが他方よりも大きい。

それぞれが正確に何であるか

まず図形から始めましょう。というのも、残りの大半はそれらが占めるからです。

• 概要 — LFM2.5-VL-3B-DSpark は投機的デコーディング用ドラフターであり、UI-Venus 2.9B は汎用GUIエージェントポリシーです

• パラメータ — ドラフターは279.5M BF16、Qwen3.5-9Bから初期化されたUI-Venus 2.9Bの9Bに対して

• スタンドアロン能力 — ドラフターは単独では使えるものを何も生成できず、単独でベンチマークすることもできない。UI-Venus 2.9B は完全なエージェントとして動作する

• 入力 — ドラフターは画像そのものを決して見ず、ターゲットモデルの隠れ状態のみを見る。UI-Venus 2.9B はスクリーンショットを直接取り込み、それらを全面的に中心に据えて構築されている

• 出力 — ドラフターは検証用のトークンを提案し、UI-Venus 2.9B はライブインターフェースに対してバウンディングボックス付きのグラウンデッドアクションを出力する

• ベース — ドラフターは自身のメタデータでLiquidAI/LFM2.5-VL-3Bに紐付けられている。UI-Venus 2.9BはQwen3.5-9Bを基に構築されている

• コンテキスト — ドラフターはターゲットが提供するものをそのまま継承する。UI-Venus 2.9B は、ベンダー自身の vLLM レシピにおいて最大 262,144 トークンで提供される。

• ライセンス — どちらも異なる形で未解決である。LiquidはLFM1.0ライセンスで提供されており、UI-Venus 2.9Bのカードには、その重みライセンスが最終確認待ちであると明記されている

A two-panel card titled 'Drafter vs agent - different units', subtitled 'One column measures seconds saved. The other measures tasks completed. They are not on the same axis.' The left panel 'LFM2.5-VL-3B-DSpark' has rows: What it is 'Speculative-decoding drafter', Parameters '279.5M BF16', Base 'LiquidAI/LFM2.5-VL-3B', Runs alone 'No, by construction', Its number '2.04x-3.13x decode', License 'LFM1.0, not OSI'. The right panel 'UI-Venus 2.9B' has rows: What it is 'GUI agent policy', Parameters '9B, from Qwen3.5-9B', Base 'Ant Group inclusionAI', Runs alone 'Yes - a complete agent', Its number '80.2 AndroidWorld', License 'Pending final confirmation'. A strip beneath reads 'Neither figure has been reproduced outside the lab that published it. Treat both as ceilings, not expectations.' The OrcaRouter logo is composited in the bottom-right corner.

最後の箇条書きこそ、慎重に検討すべき項目です。私たち自身のUI-Venus-2-9Bに関する8月下旬の報道では、このリリースをApache-2.0として説明していました。当時、プロジェクトの資料にそう記載されていたからです。今日のモデルカードは、より異なる、より強い内容を述べています。すなわち、モデルの重みのライセンスは最終確認待ちであり、公開リリース前に追加される予定であること、そして現在の上流資料にライセンスの矛盾が含まれているため、Apache-2.0の宣言は意図的に引き継がれていないということです。UI-Venus 2.9Bの商用展開を計画しているなら、ライセンスの問題はベンダー自身が認めるところにより未解決であり、それは脚注ではなく重大なリスクです。

双方が実際に公表した数字

2つのリポジトリはそれぞれ別のものを測定しており、まさにそこが要点です。Liquidはスループットを公開し、Ant Groupはタスク成功率を公開しています。

ドラフターについては、Liquid自身のハーネスによれば、SGLang経由の単一H100 80GB(BF16)でデコード速度は最大2.66倍、Apple M5 Max上のMLX-VLMでは最大3.13倍、M3 Ultra上のllama.cppでは最大2.14倍。エンドツーエンドでは、同じ実行でもスタックとタスクに応じて1.30×~2.62×の範囲に収まる。ドラフト受理は検証パスあたりおよそ3.2~4.5トークン。これらはいずれも、外部による再現のないベンダー測定値である。

UI-Venus 2.9B について、モデルカード自体の表は、AndroidWorld で 80.2、50ステップの予算で MobileWorld で 65.8、OSWorld-Verified で 70.8、DeskCraft で 48.0、刷新された595タスク分割全体で WebVoyager で 90.8、Online-Mind2Web で 74.0、ScreenSpot-Pro で 73.0、VenusBench-GD で 77.1 を報告している。CAPTCHA については、VenusBench-CAPTCHA で 78.1、MCA-Bench で 75.7 を報告している。安全性の面では、OSHarm で 11.3% の攻撃成功率を報告しており、これは Qwen3.5-9B ベースの 25.3% に対するものである。これらはすべてベンダー報告であり、一部のベースラインにはアスタリスクが付いており、これは UI-Venus の著者が明記されたプロトコルの下で評価したことを意味し、またモデルカード自体が、OSWorld-Verified の比較はモデル固有のアクションスキャフォールドを使用しており、制御されたアブレーションではなくベンチマークレベルの参考値として読むべきだと警告している。

両方のリストに欠けているものに注目してほしい。第三者によって測定されたものは一切ない。ドラフターの場合、それはチェックポイントが数日前のものだからだ。UI-Venus 2.9Bの場合、それはGUIエージェントのベンチマークは再現にコストがかかり、ライブ環境での結果は評価日における環境の状態によって変動するためだ——これはカードが自ら記している注意点である。

二人が実際に出会う場所

A screenshot of the Hugging Face model card for inclusionAI/UI-Venus-2-9B showing 'Like 34' and 'Downloads last month 8,423'. The card describes UI-Venus-2 as a general-purpose foundation GUI agent covering 170+ multilingual apps and 4,000+ domains across 19 categories, evaluated on OSWorld, AndroidWorld and MobileWorld, and reports an OSHarm attack success rate of 11.3% against 25.3% for its Qwen3.5-9B base and an OSBlind figure of 48.8% against 79.4% for that base.

実際に重なりは存在しますが、それはカテゴリラベルが示唆するよりも狭いものです。オンデバイスまたはエッジ向けの視覚エージェントを構築しているなら、どちらも関連しており、どちらもピクセルをモデルに通すコストに関心があります。両者はその問題に反対の端から取り組みます。

UI-Venus 2.9Bは訓練でそれに挑む。シミュレートされたモバイル、Web、OS環境上でのマルチモーダル中間トレーニング、ドメインごとのオフラインRL、そして単一ポリシーへのマルチティーチャー・オンポリシー蒸留という3段階パイプラインだ。公開された能力はその結果である。モデルは9Bで、GUIエージェントとしては小さく、エッジデバイスとしては大きい。そしてカードが意図するサービング構成はvLLMデプロイメントだ——同じドキュメントは、その構成がカード更新の一環としてライブカナリア検証されなかったと注記し、デプロイ前にQwen3.5向けのvLLMバージョンを固定して検証するよう指示している。

LFM2.5-VL-3B-DSpark はランタイムでそれに挑む。対象モデルの重みには手を付けず、トークンをドラフトして検証することで速度を稼ぐ。スマートフォンクラスのデバイスでは、そのトレードオフはドラフター側に一方的に有利だ。なぜなら、出力は証明可能に対象モデルのものであり、追加メモリはモデルの10分の1未満で済むからだ。

これを選ぶ人にとっての帰結はこうだ。エージェントループはタスクごとに多数のモデル呼び出しを行い、その呼び出しごとに新しいスクリーンショットのプリフィルを支払う。視覚エンコーディングとプリフィルこそ、投機的デコーディングが高速化しない段階であり、Liquid 自身の発表も、自社の見出し数値を無制限に解釈することへの反論としてこの点を挙げている。したがって、ドラフターの優位は、まさに UI-Venus 2.9B が生きるワークロードにおいて縮小する。逆に、UI-Venus 2.9B の優位 — 実際にタスクを完了すること — は、ドラフターがどんな速度でも提供するものではない。

2つを実行する

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B-DSpark showing 'Like 6', the license 'lfm1.0' and 'Model size 0.3B params  Tensor type BF16'. The card text specifies 'Target model: LiquidAI/LFM2.5-VL-3B', 'Draft parameters: 279.5M (BF16)', a backbone of 4 full attention layers at hidden_size=2048 with grouped-query attention plus a Markov head and a confidence head, 'Block size: 9 during training; 8 or 9 at inference', a vocabulary of 128,000, and the notes 'On Apple silicon the drafter is run at block size 8 rather than 9' and 'Use each drafter checkpoint with its corresponding target model'.

どちらも OrcaRouter 上のホスト型エンドポイントではない。LFM2.5-VL-3B-DSpark と UI-Venus 2.9B はどちらも、重みを自分で取得して自分で配信する必要があり、その配信の話は両者の大きく異なる役割によって形作られている。ドラフターには、DSPARK 投機的アルゴリズムのフラグとブロックサイズ 9 を指定した SGLang v0.5.19 以降、またはドラフターをドラフトモデルとして渡し temperature を強制的にゼロにした MLX-VLM v0.7.2 以降、あるいは 567 MB の F16 GGUF を量子化されたターゲットと組み合わせた llama.cpp が必要だ。UI-Venus 2.9B には、最大長 262,144 トークンで 9B モデルを扱えるだけの大きさの vLLM サーバーに加えて、プロジェクトのコードリポジトリにある参照プロンプトとアクションパーサーが必要である——サーバーを起動するだけでは、動作するクローズドループの GUI エージェントにはならない、とカードは明言している。

どちらもまた、それぞれができることの端に同じ隙間を残す。小さな視覚言語モデルとドラフターを組み合わせても、依然として対応できない画面やタスクに出くわし、GUIエージェントは学習分布から外れた環境では依然として失敗する。すり抜けたクエリはどこかに行き着くが、ほとんどの本番設計では、それがより大きな汎用モデルである。それらを各プロバイダーの定価で200以上のモデルをカバーする単一のエンドポイントを通し、プロバイダーが劣化したときには自動フェイルオーバーを伴うルーティングを行うことで、フォールバック経路は、独自のキーと契約を持つ第二のデプロイプロジェクトになってしまうのではなく、重要な統合リストから外れたままにできる。

1分で決める方法

ユーザーインターフェースを操作するソフトウェア——これまで見たことのないアプリをクリックし、タイプし、ナビゲートする——が必要なら、あなたが買うのはポリシーであり、それが UI-Venus 2.9B です。9B vLLM デプロイメントの予算を確保し、商業的にコミットする前に保留中のライセンス問題を読み、ベンダーのベンチマーク表は確定した結果ではなく、有力な出発仮説として扱ってください。特に、カード自体がスキャフォールド依存と指摘している OSWorld-Verified の比較についてはなおさらです。

すでに LFM2.5-VL-3B を運用していて、手持ちのハードウェアでより高速にしたいなら、購入すべきなのはランタイム最適化であり、それが LFM2.5-VL-3B-DSpark です。まず次の3点を確認してください。ワークロードが prefill 中心ではなく decode 中心であること、4-bit エクスポートではなく 16-bit で提供していること、ランタイムがバージョン下限を満たしていることです。3点すべてに当てはまれば、メモリコストは 8.9% で、出力は構造上変わりません。

どちらのリポジトリに触れても生き残らない唯一のもの、それは両者を代替物として扱うことだ。それらはスピードを倍増させるものであり、エージェントでもある。そして両者が競合する唯一のシナリオとは、自分が何を作るかをすでに決めてしまっていて、代わりにもっと安く作る理由を探している場合だけだ。

OrcaRouterは、1つのキーで200以上のモデルにプロバイダー定価・マークアップ0%でアクセスでき、エッジモデルやエージェントが処理すべきでないクエリ向けに、ルーティングポリシーと自動フェイルオーバーを備えています。フォールバック経路のための1つのAPIこのページのどちらのモデルもそこではホストされていません。どちらもあなた自身の重みから提供されていますが、フォールバック経路はあなたが構築しなくてよい部分です。