
LFM2.5-VL-3B-DSpark vs UI-Venus 2.9B:GUIエージェントに対する速度倍率
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 36 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 181 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
LFM2.5-VL-3B-DSpark と UI-Venus 2.9B は「小規模ビジョンモデル」という同じ曖昧な見出しの下に分類され、そのうえで互いに比較されますが、これはカテゴリーエラーであり、誰かが統合に一週間を無駄にする前に正しておく価値があります。LFM2.5-VL-3B-DSpark は 279.5M パラメータのドラフトモデルで、Liquid AI の LFM2.5-VL-3B を高速化します。Ant Group の inclusionAI ラボによる UI-Venus 2.9B は、スクリーンショットを読み取り、操作を判断し、モバイル・ウェブ・デスクトップ環境でそれを実行する 9B の GUI エージェントです。一方は既存のモデルを速くするもの。もう一方は実際に作業を行う当のものです。必要なものが GUI エージェントなのであれば、ドラフターはより安価な選択肢ではありません——そもそも選択肢にすらなりません。
有益な比較は、どちらが優れているかではなく、それぞれがどの問題を解決するのか、そしてその過程でそれぞれがあなたに何を犠牲にさせるかだ。どちらもまた、より広いエコシステムがまだ追いついていない新参であり、それぞれのリポジトリが主張していることと、他の誰かが検証したこととのギャップは、一方のほうが他方よりも大きい。
それぞれが正確に何であるか
まず図形から始めましょう。というのも、残りの大半はそれらが占めるからです。
• 概要 — LFM2.5-VL-3B-DSpark は投機的デコーディング用ドラフターであり、UI-Venus 2.9B は汎用GUIエージェントポリシーです
• パラメータ — ドラフターは279.5M BF16、Qwen3.5-9Bから初期化されたUI-Venus 2.9Bの9Bに対して
• スタンドアロン能力 — ドラフターは単独では使えるものを何も生成できず、単独でベンチマークすることもできない。UI-Venus 2.9B は完全なエージェントとして動作する
• 入力 — ドラフターは画像そのものを決して見ず、ターゲットモデルの隠れ状態のみを見る。UI-Venus 2.9B はスクリーンショットを直接取り込み、それらを全面的に中心に据えて構築されている
• 出力 — ドラフターは検証用のトークンを提案し、UI-Venus 2.9B はライブインターフェースに対してバウンディングボックス付きのグラウンデッドアクションを出力する
• ベース — ドラフターは自身のメタデータでLiquidAI/LFM2.5-VL-3Bに紐付けられている。UI-Venus 2.9BはQwen3.5-9Bを基に構築されている
• コンテキスト — ドラフターはターゲットが提供するものをそのまま継承する。UI-Venus 2.9B は、ベンダー自身の vLLM レシピにおいて最大 262,144 トークンで提供される。
• ライセンス — どちらも異なる形で未解決である。LiquidはLFM1.0ライセンスで提供されており、UI-Venus 2.9Bのカードには、その重みライセンスが最終確認待ちであると明記されている

最後の箇条書きこそ、慎重に検討すべき項目です。私たち自身のUI-Venus-2-9Bに関する8月下旬の報道では、このリリースをApache-2.0として説明していました。当時、プロジェクトの資料にそう記載されていたからです。今日のモデルカードは、より異なる、より強い内容を述べています。すなわち、モデルの重みのライセンスは最終確認待ちであり、公開リリース前に追加される予定であること、そして現在の上流資料にライセンスの矛盾が含まれているため、Apache-2.0の宣言は意図的に引き継がれていないということです。UI-Venus 2.9Bの商用展開を計画しているなら、ライセンスの問題はベンダー自身が認めるところにより未解決であり、それは脚注ではなく重大なリスクです。
双方が実際に公表した数字
2つのリポジトリはそれぞれ別のものを測定しており、まさにそこが要点です。Liquidはスループットを公開し、Ant Groupはタスク成功率を公開しています。
ドラフターについては、Liquid自身のハーネスによれば、SGLang経由の単一H100 80GB(BF16)でデコード速度は最大2.66倍、Apple M5 Max上のMLX-VLMでは最大3.13倍、M3 Ultra上のllama.cppでは最大2.14倍。エンドツーエンドでは、同じ実行でもスタックとタスクに応じて1.30×~2.62×の範囲に収まる。ドラフト受理は検証パスあたりおよそ3.2~4.5トークン。これらはいずれも、外部による再現のないベンダー測定値である。
UI-Venus 2.9B について、モデルカード自体の表は、AndroidWorld で 80.2、50ステップの予算で MobileWorld で 65.8、OSWorld-Verified で 70.8、DeskCraft で 48.0、刷新された595タスク分割全体で WebVoyager で 90.8、Online-Mind2Web で 74.0、ScreenSpot-Pro で 73.0、VenusBench-GD で 77.1 を報告している。CAPTCHA については、VenusBench-CAPTCHA で 78.1、MCA-Bench で 75.7 を報告している。安全性の面では、OSHarm で 11.3% の攻撃成功率を報告しており、これは Qwen3.5-9B ベースの 25.3% に対するものである。これらはすべてベンダー報告であり、一部のベースラインにはアスタリスクが付いており、これは UI-Venus の著者が明記されたプロトコルの下で評価したことを意味し、またモデルカード自体が、OSWorld-Verified の比較はモデル固有のアクションスキャフォールドを使用しており、制御されたアブレーションではなくベンチマークレベルの参考値として読むべきだと警告している。
両方のリストに欠けているものに注目してほしい。第三者によって測定されたものは一切ない。ドラフターの場合、それはチェックポイントが数日前のものだからだ。UI-Venus 2.9Bの場合、それはGUIエージェントのベンチマークは再現にコストがかかり、ライブ環境での結果は評価日における環境の状態によって変動するためだ——これはカードが自ら記している注意点である。
二人が実際に出会う場所

実際に重なりは存在しますが、それはカテゴリラベルが示唆するよりも狭いものです。オンデバイスまたはエッジ向けの視覚エージェントを構築しているなら、どちらも関連しており、どちらもピクセルをモデルに通すコストに関心があります。両者はその問題に反対の端から取り組みます。
UI-Venus 2.9Bは訓練でそれに挑む。シミュレートされたモバイル、Web、OS環境上でのマルチモーダル中間トレーニング、ドメインごとのオフラインRL、そして単一ポリシーへのマルチティーチャー・オンポリシー蒸留という3段階パイプラインだ。公開された能力はその結果である。モデルは9Bで、GUIエージェントとしては小さく、エッジデバイスとしては大きい。そしてカードが意図するサービング構成はvLLMデプロイメントだ——同じドキュメントは、その構成がカード更新の一環としてライブカナリア検証されなかったと注記し、デプロイ前にQwen3.5向けのvLLMバージョンを固定して検証するよう指示している。
LFM2.5-VL-3B-DSpark はランタイムでそれに挑む。対象モデルの重みには手を付けず、トークンをドラフトして検証することで速度を稼ぐ。スマートフォンクラスのデバイスでは、そのトレードオフはドラフター側に一方的に有利だ。なぜなら、出力は証明可能に対象モデルのものであり、追加メモリはモデルの10分の1未満で済むからだ。
これを選ぶ人にとっての帰結はこうだ。エージェントループはタスクごとに多数のモデル呼び出しを行い、その呼び出しごとに新しいスクリーンショットのプリフィルを支払う。視覚エンコーディングとプリフィルこそ、投機的デコーディングが高速化しない段階であり、Liquid 自身の発表も、自社の見出し数値を無制限に解釈することへの反論としてこの点を挙げている。したがって、ドラフターの優位は、まさに UI-Venus 2.9B が生きるワークロードにおいて縮小する。逆に、UI-Venus 2.9B の優位 — 実際にタスクを完了すること — は、ドラフターがどんな速度でも提供するものではない。
2つを実行する

どちらも OrcaRouter 上のホスト型エンドポイントではない。LFM2.5-VL-3B-DSpark と UI-Venus 2.9B はどちらも、重みを自分で取得して自分で配信する必要があり、その配信の話は両者の大きく異なる役割によって形作られている。ドラフターには、DSPARK 投機的アルゴリズムのフラグとブロックサイズ 9 を指定した SGLang v0.5.19 以降、またはドラフターをドラフトモデルとして渡し temperature を強制的にゼロにした MLX-VLM v0.7.2 以降、あるいは 567 MB の F16 GGUF を量子化されたターゲットと組み合わせた llama.cpp が必要だ。UI-Venus 2.9B には、最大長 262,144 トークンで 9B モデルを扱えるだけの大きさの vLLM サーバーに加えて、プロジェクトのコードリポジトリにある参照プロンプトとアクションパーサーが必要である——サーバーを起動するだけでは、動作するクローズドループの GUI エージェントにはならない、とカードは明言している。
どちらもまた、それぞれができることの端に同じ隙間を残す。小さな視覚言語モデルとドラフターを組み合わせても、依然として対応できない画面やタスクに出くわし、GUIエージェントは学習分布から外れた環境では依然として失敗する。すり抜けたクエリはどこかに行き着くが、ほとんどの本番設計では、それがより大きな汎用モデルである。それらを各プロバイダーの定価で200以上のモデルをカバーする単一のエンドポイントを通し、プロバイダーが劣化したときには自動フェイルオーバーを伴うルーティングを行うことで、フォールバック経路は、独自のキーと契約を持つ第二のデプロイプロジェクトになってしまうのではなく、重要な統合リストから外れたままにできる。
1分で決める方法
ユーザーインターフェースを操作するソフトウェア——これまで見たことのないアプリをクリックし、タイプし、ナビゲートする——が必要なら、あなたが買うのはポリシーであり、それが UI-Venus 2.9B です。9B vLLM デプロイメントの予算を確保し、商業的にコミットする前に保留中のライセンス問題を読み、ベンダーのベンチマーク表は確定した結果ではなく、有力な出発仮説として扱ってください。特に、カード自体がスキャフォールド依存と指摘している OSWorld-Verified の比較についてはなおさらです。
すでに LFM2.5-VL-3B を運用していて、手持ちのハードウェアでより高速にしたいなら、購入すべきなのはランタイム最適化であり、それが LFM2.5-VL-3B-DSpark です。まず次の3点を確認してください。ワークロードが prefill 中心ではなく decode 中心であること、4-bit エクスポートではなく 16-bit で提供していること、ランタイムがバージョン下限を満たしていることです。3点すべてに当てはまれば、メモリコストは 8.9% で、出力は構造上変わりません。
どちらのリポジトリに触れても生き残らない唯一のもの、それは両者を代替物として扱うことだ。それらはスピードを倍増させるものであり、エージェントでもある。そして両者が競合する唯一のシナリオとは、自分が何を作るかをすでに決めてしまっていて、代わりにもっと安く作る理由を探している場合だけだ。
OrcaRouterは、1つのキーで200以上のモデルにプロバイダー定価・マークアップ0%でアクセスでき、エッジモデルやエージェントが処理すべきでないクエリ向けに、ルーティングポリシーと自動フェイルオーバーを備えています。フォールバック経路のための1つのAPIこのページのどちらのモデルもそこではホストされていません。どちらもあなた自身の重みから提供されていますが、フォールバック経路はあなたが構築しなくてよい部分です。
