
LFM2.5-8B-A1B-DSpark vs Qwen3-8B:モデルを高速化するドラフト、誰もがすでに実行している8Bに挑む
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianNEWQwen3.8 27B2026-08-1552知能68コーディング
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokNEWSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
Liquid AIは2026年8月20日、LFM2.5-8B-A1B-DSparkドラフトチェックポイントをリリースしました。これは、単一のH100上でLFM2.5-8B-A1B edge MoEの生成を最大3.18倍高速化する、327.7Mパラメータの投機的デコーディング支援ツールです。この比較を正直に行う前に、一つ事実をテーブルの上に載せる必要があります。DSparkチェックポイントは呼び出して使えるモデルではなく、別のモデルを高速化するだけです。したがって、このリリースが促す実際のデプロイに関する問いは、ほとんどのチームがこの一年ずっと検討してきたもの——LFM2.5-8B-A1BかQwen3-8Bか——という、それぞれのライフサイクルにおいて非常に異なる段階にある2つの8Bクラスのオープンウェイトモデルの選択です。
ここでフレーム(枠組み)がいつも以上に重要になるのは、両者が同種のものではないからだ。Qwen3-8Bは、今日すぐにセルフホストまたはトークン購入が可能な、完全でデプロイ可能なモデルである。LFM2.5-8B-A1Bもまた、完全でデプロイ可能なモデルである——DSparkドラフトはそのアドオンであり、バージョンではない。ドラフトが約束するすべては、ベンダーによる計測結果であり、1日前のデータである。リポジトリとフォーマットに関するすべては、確認できるようにそこにあるだけだ。本稿は、この2つのカテゴリを分けて扱う。
まず、「DSpark」という単語はこの文の名詞ではありません。
投機的デコーディングは、本物のモデルの代わりに軽量なドラフトモデルを先に走らせる手法です。ドラフターは次の数トークンを推測し、ターゲットモデルはそのブロック全体を1回のフォワードパスで検証し、一致した部分だけを採用します。推測が当たれば、1回の重み読み込みパスのコストで複数トークンを進められるため、ターゲットモデルの重みに触れることなくスループットが向上します。さらに、ターゲットモデルが提案されたすべてのトークンを検証するため、グリーディーデコード時の出力はLFM2.5-8B-A1Bを単独で実行した場合と同一になります。Liquidはこれを「構造上ロスレス」(lossless by construction)と呼び、これこそがドラフトを取り付けることが安全である理由のすべてです。
LiquidのLFM2.5-8B-A1B-DSparkは、意図的に小さく設計されたドラフターモデルです。アテンション層のみ5層、ステップごとに9トークンを提案するブロック、そしてターゲットの128,000トークン語彙に対するマルコフヘッドを備え、チャット・コード・関数呼び出しデータを混ぜたデータセットで15エポック訓練されています。チェックポイントの選定は損失ではなく受理率に基づいています。これはベンダーがその日に出荷した3つのドラフトのうちの1つであり、同じくLFM2.5-1.2B-InstructとLFM2.5-2.6Bがリリースされました。いずれもSafetensorsとGGUF形式で提供され、初日からSGLangとllama.cppに対応しています。また、8Bクラスのモデルとの比較を読む人にとって重要な点ですが、このモデルはどの推論プロバイダーからも提供されておらず、トークンあたりの料金もありません。このモデルは、ユーザー自身の投機的デコードスタックの中だけで動作します。

実際にデプロイされる2つのモデル
ドラフトを取り除けば、本当の比較は、それが加速するモデルと従来モデルの間にある。両方ともオープンウェイトで約8Bクラスだが、似ているのはそこまでだ:
アーキテクチャ — LFM2.5-8B-A1BはスパースMoEであり、総パラメータ数は8.3Bだが、トークンごとにアクティブになるのは約1.5Bのみ。一方、Qwen3-8Bは高密度な8.2Bモデルで、すべてのトークンで全パラメータを活性化する。
• リリース — LFM2.5-8B-A1B は2026年5月28日にリリースされました。Qwen3-8B は2025年4月にリリースされ、1年以上経過しており、一部のサービングプラットフォームではすでに非推奨となっています。
• コンテキスト — LFM2.5-8B-A1Bはネイティブ128Kのコンテキストと128Kトークンの語彙を備えています。Qwen3-8Bはネイティブ32Kで、YaRNにより約128Kまで拡張可能です。
• 推論 — LFM2.5-8B-A1Bは、明示的な思考連鎖(チェーン・オブ・ソート)を出力する推論モデルです。Qwen3-8Bは、リクエストごとに思考モードと非思考モードを切り替えます。
{{1}}知能 — Artificial Analysisによると、LFM2.5-8B-A1Bは知能指数8、Qwen3-8Bは8〜8.3を記録しており、いずれも同等クラスのオープンウェイトモデルの中央値9を下回っています。{{2}}どちらもフロンティア級の頭脳ではなく、{{3}}両モデルともその点を正直に認めています。{{4}}
• 速度 — Artificial Analysisによると、LFM2.5-8B-A1Bは各プロバイダーで毎秒約340トークンを出力します。一方、Qwen3-8Bは毎秒37〜40トークン程度で、同クラスで最も遅い部類に入ります。
• ライセンス — LFM2.5-8B-A1BはLiquidのLFM Open License v1.0に基づきます。Qwen3-8BはApache-2.0です。

スピードこそ、これが僅差でなくなる点だ。
8Bクラスのオープンウェイトモデルをめぐる議論が動いた最大の理由は、メモリ単位あたりの速度だ。Qwen3-8Bはdenseモデルであり、生成されるトークンごとに8.2Bの重みをすべてメモリバス経由でストリーミングするため、サイズの割に遅く、本格的なVRAMが必要になる。LFM2.5-8B-A1Bは、すべてのトークンを約1.5Bのアクティブパラメータにルーティングする。これが設計の要点そのものだ——高速でコンパクトなオンデバイスMoEである。Liquid自身の主張はさらに踏み込む。ベンダー報告によれば、M5 Max CPU上で6GB未満のメモリ使用で毎秒約253トークンを処理するという。デプロイ可能なモデルの生のスループットに関しては、この点ではドラフトは問題にすらならない。スペキュレーションを追加する前から、MoEはdense 8Bより数倍高速なのだ。
価格に関して言えば、両モデルともオープンウェイトなので、セルフホスティングにかかるコストは、いずれの場合もお使いのハードウェアのコスト次第です。ホスティング比較では提供状況に大きな差があります。Qwen3-8Bは、AlibabaのAPIからリスト価格で入力100万トークンあたり0.18ドル、出力100万トークンあたり2.10ドルで提供されており、さらに多数のサードパーティ製オープンモデルホストでも利用できます。一方、LFM2.5-8B-A1Bには注目すべきファーストパーティのホスティング・トークン価格がなく、ドラフト版にはまったくありません。つまり、現在ほとんどのチームがLiquidのエッジMoEを実際に実行する方法は、セルフホスティング、すなわち手元のラップトップ、エッジボックス、または自前のGPU上で実行することで、まさにその構成においてDSparkドラフトが重要な変数になります。
この決定に対して、このドラフトが実際に変更する点
このドラフトが変更するのは一軸のみ、すなわち、制御下のサービングスタック上でLFM2.5-8B-A1Bがトークンを生成する速度である。モデルが賢くなるわけではなく、回答内容が変わるわけでもない——グリーディー出力はターゲット単体とビット単位で同一である。効果があるのは、単一リクエストのスループットにおけるGPUサービングだ。Liquidは単一H100上で5つのベンチマークにわたり平均2.54倍(418→1,074トークン/秒)、MATH500ではバッチサイズ1・温度0で最大3.18倍を計測した。ほとんど効果がないのはAppleシリコンで、同じモデルはM4 Max上で平均1.18倍(90→106トークン/秒)にとどまった。これは、ドラフトトークンのブロックを検証する際にllama.cppの現在のMetal MoEバックエンドでより多くのエキスパートが活性化され、ウェイト転送量が増えるためで、投機的復号が償却しようとするコストそのものである。これらはすべてリリース当日のベンダー公称値であり、独立に再現されたものではない。
この分割は、そのまま意思決定ルールに対応します。自前のGPUでLFM2.5-8B-A1Bを運用する場合、ドラフトは真のコスト削減レバーです。同じシリコンから毎秒約2.5倍のトークンを得られ、しかも出力はまったく変わりません。必要なのは、8月20日のDSpark統合を含むビルドだけです。一方、API経由でモデルを呼び出す場合は、高速化の恩恵を受けるのはプロバイダー側で、ドラフトはあなたにとって無関係です。さらに、デバイスがラップトップまたはスマートフォンの場合、この特定モデルに対するドラフトは現時点ではほぼ無意味です。オンデバイスで効果を発揮するのは、dense(高密度)モデルであるLFM2.5-1.2B-InstructとLFM2.5-2.6B向けの姉妹ドラフトで、それぞれ2.54倍と2.27倍の高速化を実現します。一方、Qwen3-8Bはドラフトを一切必要としません。単に、より低速で高密度なモデルであり、デプロイするために投機的復号を必要としないからです。

Qwen3-8Bが誕生して1年、その選択
Qwen3-8Bは、退屈だが正しいデフォルトです。成熟しており、Apache-2.0、119言語対応、思考モードと非思考モードを備え、あらゆる場所で提供され、チャット、コード、構造化テキストに対しても依然として十分に優れた汎用モデルです。その問題点は古さと速度です。16か月前の高密度8Bモデルであり、同クラスとしては遅く、一部のプラットフォームではすでに非推奨となっています。これは、今日グリーンフィールドプロジェクトを始めるのであれば、真剣に検討すべきメンテナンス上のシグナルです。
LFM2.5-8B-A1Bは、より新しく、より焦点を絞った賭けである。コンシューマーハードウェア上での高速なツール呼び出しと指示追従のために構築されたエッジファーストのMoEであり、GPUセルフホストケース向けのオプションのサービングブーストとしてDSparkドラフトを備えている。これはより賢いモデルではない——両者ともArtificial Analysisのオープンウェイト中央値より下に位置する——しかし、トークンあたりのメモリがわずかで劇的に高速であり、それがオンデバイスエージェントにとって重要なトレードオフである。その注意点はQwen3-8Bの鏡像である。すなわち、リリースがより新しく、ファーストパーティのホスティング価格がなく、投機的デコーディングの数値はベンダー以外の誰もまだ再現していない。
どちらの場合でも、その下にあるルーティング層は同じままです。LFM2.5-8B-A1BもQwen3-8Bも、現時点ではOrcaRouterのホステッドカタログには含まれていません。したがって、正直な言い方をすれば、ルーターがこの組み合わせに対して果たす役割は次のとおりです:200以上のホステッドモデルに単一のAPIでアクセスでき、プロバイダーのリスト価格を0%マークアップでそのまま通過させるため、ベンダーの値下げは発表当日にプラットフォーム上で反映されること;自動フェイルオーバーにより、実績のない新しいモデルは本番経路を賭ける対象ではなく、実際のトラフィックに対して試す対象となること;そして、自分で運用するモデルの前面に配置できるルーティングDSLを備えており、これによりセルフホストのLFM2.5-8B-A1Bスタックが、ホステッドエンドポイントと単一のキーの背後で共存できます。
ラップトップやエッジボックス向けに構築していて、ツール呼び出しの速度を重視するなら、LFM2.5-8B-A1Bはテストすべき方向です。そのドラフトは、いざというときにGPUサービング経路で無料の2.5倍の速度向上をもたらします。考えなくて済むゼネラリストが欲しいなら、Qwen3-8Bでもまだ機能します — ただし、これは2025年初頭のモデルであり、エコシステムが置き換えを始めつつあることを認識しておいてください。ドラフトもターゲットも変えない唯一の点は、証拠の正直な状態です。DSparkリリースの高速性に関するすべては、単一のベンダーによる単一の日の測定結果であり、独立したベンチマークが、これを実際にどこまで信じるかを決定する未解決の項目です。
