
GLM-5.3-FlashX 対 DeepSeek V4.1 Flash:安価なモデルより遅いスピードティア
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Z.aiのプレミアム速度ティアには問題がある。その名はDeepSeek V4.1 Flashだ。Z.aiがGLM-5.3-FlashXを2026年9月18日に投入したとき、新ティアは一つの数字で売り込まれた。最大毎秒200出力トークン、基盤のGLM-5.3-Flashの約5倍のスループットを2.5倍の価格で、というものだ。独立した計測では、すでにDeepSeekの低価格モデルが毎秒214.7トークン、初回トークンまでの時間1.15秒を記録しており、Z.aiが宣伝する上限をどちらも上回り、しかもFlashXが到底及ばない価格だ。速度を買うなら、市場はFlashXの登場前に動いていた。
そのフレーミングは、一点においてはFlashXに対して不公平であり、それ以外のすべてにおいては公平だ。両モデルともコストのために設計された1Mコンテキストのオープンウェイト派生モデルであり、どちらも本来の目的においては genuinely 優れている。しかし、両者は同じ問題の異なる半面のために作られており、その価格差は今や十分に広いため、「どちらが優れているか」はほとんどのワークロードにとって一行で答えが出る。
それぞれが実際にどこで優れているか
• 価格・リスト — GLM-5.3-FlashX は100万入力/出力トークンあたり $0.37 / $1.25 に対し、DeepSeek V4.1 Flash はオフピーク時 $0.15 / $0.60、ピーク時 $0.30 / $1.20br> • キャッシュ入力 — FlashX は100万トークンあたり $0.075 に対し、DeepSeek はオフピーク時 $0.003 で、エージェントループでは大きく積み上がる25倍の開きbr> • 実測スループット — FlashX は最大 200 tok/s(ベンダーのピーク値で、独立した数値は未公表)に対し、DeepSeek は 214.7 tok/s(Artificial Analysis、DeepSeek の API 上)br> • 初回トークンまでの時間 — FlashX は未公表に対し、DeepSeek V4.1 Flash は実測 1.15 秒br> • 独立した知能指標 — FlashX は GLM-5.3-Flash の Artificial Analysis Intelligence Index スコア 42 を継承し、DeepSeek V4.1 Flash は 40br> • アーキテクチャ — 総パラメータ 320B / アクティブ 18B の MoE に対し、総パラメータ 552B でプリフィル時に約 8B、デコード時に 16B がアクティブbr> • 入力モダリティ — テキスト、画像、動画、ファイル に対し、テキストと画像br> • 出力上限 — 131,072 トークン に対し、約 384,000br> • オープンウェイト — GLM-5.3-Flash は MIT ライセンス、FlashX は独自のウェイトを持たないホステッド階層で、DeepSeek V4.1 Flash は MIT ライセンス

そのリストは2度読んでください。その形自体が物語っているからです。FlashXが勝っているのはちょうど2行だけで、しかもどちらも僅差です。独立系のインテリジェンス指標における2ポイントの優位と、動画入力です。DeepSeekは、価格、キャッシュ価格、実測速度、出力長、そして重要な意味でのモダリティの広さで優位に立ちます——画像を入力として受け取り、長い回答を生成するのです。この2ポイントの指数差は、1回のベンチマーク実行のノイズの範囲内であり、あなたのアーキテクチャを決める要因にすべきではありません。
安価なモデルより遅いスピードティア
ここはじっくり考える価値のある部分だ。Z.aiは実際の課題を解決するためにFlashXを構築した。GLM-5.3-Flashは遅いのだ。Artificial Analysisの測定では毎秒98出力トークンで、同規模のオープンウェイトモデル群の中央値は上回るものの、インタラクティブな用途にはほど遠い。同社の解決策はサービングスタックの再構築だった——約10万基の国産アクセラレータ、SGLangベースのエンジン、W8A8量子化、混合精度KVキャッシュ、エンコード・プリフィル・デコード分離アーキテクチャ——であり、同一ハードウェア上でベースライン比約3倍のエンドツーエンドスループットを報告している。
DeepSeekは同じ問題をアーキテクチャ層で解決し、しかも先にそこへ到達した。V4.1 FlashのCausal Encoder–Decoder分割は、一律の数値ではなく、プリフィル時に約8B、デコード時に16Bのパラメータを有効化する。また、FP4 KVキャッシュを備えたCompressed Sparse Attention 2は、グローバルキャッシュをトークンあたり890バイトに削減する。これは前世代が必要としたHBMの約4分の1、SSDストレージの約8分の1にあたる。その結果、中立ラボの計測で毎秒214.7トークンで動作し、同じファーストパーティAPI上で、プレミアム階層を必要としないモデルとなっている。
Z.aiの200はベンダー公表のピーク値であり、DeepSeekの214.7は独立系の中央値だ。これはZ.aiにとって考えうる限り最も不利な比較であり、だからこそそれを割り引いて受け止めるべき理由でもある。すでにウォームで、出力が短く、混雑していないリクエストなら、FlashXがDeepSeekを上回る可能性は十分にある。だが、それを知ることはできない。Z.aiの外部でFlashXのスループット数値を公表した者は誰もいないからだ。今日わかっているのは、両モデルが同じ速度帯にあり、一方のコストがもう一方の3分の1であるということだけだ。

DeepSeekの価格優位性が構造的なものになるのはどこか
DeepSeek V4.1 Flashはオフピーク時、入力トークン100万あたり$0.15、出力トークン100万あたり$0.60を課金し、平日の2つの時間帯(UTC 01:00–04:00および06:00–10:00)には$0.30と$1.20に倍増する。FlashXは$0.37と$1.25の定額だ。これらを並べてみると、機能のように見える定額価格は、作業をスケジュールできる人にとっては実際にはより高くつく料金体系なのだ。
キャッシュ入力の項目は、エージェントのワークロードを左右する。DeepSeekはオフピーク時にキャッシュ入力トークン100万個あたり0.003ドルを請求する。FlashXは0.075ドルで、25倍高い。長いシステムプロンプトとツールスキーマを毎ステップ再送信するエージェントは、毎ステップその差額を支払うことになり、実際の請求額を最も支配しやすい単一の明細項目である。Z.aiはキャッシュストレージを期間限定で無料としているが、これは実際に蓄積される読み取りではなく、ストレージに対する割引である。
そこには対抗軸があり、それはDeepSeek自身の数値にどれだけコストがかかるかについての正直さだ。V4.1 Flashの見出しスコアを支えるベンダー実施の評価は、最大推論エフォートで生成されており、DeepSeekは、エフォート25からエフォート100に移行すると、出力トークンをおよそ2.5倍消費しながらDeepSWE v1.1が66.0から74.2に上がると記録している。2.5倍のトークンでは、高エフォート構成の実効コストは、表示価格が示唆するよりもFlashXにはるかに近い。そしてこのモデルは非常に冗長であると記録されており、Intelligence Indexで中央値130Mに対して250Mの出力トークンを生成する。おしゃべりなモデルの安いトークン単価は、安いタスクと同じではない。価格でこの2つを比較する人は、100万トークンあたりのコストではなく、完了したタスクあたりのコストを比較すべきであり、推定ではなく測定することを想定すべきだ。
具体的にどう決めるか
ワークロードが安定したプレフィックスを持つ長時間実行エージェントなら、DeepSeek V4.1 Flash が最適で、それを決めるのはキャッシュ済み入力比率だけだ。同じ呼び出しで動画理解やファイル入力が必要なら、両者のうちそれらを受け付けるのは FlashX だけだ——これはスペック表上の違いではなく、真の機能差である。長い生成出力が必要なら、DeepSeek の約384Kの出力上限と FlashX の131,072の差は、レポート生成、長いコードファイル、回答するのではなく合成するあらゆるものにとって重要だ。単一のベンチマーク指標で最強の独立スコアが必要なら、FlashX の42対40は確かに本物だが、それを土台にするには小さすぎる。
スタックがすでにルーティング済みなら、両モデルは1つのエンドポイントから到達可能で、これがこれを決着させる最も安価な方法です。OrcaRouterではベンダーの定価が0%のマークアップでそのまま適用されるため、DeepSeekのオフピーク割引や将来のZ.aiの価格変更は発生したその日に反映され、両者の切り替えは統合作業ではなくモデル文字列の変更で済みます。自動フェイルオーバーは特にFlashXにとって持つ価値があります。これは新しいクラスター上の提供開始から3週間のサービング層であり、あなたが備えようとしている障害モードは容量の上限であって、モデルが動かなくなることではないからです。
率直にまとめると、DeepSeek V4.1 Flash はほとんどの本番運用にとってより良いデフォルトだ — トークンあたりもキャッシュ済みトークンあたりも安く、実測でより速く、より長い出力も可能だ。GLM-5.3-FlashX が正しい選択になるのは、動画またはファイル入力を必要とし、その背後によりわずかに高い独立系インデックスを求める、より狭い領域だ。Z.ai はスピード枠にプレミアム価格を付け、高速で安価なモデルがすでに存在する市場に投入した。以上が比較のすべてだ。

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
