ヒーロータイトルカード:DeepSeek V4.1 Flash vs GLM-5.2 — 2つのMITモデル、1つの退屈な答え
Guides & Insights

DeepSeek V4.1 Flash 対 GLM-5.2:2つのMITモデル、1つの退屈な答え

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

DeepSeek V4.1 FlashGLM-5.2は同じ種類の存在であり、そしてそこがたいていの比較が飛ばしてしまう部分だ。どちらも Mixture-of-Experts モデルで、どちらも MIT ライセンスのもとでダウンロード可能な重みとして提供され、どちらも100万トークンのコンテキストを扱え、どちらも自ら学習させていないベンダーが提供するホスト型 API を通じて利用できる。GLM-5.2 のほうが先に登場し、そのリリース時点では Artificial Analysis Index で51を記録する、オープンウェイトモデルとして最高スコアのモデルだった。DeepSeek V4.1 Flash は2026年9月10日に、DeepSeek の新しいアーキテクチャファミリーの中で、より小型で新しく安価なモデルとして登場した。両者を比べるうえで重要なのは、どちらがより賢いかではない。実際に自分が抱えている仕事に対して、どちらを動かせるのか、そしていくらのコストで動かせるのか、ということだ。

彼らが共有しているもの、つまりその大部分

まず重なっている部分から始めましょう。それによって、通常の意思決定基準のほとんどが排除されるからです。オープンモデルとクローズドモデルのどちらを選ぶかという場合、ベンダーロックインを検討し、ファインチューニングできるかどうかを検討し、ベンダーが一方的に条件を変更できるかどうかを検討します。ここではそのいずれも当てはまりません。DeepSeek V4.1 Flash と GLM-5.2 はどちらも MIT ライセンスで、重みを自分で取得してホストできます。どちらも入力として100万トークンを扱えます。どちらも MoE アーキテクチャです。つまり、トークンごとに活性化する重みはほんの一部であるため、総パラメータ数に対してどちらも低コストで実行できます。

つまり、比較はオープン対クローズドではなく、長いコンテキスト対短いコンテキストでもない。それは四つか五つの数字の集合であり、その数字はコストでは一方の方向を、成熟度ではもう一方の方向を指している。

実際にどこで分岐するのか

• 100万トークンあたりの料金 — DeepSeek V4.1 Flash はオフピーク時で入力 $0.15 / 出力 $0.60、GLM-5.2 は入力 $1.40 / 出力 $4.40。これは入力価格の9倍強、出力価格の7倍強にあたります。

• キャッシュ入力 — オフピーク時、100万トークンあたり V4.1 Flash は $0.003、GLM-5.2 は $0.26。エージェントループの請求額を支配するこの費目において、実に90倍近い差です。

• パラメータ — V4.1 Flash は合計552Bで、入力時に8B、出力時に16Bがアクティブになるのに対し、GLM-5.2 は合計約745Bで、約40Bがアクティブです。GLM-5.2 は1トークンあたり約2.5倍のパラメータをアクティブにします。

• 最大出力 — V4.1 Flash 384Kトークン 対 GLM-5.2 128Kトークン。上限は3倍。

• コンテキストウィンドウ — 各100万トークン。レベル。

• 独立系インデックススコア — GLM-5.2はArtificial Analysis Indexで51を記録し、リリース時点でオープンウェイトモデルの中で最高となっています。DeepSeek V4.1 Flashはまだ公開されたIndex値を有していません。

• 初回トークンまでの観測レイテンシー — OrcaRouter自身の7日間のテレメトリーでは、V4.1 Flashがp50で2.63秒、p95で9.05秒であるのに対し、GLM-5.2はp50で2.36秒、p95で10.00秒でした。中央値は同水準です。テールはそうではありません。

価格の方向性と成熟度の方向性は逆である。GLM-5.2 は、独立したスコアを持ち、より長い実績を有するモデルだ。DeepSeek V4.1 Flash は、トークン単価がより安く、入力価格は9分の1、出力の上限は3倍のモデルだ。このリストをどう読んでも、一方のモデルが単純に支配しているという解釈は成り立たない。

Two-column scoreboard: DeepSeek V4.1 Flash vs GLM-5.2 — price per 1M tokens $0.15 input and $0.60 output vs $1.40 and $4.40, cached input $0.003 vs $0.26, total parameters 552B vs about 745B, active parameters 8B input and 16B output vs about 40B, context window 1M tokens on both, max output 384K tokens vs 128K tokens, Artificial Analysis Index score not yet published vs 51, both MIT-licensed, and a p50 time to first token of 2.63 s vs 2.36 s

テールは過小評価されているラインだ

オープンウェイトモデルの比較の多くは、まずインデックススコアを掲げる。代わりに注目すべきはレイテンシのテレメトリだが、それはあなたが予想する理由からではない。中央値は横並びなのだ。GLM-5.2のp50の初回トークンまでの時間は2.36秒で、V4.1 Flashは2.63秒だ。これは差ではなく、共有ネットワーク上のノイズである。より安価なモデルに初回トークンの優位性があると引用する人は、間違ったパーセンタイルを読んでいる。

p95は両者が分かれる地点であり、その方向は価格差から示唆されるものとは逆だ。GLM-5.2の最悪ケースの待ち時間は10.00秒、V4.1 Flashのそれは9.05秒である。これは中央値よりも重要だ。なぜなら、ユーザーが気づくリクエストは遅いものだからだ。普段は即時に応答し、時折10秒間止まるツールは、常に3秒で返るツールにはない形で信頼できないものに見える。そして、1ターンに10回の呼び出しを並列展開するエージェントループでは、p95こそが、そのターンが人の忍耐の範囲内で完了するかどうかを決める数値だ。GLM-5.2のテールは欠陥ではない。トークンあたり約400億個のパラメータを活性化するより大きなモデルであり、コストはかかるだけのことだ。しかし、それこそが、このモデルが非同期の仕事——キュー、バッチジョブ、誰も見ていないバックグラウンドエージェント——に、リクエスト・レスポンス型インターフェースよりも適している理由である。

どちらのモデルも、私たちが確認できるページではスループットの数値を公表していない。これは穴埋めするのではなく、率直に言っておく価値がある。初回トークンまでの時間は、この2つが共通のデータで比較できる唯一のレイテンシ次元であり、その次元において正直に読み取れるのは、中央値では同等で、テールでは近いということだ。

指数スコアが決着をつけるものとつけないもの

GLM-5.2のArtificial Analysis Indexにおける51は、実際に独立して算出された数値であり、このモデルにとって最も強力な単一の根拠である。ただしこれは複合指標でもある。複数の評価セットを集約した単一の数値であり、そのため一般的な能力の要約としては優れているが、個別の特定タスクにおける性能を予測するものとしては乏しい。51を記録するモデルとスコアが未公表のモデルは、51を記録するモデルと40を記録するモデルとは同じではない。

DeepSeek V4.1 Flashについての率直な見解は、独立した実績が薄いというもので、その理由は登場からの日数の短さにある。一般提供が開始されてから12日しか経っていない。同モデルが登場している最近のサードパーティによる横断評価の1つ、2026年9月21日公開のAgents on Railsエージェント型コーディングボードでは、最大エフォートで17%、中位に位置し、GLM-5.3 Flashの15%より上、Gemini 3.8 Flashの23%より下だった。これは狭い一事項を測る単一のボードにすぎず、Indexスコアの代わりにはならない。現時点でV4.1 Flashが能力でGLM-5.2を上回ると主張する人は、測定結果を報告しているのではなく、アーキテクチャと価格から外挿しているだけだ。

それぞれの主張を、率直に述べたもの

DeepSeek V4.1 Flashは、ワークロードが大量処理、低レイテンシ重視、あるいは出力が多い場合に選ぶべきモデルです。入力価格が9分の1、キャッシュ読み取り価格がおよそ90分の1というのは、毎ターン・コンテキストを読み直すエージェントループにおいて構造的な優位性であり、384Kの出力上限は128Kとは別カテゴリの成果物です。タスクが分類、抽出、長文の構造化生成、あるいはエージェントパイプライン内の大量処理実行者であるなら、コスト差はわずかではありません——実行可能なパイプラインと実行不可能なパイプラインを分ける差なのです。

GLM-5.2は、意思決定を正当化するために公開された独立検証済みの能力指標が必要なとき、あるいは作業が非同期で、最悪10秒の待ちが気にならないときに手を伸ばすべきモデルです。それは成熟した選択です。スコアは存在し、挙動は文書化され、他の人々がその限界を見つけられるほど長く本番環境で使われてきました。そこには確かな価値があり、それは価格の欄には表れません。

どちらも明らかに正解でない場合——混在するトラフィックを扱う汎用アシスタント——に有用なのは、どちらかを選ぶことではない。トラフィックの大半は安価なモデルに送り、必要なリクエストのために高価なモデルを取っておくことだ。

両方を1つのシステムとして稼働させる

両モデルはオープンウェイトで、しかも両方ともホストされているため、ここでは split-and-route パターンのセットアップが異例なほど低コストであり、まさにここで OrcaRouter のルーティング層が、後付けの売り込みではなく、その存在意義を証明する。両モデルは単一のキーの背後にあるため、ルーティングの判断は2つ目の統合ではなく設定だ。短く大量のリクエストを DeepSeek V4.1 Flash に、長い非同期ジョブを GLM-5.2 に送るルールは、アプリケーションコード内の分岐ではなく、数行で済む。

この組み合わせに特に関係するプラットフォームの特性が2つある。OrcaRouter はプロバイダーのリスト価格を0%のマークアップでそのまま通すため、上記の数値はベンダー自身の料金であり、DeepSeek のピークスケジュールは DeepSeek が定義するとおりに正確に適用される——平日のピークは UTC 01:00~04:00 および 06:00~10:00 で、週末は完全にオフピークであり、これほど安価なモデルでは明示的に下す価値のあるスケジューリング上の判断である。さらに、ルーティング DSL は複数のモデルを1回の呼び出しに組み合わせることができ、これは強みが重ならない2つのオープンウェイトモデルを使う自然な方法である。安価なモデルが生成し、より強力なモデルがレビューし、呼び出し側は単一のレスポンスを受け取る。両方のパスの背後には自動フェイルオーバーがあり、これは2つのモデルの一方が12日前に登場したばかりで、あなたのデータに対する挙動がまだ知られていない場合に重要である。

これが妥協ではなく適切な構成である理由は、2つのモデルが競合しない軸で異なっているからだ。一方は高速で安価、もう一方はスコア付きで低速。両方を使うパイプラインはヘッジではなく、道具をタスクに合わせているのだ。

Screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model id, 1M-token context, 128K max output, text input and text output, $1.40 input and $4.40 output per 1M tokens, and observed time to first token of 2.36 s at p50 and 10.00 s at p95

何を見るべきか

• DeepSeek V4.1 Flash について公表された Artificial Analysis Index の数値。それが存在するまでは、これら2つのモデル間の能力比較は測定ではなく議論であり、そしてそれを決着させる唯一の証拠である。

• GLM-5.2 のレイテンシプロファイルが改善するかどうか。その p95 は 10.00 秒で、ホスティングプロバイダーが最適化を進めるにつれて動く可能性が最も高い数値であり、現時点では2つのモデル間で測定された単一の最大の差異である — 料金ではなく、テールの待ち時間である。

• DeepSeekのピーク時間帯スケジュールが変わるかどうか。入力トークン100万個あたり0.15ドルのモデルでは、ピーク時の倍率がコストモデルにおける最大の単一変数となる。

それらのうち最初のものが出るまでは、正確な要約はこうだ。DeepSeek V4.1 Flash は入力で約9倍、キャッシュ済み入力ではほぼ90倍、GLM-5.2 より安く、出力上限は3倍ある。独立したスコアを持ち、実績も長いのは GLM-5.2 であり、初回トークンまでの中央値は、最悪ケースでは及ばないものの、より安価なモデルと同水準だ。どちらも MIT。どちらもキー1つで使える。勝者ではなく、ワークロードで選べ。

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id with a Featured badge, 1M-token context, 384K max output, text and image input, $0.15 input and $0.60 output per 1M tokens, a cache read rate of $0.003, and a p50 time to first token of 2.63 s

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新