生成されたヒーロータイトルカードは「GPT-6 Luna vs GLM-5.3」と表示し、サブタイトルは「タスクあたり10倍のコストで8インデックスポイント、しかも重みは依然として公開されていない」で、チップにはLunaが100万あたり$0.10/$0.50でインデックス37、GLM-5.3が100万あたり$1.40/$4.40でインデックス45、インデックスタスクあたりのコストが$0.07対$0.68と表示され、右下にOrcaRouterのロゴが付いている。
Guides & Insights

GPT-6 Luna対GLM-5.3:依然としてダウンロードできないオープンウェイトモデル

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

GLM-5.3はより優れたモデルだ。最大エフォート時でArtificial Analysis Intelligence Indexの45を記録しており、GPT-6 Lunaの37と対比される。Z.aiによれば、一部のサイバーセキュリティ評価ではMythos 5と同等であり、複数の総合ボードで主要なオープンウェイトモデルにもなっている。また、現時点では、所有するモデルではなくレンタルするAPIだ。Z.aiはサイバーセキュリティ上の懸念から重みの公開を約2週間遅らせており、オープンウェイトのフラッグシップの最大の目的であるはずのダウンロードはまだ提供されていない。

その遅延こそがこの対決の核心であり、価格表が見落としている形で計算を変える。GPT-6 Lunaは2026年9月22日に、入力100万トークンあたり0.10ドル、出力100万トークンあたり0.50ドルで登場し、一般提供され、条件はなかった。GLM-5.3は2026年8月18日に1.40ドルと4.40ドルで登場した——Lunaの入力料金の14倍、出力料金のほぼ9倍——しかも重みは伏せられていた。したがって比較はオープン対クローズドではない。今日呼び出せるクローズドモデルを10分の1のコストで、まだ手に入れられないものを買うかのように価格づけされた、今日呼び出せるだけのオープンモデルと比べているのだ。

2つのモデル、1か月違いで、まったく異なる2つの取引

GPT-6 Lunaは、OpenAIのGPT-6世代における小型ティアであり、GPT-6 Solとともに$2.00/$10.00で提供され、フラッグシップのGPT-6 Astra($10.00/$50.00)の下位に位置します。1,050,000トークンのコンテキストウィンドウ、128,000トークンの出力上限、テキストと画像の入力、そしてnone、low、medium、high、xhigh、maxへと至る推論ラダーを備えており、デフォルトはmediumです。OpenAIはこれを、集中した大量処理に最適なファミリー内で最も効率的なモデルと位置づけており、料金表もそれを裏づけています。キャッシュ済み入力は100万トークンあたり$0.01で、すでに低い非キャッシュ時の10分の1です。

GLM-5.3は、複雑なソフトウェアエンジニアリングと長期的なエージェント型作業に向けたZ.aiの現行フラッグシップであり、2026年8月18日にリリースされました。テキスト入力・テキスト出力で、100万トークンのコンテキストウィンドウと128,000トークンの出力上限を備え、常に推論が有効です。非推論モードはありません。Z.aiは、GLM-5.2と比べてコーディング体験がおよそ50%向上したと説明し、リポジトリ規模のコーディングと自律的な多段階エンジニアリング向けに位置づけています。重みは、公開されれば目玉機能になるでしょう。現時点で稼働しているのはAPIです。

2つの料金表が実際に述べていること

1次元につき1行、それぞれ両側をオン:

• 入力 1M あたり — GPT-6 Luna $0.10 対 GLM-5.3 $1.40

• 出力 100万あたり — GPT-6 Luna $0.50 対 GLM-5.3 $4.40

• キャッシュ入力 — GPT-6 Luna は100万トークンあたり$0.01、GLM-5.3 は100万トークンあたり$0.26で、自身の入力レートに対して81%の割引

• AA Intelligence Index — GPT-6 Luna 37(最大エフォート時)vs GLM-5.3 45(最大エフォート時)

• デフォルト努力スコア — デフォルトの中程度設定における GPT-6 Luna 29 対 常時推論の GLM-5.3、最大設定で測定

• インデックス実行時の出力トークン — GPT-6 Luna 150M 対 GLM-5.3 210M、リーダーボード中央値 140M に対して

• インデックスの実行にかかるコスト — GPT-6 Luna $122.39 対 GLM-5.3 $2,503.48

• インデックスタスクあたりのコスト — GPT-6 Luna 約$0.07 に対し GLM-5.3 約$0.68

• コンテキストと出力 — GPT-6 Luna 1,050,000 in / 128,000 out 対 GLM-5.3 1M in / 128,000 out

• 長コンテキスト条項 — GPT-6 Luna は入力とキャッシュが2倍、272K 入力を超えると出力が1.5倍で、リクエスト全体に適用。GLM-5.3 には公開カード上に同等の条項なし

• 推論オフスイッチ — GPT-6 Luna は none から max まで、GLM-5.3 は常時オンで非推論モードなし

• 重み — GPT-6 Luna はクローズド、API のみ。一方 GLM-5.3 はコミットメントによりオープン、リリースは延期

A generated single-panel scoreboard card headed 'Same suite, ten times the task cost' with six rows: GPT-6 Luna $0.10 in / $0.50 out per 1M with index 37 at max effort; GLM-5.3 $1.40 in / $4.40 out per 1M with index 45 at max effort; cost per completed index task about $0.07 against about $0.68; output tokens on the index run Luna 150M against GLM-5.3's 210M and a board median of 140M; reasoning configuration Luna none through max against GLM-5.3 always on with no off switch; and weights, Luna closed and API-only against GLM-5.3 open by commitment with the release delayed. Footer: 'Index and cost per task per Artificial Analysis; prices per OpenAI and Z.ai.'

冗長性税こそが、これを決める数字だ

8ポイントの指標差は実際にあり、価格差はさらに大きいが、どちらも最も重要な数字ではない。最も重要なのは、完了したタスクあたりの出力トークン数だ。なぜなら、そこでは8ポイントの能力優位が元を取れるかどうかが決まるからだ。

Artificial Analysisのインデックス実行は、利用できる中で最もクリーンな統制比較だ。同じスイート、同じハーネスを、両方のモデルに対して実行している。GLM-5.3はこれを完了するのに2億1000万の出力トークンを生成した。GPT-6 Lunaは1億5000万だった。ボード中央値の1億4000万に対して、どちらもおしゃべりだ — GLM-5.3は中央値の1.5倍、GPT-6 Lunaはおよそ1割増し。だが、その差の向きは、価格の面でZ.aiのモデルに不利に複合する。40%多いトークンを出力し、1トークンあたり8.8倍の料金を課しているのだ。

両者を突き合わせると、完了したインデックスタスク1件あたりのコストはGLM-5.3で約0.68ドル、GPT-6 Lunaで約0.07ドルになる——およそ10倍の差で、これは生の料金表の比率より大きい。より高価なモデルのほうが冗長でもあるからだ。これがこの組み合わせの正直な姿である。GLM-5.3は、完了したジョブ1件あたり10倍の金で8インデックスポイントを買うことになり、それが良い買い物かどうかは、あなたのワークロードにおいて8ポイントが「動くか動かないか」の差になるかどうかに完全に依存する。

多くの本番トラフィックにとってはそうではない。モデルにできることの限界ぎりぎりのリポジトリで作業するコーディングエージェントにとっては、しばしばそうであり、失敗するタスクでは、どれほどの価格優位も能力の差を埋めることはできない。

なぜオープンウェイトが答えを変え、なぜ遅延がそれを元に戻すのか

オープンウェイトのフラッグシップモデルに関する標準的な論拠は、トークンあたりの価格は一時的なものだというものだ。利用量が購入を正当化するまではレンタルし、その後モデルをダウンロードすれば、トークンの限界費用は電気代になる。その論法に従えば、GLM-5.3の$1.40/$4.40は、実際にはGPT-6 Lunaの$0.10の14倍ではない——それはゼロへ向かう途中の橋渡し価格であり、クローズドモデルのより安い料金は出口のないレンタルなのだ。

その主張は正しく、現在は停止されている。Z.aiはサイバーセキュリティに関する所見を理由に、重みを約2週間保留した。つまり、プレミアムを正当化する出口の道筋はまだ存在しない。それが存在するまでは、GLM-5.3は従量制APIであり、汎用ボードで4ポイント、コーディングボードで1ポイント後れているモデルと比べてタスクあたり10倍のコストがかかる——そして購入者は、クローズド重みへのアクセスに対してオープン重みの価格を支払っている。

指摘しておく価値のある二次的な論点がある。この遅延はスキャンダルではない。ベンダーが能力に関する発見を真剣に受け止めているということであり、脆弱性をうまく見つけるモデルは、ラボがダウンロード可能なファイルとして公開する際に慎重になるべき、まさにそういう種類のモデルだ。しかし、それは重みの公開日が今やこの比較で最も重要な日付そのものになったことを意味しており、しかもその日付は公表されていない。12か月の期間でこの2つのモデルのどちらを選ぶかというチームは、条件が来月にも変わりうるモデルと、条件が変わりえないモデルのどちらを選ぶかを選んでいることになる——そして、それに見合った価格設定がされているのは、そのうち片方だけだ。

マイグレーションの対象範囲は小さい

両モデルはともに OpenAI 互換の chat completions サーフェスを備え、どちらも 1M クラスのコンテキストウィンドウを持ち、出力は 128,000 トークンで上限が設けられている。そのため、両者間の移植は書き直しというよりも設定変更に近い。実際に支障をきたす違いは、構造上のものではなく挙動上のものだ。

GPT-6 Lunaの長コンテキスト条項は高くつく方だ。272,000入力トークンを超えるリクエストは、リクエスト全体に対して入力料金とキャッシュ料金が2倍、出力料金が1.5倍で請求されるため、300,000トークンの呼び出しは、同じ作業を2回に分けた場合の2倍のコストになる。GLM-5.3の公開カードには同等の条項がない。このことは、真に大規模な単一リクエストでは価格差をかなり縮め、出力の多いジョブではそれを逆転させうる。

推論の設定は逆方向に作用する。GLM-5.3 は常に推論がオンで、オフにする方法が用意されていない。これはレイテンシに敏感な用途にとって厳しい制約であり、分類器やルーターでは使えない。GPT-6 Luna は none、low、medium、high、xhigh、max を提供し、デフォルトは medium で、そこでは 37 ではなく 29 のスコアになる。この単一のパラメータが、GPT-6 Luna が Z.ai のモデルに 8 インデックスポイント差をつけられるか、16 ポイント差をつけられるかの分かれ目であり、これを明示的に設定せずに移行するチームは、1つ目の構成を買ったと思い込みながら2つ目の構成を動かしていることになる。

GLM-5.3はZ.aiの定価でOrcaRouter上にあります。パススルー価格設定のもとでは、ベンダーの料金改定はリセラーが再交渉するのを待たずに当日中に当社側へ反映されます。これは、重みが公開された時点で看板となる数字が動くと見込まれるモデルにとっては、いつも以上に重要なことです。GPT-6 Lunaは本稿執筆時点で当社のカタログには含まれておらず、OpenAI自身のAPI経由で利用します。両方を運用するチーム——両者が極端な部分で大きく異なることを踏まえると、ここではこれが合理的な構成です——は、GLM-5.3用の1つのキーを、OpenAI用にすでに使っているものと並べて運用し、5セントの分類器とリポジトリ規模のコーディングエージェントの間で、デプロイではなくルートを変更することでトラフィックを移します

A screenshot of the Artificial Analysis page for GPT-6 Luna (max), showing an Intelligence rank of 6th of 183 models, a Speed rank of 35th, a Cost rank of 20th and a Verbosity rank of 36th, input pricing of $0.10 and output of $0.50 per 1M tokens, an Intelligence Index score of 37 against a comparable-model median of 12, 150M output tokens generated during the index run, 153.9 tokens per second, and a total of $122.39 spent evaluating the model.

電話

プログラムが消費する用途や大量処理には GPT-6 Luna を選びましょう。分類、抽出、ルーティング、一括要約、エージェントの内部ループ。$0.10/$0.50 で、キャッシュ済み入力は 1 セント、Batch は標準料金の半額なので、完了したタスクあたりのコストは GLM-5.3 より一桁安く、8 ポイントのインデックス差はあなたの評価では見えないでしょう。effort パラメータを明示的に設定し、長い呼び出しは 272,000 トークン未満に抑えてください。

難しいタスクで、請求額よりも答えが重要なときはGLM-5.3を選べ。リポジトリ規模のソフトウェアエンジニアリング、自律的な多段階作業、タスクが完了するか失敗するかを分けるのがインデックス8ポイントといったあらゆる場面だ。冗長さは確かな負担であり、タスクコストが10倍になるのも事実だが、やり直しが必要なモデルより、最後までやり切るモデルのほうが安上がりだ。

そして、重みに注目してほしい。Z.aiがGLM-5.3のダウンロードを公開する日こそ、この比較の中心的な事実が変わる日であり、それはこのページに載っている日付の中で、まだカレンダーに記されていない唯一の日付だ。

A screenshot of the OrcaRouter model page for GLM-5.3 (z-ai/glm-5.3), showing the Tools, JSON and Reasoning badges, a 2026-08-18 catalogue date, 1M-token context with 128K maximum output, list pricing of $1.26 input and $3.96 output per 1M tokens, a p50 time to first token of 3.99s, 1807.1M tokens of traffic, and the description of GLM-5.3 as Z.ai's flagship model for complex software engineering and long-horizon agentic tasks.

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新