
GPT-6.1 Sol 対 GLM-5.3:重みは出荷されたが、請求額は動かなかった
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
OpenAIはGPT-6.1 Solを2026年9月29日のDevDay基調講演で公開し、Z.aiはGLM-5.3を6週間前の2026年8月18日に公開したうえで、そのチェックポイントを1週間保留した。その保留は終わった。zai-org/GLM-5.3は8月25日からHugging Faceで公開されており、約7530億パラメータのBF16/FP8チェックポイントで、うち約400億がトークンあたりのアクティブパラメータだ。その後ダウンロード数は140万件を超えている。こうして、8月以降ほとんどの比較が問い続けてきた疑問——これはオープンモデルなのか、それともレンタルなのか——に答えが出たが、その答えは算数を変えなかった。独立系のボードでは、GPT-6.1 Solが51.8で完了インデックスタスク1件あたり0.72ドル、GLM-5.3が44.8で2.01ドル。トークン単価では安いほうのモデルを所有できるようになっても、完了したジョブ1件あたりでは依然としてほぼ3倍支払うことになる。
各モデルの正体
GPT-6.1 SolはOpenAIのミッドティアGPT-6モデルで、GPT-6 Astraフラッグシップの1段下、低価格なGPT-6 Lunaの1段上に位置します。1,050,000トークンのコンテキストウィンドウ、128,000トークンの出力上限、2026年4月30日の知識カットオフを備え、テキスト、画像、ファイルを入力として受け付けます。推論はlowからmaxまで、デフォルトはmedium。noneとminimalという値は以前GPT-6 Solが受け付けていましたが、現在はエラーを返します。これについてOpenAI自身の移行ガイダンスでは、開発者にlowを代わりに使用するよう指示しています。コストは入力100万トークンあたり$2.00、出力100万トークンあたり$10.00で、キャッシュ済み入力は$0.10です。
GLM-5.3は、ソフトウェアエンジニアリングと長期的なエージェント作業に向けたZ.aiの現行フラッグシップであり、GLM-5.2と同じmixture-of-expertsベース上に構築され、その性能向上はモデルの大型化ではなくポストトレーニングによるものです。テキスト入力・テキスト出力で、どの価格帯でもビジョンは非対応。コンテキストウィンドウは100万トークン、出力上限は128,000トークン、そしてthinkingは常時オンです。非推論モードは存在せず、これはレイテンシに敏感な呼び出しにとって厳しい制約となります。Z.aiの価格表では100万トークンあたり入力$1.40、出力$4.40、キャッシュ済み入力は$0.26。当社のカタログでは入力$1.26、出力$3.96、キャッシュ読み取り$0.234で掲載しているため、ベンダーの価格表のほうがより保守的な数字であり、議論の出発点とすべきものです。
料金表、そしてそれを反転させる行
1次元につき1行、それぞれ両側をオン:
• 入力 — GPT-6.1 Sol は100万トークンあたり2.00ドル、GLM-5.3 は100万トークンあたり1.40ドル。GLM のほうが30%安い
• 出力 — GPT-6.1 Sol は100万トークンあたり10.00ドル、GLM-5.3 は100万トークンあたり4.40ドル。GLM のほうが56%安い
• キャッシュ入力 — GPT-6.1 Sol は100万トークンあたり0.10ドル、GLM-5.3 は100万トークンあたり0.26ドル。優劣が逆転し、Sol のほうが2.6倍安い
• ロングコンテキスト条項 — GPT-6.1 Sol は272,000入力トークンを超えるリクエスト全体を、入力とキャッシュは2倍、出力は1.5倍で再価格設定するのに対し、GLM-5.3 には公開カード上に同等の条項がない
• コンテキストと出力 — 入力1,050,000 / 出力128,000 対 入力100万 / 出力128,000。5%の差で、重要ではない
• モダリティ — テキスト、画像、ファイルを入力、テキストを出力 対 テキストのみ
• 推論の下限 — GPT-6.1 Sol は low、medium(デフォルト)、high、xhigh、max に対し、GLM-5.3 は常時オンで、下げられる下限がない
• 重み — クローズド、APIのみ 対 オープン、ダウンロード可能、FP8
• 独立スコア、Artificial Analysis v4.3.2 の最大エフォート時 — 51.8 対 44.8
• インデックスタスクあたりの独立コスト — 0.72ドル 対 2.01ドル
• インデックス実行の出力トークン数 — 6,700万 対 2億1,000万
img src="2.png" alt="「GPT-6.1 Sol 対 GLM-5.3 — スコアボード」と題された、生成された2列の比較スコアボード。左列「GPT-6.1 Sol」:各行は「知能指数:51.8」「インデックスタスクあたりのコスト:$0.72」「入力価格:100万トークンあたり$2.00」「出力価格:100万トークンあたり$10.00」「インデックス実行時の出力トークン数:67M」「重み:非公開」。右列「GLM-5.3」:各行は「知能指数:44.8」「インデックスタスクあたりのコスト:$2.01」「入力価格:100万トークンあたり$1.40」「出力価格:100万トークンあたり$4.40」「インデックス実行時の出力トークン数:210M」「重み:Hugging Face で公開」。フッターには「Artificial Analysis v4.3.2 に基づく最大努力時の独立した数値。ベンダーの定価。」と記されている。OrcaRouter のロゴが右下隅にある。" /> 最後のそのペアこそが、この対決の決着がつくところであり、それは決して些細な効果ではない。

2億1000万トークン問題
Artificial Analysisは、ボード上のすべてのモデルに対して同じ10項目の評価スイートを実行し、各スコアの背後にあるトークン数を公開している。GLM-5.3は、この実行を完了するのに約2億1000万の出力トークンを生成した。GPT-6.1 Solは6700万を生成した。ボード上の各モデル自身の比較クラスと照らし合わせると、GLM-5.3の2億1000万はクラス中央値の約1億4000万を上回っている一方、Solの6700万は、採点対象であるフラッグシップクラスの中央値およそ8100万を大きく下回っている。出力はどの料金表でも高価な側面であるため、GLM-5.3の出力項目における目玉の56%割引は、実測値と突き合わせると通用しない。つまり、0.44×の価格で3.1×のトークンを出力しており、3.1 × 0.44は1.37 — GLM-5.3は、料金表が実質的に安いにもかかわらず、このワークロードではより高価なモデルなのである。
ボード自身のタスクあたりコストの数値は、方向性とおおよその規模を裏付けている。$2.01 対 $0.72 は 2.8× であり、トークン比だけが示唆するより大きい。なぜなら GLM-5.3 はタスクあたりの入力とキャッシュの明細でもより多く支払うからだ。これが何を証明し、何を証明しないかについては正確に述べておく価値がある。インデックス実行は10件の固定評価であり、それらにおける冗長性はあなたのトラフィックにおける冗長性と同じではない。しかし購入者にとって請求されるのはトークンであり、モデルが長い回答を生成しなければならないどのタスクセットでも、差の形は同じだ。
部分的なオフセットは、キャッシュ入力の行だ。GLM-5.3のキャッシュ読み取りは1.40ドルの基本料金に対して0.26ドル、GPT-6.1 Solのそれは2.00ドルの基本料金に対して0.10ドルだ。安定したプレフィックスを持つあらゆるワークロードで支配的な料率において、Solは2.6倍の差で勝つ。あなたのトラフィックが、1段落の回答を伴う大規模な固定コーパスなら、GLM-5.3は明白に安い選択肢であり、それを選ぶべきだ。あなたのトラフィックが、これら両モデルが作られた対象のトラフィック——エージェントループ、リポジトリ規模の編集、長い生成出力——に似ているなら、キャッシュ入力の優位は3倍のトークン比率の前ではノイズ同然に縮む。
ベンダー番号がどこに落ち着くか
Z.aiの発表時の数値は強力で、そしていつも通り再現されていない。Terminal-Bench 2.1は88.2、DeepSWE v1.1は66.9、CyberGymは84.5、ExploitBenchは54.4、AutomationBenchは48.2、GDPval-AA v2は1769 Elo。二度読む価値がある唯一の数字はTerminal-Bench 3.0の28.3だ — 後継ベンチマークであり、古い方での88.2に対する訂正である。モデルは、そのポストトレーニングが狙ったベンチマークでは卓越していても、同じベンチマークの次世代では平凡であり得る。
OpenAIによるGPT-6.1 Solのローンチ時の数値は、素のスコアではなく、完了したタスク1件あたりのコストを全面的に軸としたものになっている。DeepSWE v1.1はより低い推論エフォートでGPT-6 Solの最良値を6.4パーセントポイント上回り、AutomationBench 1.0.6はミディアムエフォートでClaude Opus 5.5を2.2ポイント上回り、OSWorld 2.0は最大エフォートでGPT-6 Solを7ポイント上回り、Terminal-Bench Science 0.1はタスク1件あたりのコストが半分未満でGPT-6 Solを2倍以上上回っている。注記しておくと、これらはOpenAIのハーネスをOpenAIの設定でOpenAIが選んだベンチマークセット上で実行したものであり、そのいずれも独立に再現されていない。
両ベンダーが公開したセットの重なりは薄く、利用可能な唯一の直接比較は同じベンチマーク上で行われている。Z.aiはDeepSWE v1.1で66.9を報告し、OpenAIはGPT-6 Sol(6.1が置き換えるモデル)で68.8、そして6.1 Solが自身の前身から6.4ポイント改善したと報告している。ベンダー報告の比較では2ポイント差、OpenAI自身の差分ではおよそ6ポイント差だ。これはほぼ制御された比較に近く、独立した委員会が述べていることを示している。すなわち、能力ではほぼ同等だが、仕事を最後までやり遂げるコストでは大きな隔たりがある。
1つのAPI、それとも2つのコントラクト
両モデルともOrcaRouter上にあり、この組み合わせではそこが異例の点だ。GPT-6.1 Solはリリース当日にOpenAI自身の定価でカタログに登場した——100万トークンあたり$2.00と$10.00、キャッシュ入力は$0.10、272,000トークンの段階で$4.00と$15.00になるのも、ベンダーが記載しているとおりにそのまま反映されている——そしてGLM-5.3は$1.26と$3.96、キャッシュ読み取り$0.234でそれと並んでいる。どちらにも上乗せはない。プラットフォームはプロバイダーの定価を変更せずにそのまま通すので、再販業者が再交渉した後ではなく、ベンダーの値下げが当日にこちら側へ反映されるのだ。

それは、この特定の組み合わせでは、ほとんどの場合よりも重要だ。両者のどちらを選ぶかという決定は「どちらが優れているか」ではない — それはあなた自身の出力長に対するしきい値であり、Z.ai が料金表を改定した最初の時点、あるいは OpenAI が 6.1 ティアのティア境界を変更した最初の時点で動く。両方を 1 つのキーの背後に置き、それらの間で自動フェイルオーバーを行い、デプロイではなく設定で変更するルーティングルールを備えることが、そのしきい値を議論するのではなく実際のトラフィックでテストできるようにする。Sol のキャッシュラインがあなたのワークロードで勝つなら、それでルーティングする。回答長が短いままで、コンテキストの崖がない GLM-5.3 のフラットなカードがそのセグメントで勝つなら、代わりにそちらでルーティングする — 同じキー、2 つ目の契約なし、2 つ目の請求なし。

今日どうしても選ばなければならないなら、どちらですか?
• 長い生成出力、エージェント型ループ、出力の多い作業 — GPT-6.1 Sol。トークン数を当てはめると、その差はほぼ3倍に達する。ここが料金表が嘘をつき、実測が嘘をつかないところだ。
• 安定したプレフィックス、短い回答 — GLM-5.3。キャッシュ済み入力と入力の料金は本当に優れており、冗長さが牙をむく機会はない。
• 入力トークンが272,000を超えるあらゆるリクエスト — GLM-5.3。なぜなら GPT-6.1 Sol はその境界でリクエスト全体を再価格設定するのに対し、GLM-5.3 の料金表には同等の段階が存在しないからだ。
• 画像やドキュメントを視覚入力として含むあらゆるもの — GPT-6.1 Sol。GLM-5.3 はテキスト専用であり、これは接戦ですらない。
• 自社の境界内での推論、あるいはベンダー条件の変更に対するヘッジ — GLM-5.3。そして今やダウンロードは約束ではなく実在する。ハードウェアの予算を確保せよ。チェックポイントは大きな FP8 アーティファクトであり、セルフホスティングは API ではなく資本の意思決定である。
• レイテンシに敏感な呼び出し — どちらも注意深く扱わなければならない。GLM-5.3 には推論をオフにする手段がなく、GPT-6.1 Sol には low という下限があり、独立系ボード上で計測された初回トークンまでの時間は332秒で、ボード中央値の3.7と対照的だった。
この記事で比較したモデル3
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
