
GPT-6 Sol vs MiniMax M3:出力価格が8倍でもなお買えないもの
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
最初に言うべきことはGPT-6 Sol対MiniMax M3、価格面でもスコア面でも差は大きく、しかも両者は逆方向を指しているということだ。MiniMax M3は自分でダウンロードして実行できるオープンウェイトモデルで、100万入力トークンあたり0.30ドル、100万出力トークンあたり1.20ドルと表示されている。2026年9月22日にリリースされたGPT-6世代の中間層であるGPT-6 Solは、同じ単位で2.00ドルと10.00ドルだ。これは出力単価の8倍を少し超える。MiniMax M3は入力モダリティとして動画も受け付けるが、GPT-6 Solは受け付けない——Solモデルが受け付けるのはテキスト、画像、ファイルだ。M3に欠けているのは、Solのスコアに近いスコアだ。Artificial AnalysisのIntelligence Indexでは29.2対47.6、同じリビジョンv4.3.2のボード上で。
その非対称性こそが物語のすべてであり、それは単純な価格対品質のトレードオフよりも興味深い。なぜなら、オープンウェイトの列は、クローズドの列がどんな価格でも売ることができないものを保持できるからだ。M3のチェックポイントはHugging Faceにあり、モデルはネットワーク境界内で実行できる。この2つのどちらかを選ぶなら、有用な問いはどちらが優れているかではない。あなたが買っている4つの別々のもの——価格、スループット、制御、能力——のうち、どれを失う余裕があるかだ。
4つの次元があり、それらは同じようには順位付けされない
• 出力価格 — GPT-6 Sol $10.00/100万トークン 対 MiniMax M3 $1.20/100万トークン
• 入力価格 — GPT-6 Sol $2.00/100万トークン 対 MiniMax M3 $0.30/100万トークン
• キャッシュ入力 — GPT-6 Sol $0.20/100万トークン 対 MiniMax M3 $0.06/100万トークン
• 重み — GPT-6 Sol はクローズド、APIのみ 対 MiniMax M3 はオープンウェイトかつセルフホスト可能
• 入力モダリティ — GPT-6 Sol テキスト、画像、ファイル 対 MiniMax M3 テキスト、画像、動画
• コンテキストウィンドウ — GPT-6 Sol 1,050,000トークン 対 MiniMax M3 1,048,576トークン
• 最大出力 — GPT-6 Sol 128,000トークン 対 MiniMax M3 512,000トークン
• インテリジェンス指数 — GPT-6 Sol 47.6 対 MiniMax M3 29.2
• コーディング指数 — GPT-6 Sol はこのリビジョンでは未公開 対 MiniMax M3 58.6
• 長文リクエストの段階 — GPT-6 Sol は272,000入力トークンを超えるとリクエスト全体の価格を再設定 対 MiniMax M3 は料金カードに段階なし
そのうちの2行は、1行以上に値する。最大出力の上限は、他のすべてとは逆方向に働く。M3 は1回の応答で最大512,000トークンを出力し、GPT-6 Sol の128,000の4倍だ。1回の呼び出しでファイル全体や長いレポートを生成するワークロードにとって、それは丸め誤差ではなく構造的な優位性である。そして長いリクエストの段階は、M3 にはまったくない GPT-6 Sol の実際のコストだ — 入力トークンが272,000を超えると、Sol はリクエスト全体を $4.00 / $15.00 に再価格設定するが、M3 のカードには同等の条項がない。300,000トークンのプロンプトでは、出力レートの比較は8倍ではなく、12.5倍である。
正直な順位付けは、ワークロード次第でまったく変わる。大量処理の分類や抽出のように、誤った回答のコストは低く、遅い回答のコストは高くつく場合、長文コンテキストのペナルティがない $0.30 / $1.20 の M3 が妥当なデフォルトであり、Sol は無駄金でしかない。最初の回答が正しくなければならないタスク——移行計画、セキュリティレビュー、それに基づいて行動する人に読まれる推論——では、出力価格が8倍でも18.4ポイントのインデックス差は、ほとんどのチームが受け入れる取引だ。そうしなければ、人間に金を払って修正してもらうことになるからだ。

M3の公表数値が異例なほど良好なのはどこか、そしてそれが乏しいのはどこか
MiniMax M3の最も強い独立系スコアは、この価格のモデルに期待するようなところにはない。長文コンテキスト想起は83.0で、GPT-6 Solの83.7を0.7下回るだけ、実質同点だ。しかも100万トークン窓で、入力価格は6分の1である。GPQA Diamondは92.9で、フロンティア帯に十分近く、その差は能力差というより推論エフォート設定の違いによって生じ得る範囲に収まっている。この2つの数値があるからこそ、M3は「安い」で片付けるのではなく、真剣に受け止める価値がある。
薄弱な部分も同様に明白であり、曖昧にごまかすのではなく明言すべきだ。リテール型のツール利用は貧弱だ。tau-bankingではM3が15.3を記録し、より新しいTerminal-Bench 4.0改訂版では2.0を記録する。これらはどちらも第三者による測定であり、どちらも、ベンチマーク平均が、模擬サービスに対するエージェント型ツール呼び出しにおける特定的で大きな弱点を隠しているモデルを示唆している。ベンダー自身が報告した数値ははるかに良い印象を与える——SWE-Bench Pro 59、BrowseComp 83.5、MCP Atlas 74.2、Terminal-Bench 2.1は66——そしてそれらは自社ハーネス上のベンダー数値であり、測定ではなく主張である。ツール利用に依存するあらゆる導入は、この2つの数値を併せて読み、直接テストすべきだ。
ベンチマーク比較そのものについて、二次的な論点があります。GPT-6 Sol は、当社のカタログにおいて M3 よりも少ないベンチマークセットで測定されています — M3 の23件に対して5件です。これは、ベンダーの公開情報が少なく、第三者が同モデルに対して実施したテストもより少ないためです。23件の公開数値を持つモデルは、5件しか持たないモデルよりも常により徹底的に評価されているように見えますが、その違いは能力ではなくドキュメント(文書化)の差です。
オープンウェイトが実際にもたらすもの:より低い請求額を超えて
M3 のセルフホスティングは、GPT-6 Sol には太刀打ちできない選択肢であり、その価値は主に金銭的なものではない。$0.30 / $1.20 では、API はほとんどのチームがハードウェアを動かすコストよりも安い。したがって、それをダウンロードする理由はスプレッドシートではなく制約にある。すなわち、境界の外に出せないデータ、許容できる外部依存を持てないワークロード、ファインチューニング、あるいは共有エンドポイントでは満たせないレイテンシ予算である。オープンウェイトは、それら4つのうちクローズドモデルが答えられる唯一のものであり、そしてクローズドモデルは、利用できないことによってそれに答える。GPT-6 Sol の答えは、それを実行する必要はないというものだ——これは別の議論であり、別のチーム群にとっては真である。
スループットは、モデルが示さない数値なので、それ専用の行を設ける価値があります。{{1}}MiniMax M3{{/1}}は、当社のローリング7日間ウィンドウで毎秒およそ495出力トークンと測定されています。{{2}}GPT-6 Sol{{/2}}はおよそ244です。M3は、この比較で単に安価なモデルというだけではなく、当社のルートでは約2倍高速であり、そのことはバッチジョブのコストをドルだけでなくウォールクロック時間でも変えます。ただし注意点として、これらは共有プレイグラウンドでのローリングウィンドウであり、管理されたベンチマークではなく、変動します。

ペアを1つのシステムとして実行する
両モデルは他の200以上と並んで単一のOrcaRouterキーの背後にあり、そのためここで興味深い構成は選択ではなく、安価なモデルを優先するカスケードになる。大量のトラフィックはMiniMax M3へ流し、チェックに失敗するか難易度シグナルに引っかかるリクエストのためにその背後にGPT-6 Solを残しておけば、難しい呼び出しは依然として47.6を記録するモデルに届きながら、ブレンドコストはSolの料金よりもオープンウェイトの料金にはるかに近づく。その組み合わせを表現する場所がOrcaRouterのルーティングDSLだ — 呼び出しは、タスクごとに1つのエンドポイントをハードコードする代わりに、複数のモデルとそれらの間の条件を指定できる。
本当に決められないチームにとって、モデル融合は同じ発想の乱暴な版だ。複数のモデルが一斉に回答し、その応答を組み合わせる。大量処理には向かず、めったに実行しない高リスクのプロンプト——29.2の回答と47.6の回答の差だけがページ上の唯一の関心事になるような場面——にはまずまず向いている。
フェイルオーバーは、クローズドモデルよりもオープンウェイトモデルのほうが重要です。それには明確な理由があります。M3 は複数のインフラプロバイダーによって提供されており、エンドポイントもそれぞれ異なります。事前に設定された第2のルートがあれば、遅いホストや性能が低下したホストは障害ではなくリトライで済みます。また、当社のカタログはプロバイダーの定価をマークアップなしでそのまま反映しているため、ベンダーの料金改定は当日中に当社側でも有効になります。これは、ベンダーがキャッシュ入力のレートを1つ変えるだけで請求額が目に見えて変わる $1.20 の出力ラインでは重要です。

実際にどちらに電話すべきか
大量処理、動画入力を求めるもの、1回の応答で128,000トークン超を出力する必要があるもの、自社の境界内で実行しなければならないものには MiniMax M3 を採用せよ。回答そのものが製品となるリクエスト、M3 の tau-banking と Terminal-Bench 4.0 のスコアが脚注ではなく警告となるツール多用のエージェントループ、18ポイントのインデックス差が出力レートの8倍の価値があるとあなたが考えるあらゆる用途には GPT-6 Sol を採用せよ。どちらもあなたのトラフィック全体を説明しないなら、両方を採用し、ルーターに決めさせよ。
どちらに進む前にも確認すべきことが1つあり、それはこのブログが繰り返し直面してきた同じ確認ポイントです。M3は2026年5月以降Mシリーズの旗艦であり、当社のカタログ内で最新のMシリーズモデルでもあり続けているため、まさに現行です。しかしGPT-6 SolはすでにGPT-6.1 Solに取って代わられており、同じショートコンテキスト料金で、キャッシュ入力はより安価になっています。そしてGPT-6 Solのページ自体に、その後継へのポインタがあります。ここでSolを検討している理由が、8日前の統合ではなく能力であるなら、まず後継を見てください。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
