「GPT-6.1 Sol vs MiniMax M3」というタイトルの生成されたヒーローカード。角丸のパネルが2つあり、左は「GPT-6.1 Sol」で「OpenAI - 2026年9月29日リリース」「100万トークンあたり入力 $2.00 / 出力 $10.00」「AA Index 51.8」「タスクあたり $0.72」を列挙。右は「MiniMax M3」で「MiniMax - 2026年5月31日リリース」「100万トークンあたり入力 $0.30 / 出力 $1.20」「AA Index 29.2」「タスクあたり $0.51」を列挙。両者の間には「より安いカード、より小さな請求 - インデックスポイント差 22.6」という一文。フッターは「数値: Artificial Analysis v4.3.2.」、右下にOrcaRouterのロゴ。
Guides & Insights

GPT-6.1 Sol対MiniMax M3:安い料金表が請求額で負ける

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

MiniMax M3が求める額のほんの一部しか求めないGPT-6.1 Sol — 100万入力トークンあたり0.30ドル 対 2.00ドル、100万出力トークンあたり1.20ドル 対 10.00ドル — そして実際に動くメーターで見れば、より安い。Artificial Analysis の v4.3.2 評価でタスクあたり0.508ドル 対 0.724ドルだ。これは紛れもない勝利であり、同時にそれが議論のすべてでもある。なぜなら、M3 に低い請求額をもたらすのと同じ測定が、GPT-6.1 Sol に22.6ポイントのインデックス優位をもたらし、モデルがエージェント作業を説明できるかではなく完遂できるかを測るベンチマーク群が、その差を壁に変えてしまうからだ。ベンダーは2026年9月29日に GPT-6.1 Sol を出荷した。同社は2026年5月31日に、4280億パラメータのオープンウェイトモデルである M3 をリリースした。

どちらも稼働中で、どちらも価格が設定されており、どちらもAPI呼び出し1回で使える。以下では、両者を選別する計算と、その計算だけでは全体像を語れない2つの点を示す。

各モデルの正体

GPT-6.1 Solは、推論とソフトウェアエンジニアリングにおけるOpenAIの現行フラッグシップだ。クローズドモデルであり、置き換える対象であるGPT-6 Solのわずか1週間後にリリースされ、前世代と同じ$2.00 / $10.00の定価で販売されている。キャッシュ入力の料金は$0.10で、GPT-6 Solがキャッシュヒットに課していた価格の半額であり、OpenAIがチャットではなくエージェント型コーディングについて語るときに指し示すモデルでもある。

MiniMax M3は、総パラメータ数4280億、トークンあたりのアクティブパラメータ230億のmixture-of-expertsモデルで、MiniMax Community Licenseの下で公開されています——非商用の独自ライセンスによるオープンウェイト公開であり、OSI承認のライセンスではありません。これを提供する推論プロバイダーは幅広く存在します。Artificial Analysisは、M3について15のホストを記録しているのに対し、GPT-6.1 Solは8つです。この広がりこそがオープンウェイトの実用的な利点であり、M3における価格競争がクローズドモデルよりも速く進んでいる理由でもあります。

料金表、そしてそれを覆すメーター

A generated two-column scoreboard titled 'GPT-6.1 Sol vs MiniMax M3 - the scoreboard'. Left column 'GPT-6.1 Sol': Input $2.00 / 1M, Output $10.00 / 1M, AA Index 51.8, Cost per task $0.72, Output tokens 38,128, Time per task 640 s. Right column 'MiniMax M3': Input $0.30 / 1M, Output $1.20 / 1M, AA Index 29.2, Cost per task $0.51, Output tokens 48,192, Time per task 486 s. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

公表された2つの料金表を並べてみれば、その差は歴然としている。

• 入力 — GPT-6.1 Sol は100万トークンあたり$2.00、MiniMax M3 は100万トークンあたり$0.30。M3 は85%安い
• 出力 — 100万トークンあたり$10.00 対 $1.20。M3 は88%安い
• キャッシュ入力 — 100万トークンあたり$0.10 対 $0.06
• AAタスクあたりのコスト — $0.724 対 $0.508。M3 は30%安く、85%ではない
• タスクあたりの出力トークン — 38,128 対 48,192。M3 は26%多く書く
• タスクあたりの時間 — 640秒 対 486秒
• コンテキストウィンドウ — 1,050,000 対 1,048,576トークン。実質同等
• 最大出力 — 128,000トークン 対 512,000。M3 は非常に長い回答を1つ書く
• 受け付ける入力 — テキスト、画像、ファイル 対 テキスト、画像、動画
• インデックス順位 — GPT-6.1 Sol は147モデル中10位、MiniMax M3 は62位

上位の2つの安価な行は、調達シートが目にする行だ。3つ目の行こそが請求額を支払う行であり、85~88%のレートカード上の優位が実世界では30%の優位になる、なぜならM3はタスクあたりにより多くのトークンを出力し、タスクは固定量の作業ではないからだ。レートカードはトークンに値付けするが、作業はタスクで値付けされる。最初の2行で止まる比較は、間違った数値を、間違った単位で比較している。

30パーセントが重要でなくなる場所

タスクあたりのコストは十分に近いため、大量テキスト以外の用途ではインデックススコアの差が決め手になる。Artificial AnalysisはGPT-6.1 Solを51.83、MiniMax M3を29.22と評価している。22.6ポイントの差があり、しかもその差はスイート全体に均等に分布しているわけではない。モデルにターミナルを操作させ、リポジトリを編集させ、自身の作業を検証させる評価では、この2つのモデルは同じカテゴリーにはない:

• Terminal-Bench 4.0 — GPT-6.1 Sol 0.5606 対 MiniMax M3 0.0202
• Terminal-Bench Science — 0.5810 対 0.0048
• AA-Omniscience — 41.53 対 1.35
• MMLU-Pro — 0.8595 対 0.7856
• AutomationBench — 0.6487 対 0.2125
• τ²-bench — 今回の実行では GPT-6.1 Sol は未公開、M3 は 0.8889
• GPQA Diamond — 今回の実行では GPT-6.1 Sol は未公開、M3 は 0.9293
• CritPT — 0.3171 対 0.0371

これを注意深く読んでほしい。なぜなら、これは完勝ではなく、例外こそが興味深い部分だからだ。MiniMax M3は、ツール利用とカスタマーサービス対話の評価であるτ²-benchで0.8889、GPQA Diamondで0.9293を記録している。これは大学院レベルの科学スコアであり、この特定の実行で公表されたOpenAIのあらゆる数値を上回っている。M3は有能な推論モデルであり、会話型ツールの使い手としても優れている。Terminal-Bench 4.0では0.0202だ。それは「より劣る」のではない。多段階のリポジトリタスクをまったく最後まで一貫して遂行できないモデルだということだ。そして、トークンの割引があっても、モデルが失敗するタスクが、モデルが完了するタスクより安くつくことはない。

タスクあたりの数値が隠している二次的なコストがある。M3はタスクあたり48,192出力トークンと、最初の回答までの時間23.0秒を記録しており、GPT-6.1 Solの332.0秒と対照的だ——小規模モデルはほぼ即座に話し始め、その後じっくりと推論する。ワークロードがレイテンシに敏感だが浅いものであるなら、それはM3に有利な点だ。エージェント型であるなら、支払うのはトークン数であり、得られるのは最終スコアだ。

当社独自のGPT-6.1 Solのモデルカードには、実際にルーティングする際の形式で同じ数値が掲載されています。すなわち、$2.00 / $10.00の料金、1,050,000トークンのコンテキストウィンドウ、最初のトークンまでのp50が4.54秒、そしてArtificial Analysisのインデックスとベンチマークブロックが同じページにあります。

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

ここでオープンウェイトにどれほどの価値があるのか

M3がダウンロード可能であることは、その最大の論拠であり、それが何をもたらすのかを正確に述べる価値がある。それは、自社の境界内でモデルを実行できるライセンス条件をもたらす——データを外部に出せない場合に有用だ——そして、15の独立したホストから生まれる価格競争をもたらす。だが、安価なデプロイをもたらすわけではない。4280億パラメータ、うち230億がアクティブという規模は、依然として本格的な推論ハードウェアを必要とし、MiniMax Community Licenseは条件が付いたカスタムライセンスであって、無制限のライセンスではない。ほとんどのチームにとって、「オープンウェイト」とはホスト型推論のより良い価格を意味するのであって、ラックに置く箱を意味するのではない。

MiniMax M3 の OrcaRouter カードには、提供されている数値が載っています。$0.30 / $1.20 の料金、1,048,576 トークンのコンテキストウィンドウ、512,000 トークンの最大出力、テキスト/画像/動画入力、そしてそれをルーティングするプロバイダー全体で 7 日間に 5,640 万トークンのボリュームです。

A screenshot of the OrcaRouter model page for minimax/minimax-m3, showing the $0.30 input and $1.20 output per-million prices, a 10.60 s p50 time to first token, 56.4M tokens over seven days, a 1,048,576-token context window, 512,000 max output and text/image/video input, above the OpenAI-compatible code sample.

両方とも1つのキーの背後に

この比較が移行ではなく構成変更である実用的な理由は、どちらのモデルも単一の OrcaRouter エンドポイントから利用できることです — 200 以上のモデルに対応する 1 つの API で、プロバイダーの定価が 0% のマークアップでそのまま渡されるため、MiniMax の料金改定は、リセラーが再交渉するタイミングではなく、ベンダーが公表したその日に請求へ反映されます。これは、M3 にとっては競合モデルよりも重要です。オープンウェイトモデルへルーティングする理由そのものが、その価格とホストリストが動いていることであり、パススルー型の課金メーターだけが、動く標的を追跡できる唯一の方式だからです。

自動フェイルオーバーが残りの半分です。M3 は信頼性の異なる多数のプロバイダーによって提供されており、ルーティング層は、あるホストが劣化したときに、呼び出し元がどのホストに着地したかを知らなくても、リクエストを別のホストへ移せます。これが、Terminal-Bench スコアが「クリティカルパス向けではない」と言っているモデルを採用する誠実な方法です — 再試行が安く済む場所に置くことです。

今日どうしても選ばなければならないなら、どちらですか?

作業が大量のテキスト——抽出、要約、分類、対話、つまり出力が散文で、失敗の形がビルドの破綻ではなく誤った一文であるようなあらゆるもの——であるなら、MiniMax M3 が正しいデフォルトであり、その30パーセントは実際のコストに直結する。GPQA と τ²-bench の数値を根拠にすればよい。これは能力の高いモデルであり、たまたま安価なのだ。

もしその作業がエージェント的——リポジトリ、ターミナル、ツールチェーン、検証ステップを伴うものなら何でも——なら、Terminal-Bench 4.0 での 0.0202 は失格であり、GPT-6.1 Sol の 0.5606、タスクあたり $0.724 のほうが、トークンあたり 85% 高くてもより良い取引だ。料金表は、あなたが買っていたものでは決してなかったのだ。

役に立つ答えは、一度だけで選ぶ必要はないということだ。浅いティアはM3へ、エージェントティアはGPT-6.1 Solへルーティングし、両方を1つの認証情報の背後に置く——タスクが抽出として始まり修復作業へと変わるとき、ルーティングDSLがその2つを単一の呼び出しに合成する。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新