生成されたヒーローカード。タイトルは Claude Sonnet 5.5 対 MiniMax M3、サブタイトルは15倍安価なモデルが互角となる点。3枚の統計カードを備え、長コンテキスト想起率 82.7% 対 83.0%、Terminal-Bench 4.0 63.6% 対 2.0%、タスクあたりコスト $7.60 対 $0.51。フッターの記載は、すべての数値は Artificial Analysis v4.3.2 による。MiniMax M3 の仕様は MiniMax による。
Guides & Insights

Claude Sonnet 5.5 対 MiniMax M3:15倍安いモデルが実際に互角となるポイント

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

独立系のボードには、MiniMax M3とClaude Sonnet 5.5が同じモデルになっている行が1つあり、それは誰も推測しないものである。長文コンテキストの想起では、MiniMax M3は83.0%、Claude Sonnet 5.5は82.7%を記録する。MiniMax M3のコストは入力100万トークンあたり$0.30、出力100万トークンあたり$1.20。Claude Sonnet 5.5は$2.00と$10.00。Intelligence Index全体では、M3の実測コストは1タスクあたり$0.51で、Claude Sonnet 5.5は$7.60 — 15倍安く、しかも非常に長い文書の中からモデルが依然として何かを見つけられるかを測る唯一の評価において、まったく後れを取っていない。

次にエージェント評価を開くと、形勢はひっくり返り、もはや比較にならないほどになる。モデルにシェルを操作させ、実際にソフトウェアタスクを完了させることを求めるTerminal-Bench 4.0では、MiniMax M3は2.0%を記録し、Claude Sonnet 5.5は63.6%を記録する。本番業務に最も近いベンチマークにおける30倍の差は価格の問題ではなく、トークンあたりの節約では到底埋め合わせられない。この対決が提起する有用な問いは「どちらが優れているか」ではなく、あなたのワークロードがこれら2つの故障モードのどちらを吸収できるかである。MiniMax M3は、検索ではフロンティアモデルに匹敵するが実行では崩壊する、オープンウェイトで100万トークン、ネイティブ動画のモデルであり、Claude Sonnet 5.5は、正反対のことをするために2026年9月28日に出荷されたクローズドモデルである。

それぞれが何であるかを、平易に述べたもの

MiniMax M3は、中国のラボによるフラッグシップのオープンウェイト基盤モデルで、2026年6月1日に発表され、MiniMax独自のコミュニティライセンスの下でダウンロードできます。総パラメータ数が約4280億、トークンあたり約230億がアクティブなMixture of Expertsであり、強い意味でネイティブにマルチモーダルです。テキスト、画像、動画を入力するとテキストが出力され、マルチモーダルパイプラインは後付けではなく、最初の事前学習ステップから再構築されています。ウィンドウは1,048,576トークン——当社のカタログ項目では、保証される使用可能な最小値は512,000——で、最大出力は512,000トークンです。これはベンダーではなく当社の数値で、MiniMaxが公表していないためです。アーキテクチャはMiniMax Sparse Attentionで、arXiv 2606.13392の主題であり、ベンダーはこれについて、100万トークンのウィンドウで前世代よりプリフィルが9倍超高速、デコードが15倍超高速だと主張しています。これらはベンダーの数値であり、独立に再現されたものは確認していません。

Artificial Analysis model page for MiniMax-M3, an open-weights model released June 2026, showing an Intelligence Index of 29, an output speed of 115.3 tokens per second, $0.30 per million input tokens and $1.20 per million output tokens, $0.51 per Intelligence Index task, a 1M-token context window, and text, image and video input.

Claude Sonnet 5.5 は Anthropic の 2 番目の 5.5 世代モデルで、執筆時点では公開からまだ 1 日しか経っておらず、クローズドモデルだ。Anthropic はこれをラインナップ中で速度と知能の最良の組み合わせだと説明しており、スペックはコンテキスト 1,000,000 トークン、同期出力 128,000 トークン(Message Batches API では 300,000 トークン)、テキスト・画像・ファイル入力、選択可能な effort を伴う適応的思考、2026 年 6 月の知識カットオフ、そしてローンチ時点から利用可能なゼロデータリテンションだ。価格は Claude Sonnet 5 から据え置きで、入力 $2.00、出力 $10.00、キャッシュ読み取り $0.20、キャッシュ書き込み $2.50 となっている。Anthropic によれば、Claude Sonnet 5 より 30% 高速に動作し、タスクあたり最大 30% 低コストになるという——これはベンダー側の数値であり、再現されたものではなく、料金が同一である以上、料金ではなくトークン数に関する主張として読むべきものだ。

ベンチマークの形がすべてを物語っている

両方のモデルは同じインデックス、リビジョン v4.3.2 で測定されており、評価ごとの結果が、この組み合わせを一方的ではなく興味深いものにしています。

• 長文脈リコール — MiniMax M3 83.0% 対 Claude Sonnet 5.5 82.7%、真の同点における丸め誤差程度の差

• SciCode — MiniMax M3 47.1% 対 Claude Sonnet 5.5 61.0%、現実的だが耐えうる差

• Humanity's Last Exam — MiniMax M3 39.0% 対 Claude Sonnet 5.5 55.0%

• Terminal-Bench 4.0 — MiniMax M3 2.0% 対 Claude Sonnet 5.5 63.6%、ここでこの比較はもはや有用ではなくなる

• インテリジェンス指数 — MiniMax M3 29 対 Claude Sonnet 5.5 56

• Indexタスクあたりのコスト — MiniMax M3 $0.51 対 Claude Sonnet 5.5 $7.60

• Index全体で生成された出力トークン — MiniMax M3 120M 対 Claude Sonnet 5.5 410M

• 出力速度 — MiniMax M3 115.3 トークン/秒 vs Claude Sonnet 5.5 138.7 トークン/秒

それらの行を順に読めば、首尾一貫したモデルが見えてくる。MiniMax M3は静的推論と検索は得意だが、持続的な実行は苦手だ。そのTerminal-Benchの結果は小幅な不足ではない。2.0%というスコアは、このモデルが事実上タスクを完了できないことを意味しており、同じパターンは、自動化ベンチマークのスコアが0.71に対して0.21であることにも、全知スコアが32.3に対して1.35であることにも表れている。MiniMax M3が地歩を保つのは、まさにそのアーキテクチャが優位を主張する領域だ。すなわち、真に長い入力を読み、答えることである。それは、MiniMaxがMSAを売り込んだ通りの働きを、MSAがしているということだ。

Generated comparison scoreboard titled Claude Sonnet 5.5 vs MiniMax M3, the scoreboard, with six matched rows: input price $2.00 vs $0.30, output price $10.00 vs $1.20, Intelligence Index 56 vs 29, cost per task $7.60 vs $0.51, long-context recall 82.7% vs 83.0%, and Terminal-Bench 4.0 63.6% vs 2.0%, with a footer reading All figures per Artificial Analysis v4.3.2; MiniMax M3 is open-weight under MiniMax's community licence.

コストの行は、もう一つ、それほど明白でない点を追加する。MiniMax M3 はトークンあたりの価格が安いだけではない——入力で1/6.7、出力で1/8.3——回答に到達するまでに消費するトークンも少なく、同じベンチマーク全体でおよそ1億2000万対4億1000万である。2つの効果が掛け合わさって、タスクあたり15倍の差になる。その差の一部は純粋な効率であり、一部は単純に、MiniMax M3 が失敗しているタスクをより早く諦めることによる。誤った答えを返す安価なタスクは節約にはならず、これがこの記事で最も安上がりな教訓である。

価格表が示せない次元

MiniMax M3 には、Claude Sonnet 5.5 が持たず、獲得することもできない特性がある。それは、重みを持ち出せるということだ。これが重要になるのは、まさに一種類の買い手にとってだけであり、その買い手にとっては、それが上記のすべてを上回る。リクエストが管轄区域から出られない、ネットワーク境界を越えられない、あるいは API に一切到達できない場所で実行しなければならない場合、ダウンロード可能な重みを持たないモデルは、どんな価格でも選択肢にはならない。そして、4280億パラメータのオープンウェイトモデルなら選択肢になる。同じ特性は、逆方向では負債にもなる。アクティブ23Bで428Bパラメータをセルフホストするのは、APIキーではなく資本判断であり、MiniMax自身のスパースアテンションに関する主張が存在するのは、100万トークンでの代替手段が支払い不可能なインフラだからだ。

それ以外のすべての人にとって、正直な捉え方はこうだ。これは値札が付いた「内製か購入か」の線引きである。Claude Sonnet 5.5 は、エージェント的なことをするなら何であれ、より優れたモデルだ。MiniMax M3 は、巨大な何かを読んでそれについての質問に答えるにはより優れたモデルであり、動画の処理には劇的に優れたモデルだ。Claude Sonnet 5.5 は動画をまったく受け付けない——その入力サーフェスはテキスト、画像、ファイルだ。

• 重み — MiniMax のコミュニティライセンスの下でオープンな MiniMax M3 対 クローズドな Claude Sonnet 5.5

• 入力モダリティ — MiniMax M3 はテキスト、画像、動画、Claude Sonnet 5.5 はテキスト、画像、ファイル

• 最大出力 — 当社カタログでは MiniMax M3 が 512,000 トークン、Claude Sonnet 5.5 は同期時 128,000、バッチ利用時 300,000

• キャッシュ料金 — MiniMax M3 は読み取り100万件あたり $0.06、Claude Sonnet 5.5 は読み取り $0.20、書き込み $2.50

• エフォート制御 — MiniMax M3の思考は有効・適応・無効を切り替え可能であるのに対し、Claude Sonnet 5.5の適応的思考では無効化にbetween_tools形式

• データ保持 — セルフホストの場合、MiniMax M3 はご自身のデプロイによって管理されるのに対し、Claude Sonnet 5.5 では、ローンチ時に A​nthropic からゼロデータ保持が利用可能です

2つの契約を結ばずに両方を実行する

オープンウェイトの中国製モデルとクローズドなAnthropicモデルを1つのパイプラインで混ぜて使うと、運用コストの大半はトークンではなく、2つ目の契約、2つ目のキー、2つ目のレート制限、そして障害が起こり得る2つ目の場所です。OrcaRouterはそれを200以上のモデルをカバーする1つのOpenAI互換エンドポイントに集約します。プロバイダーの定価はそのまま通され、どちら側にもマークアップは加えられず、上流プロバイダー間の自動フェイルオーバー、そして複数のモデルを1回の呼び出しに組み合わせるためのルーティングDSLを備えています。MiniMax M3はここで minimax/minimax-m3としてルーティング可能で、MiniMaxの$0.30と$1.20、キャッシュ読み取りは$0.06です。また、トラフィック量の面でカタログ中でもっとも混雑しているモデルの1つであり、それ自体が有用なシグナルです。ルーティング層は、モデルがどれだけの実負荷を担っているかを、スコアだけでなく教えてくれます。

Claude Sonnet 5.5 はまだ当社のカタログには登録されておらず、本記事はそうでないふりをするつもりはありません。現在それを利用するルートは A​nthropic 自身の API です。Claude Sonnet 5 はここで同じ $2.00 と $10.00 でルーティングでき、6月30日からずっとそうなっており、後継モデルが登場してまだ1日という今、自然なステージング先でありフェイルオーバーの相棒でもあります。

長コンテキストの切り替えと、ひとつの認証情報の背後にあるエージェント型の経路——その組み合わせこそ、ルーターの存在意義だ。MiniMax M3 はこのカタログを通じて週あたり6,320万トークンのトラフィックを処理しており、Claude Sonnet 5 の790万トークンと対照的だ。つまり安価なモデルはここでは代替要員ではない。すでにその量を担っているのだ。両方をひとつのキーからルーティングするということは、その分割が、安い側を使う前に署名しなければならない第二の契約ではなく、トラフィックを移せる構成上の判断になるということだ。

OrcaRouter model page for minimax/minimax-m3, dated 2026-05-31, showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 512K maximum output, text, image and video input, $0.30 input and $1.20 output per million tokens, a p50 time to first token of 10.00 s, and 63.2M tokens of recent traffic.

ネクタイをどうするか

ワークロードが文書規模の質問応答——非常に長い入力、短い事実回答、許容できるレイテンシ——であれば、長コンテキストでの互角さは本物であり、MiniMax M3 の15倍のコスト優位性もまた本物です。それは単純な置き換えであり、今週試す価値があります。

ワークロードがエージェント型なら、価格の話に入る前にTerminal-Benchの行が決着をつける。Indexタスクあたり7.60ドルのClaude Sonnet 5.5 対 0.51ドルのMiniMax M3 は、あなたの本番トラフィックに最も近い評価で60ポイント高くスコアするモデルに対して15倍の割増であり、タスクに失敗する15倍安い方こそが高くつく選択肢だ。自分のデータで測るべき指標は、リクエストあたりのトークン数ではなく、完了したタスクあたりのトークン数である。なぜなら、それが本記事で唯一、MiniMax M3の価格優位が既定では通用しない数字だからだ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新