
Gemini 3.7 Flash vs Claude Opus 5:6分の1の価格で働き者モデルがもたらすもの
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 221 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
ここに、この比較を行う価値があることを示す数字がある。Anthropicの旗艦モデルであるClaude Opus 5は、Artificial Analysis Intelligence Indexで61点を獲得した。一方、Googleの実務モデルであるGemini 3.7 Flash(2026年8月13日リリース)は56点だ。差は5点。そして、Googleが年末まで実施しているプロモーション料金では、Gemini 3.7 Flashは入力100万トークンあたり0.75ドル、出力100万トークンあたり3.75ドルで、Claude Opus 5の5.00ドル/25.00ドルのおよそ6分の1だ。「実務モデル」と「旗艦モデル」を隔てていた差は、正直な問いが「安いモデルが優れているかどうか」ではなく「高いモデルにしかできないことはまだ何があるのか」となるところまで縮まっている。
この比較の枠組みが重要なのは、これが同等条件での対決ではないからであり、それを無視すれば誤解を招きます。2026年7月24日リリースのClaude Opus 5は、Anthropicが一般提供するモデルの中でも最も高性能です。1Mトークンのコンテキストを備え、出力上限128Kトークンの推論モデルで、最も困難なエンジニアリング、研究、コンピューター利用タスク向けに設計されています。一方のGemini 3.7 FlashはGoogleの高負荷処理向け主力モデルで、1Mのコンテキスト、64Kの出力、テキスト/画像/音声/動画の入力に対応します。その設計思想はOpusとは対照的で、ルーチン作業が大半を占める95%のトラフィックに対して、できるだけ多くのトークンを、できるだけ安価にストリーミングすることにあります。両者を単一の数値で比較すれば、間違った答えにたどり着きます。実際に実行するワークの特性で比較してこそ、有益な答えが得られるのです。

5つのポイント、詳しく解説
インテリジェンス指数は線形スケールではなく、56と61の差は、タスクによってはより大きな意味を持つ。Opus 5の61は、複合指数の中で最も困難な構成要素でトップに立つことから来ている。ARC-AGI-3での30.2、FrontierBenchでの43.3、SWE-bench Proでの79.2はすべてベンダー報告値だが、これらはFlashクラスのモデルが到底及ばないフロンティア推論の結果である。Gemini 3.7 Flashの56は異なる方法で得られている。Googleが報告した同モデルの数値(DeepSWE v1.1で65.3、WebDev Arenaで1588 Elo、AutomationBenchで30.4)は、境界が定められた大量のエンジニアリングやエージェントに優れたモデルを示しており、斬新なオープンエンド推論に優れているわけではない。したがって、指数の5ポイントの差は、表面的な距離が小さく見えても、実際の能力の断崖を表している。
• Intelligence Index — Artificial Analysis によると、Gemini 3.7 Flash は 56、Claude Opus 5(max effort)は 61。
• 出力速度 — Gemini 3.7 Flashは約340トークン/秒、Claude Opus 5は約53トークン/秒(いずれもArtificial Analysis調べ)。6.4倍の差。
• コンテキストウィンドウ — 両モデルとも1Mトークンですが、Claude Opus 5の出力上限は128Kであるのに対し、Gemini 3.7 Flashは64Kです。
• 入力価格 — $0.75(プロモーション価格、2026年まで)に対して $5.00 — 6.7倍の格差。
• 出力価格 — $3.75(プロモーション価格)対 $25.00 — 6.7倍の差。
• マルチモーダル入力 — Gemini 3.7 Flash はテキスト、画像、音声、動画に対応し、Claude Opus 5 はテキストと画像のみです。

Claude Opus 5がまだ価格に見合う価値があるところ
フラッグシップのケースはノスタルジアではなく、タスク分布の裾にある。長期的な自律エンジニアリング(モデルがコードベースだけを相手に1時間かけて計画し、編集し、テストし、反復する作業)は、Opus 5の報告上のリードが最も大きい領域であり、そのコンピュータ利用の結果(OSWorldで71、ベンダー報告)は、Gemini 3.7 Flashが参入しないクラスにOpus 5を位置づける。Claude Opus 4.8から移行するチームは、Opus 5がアダプティブシンキングをデフォルトで有効にし、努力レベルを再調整して出荷されること、そして思考の無効化が高努力レベルに制限されることも知っておくべきだ。これらは既存のパイプラインを壊す可能性のある動作変更である。そのどれも、困難な作業に対して間違った選択だということを意味しない。価格が示唆するよりも狭い作業範囲に対しては、正しい選択なのである。
Opus 5 のもう一つの売りは、Anthropic のプラットフォーム経済性だ。プロンプトキャッシングはキャッシュヒット時に実効入力コストを最大90%削減でき、バッチ層では非同期トラフィックの価格が半減する。つまり、キャッシュとバッチを多用する Opus 5 のワークロードでは、請求額は表向きの $5 / $25 が示すよりも、はるかにステッカー価格の影に近くなる。最上位モデルの実質価格はワークロード次第だが、実用モデルの価格はそうではない。
Gemini 3.7 Flash がより賢い買い物となるケース
ストリーミングやバッチ処理、長時間コンテキストへの供給を伴うあらゆる用途において、この主力モデルは単に低コストなだけでなく、構造的にも有利な立場にある。6.4倍の出力速度の優位性は、構築可能なものを根本的に変える。対話型コーディング補完、リポジトリ全体のライブ要約、1分間に多数の呼び出しを必要とするエージェントループ——これらはすべて、53トークン/秒のモデルでは品質の壁に到達するずっと前にスループットの壁に衝突する。Gemini 3.7 Flashは音声入力と映像入力にも対応しており、会議の文字起こしやビデオフレーム理解など、その入力軸においてどのClaudeモデルも扱えないユースケースを切り開く。さらに、思考レベルを調整できるため、低コストの定型作業では低労力設定で実行し、より難しいサブセットでは高労力設定で実行でき、使用した推論量に応じたコストのみを支払えばよい。
ペアリングプレイブック
{{1}}現場の{{/1}}実務者たちは、これを{{2}}二者択一{{/2}}として扱うことをほぼやめており、繰り返し現れるパターンは{{3}}分割統治ループ{{/3}}です。Claude Opus 5は計画と設計を、Gemini 3.7 Flashは大量の実装を、Opus 5はレビューを担当します。各モデルは{{4}}品質対コスト比{{/4}}が最も優れた部分で使用され、組み合わせたパイプラインは、どちらか単独で実行するよりも安価で高速です。ルーティングレイヤーが、そのパターンをアーキテクチャ上の概念ではなく実用的なものにしています。Claude Opus 5はOrcaRouter上でAnthropicの定価・マークアップ0%で利用可能で、ルーティングDSLを使えば、プランナーをOpus 5へ、実行者をOpenAI互換の単一エンドポイントの背後にあるFlashクラスのモデル群へ送る単一の呼び出しを構成できます。— さらに次のステップとしてモデルフュージョンがあり、両方のモデルが同じ質問に回答し、ジャッジが2つの判定を調整します。

請求書を並べて表示
実際の数字で見てみよう。入力1000万トークン、出力100万トークンの1日分——高負荷だが標準的なエージェントパイプライン——は、Claude Opus 5 の標準レートで $75 + $375 = $450 の請求となる。同じトラフィックを Gemini 3.7 Flash のプロモーションレートで処理すると、$7.50 + $37.50 = $45 となり、ちょうど10分の1だ。入力側の Opus のキャッシュ割引を考慮しても、その差は一桁(10倍)だ。そして、それが "flash for the bulk, opus for the hard tail" が、特殊なものではなく標準的な本番構成になった理由だ。プロモーションが終了すると、Gemini 3.7 Flash の入力レートは $1.50 に倍増する——それでも Opus の3分の1であり、この組み合わせの計算が成り立つほど十分に安いままである。
率直な見方
5ポイントの差は実際に存在し、それはまさに予想どおりの場所にあります。すなわち、最も困難で、最も長い時間軸を要する作業です。もしワークロードがそのテール(尾部)——フロンティア研究、数時間に及ぶ自律的エンジニアリング、コンピューター利用——に支配されているなら、Claude Opus 5は価格に見合う価値があり、あれこれ考えすぎる必要はありません。もしワークロードが量、レイテンシー、または長いコンテキストに支配されているなら、プロモーション料金のGemini 3.7 Flashのほうが桁違いに優れた買い物であり、フラッグシップとの差はベンチマークの1段階であって、深淵ではありません。モデルは収束しつつあり、ほとんどのチームにとっての実際的な答えはもはや「どちらを選ぶか」ではなく、「作業のどの部分をどちらに任せるか」です。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
