
Kimi K3 vs Gemini 3.1 Pro: オープンウェイトのコーディング価値 vs ネイティブなマルチモーダル推論
- googleNEWGoogle: Gemini 3.6 Flash2026-07-2150知能69コーディング
- googleNEWGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaNEWMeta: Muse Spark 1.12026-07-1651知能71コーディング
- kimiNEWMoonshotAI: Kimi K32026-07-1557知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0951知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0955知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0959知能77コーディング
- grokxAI: Grok 4.52026-07-0854知能72コーディング
- tencentTencent: Hy32026-07-0641知能59コーディング
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232知能42コーディング
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226知能39コーディング
- anthropicAnthropic: Claude Sonnet 52026-06-3053知能72コーディング
- klingKling: Kling 3.0 Turbo2026-06-1757知能52コーディング57数学
- z-aiZ.ai: GLM 5.22026-06-1651知能69コーディング60数学
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242知能61コーディング61数学
- anthropicAnthropic: Claude Fable 52026-06-0960知能77コーディング
- qwenQwen: Qwen3.7 Plus2026-06-0139知能56コーディング59数学
- minimaxMiniMax: MiniMax M32026-05-3144知能59コーディング59数学
- AnthropicAnthropic: Claude Opus 4.82026-05-2856知能74コーディング68数学
- GoogleGemini 3.5 Flash2026-05-2350知能70コーディング51数学
Gemini 3.1 Proは、Googleのネイティブなマルチモーダル推論モデルであり、テキスト、画像、オーディオ、ビデオ、およびコードリポジトリ全体を取り込み、いくつかの推論リーダーボードでトップを占めています。Kimi K3は、Moonshotのオープンウェイトのチャレンジャーで、低コストで大量のテキストやコーディング作業向けに設計されており、セルフホストも可能です。これらはリーダーボードが示すよりも重複が少なく、それが選択の鍵となります。
Geminiはネイティブのマルチモダリティと高度な推論で優位に立ち、Kimiは価格、オープン性、そしてK2のエビデンスに基づく実用的なコーディング価値で勝っている。興味深いことに、Geminiのコミュニティ自体が、ベンチマーク上の推論と実際のコーディング実行の間にギャップがあると指摘している。これはまさにKimiが活躍する領域である。
まず正直な注意点:2026年7月15日時点で、MoonshotはK3の正式な仕様やベンチマークを公開していません。リークされたローンチプロモは本物ですが、数値は確認されていません。そのため、能力を比較する際には、Kimiの出荷ラインであるK2.6およびK2.7 Codeを、K3が構築すると予想される下限として使用し、その旨を毎回明記します。K3の数字はすべて、モデルカードが公開されるまでは噂として扱ってください。
簡潔な評決
- 価格: Kimiのラインは約$0.60-$0.95 / $2.80-$4.00(100万トークンあたり)。Gemini 3.1 Proはプロンプトサイズによって段階的で、$2/$12(最大200Kトークン)、$4/$18(200K超)、キャッシュ利用時は$0.20/$0.40。Kimiは全体的に安く、特に長いプロンプトで顕著です。
- マルチモダリティ:Geminiが圧倒的に優位、ネイティブテキスト、画像、音声、動画、リポジトリ入力に対応。Kimiのラインはネイティブビジョンのみだが、K3はこれを拡張するという噂があるが、確定していない。
- 推論:GeminiはDeep Thinkモードで複数のテスト(GPQA Diamond 94.3、ARC-AGI-2 77.1)でリードしている。KimiのK2.6ベースラインは数学(AIME 2026 96.4)とコーディングベンチマークで僅差である。
- 開放性: Kimiはオープンウェイト(Modified MIT)で自己ホスト可能;Geminiはクローズドで、APIのみで無料枠はありません。
- 実世界のコーディング:Geminiのコミュニティは、それが「推論には驚くほど優れているが、実際に作業を完了する際には頻繁に失敗する」と報告している。Kimiのラインは、実用的で安価なコーダーであり、時々動作が遅くなる。
- 結論:マルチモーダルおよび高度な推論タスクにはGemini 3.1 Proを選択し、コスト効率の高いテキスト・コード処理やオープンウェイト/セルフホストのニーズにはKimi K3を選択してください。
概要
- Kimi K3(予想、K2.6/K2.7ベース):オープンウェイトMoE、Modified MIT;噂では2.5T~4Tパラメータ;噂では1Mコンテキスト;ネイティブビジョン;価格未発表(ライン約$0.60-$0.95 / $2.80-$4.00)。
- Gemini 3.1 Pro: クローズド、APIのみ。最大1Mコンテキスト / 64K出力。ネイティブでマルチモーダル(テキスト、画像、音声、動画、リポジトリ)対応、出力はテキスト。段階的価格設定: $2/$12 (<=200K) および $4/$18 (>200K)、キャッシュ $0.20/$0.40、バッチAPI 50%オフ。Deep Think reasoning層。2026年2月19日よりプレビュー版。
価格と長文脈追加料金
Kimiはどこでも安く、長い入力になるとその差は広がります。Geminiの巧妙だが重大な詳細は、プロンプトが200Kトークンを超えた瞬間に価格が2倍になり、1百万トークンあたり$2/$12から$4/$18になることです。あなたのユースケースが本当に長いコンテキスト(大きなドキュメント、リポジトリ全体)の場合、そのティア変更は簡単にトリガーされ、比較記事ではほとんどモデル化されません。Kimiのフラットでプロバイダーごとの低価格はその崖を回避しますが、それ自体のレートはホストによって異なります。
バッチ処理やキャッシュを多用するパイプラインの場合、状況はより複雑です。Geminiの50%のバッチ割引と安価なキャッシュ入力($0.20)は特定のパターンに報酬を与えます。繰り返しになりますが、決定的な数値は、料金表の最初の行ではなく、トラフィックの形状に基づく実際の総費用で測定されます。
ベンチマーク: 推論リーダー vs コーディング価値
Gemini 3.1 Proは推論の傑出したモデルです:GPQA Diamond 94.3(大学院レベルの科学)、ARC-AGI-2 77.1(抽象的推論)、LiveCodeBench Pro 2887 Elo、そしてIntelligence Indexは約57。コーディングベンチマークは堅実ですが支配的ではなく、SWE-bench Verified 80.6、SWE-Bench Pro 54.2、MCP Atlasのツール使用スコア(69.2)は最高のエージェントモデルに劣ります。
KimiのK2.6ベースラインは、コスト重視のビルダーにとって重要な部分で競争力があります:AIME 2026 96.4、LiveCodeBench v6 89.6、SWE-Bench Verified 80.2、そして報告によるとオープンソースでリーダー的なSWE-Bench Pro 58.6、実際にGeminiのProの数値を上回っています。ただし注意点は両刃の剣です:Kimiの数値は主に自社によるものであり、Geminiの実世界でのコーディング信頼性は、そのユーザー自身から疑問視されています。 Kimi K3はこれらの数値を引き上げることが期待されており、リリース時には自身のタスクで確認してください。

マルチモーダル性、オープン性、そして信頼性
Geminiのネイティブなマルチモーダル性は、現在Kimiが対抗できない機能です。動画、音声、またはテキストと組み合わせたマルチメディアを分析するワークフローであれば、Geminiが明白な選択肢となります。Kimiはオープン性を示します。自己ホスト可能な重み、または中立な管轄区域のホスト経由でルーティングできるのに対し、GeminiはクローズドでAPIのみのアクセスです。信頼性に関しては、逸話が通常の話を逆転させます。Geminiは美しく推論しますが、コミュニティによれば実行時に「つまずく」のに対し、Kimiは安定した、ただしゆっくりとしたコーダーで、時折API容量の制限があります。ボトルネックが思考か実行かに応じてモデルを選んでください。

どちらを使うべきですか?
タスクがマルチモーダルまたは推論が難しい場合、ビデオとドキュメントを一緒に分析する場合、抽象的な問題解決、Deep Thinkの恩恵を受けるものにはGemini 3.1 Proを使用してください。価格とオープン性が重視される大量のテキストやコーディング、そしてGeminiの長文コンテキストの価格帯に引っかかりたくない場合には、Kimi K3を使用してください。
1つのOrcaRouterエンドポイントの背後では、グローバルに選択する必要はありません。マルチモーダルや高度な推論を要する呼び出しはGemini 3.1 Proに送り、バルクのテキスト/コーディングはKimi K3にルーティングします。モデルごとのコストとレイテンシが可視化され、Kimiのキャパシティ低下をカバーするフェイルオーバーも備えています。タスクごとにルーティングし、ボリュームに対してはKimiの価格を支払い、マルチモーダル機能が代替不可能な場面ではGeminiを使用します。

よくある質問
Kimi K3 と Gemini 3.1 Pro では、どちらが安いですか?
Kimiは全般的に、その価格帯は約$0.60~$0.95 / $2.80~$4.00に対し、Geminiは$2/$12(200Kトークン超では$4/$18)です。ギャップは長文脈プロンプトで最も大きくなります。
マルチモーダル作業にはどちらが良いですか?
Gemini 3.1 Proは、明らかに、画像、音声、動画、リポジトリをネイティブで受け入れます。Kimiのラインはネイティブビジョンのみを持っています。K3はこれを拡張するかもしれませんが、未確認です。
コーディングにはどちらが良いですか?
近いですが、ワークロードに依存します。KimiのラインはGeminiよりも高いSWE-Bench Proスコアと強力なLiveCodeBenchを報告しており、ユーザーはそれを実用的なコーダーと感じています。Geminiは推論が得意ですが、コーディングの信頼性に関する苦情が寄せられています。両方をテストしてください。
1つのAPIで両方を使用できますか?
はい。OpenAI互換のゲートウェイであるOrcaRouterは、一つのエンドポイントの背後でマルチモーダル/推論をGeminiに、バルクテキスト/コーディングをKimiにルーティングし、コスト追跡とフェイルオーバーを提供します。
Kimi K3にはまだ公式のベンチマークがありませんが、この比較を信頼できますか?
もっともな質問です。2026年7月15日現在、K3は未確認のため、この比較ではKimiが出荷しているK2.6/K2.7ラインを下限として、すべてのK3の数字を噂としてラベル付けしています。コミュニティのコンセンサスは「興奮しているが、本当の数字を待つ」であり、独立したリーダーボードは通常、リリース後3~6週間で公開されます。低リスクの方法:判定を方向性として扱い、今すぐタスクベースのルーティングを設定し、Moonshotの公式K3の数字が発表された日に再ベンチマークを実施することです。
結論
Gemini 3.1 Proは、ネイティブなマルチモーダル推論のリーダーであり、Kimi K3は低コストでオープンウェイトのコーディング・価値重視の選択肢です。マルチモーダル性と高度な推論が結果を左右する場面ではGeminiを使用し、コスト効率の高いテキストおよびコード量の処理にはKimi K3を使用し、それらをルーティングすることで、Geminiが代替不可能な場面だけに支払うようにしてください。
