
Kimi K3 vs Gemini 3.1 Pro: オープンウェイトのコーディング価値 vs ネイティブなマルチモーダル推論
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Gemini 3.1 Proは、Googleのネイティブなマルチモーダル推論モデルであり、テキスト、画像、オーディオ、ビデオ、およびコードリポジトリ全体を取り込み、いくつかの推論リーダーボードでトップを占めています。Kimi K3は、Moonshotのオープンウェイトのチャレンジャーで、低コストで大量のテキストやコーディング作業向けに設計されており、セルフホストも可能です。これらはリーダーボードが示すよりも重複が少なく、それが選択の鍵となります。
Geminiはネイティブのマルチモダリティと高度な推論で優位に立ち、Kimiは価格、オープン性、そしてK2のエビデンスに基づく実用的なコーディング価値で勝っている。興味深いことに、Geminiのコミュニティ自体が、ベンチマーク上の推論と実際のコーディング実行の間にギャップがあると指摘している。これはまさにKimiが活躍する領域である。
まず正直な注意点:2026年7月15日時点で、MoonshotはK3の正式な仕様やベンチマークを公開していません。リークされたローンチプロモは本物ですが、数値は確認されていません。そのため、能力を比較する際には、Kimiの出荷ラインであるK2.6およびK2.7 Codeを、K3が構築すると予想される下限として使用し、その旨を毎回明記します。K3の数字はすべて、モデルカードが公開されるまでは噂として扱ってください。
簡潔な評決
- 価格: Kimiのラインは約$0.60-$0.95 / $2.80-$4.00(100万トークンあたり)。Gemini 3.1 Proはプロンプトサイズによって段階的で、$2/$12(最大200Kトークン)、$4/$18(200K超)、キャッシュ利用時は$0.20/$0.40。Kimiは全体的に安く、特に長いプロンプトで顕著です。
- マルチモダリティ:Geminiが圧倒的に優位、ネイティブテキスト、画像、音声、動画、リポジトリ入力に対応。Kimiのラインはネイティブビジョンのみだが、K3はこれを拡張するという噂があるが、確定していない。
- 推論:GeminiはDeep Thinkモードで複数のテスト(GPQA Diamond 94.3、ARC-AGI-2 77.1)でリードしている。KimiのK2.6ベースラインは数学(AIME 2026 96.4)とコーディングベンチマークで僅差である。
- 開放性: Kimiはオープンウェイト(Modified MIT)で自己ホスト可能;Geminiはクローズドで、APIのみで無料枠はありません。
- 実世界のコーディング:Geminiのコミュニティは、それが「推論には驚くほど優れているが、実際に作業を完了する際には頻繁に失敗する」と報告している。Kimiのラインは、実用的で安価なコーダーであり、時々動作が遅くなる。
- 結論:マルチモーダルおよび高度な推論タスクにはGemini 3.1 Proを選択し、コスト効率の高いテキスト・コード処理やオープンウェイト/セルフホストのニーズにはKimi K3を選択してください。
概要
- Kimi K3(予想、K2.6/K2.7ベース):オープンウェイトMoE、Modified MIT;噂では2.5T~4Tパラメータ;噂では1Mコンテキスト;ネイティブビジョン;価格未発表(ライン約$0.60-$0.95 / $2.80-$4.00)。
- Gemini 3.1 Pro: クローズド、APIのみ。最大1Mコンテキスト / 64K出力。ネイティブでマルチモーダル(テキスト、画像、音声、動画、リポジトリ)対応、出力はテキスト。段階的価格設定: $2/$12 (<=200K) および $4/$18 (>200K)、キャッシュ $0.20/$0.40、バッチAPI 50%オフ。Deep Think reasoning層。2026年2月19日よりプレビュー版。
価格と長文脈追加料金
Kimiはどこでも安く、長い入力になるとその差は広がります。Geminiの巧妙だが重大な詳細は、プロンプトが200Kトークンを超えた瞬間に価格が2倍になり、1百万トークンあたり$2/$12から$4/$18になることです。あなたのユースケースが本当に長いコンテキスト(大きなドキュメント、リポジトリ全体)の場合、そのティア変更は簡単にトリガーされ、比較記事ではほとんどモデル化されません。Kimiのフラットでプロバイダーごとの低価格はその崖を回避しますが、それ自体のレートはホストによって異なります。
バッチ処理やキャッシュを多用するパイプラインの場合、状況はより複雑です。Geminiの50%のバッチ割引と安価なキャッシュ入力($0.20)は特定のパターンに報酬を与えます。繰り返しになりますが、決定的な数値は、料金表の最初の行ではなく、トラフィックの形状に基づく実際の総費用で測定されます。
ベンチマーク: 推論リーダー vs コーディング価値
Gemini 3.1 Proは推論の傑出したモデルです:GPQA Diamond 94.3(大学院レベルの科学)、ARC-AGI-2 77.1(抽象的推論)、LiveCodeBench Pro 2887 Elo、そしてIntelligence Indexは約57。コーディングベンチマークは堅実ですが支配的ではなく、SWE-bench Verified 80.6、SWE-Bench Pro 54.2、MCP Atlasのツール使用スコア(69.2)は最高のエージェントモデルに劣ります。
KimiのK2.6ベースラインは、コスト重視のビルダーにとって重要な部分で競争力があります:AIME 2026 96.4、LiveCodeBench v6 89.6、SWE-Bench Verified 80.2、そして報告によるとオープンソースでリーダー的なSWE-Bench Pro 58.6、実際にGeminiのProの数値を上回っています。ただし注意点は両刃の剣です:Kimiの数値は主に自社によるものであり、Geminiの実世界でのコーディング信頼性は、そのユーザー自身から疑問視されています。 Kimi K3はこれらの数値を引き上げることが期待されており、リリース時には自身のタスクで確認してください。

マルチモーダル性、オープン性、そして信頼性
Geminiのネイティブなマルチモーダル性は、現在Kimiが対抗できない機能です。動画、音声、またはテキストと組み合わせたマルチメディアを分析するワークフローであれば、Geminiが明白な選択肢となります。Kimiはオープン性を示します。自己ホスト可能な重み、または中立な管轄区域のホスト経由でルーティングできるのに対し、GeminiはクローズドでAPIのみのアクセスです。信頼性に関しては、逸話が通常の話を逆転させます。Geminiは美しく推論しますが、コミュニティによれば実行時に「つまずく」のに対し、Kimiは安定した、ただしゆっくりとしたコーダーで、時折API容量の制限があります。ボトルネックが思考か実行かに応じてモデルを選んでください。

どちらを使うべきですか?
タスクがマルチモーダルまたは推論が難しい場合、ビデオとドキュメントを一緒に分析する場合、抽象的な問題解決、Deep Thinkの恩恵を受けるものにはGemini 3.1 Proを使用してください。価格とオープン性が重視される大量のテキストやコーディング、そしてGeminiの長文コンテキストの価格帯に引っかかりたくない場合には、Kimi K3を使用してください。
1つのOrcaRouterエンドポイントの背後では、グローバルに選択する必要はありません。マルチモーダルや高度な推論を要する呼び出しはGemini 3.1 Proに送り、バルクのテキスト/コーディングはKimi K3にルーティングします。モデルごとのコストとレイテンシが可視化され、Kimiのキャパシティ低下をカバーするフェイルオーバーも備えています。タスクごとにルーティングし、ボリュームに対してはKimiの価格を支払い、マルチモーダル機能が代替不可能な場面ではGeminiを使用します。

よくある質問
Kimi K3 と Gemini 3.1 Pro では、どちらが安いですか?
Kimiは全般的に、その価格帯は約$0.60~$0.95 / $2.80~$4.00に対し、Geminiは$2/$12(200Kトークン超では$4/$18)です。ギャップは長文脈プロンプトで最も大きくなります。
マルチモーダル作業にはどちらが良いですか?
Gemini 3.1 Proは、明らかに、画像、音声、動画、リポジトリをネイティブで受け入れます。Kimiのラインはネイティブビジョンのみを持っています。K3はこれを拡張するかもしれませんが、未確認です。
コーディングにはどちらが良いですか?
近いですが、ワークロードに依存します。KimiのラインはGeminiよりも高いSWE-Bench Proスコアと強力なLiveCodeBenchを報告しており、ユーザーはそれを実用的なコーダーと感じています。Geminiは推論が得意ですが、コーディングの信頼性に関する苦情が寄せられています。両方をテストしてください。
1つのAPIで両方を使用できますか?
はい。OpenAI互換のゲートウェイであるOrcaRouterは、一つのエンドポイントの背後でマルチモーダル/推論をGeminiに、バルクテキスト/コーディングをKimiにルーティングし、コスト追跡とフェイルオーバーを提供します。
Kimi K3にはまだ公式のベンチマークがありませんが、この比較を信頼できますか?
もっともな質問です。2026年7月15日現在、K3は未確認のため、この比較ではKimiが出荷しているK2.6/K2.7ラインを下限として、すべてのK3の数字を噂としてラベル付けしています。コミュニティのコンセンサスは「興奮しているが、本当の数字を待つ」であり、独立したリーダーボードは通常、リリース後3~6週間で公開されます。低リスクの方法:判定を方向性として扱い、今すぐタスクベースのルーティングを設定し、Moonshotの公式K3の数字が発表された日に再ベンチマークを実施することです。
結論
Gemini 3.1 Proは、ネイティブなマルチモーダル推論のリーダーであり、Kimi K3は低コストでオープンウェイトのコーディング・価値重視の選択肢です。マルチモーダル性と高度な推論が結果を左右する場面ではGeminiを使用し、コスト効率の高いテキストおよびコード量の処理にはKimi K3を使用し、それらをルーティングすることで、Geminiが代替不可能な場面だけに支払うようにしてください。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
