記事「Grok 4.7 vs Kimi K3 — 価格 対 コンテキスト」向けに生成されたヒーロータイトルカード。サブタイトルは「2つのフロンティアモデル、2つの異なる賭け」、スタットチップには価格 $2/$6 対 $3/$15、コンテキスト 500K 対 1M、オープンウェイト なし 対 あり。
Guides & Insights

Grok 4.7 vs Kimi K3: 価格は半分、コンテキストは半分、重みは一切なし

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

3億トークン分の1か月のエージェント型コーディング作業を、両モデルの定価で処理してみると、この選択はもはやベンチマーク論争には見えなくなる。Grok 4.7は、SpaceXAIが2026年9月21日にリリースしたもので、入力100万トークンあたり2ドル、出力100万トークンあたり6ドルを課金する。Kimi K3は、Moonshot AIが2026年7月16日にリリースしたもので、3ドルと15ドルを課金する。その仮想上の1か月——たとえば入力2億トークン、出力1億トークン——では、Grok 4.7はおよそ1,000ドル、Kimi K3はおよそ2,100ドルになる。この差は端数の違いではない。モデル1つ分の予算に相当する。それに対して、Kimi K3は500,000ではなく1,000,000トークンのコンテキストウィンドウ、画像だけでなくネイティブの動画入力、そしてダウンロード可能な重みを提供する。Grok 4.7は、Kimi K3も狙っている長期的なターミナル作業のために明示的に訓練された、より高速で安価なクローズドモデルを提供する。どちらもフロンティア級だ。だが同じ買い物ではない。

2つのモデル、手短に

Grok 4.7はSpaceXAIの最先端コーディングおよびナレッジワークモデルであり、Grok 4.6よりも大規模なベースモデル上に構築され、数時間かかる可能性のあるタスクを対象とした、より長期の強化学習実行が行われています。これはプロプライエタリで、重みもダウンロードもありません。50万トークンのコンテキストウィンドウに対応し、テキストと画像を入力として受け取り、テキストを返し、推論エフォートレベルをlowからxhighまでサポートします。その目玉の主張は速度と価格です。SpaceXAIは、同等のモデルと比べて約2倍高速で、価格は約半分だと位置づけています。

Kimi K3はMoonshot AIのフラッグシップであるオープンなMixture-of-Expertsモデルであり、3兆パラメータ級では初のオープンモデルです。総パラメータ数2.8兆、トークンあたり1040億がアクティブで、Kimi Delta Attentionと量子化対応MXFP4重みに基づいて構築されています。テキスト、画像、動画を入力でき、100万トークンのコンテキストに対応し、推論は常時オンで強度を設定可能、重みはKimi K3 Licenseの下でダウンロードできます——商用利用は許可されていますが、制限があります。設計上、持ち帰ることのできるモデルです。

それが両者の構造上の違いのすべてだ。一方は安価で高速な閉じたエンドポイント。もう一方は、より高価で低速な、2倍のコンテキストを持つオープンなアーティファクトだ。以下に続くすべては、その帰結である。

ベンチマークが実際に比較しているもの

Grok 4.7 対 Kimi K3 の比較記事のほとんどはここで間違える。だから率直に言っておく価値がある。両モデルが公表している数値は、大部分が同じものを測っておらず、少なくとも、比較可能に見える一組はそうではない。

まず、本当に誤解を招く組み合わせから始めよう。Kimi K3の発表資料は、Terminal-Bench 2.1のスコア88.3を挙げている。Grok 4.7の発表資料は、Terminal-Bench 4.0で38.0%を挙げている。これらはベンチマークのバージョンが異なり、タスクセットも採点方法も異なる。並べて示せば、Kimi K3がエージェントモデルとして2倍以上の性能を持つかのように思わせてしまう。それは正当化できる解釈ではなく、誰も繰り返すべきではない。どちらの数値もベンダーによる報告であり、独立に再現されたものはない。

比較できるのは独立した合成指標であり、そこでは両者は接近している。現在の Artificial Analysis Intelligence Index(バージョン v4.3.2)では、Kimi K3 は 44 点——113 モデル中 2 位で、このボード上におけるオープンウェイトモデルとして最高順位だ。Grok 4.7 は 46 点で、655 中 16 位。2 点差であり、Kimi K3 の順位は最大推論エフォートで獲得されたものだ。ブレンドされた合成指標では、これらのモデルは同格である。

• 独立系の総合スコア — Grok 4.7 は AA Intelligence Index v4.3.2 で46、Kimi K3 は同じバージョンで44。実質同点。

• コンテキストウィンドウ — Grok 4.7 は500,000トークン、Kimi K3 は1,000,000トークン。Kimi K3 にとって紛れもない、無条件の優位であり、何の但し書きも付かない唯一の仕様差。

• 入力モダリティ — Grok 4.7 はテキストと画像、Kimi K3 はテキスト、画像、動画。ワークロードに動画が含まれるなら、Kimi K3 の方がより広く対応しています。

• 重み — Grok 4.7 はプロプライエタリでダウンロード不可、対する Kimi K3 は Kimi K3 License の下でオープンウェイト。オンプレミスまたはエアギャップ環境が要件なら、重要なのはこの行だけだ。

• 100万トークンあたりの価格 — Grok 4.7 は入力 $2 / 出力 $6 に対し、Kimi K3 は入力 $3 / 出力 $15 で、Kimi のキャッシュ入力料金は100万トークンあたり $0.30。Grok 4.7 はあらゆる軸でより安く、出力では劇的に安い。

• 推論エフォート制御 — Grok 4.7 は low から xhigh まで、Kimi K3 は常時オンでエフォートを設定可能。機能的には似ているが、違いは Grok 4.7 では推論を下げられること。

• ベンダー報告のエージェント型エビデンス — Grok 4.7 は Terminal-Bench 4.0 で38.0%、CursorBench 4.0 で46.3%、DeepSWE v1.1 で71.0%(いずれもベンダー報告)に対し、Kimi K3 は Terminal-Bench 2.1 で88.3%、Frontend Code Arena で1,679 Eloの首位(ローンチ時にベンダー報告)。比較不能 — 上記参照。

A generated two-column comparison scoreboard for Grok 4.7 and Kimi K3 with six rows: price $2/$6 vs $3/$15 per million tokens, context 500K vs 1M tokens, AA Intelligence Index 46 vs 44, weights proprietary vs open, modalities text and image vs text, image and video, and speed twice as fast vs slower output, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

お金は実際どこへ行くのか

料金表はその差を過小評価している。なぜなら、2つのモデルはトークンの消費の仕方が異なるからだ。Grok 4.7は冗長な推論モデルであり、Artificial AnalysisがIntelligence Indexの実行中に生成された出力トークンを測定したところ、2億4000万トークンで、モデル全体の中央値である9200万トークンに対して多かった。Kimi K3は逆の種類の高コストだ。常時稼働の大規模推論モデルであり、出力100万トークンあたり15ドルでは、冗長さこそがあなたが買っているものだ。

では、誠実なコストモデルは「$2/$6 対 $3/$15」ではない。それは、完了したタスクあたりの出力トークンに出力料金を掛けたものに、すべての再試行を含む入力トークンに入力料金を掛けたものを足したものだ。100万トークンあたり$6で1回の長いパスでタスクを解くモデルは、100万トークンあたり$15で3回の試行を要するモデルに勝つことができ、また、安価なモデルのパスが十分に長ければ、そのモデルに負けることもある。それは、誰かがあなたのために公表してくれるものではなく、あなたが自分のリポジトリで実行する測定なのだ。

実行する前に知っておく価値のある非対称性が1つあります。Grok 4.7の前身であるGrok 4.6は、入力トークン200,000で価格の崖を適用し、そのラインを超えたリクエストはリクエスト全体が2倍の料金で再計算されます。Grok側でのロングコンテキスト作業では、導入するモデルの最新の料金表と照らし合わせて確認する必要があります。500,000トークンのウィンドウと200,000トークンの崖は相性が悪いからです。Kimi K3の料金は一律で、これが両者の中ではより地味な利点です。

それぞれがどこで壊れるか

どちらのモデルにも、発表資料が前面に押し出していない故障モードがあり、しかもそれらは異なる種類の故障だ。

Kimi K3 の課題は、持続的な負荷の下での信頼性にある。ローンチ時にコミュニティおよび第三者機関が実施した検証では、実行が長引くにつれてエージェント性能が低下すること——単発の結果は強いものの、持続的な合格率は弱くなる——が報告されており、またその出力速度は毎秒約37~38トークンで、対話的なコーディングには遅い。Moonshot もまた、需要が供給能力を上回ったため、ローンチ直後に新規のコンシューマー向けサブスクリプションを一時停止せざるを得なかった。このことは、ホスト側の提供余力について何かを物語っている。

Grok 4.7のそれは正反対の形だ。高速で、安価で、クローズドであり、つまり中身を検査できず、自分で実行できず、非推奨化に備えたヘッジもできない。SpaceXAIはすでに、このリリースの後続としてGrok 4.8、Grok 4.9、Grok 5を公に並べている。そしてGrok 4.6は、後継に取って代わられるまでおよそ5週間しか持たなかった。Grok 4.7上で何かを構築するなら、モデルIDが前提ではなく設定値になるように作るべきだ。

どちらのモデルの失敗でもない第三の考慮事項がある。2週間の自律実行には、どちらも正解ではない。そして両ベンダーはまさにそれをデモで示している。公開されている16日間および48時間の自律コーディングのデモは、ベンダーが実施し、ベンダーが選んだタスクによるもので、独立した再現はない。それらは知っておく価値はあるが、それを前提に計画を立てる価値はない。

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing Moonshot AI's list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

両方を実行すること、そしてそれが本当の答えである理由

コスト差とコンテキスト差は逆方向を指しており、それがどちらか一方を選ばないことの根拠になる。Kimi K3 は、1M ウィンドウによって入力を分割せずに済むリポジトリ規模の作業や、自己ホストしなければならないあらゆる用途で、その価格に見合う。Grok 4.7 は、ボリューム——ターン数の多いエージェントループ、ツール呼び出しの多いパイプライン、速度と出力コストが支配的な長時間のターミナルセッション——で、その価格に見合う。

Kimi K3はOrcaRouterで利用できます。これにより、その分割は調達上の判断ではなくルーティング上の判断になります。Kimi K3はMoonshotの定価でカタログに掲載されており、OrcaRouterはプロバイダーの定価を0%のマークアップでそのまま通すため、ベンダーの値下げは次の契約更新時ではなく発表当日にここで反映されます。長いコンテキストのパスと実行のパスが競合するのではなく協調すべきワークロード——一方のモデルがリポジトリ全体を見渡し、もう一方がそれに基づいて行動する——では、ルーティングDSLが複数のモデルを1回の呼び出しにまとめ、モデルフュージョンを使えば、追加コストに見合うタスクであれば複数モデルのパネルが一緒に回答できます。1つのAPIキーでKimi K3と200以上の他のモデルをカバーするため、その分割の実行側は、たまたまコンテキストを保持しているモデルからではなく、そのジョブにとって最も安く最も速いモデルから提供できます。

明確にしておくべきことが一つある。Kimi K3 のオープンウェイトはダウンロード可能だが、OrcaRouter がルーティングする先はホスト型エンドポイントだ。あなたの要件が真にオンプレミス推論であるなら、それはルーティングの判断ではなく、自社ハードウェア上でのセルフホスティングプロジェクトであり、この比較が唯一の正解を持つ唯一のシナリオである。

評決、そして握るべき一つの数字

コストとスピードで選ぶなら、Grok 4.7の勝ちで、しかも大差です。入力価格は半分、出力価格は半分未満、提供速度はより速く、さらに下げられる推論ダイヤルまであります。コンテキスト、モダリティの広さ、またはモデルを自ら所有できるかで選ぶなら、同じ条件でKimi K3が勝ちます。能力だけで選ぶなら、独立系の総合指標では両者は2ポイント差なので、どちらかのベンダーの発表チャートではなく、自分自身の評価で決めるべきです。

握っておくべき数字は一番上のもの、$2/$6 対 $3/$15 だ。この比較で他のすべては交渉の余地があるが、この比率にはない。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新