生成されたヒーロータイトルカードは、見出しが「GPT-6 Luna vs Kimi K3」、サブタイトルが「スループットは4倍、価格は30分の1」、フッターが「価格はOpenAIおよびMoonshot AIによるもの。指数値はArtificial Analysisによるもの。」で、OrcaRouterのロゴが右下に合成されています。
Guides & Insights

GPT-6 Luna 対 Kimi K3:スループットは4倍、価格は30分の1、唯一の真の例外

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

過去3か月以内にリリースされた2つのモデル。どちらもフロンティアファミリーの廉価層として位置づけられ、どちらも「廉価層」の意味を取り違えている——いや、まったく取り違えてなどいない。Kimi K3はMoonshot AIのオープンウェイトのフラッグシップで、2026年7月27日からModified MITライセンスの下で公開されており、価格は入力100万トークンあたり$3.00、出力100万トークンあたり$15.00、キャッシュ読み取りは$0.30。GPT-6 Lunaは同ベンダーのボリューム層で、2026年9月22日から一般提供されており、$0.10と$0.50、キャッシュ読み取りは1セント。入力で30倍、出力で30倍、そして一方が持つライセンスは、もう一方がいくら積んでも提供できないものだ。

料金表がこの組み合わせを決めているわけではない。もっとも、決め手が要るほど僅差なわけでもないからだ。それを決めるのは、どちらのベンダーも見出しには載せない数字、実測の出力速度である。Kimi K3は毎秒38.7トークンを生成する。GPT-6 Lunaは153.9だ。これは4倍の開きであり、モデルが人と対話する終端ではなくループの一構成要素として使われるようなワークロードでは、4倍のスループット差は請求額ではなくアーキテクチャを変える。

この2つが実際に何であるか

Kimi K3は、2.8兆パラメータのMixture-of-Expertsモデルで、トークンあたり1040億パラメータがアクティブ、コンテキストウィンドウは1,048,576トークン、出力上限は1,048,576トークン、重みはModified MITライセンスの下でHugging Faceに公開されています。これは独立系ボードで最高スコアのオープンウェイトモデルであり、112のオープンウェイトモデルの中で1位です。また、Code ArenaのWebDevリーダーボードで1,679 Eloで首位を保持しています。MoonshotはTerminal-Bench 2.0で88.3%を報告していますが、これはベンダーによる数値であり、独立して再現されたものではありません。

GPT-6 Lunaは、OpenAIのGPT-6世代の小型ティアで、$2.00/$10.00のGPT-6 Solより下、そして$10.00/$50.00のフラッグシップGPT-6 Astraよりはるか下に位置します。テキストと画像を入力しテキストを出力、1,050,000トークンのウィンドウで最大入力は922,000、出力上限は128,000トークン、推論エフォートはnoneからlow、medium、high、xhigh、maxまで選択可能で、デフォルトはmediumです。クローズドかつ単一識別子で、APIキーを持つ誰でも利用できます。

一方はダウンロードです。一方はエンドポイントです。どちらもボリュームに応じた価格設定です。それがこの比較の構図です。

カードを1行ずつ

1次元につき1行、それぞれ両側をオン:

• 入力 100万トークンあたり — GPT-6 Luna $0.10 vs Kimi K3 $3.00

• 出力 1Mあたり — GPT-6 Luna $0.50 対 Kimi K3 $15.00

• 100万トークンあたりのキャッシュ済み入力 — GPT-6 Luna $0.01 対 Kimi K3 $0.30。どちらのカードでも、それぞれ自身の入力単価の10分の1

• 長コンテキスト条項 — GPT-6 Lunaは、272,000入力トークンを超えると入力とキャッシュを2倍にし、出力を1.5倍に引き上げ、リクエスト全体に適用する。一方、Kimi K3には、そのカードに同等の条項が公開されていない

• コンテキストウィンドウ — GPT-6 Luna 1,050,000トークン、最大入力922,000トークン 対 Kimi K3 1,048,576トークン

• 最大出力 — GPT-6 Luna 128,000トークン vs Kimi K3 1,048,576トークン、上限の8倍

• Intelligence Index(独立系)— 最大エフォート時の GPT-6 Luna 37 対 最大エフォート時の Kimi K3 44、同一のインデックス改訂

• デフォルトエフォートスコア — デフォルトの medium 設定での GPT-6 Luna 29 対、最大設定で測定された Kimi K3

• Indexタスクあたりのコスト、独立 — GPT-6 Luna 約$0.07 対 Kimi K3 $2.00

• インデックス実行時の出力トークン — GPT-6 Luna 150M 対 Kimi K3 160M、ボード中央値 88M に対して。どちらもボードの中央値モデルよりはるかに冗長である

• 出力速度、独立 — GPT-6 Luna 153.9 トークン/秒 対 Kimi K3 38.7 トークン/秒

• モデルの重み — GPT-6 Luna は非公開で API のみ、対して Kimi K3 は 2026年7月27日より Hugging Face で公開

• ライセンス — GPT-6 Luna は適用外 対 Kimi K3 Modified MIT(これは MIT と同じ法的文書ではない)

• 総パラメータ数 — GPT-6 Luna は非公開、Kimi K3 は2兆8,000億、うちトークンあたり1,040億がアクティブ

• 際立つ証拠 — GPT-6 Luna のツール呼び出しとエージェントループは、キャッシュ済み入力トークン1,000個あたり0.1セント。一方、Kimi K3 は Code Arena WebDev #1(Elo 1,679)、Terminal-Bench 2.0 はベンダー報告で88.3%、独立系ボードでオープンウェイト最高スコア

• OrcaRouter では — GPT-6 Luna は当社のカタログに含まれず、一方 Kimi K3 は Moonshot の定価でルーティング可能

Generated two-column scoreboard titled 'GPT-6 Luna vs Kimi K3 - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index at max effort 37, Output speed 153.9 tok/s, Context 1,050,000, Weights closed. Right column Kimi K3 rows: Price in/out $3.00 / $15.00, Cached input $0.30, AA Index at max effort 44, Output speed 38.7 tok/s, Context 1,048,576, Weights Modified MIT. Footer: 'Prices per OpenAI and Moonshot AI; index and speed per Artificial Analysis.'

スループットとは、誰も見出しにはしないスペックだ。

毎秒38.7トークンのモデルと毎秒153.9トークンのモデルは、価格タグだけが違う同じ製品ではありません。それらは別の製品です。

モデルが1,500トークンの回答を生成しなければならないタスクを考えてみましょう。要約、構造化抽出、説明付きのコードパッチなどです。毎秒153.9トークンなら、その回答には約10秒かかります。38.7なら約39秒です。どちらの数値にも推論時間やネットワーク遅延は含まれていないため、実世界での差は4倍より広がりこそすれ、狭まることはありません。

では、これをループに入れよう。1つのタスクを完了するために30回のモデル呼び出しを行うエージェント——計画し、ツールを選び、結果を読み、次のステップを決め、それを繰り返す——は、それらの呼び出し全体でおそらく15,000の出力トークンを生成する。GPT-6 Lunaは生成に約97秒かかる。Kimi K3は約388秒かかる。これが、ユーザーが待つタスクとユーザーがスケジュールするタスクとの違いであり、ライセンスの寛容さがどれほどであってもそれは変わらない。

冗長さはスピードの問題を相殺するどころか、むしろ悪化させる。Kimi K3 は独立インデックスを完了するのに 1 億 6000 万出力トークンを生成し、GPT-6 Luna の 1 億 5000 万と対比された——つまりその評価では、遅いモデルのほうがトークンもわずかに多く生成しており、少なかったわけではない。両モデルは同程度に冗長であり、単に同程度には速くない。そして出力課金のカードでは、冗長であることは二重に高くつく。

はっきり言っておく価値がある。これはKimi K3の欠陥ではない。2.8兆パラメータ、うち1040億がアクティブなモデルは、小規模ティアのモデルよりもトークンあたり多くの仕事をしており、スループットの数値はその仕事量の測定値である。問うべきは、あなたのワークロードがその仕事を必要としているかどうかだ。必要としているなら、毎秒38.7トークンはその能力の対価である。必要としていないなら、あなたは望んでいない熟考に対して、30倍もの代価を払っていることになる。

K3の7つのポイントがある場所

Kimi K3は、最大エフォート設定で独立系Intelligence Indexにおいて44を記録する。GPT-6 Lunaは同じ設定で37。7ポイント差——しかもそれは、1ポイントが再実行のノイズの範囲内に収まってしまう複合指標での差であり——両者はさらに、完了タスクあたりのコストで約28倍、$2.00 対 約$0.07 離れている。

その7ポイントは均等に分布しているわけではない。Kimi K3の評判はコーディングとエージェント型ソフトウェア作業に集中しており、それがこのモデルの存在理由である。Code ArenaのWebDevリーダーボードでは1,679 Eloで首位であり、ベンダーのTerminal-Bench 2.0の88.3%という数値はコーディングエージェントの測定値である。GPT-6 Luna自身のコーディング位置は前進ではなく後退である——そのCoding Agent Indexは41で、置き換えたGPT-5.6 Lunaより2ポイント低く、低下はSWE-Atlas-QnAとDeepSWE v1.1に集中している。もしあなたの仕事が実際のリポジトリに対してソフトウェアを書くエージェントなら、それは同じ方向を指す7ポイントのインデックス差と2ポイントの世代回帰であり、安価なティアの論拠はかなり弱くなる。

その7ポイントの差が当てはまらない領域こそが、GPT-6 Lunaが価格設定の対象としている作業カテゴリである。分類、抽出、ルーティング、大量要約、迅速なイエスかノーを必要とするエージェントの内部ループ — これらのタスクでは、両モデルは圧倒的大多数の場合、同じ使用可能な出力を生成し、その差はあなた自身の評価セットに触れた途端に消え去るだろう。その指数は、長期的な推論とコーディングに大きな重みを置く複合指標を測定しており、それらのどちらも、ルーティングの決定に必要なものではない。

両者の指数値に付しておく価値のある注意点が1つある。このボードはローリング評価であり、その改訂が重要だ。同じリーダーボードの以前のスナップショットでは、Kimi K3 は今日の取得結果が示す 44 よりも実質的に高い位置に置かれていた。コンポジット、ハーネス、モデルセットがすべて動くからだ。ローリング指数上で2つのモデル間の正確な差に頼る比較は、静止しないものに頼っていることになる。正直な解釈としては、この2つはそれぞれの上限において隣接する能力帯にあり、指数はあなたのタスクにとってどちらが優れているかを教えてくれない。

例外:Modified MIT が実際にもたらすもの

Kimi K3のライセンスは、GPT-6 Lunaがいくら価格を問われても答えを持たない唯一の側面であり、これは「オープンウェイト」という言葉が通常与えられるよりも精密な説明に値する。

重みは Hugging Face で公開されており、ライセンスは MIT ではなく Modified MIT です。この区別は重要です。Modified MIT ライセンスは通常、条件を付帯します — 一般には、モデルが一定規模を超える製品で使用される場合に帰属表示を行う要件です — そして、その重みを基に商用製品を構築しようと考えている人は、それが似ているファミリー名ではなく、実際のライセンス文書を読むべきです。これはそれを使わない理由にはなりません。調達文書でそれを MIT と記載しない理由にはなります。

ダウンロードで得られるものは現実的であり、限定的だ。それはコストの下限を実現する。十分な量があれば、固定のGPUフットプリントが従量課金の請求額を下回ることができるという意味で。ベンダーのロードマップからの独立を手に入れる。自分でホストするモデルは、自分の足元で非推奨にされることはない。独自のデータ分布でファインチューニングする能力を手に入れる。そして、プロンプトを自分の境界内に保つという選択肢を手に入れる。これは一部のチームにとって、価格の話が出る前に比較を終わらせるものだ。

コストを左右するのはハードウェアだ。2.8兆パラメータのMixture-of-Expertsモデルで、アクティブパラメータが1040億というモデルは、ワークステーションで動くものではない。それを本番レベルのスループットで提供するとなれば、クラスタ規模の取り組みであり、資本コスト、運用コスト、そしてレンタルではなく自らが負うことになるレイテンシ特性が伴う。これはKimi K3のセルフホスティングに反対する論拠ではない — 正しい比較は、出力100万トークンあたり$15.00 対 $0.00 ではなく、出力100万トークンあたり$15.00 対、シリコンと人材を含めたトークンあたりの総コストである、という論拠だ。ごく少数の組織にとっては、その数字はより低い。ほとんどの組織にとってはそうではなく、損益分岐点はライセンスが感じさせるよりも遠くにある。

それらのうち1つ、または両方を実行する

Kimi K3がMoonshotの定価でOrcaRouterに登場。パススルー価格の仕組みでは、ベンダーの料金改定が当日中に当社側でも反映されるということです。自動フェイルオーバーは、とりわけこのモデルにおいて真価を発揮する部分です。セルフホスト型やサードパーティ製のKimi K3エンドポイントが劣化する——まさにそうしたシナリオこそ、デプロイなしでルートを切り替えたい場面ですし、毎秒38.7トークンのモデルは、高速なモデルに比べて遅い上流を吸収できる余裕が少ないのです。

本稿執筆時点でGPT-6 Lunaは当社のカタログには含まれておらず、OpenAI自身のAPIを通じて利用するため、両方を求めるチームは、OpenAI用にすでに使っているものと併せて、Kimi K3用に1つのキーを運用することになる。また、これはルーティングDSLがハードコードされた分割にはできないことを実現する組み合わせでもある。コーディングと長期的な作業をKimi K3に送り、プログラムが消費するものと短期的なものをすべてGPT-6 Lunaに送るというルールは、どちらかのベンダーが出荷するたびに動く境界線を表現しており、それはコードパスとしてではなく構成として動く。ここで名を挙げる価値のあるもう一つの構成はモデルフュージョンだ — 遅くて慎重なモデル1つと、高速で安価なモデル1つが共に回答するパネルで、安価な側がボリュームを処理し、高価な側が重要なケースを裁定するという形は、この2つのモデルの組み合わせが異例なほどよく当てはまる。なぜなら、両者のコストの非対称性は、トラフィックのごく一部にKimi K3の呼び出しを費やすことが十分に許容できるほど大きいからだ。

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

どちらを、そしていつ

ワークロードが大量で、プログラムが消費し、レイテンシーに敏感なら、GPT-6 Luna を選べ。分類、抽出、ルーティング、一括要約、エージェントの内側のループだ。$0.10/$0.50、キャッシュ読み取りが 1 セント、スループットが Kimi K3 の 4 倍なら、計算は接戦ではなく、レイテンシーの差もわずかではない。effort パラメーターを明示的に設定せよ。デフォルトは medium で、見出しの 37 は最大 effort の数値だからだ。そして長い呼び出しは 272,000 トークンの線を超えない側に保て。

重みが必要なら、実際のリポジトリに対してエージェント型コーディングを行う仕事で、そのWebDevでの位置づけとベンダー報告によるTerminal-Bench 2.0での88.3%が重要な証拠となるなら、128,000トークンを超える出力上限が必要なら、あるいは組織がプロンプトをクローズドなエンドポイントに送信できないなら、Kimi K3を選びましょう。取引の一部として毎秒38.7トークンを受け入れ、Modified MITの条件を想定せずに読んでください。

この比較が誘う誤りは、30倍という率を能力についての問いへの答えとして扱ってしまうことだ。それはトークンについての問いへの答えである。能力についての問いは、必要なのが重みか速度かによって決まり、その二つの答えは反対方向を指している。

Screenshot of the OrcaRouter model page for Kimi K3 showing the breadcrumb Home > Models > MoonshotAI > Kimi K3, a FEATURED badge, the model id kimi/kimi-k3, Vision, Tools, JSON and Reasoning chips, a MoonshotAI attribution dated 2026-07-15, the description of a 2.8-trillion-parameter mixture-of-experts model with a 1M-token context window, input pricing of $3.00 and output of $15.00 per 1M tokens, a p50 time to first token of 8.11s, a p95 of 10.00s, and traffic of 1163.7M tokens over seven days.

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新