GPT-6.1 Sol 対 Kimi K3 ― スコアボード」というタイトルの、生成された2列比較スコアボード。左列「GPT-6.1 Sol」:行は「インテリジェンス指数:51.8」「インデックスタスクあたりのコスト:$0.72」「インデックス実行時の出力トークン数:67M」「AA-LCR 長コンテキスト:0.83」「コンテキストウィンドウ:1,050,000」「重み:非公開」。右列「Kimi K3」:行は「インテリジェンス指数:43.6」「インデックスタスクあたりのコスト:$2.00」「インデックス実行時の出力トークン数:160M」「AA-LCR 長コンテキスト:0.89」「コンテキストウィンドウ:1,048,576」「重み:Hugging Face で公開」。フッターには「独立した数値は Artificial Analysis v4.3.2 の最大エフォート時による。」とある。
Guides & Insights

GPT-6.1 Sol 対 Kimi K3:ダウンロードは存在するが、依然として安価な選択肢ではない

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Kimi K3は、この種の議論に決着をつけるのが常の反例だ。Moonshot AIは2026年7月に2.8兆パラメータのモデルを出荷し、重みを公開した——moonshotai/Kimi-K3はHugging Face上にあり、ゲートなしで、100万回以上ダウンロードされ、最終リビジョンは9月。したがってここには「原則はオープン、安全性強化のため保留」という但し書きも、待たされる2週間の遅延もない。GPT-6.1 Solは、OpenAIが2026年9月29日にリリースしたもので、クローズドかつAPI専用であり、今後もそうであり続ける。そして独立系の評価ボードでは、ダウンロード可能なモデルは43.6でクローズドモデルの51.8に対して及ばず、完了したインデックスタスク1件あたりのコストは$2.00対$0.72。オープンな重みは安価な逃げ道のはずだ。この組み合わせでは、割高な側なのはオープンな重みであり、その理由はライセンスではない。

各モデルの説明

Kimi K3は、総パラメータ数2兆8000億、うちトークンあたり約1040億——およそ3.7%——がアクティブとなるスパースな混合エキスパート(MoE)モデルです。1,048,576トークンのコンテキストウィンドウを備え、テキストと画像を入力として受け取り、テキストを返します。公開されているチェックポイントはFP8の成果物であり、まさに巨大なダウンロードです。自前のハードウェアでの本番デプロイは、ワークステーションではなくクラスタ単位の判断になります。Moonshotが掲げるアーキテクチャ上の主張は、長いコンテキストのデコードにおいて大幅に高速だと同社が述べるハイブリッド線形アテンション方式であり、さらに2兆8000億パラメータのモデルをそもそも提供可能にした残差とルーティングに関する取り組みです。

GPT-6.1 SolはOpenAIのミッドティア刷新版だ — GPT-6 Astraの下、GPT-6 Lunaの上に位置し — 1,050,000トークンのウィンドウ、128,000トークンの出力上限、テキスト・画像・ファイル入力、そして2026年4月30日の知識カットオフを備えている。推論はlowからmaxまで実行でき、デフォルトはmediumだ。以前のGPT-6 Solが受け付けていたnoneの段階は完全に拒否され、OpenAI自身の移行メモは開発者に代わりにlowを指し示している。価格は100万トークンあたり$2.00と$10.00で、キャッシュ済み入力は$0.10だ。

1次元につき1行、それぞれ両側をオン:

• 入力 — GPT-6.1 Sol は100万トークンあたり$2.00、Kimi K3 は100万トークンあたり$3.00
• 出力 — GPT-6.1 Sol は100万トークンあたり$10.00、Kimi K3 は100万トークンあたり$15.00
• キャッシュ入力 — GPT-6.1 Sol は100万トークンあたり$0.10、Kimi K3 は100万トークンあたり$0.30
• コンテキストウィンドウ — 1,050,000トークン 対 1,048,576トークン、0.1%の差で、重要ではない
• 最大出力 — 両方とも128,000トークン
• 総パラメータ数とアクティブパラメータ数 — 非公開 対 総計2兆8000億、アクティブはトークンあたり1040億
• モダリティ — テキスト、画像、ファイルを入力、テキストを出力 対 テキストと画像を入力、テキストを出力
• 重み — クローズド、APIのみ 対 オープン、ゲートなし、ダウンロード100万件超
• 長コンテキスト条項 — 入力トークンが272,000を超えるとリクエスト全体が入力とキャッシュは2倍、出力は1.5倍に再価格設定 対 公開カードには同等の条項なし
• インテリジェンス指数、独立系、最大エフォート — 51.8 対 43.6
• インデックスタスクあたりのコスト、独立系 — $0.72 対 $2.00
• インデックス実行時の出力トークン数 — 6700万 対 1億6000万、比較クラスのボード中央値1億4000万に対して

K3が唯一勝利する評価、そしてそれが重要な理由

算術の前に、例外がある。なぜなら、それは現実だからだ。Artificial Analysis v4.3.2で最大努力により評価ごとに採点すると、GPT-6.1 Solは10のうち7で首位に立ち、引き分けは皆無だが、長文脈推論評価を制するモデルはK3である:

• AA-LCR v1.1 — Kimi K3 0.887 対 GPT-6.1 Sol 0.830。長い入力に対する推論のために特別に構築された評価で、6ポイントのリード。
• SciCode — Kimi K3 0.595 対 GPT-6.1 Sol 0.542。K3 は科学的コーディングでもリードしている。
• Terminal-Bench 4.0 — Kimi K3 0.126 対 GPT-6.1 Sol 0.561。逆方向に43ポイントの差があり、このペアリングでは断トツで最大の差。
• Humanity's Last Exam — Kimi K3 0.469 対 GPT-6.1 Sol 0.529。
• AA-Omniscience — Kimi K3 19.7 対 GPT-6.1 Sol 41.5;事実の信頼性では、両者は同じクラスのモデルではない。
• GDPval-AA v2.1 — Kimi K3 Elo 1536.5 対 GPT-6.1 Sol Elo 1575.1。
• MMMU-Pro — Kimi K3 0.805 対 GPT-6.1 Sol 0.860。
• AutomationBench-AA, GDP.pdf, CritPt — K3 0.583、0.22、0.234;Sol 0.649、0.310、0.317。

AA-LCRの結果は真剣に受け止める価値がある。なぜなら、それはタスクあたりコストという話に矛盾する唯一の数値であり、安上がりに見える答えが両方向に間違っているワークロードを指し示しているからだ。あなたのトラフィックが非常に長い入力で、生成される回答は控えめで、安定したプレフィックスを多用するものなら — 冗長さが牙をむく余地のない形なら — トップティアの長文脈スコア、画像入力、ダウンロード可能なチェックポイントを組み合わせたK3は、Solよりも適している。そして、インデックス実行におけるタスクあたりコストの数値はあなたには当てはまらない。これが「オープンウェイトには割増の価値がある」の正直な意味だ。時にはオープンモデルが単純にその仕事にとってより良いモデルであり、ここではそれが一つの軸において当てはまる。

また、その2つの勝利に共通する点を挙げる価値もある。K3は、1回の長い読解または推論で答えられるタスクでは強く、多くの小さなステップで実行し、確認しなければならないタスクでは弱い。43ポイントのTerminal-Benchの差と22ポイントのomniscienceの差は、同じ発見を2つの角度から見たものだ。持続的なエージェント的実行は、このチェックポイントが最適化の対象としたものではない。

実際にそれを決めるのは、算術なのだ。

K3の料金表はどの項目でもSolの1.5倍で、完了したインデックスタスクあたりの実測コストは2.8倍であり、1.5と2.8の差は完全にトークン量で説明できる。取締役会自身の測定では、同じ10評価スイート上でK3が1億6000万出力トークン、Solが6700万出力トークンである。K3は1.5倍の価格で2.4倍の出力を生み出し、2.4 × 1.5は3.6である — 取締役会の2.00ドル対0.72ドルという数字は、入力とキャッシュの寄与がそれをわずかに相殺するため、純粋な比率より少しだけ穏やかだが、方向性は争われていない。

Moonsh​oot自身のマーケティングは、注意深く読む価値のある形で、これに反している。同社は、K3が前身モデルよりも出力トークン数が少ないと主張しており、アーキテクチャ上の取り組み——アテンション方式、残差設計——は、長コンテキストのデコーディングコストに真っ向から狙いを定めている。それらは両方とも真実でありながら、そのモデルが汎用スイートにおけるベンチマーク中央値の2倍も冗長であることはあり得る。この2つの主張は異なる事柄について述べている。以前のKimiに対する効率性と、業界全体に対する効率性だ。課金の基準になっているのは2つ目だけであり、独立した評価委員会が測定しているのもそれである。

キャッシュがそれを和らげる。両方のキャッシュ入力料金は、それぞれのモデルの非キャッシュ入力料金の10分の1だ — K3は$0.30、Solは$0.10 — したがってキャッシュ料金の行は順位を変えないが、リクエストが多く回答が軽いワークロードでは、ギャップが測定されたタスク比ではなく、ほぼ料金表の比率まで縮まるということを意味する。そしてSolの長コンテキスト条項は逆に作用する。272,000入力トークンを超えると、リクエスト全体が$4.00と$15.00、キャッシュ時は$0.20で再価格設定され、これはK3のフラットな料金表が完全に勝つ唯一の帯域だ。これは二つの理由で知っておく価値がある。というのも、ここはK3の長コンテキストスコアがこの比較で最良の数値でもある帯域だからだ。

A generated hero card for a GPT-6.1 Sol versus Kimi K3 comparison, headed 'The download exists, and it is still the dearer option', with two badges reading 'Kimi K3: $2.00 per index task' and 'GPT-6.1 Sol: $0.72 per index task', and the OrcaRouter logo in the bottom-right corner.

ここでオープンウェイトに実際どれほどの価値があるのか

三つの事柄であり、これらは分けて論じる価値がある。というのも「オープンウェイト」は通常、実際には三つあるのに一つの論拠として使われているからだ。

第一に、あなたは離れられるということです。もし Moonsh​oot が買収され、将来のバージョンのライセンスを変更し、K3 を非推奨にし、あるいは API 価格を引き上げたとしても、すでにダウンロード済みのチェックポイントは動き続けます。これはこのラボにとって仮定の話ではありません。Moonsh​oot は、既存の有料顧客へのサービス品質を守るため、以前のリリースから約48時間以内に新規サブスクリプションを停止しました。これは、API アクセスが財産ではなくポリシー上の決定であることを示す生きた実例です。こうしたことのどれも、タスクあたりのコスト表には現れませんが、そのすべてが現実です。

第二に、ピン留めできることです。固定されたリビジョンは、ファインチューニングされ、自分で管理する境界内で動作し、監査人に見せることができるものであり、APIには提供できないものです。規制対象のトラフィックにとって、それは料金表以上の価値があります。

3つ目——ふつう想定されているもの——は、安くなるというものだ。そうはならない。チェックポイントは2.8兆パラメータのFP8成果物であり、公開されているデプロイガイダンスは、単一ノードではなくマルチアクセラレータ構成を前提に組み立てられている。そのクラスのクラスタをすでに運用しているチームにとっては、ここに現実的な選択肢があり、計算はまったく変わる。トークンの限界費用が電気代になるからだ。そうでないチームは、API請求額と設備投資を比べていることになり、API請求額が大差で勝つ。正直にまとめれば、ここでのオープンウェイトが与えるのは、去る能力であって、安く動かす能力ではない。

両方とも1つのキーにあり、それこそがこのトレードを有用にしている部分です。

Kimi K3はOrcaRouter上で、Moonsh​oot自身の定価——100万トークンあたり$3.00と$15.00、キャッシュ読み取りは$0.30で、ベンダーの価格表から変更なし——で提供されています。またGPT-6.1 Solはリリース日に当社のルートにOpen​AIの価格で登場し、$2.00と$10.00、キャッシュ済み入力は$0.10、272,000トークンの段階も記載どおりにそのまま反映されています。どちらにも何も上乗せされていません。当プラットフォームはプロバイダーの定価に上乗せせず、そのまま通すため、Moonsh​ootの料金変更もOpen​AIの料金変更も、ベンダー側に現れるのと同じ日に当社側にも現れます。間に別契約や再販業者を挟むことはありません。

A screenshot of the OrcaRouter model page for kimi/kimi-k3, showing the listing dated 2026-07-15, the model described as Moonshot AI's 2.8-trillion-parameter mixture-of-experts flagship for long-horizon coding and end-to-end knowledge work, a 1M-token context with text and image input, and the list price of $3.00 input and $15.00 output per million tokens with an 8.48 s median time to first token.

このペアで、ほとんどのペアよりもこの理由が重要になるのは、2つのモデルが異なる障害モードに属しているからだ。GPT-6.1 Sol は、持続的な実行、ツールループ、事実の信頼性のために走らせるモデルであり、Kimi K3 は、最高の長文コンテキストスコアを求め、他者のビジネス判断に対するヘッジとしてチェックポイントを求めるような、非常に長い入力のために走らせるモデルだ。これらは競合する選択肢ではなく、同じトラフィック上の2つの経路である。両方を1つのエンドポイントの背後に置き、それらの間で自動フェイルオーバーを行い、長入力の作業をK3へ、実行作業をSolへ回すルールを設けることが、「オープンウェイトのフォールバックがある」という設計文書の一行を、午前3時に失敗しつつあるコールの最中でも機能する何かに変える。

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

それぞれの居場所

• ターミナルエージェント、リポジトリ規模のコーディング、多段階の実行 — GPT-6.1 Sol、Terminal-Bench 4.0での43ポイント差。これは僅差ではない。
• ハルシネーションの代償が大きい場面での回答 — GPT-6.1 Sol、AA-Omniscienceでの22ポイント差。
• 非常に長い入力に対して短い生成回答 — Kimi K3。この比較で最良の長文脈推論スコア、画像入力、そして決して活かされることのない冗長性。
• セルフホスティング、あるいは凍結できる必要がある推論スタック — Kimi K3、しかもすでにそのハードウェアを運用している場合に限る。チェックポイントが成果物であり、それを動かす経済性は別の話である。
• ベンダーが条件を変更することへのヘッジ — Kimi K3、そしてこれはGPT-6.1 Solがどんな価格でも答えられない唯一の論点である。
• 料金表で選ぶなら — この比較においてK3もSolも安価な選択肢ではなく、GPT-6ラインにおいてもどちらも安価な選択肢ではない。請求書が決め手なら、あなたが求めるモデルはこの表の向かいにではなく、価格リストのずっと下にある。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新