「Kimi K4」と表示される生成済みタイトルカード。サブタイトルは「リークが語るもの、語らないもの」、バッジは「リーク / 未検証」、縦に並んだ3行は「モデルカードなし」「重みなし」「価格や経路なし」、フッター行は「2026年9月25日時点」で、右下隅には OrcaRouter のロゴが合成されている。
Guides & Insights

Kimi K4:リークが実際に主張していること、そして「より少ないアクティブパラメータ」がなぜ本質的な話になるのか

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

たった1つの投稿が、未発表のモデル名を4つも同時に世に流通させた。そのリストはK​imi K4——Moonshot AIによる次世代モデルとされる——から始まり、GLM-5.5 FlashとGLM-5.4(Z.ai)、そしてD​eepSeek V4.1Pが並んでいる。そして投稿者自身が強調しているのは、どのフラッグシップ名でもなく、K4の土台にある算術への疑念だ——それは、置き換えるモデルよりも少ないパラメータしか活性化しないかもしれない、というものだ。この主張は検証されていない。K​imi K4のモデルカードも、重みも、API識別子も、価格も、ルートも存在せず、リスト内のZ.aiのどの名前についても同じことが言える。今やる価値があるのは、これらの主張のうちどれが検証可能か、出荷済みのベースラインがどのようなものか、そしてよりスパースなK4が実際に何を意味するのかを見極めることだ。

シグナル、およびそのティア

これは初期のシグナルであり、そのように読まれるべきだ。これを伝えている投稿は、目撃情報の報告というよりも、モデル命名規則の読み解きだ。そこでは「GLM-5.5 Flash、GLM-5.4」を興味深い命名として取り上げ、Kimi K4を「非常に奇妙」と呼び、次に推測的な仕組み——活性化されるエキスパートがより少ない——を提示しているが、構成、チェックポイント一覧、ステージングエンドポイントを見たとは主張していない。

公開記録の中でその名称に矛盾するものは何もなく、それを裏づけるものも何もない。この非対称性はリリースサイクルのこの段階では普通のことであり、だからこそ有用な行動は、さらなる憶測ではなく、ベースラインとテストを修正することだ。投稿内の名称は製品についての仮説であって、製品の証拠ではない。

Kimi K4が比較される際のベースライン

Kimi K3は実在し、リリース済みで、異例なほど詳細に文書化されている。そのため、確固たる基準点となっている。Moonshot自身のモデルカードには、2.8兆パラメータのMixture-of-Expertsモデルが記述されており、トークンあたり104Bのパラメータを活性化し、93層に分散している——1つの密な層と92の疎な層である。スパース性は積極的で、明確に述べられている:896のエキスパートのうち16がトークンごとに発火し、さらに2つの共有エキスパートが加わる。Moonshotはこれにより、Kimi K2と比べてスケーリング効率が約2.5倍改善したとしている。

K3が前世代と一線を画すのはアテンションスタックだ。その92のスパース層のうち、69層はハイブリッド線形アテンション機構であるKimi Delta Attentionを使い、24層はゲート付きMLAを使う。3:1の分割で、少数のフルアテンション層を残し、残りをより低コストな線形経路へ移している。層は12ブロックごとにアテンション残差を保持し、活性化関数はSiTU-GLU、モデル全体は量子化対応トレーニングのもとでMXFP4の重みとMXFP8の活性化を用いて学習される。コンテキスト長は1,048,576トークン、語彙は163,840で、視覚は401MパラメータのMoonViT-V2エンコーダを通して処理される。これによりK3は、後付けのマルチモーダルではなく、ネイティブに画像を扱える。

Screenshot of the Artificial Analysis model page for Kimi K3 (max), headed "Released July 2026", whose comparison summary reads In $3.00 / Out $15.00 and describes the model as leading on intelligence but expensive next to other open-weight models of similar size, notably slow and somewhat verbose, with text and image input and a 1M-token context window.

これらは後継モデルが動かさなければならない数字だ。これらの数字が「アクティブパラメータの削減」というアイデアについて何を意味するかに注目してほしい:K3はすでに並外れてスパースなモデルだ。トークンあたり、総パラメータ数の約3.7%を活性化する。104B未満しか活性化しないK4は、過剰にプロビジョニングされた設計から贅肉を削ぎ落とすことにはならないだろう — それはMoonshotが公に勝利として位置づけたスパース性比率を後退させることになり、しかも、他の業界が逆方向に進んでいる世代でそれを行うことになる。

「アクティブパラメータがより少ない」ということが本当なら、それは何を意味するのか

2つの解釈が可能であり、それらは正反対の方向を指している。寛容な解釈はアーキテクチャに関するものである:MoonshotはKDAハイブリッドをさらに拡張し、より多くのフルアテンション層を線形層に置き換え、エキスパート予算を再調整している可能性がある。その結果、より低いアクティベーション数で、より長いコンテキスト、より安価なサービングフットプリント、またはより良い品質対FLOP比を実現できる。その解釈では、より少ないアクティブパラメータは、K3がすでに述べている同じテーゼの洗練である——つまり、スパース性は妥協ではなくスケーリング戦略である。

もう一つの見方は、K4は決して一律の後継ではないというものだ。Kimiのラインは今年すでに一度分岐しており、報道はK3.1、K3.2、K4を三つの異なる製品として、さまざまに示唆してきた。K3より活性化が少ないK4が、別個のコーディング用バリアントを提供するファミリーにあることは、少なくとも単純なアップグレードと同じくらい、ポジショニングの再設定とも整合する。どちらの見方も推測にすぎない。どちらも一つの投稿で決着するものではない。

また、誰も触れていないライセンスという側面もある。K3のウェイトはKimi K3 Licenseの下で公開されており、これは標準的なオープンソースライセンスではなく、独自の「その他」ライセンスであり、初のオープンな3Tクラスモデルである。よりスパースなK4がそのライセンスを継承するのか、それとも狭めるのかは、ウェイト上に構築する誰にとっても、インデックススコアの数ポイントよりも重要である。

A generated two-column scoreboard titled "Kimi K3 vs Kimi K4 — the scoreboard", with six shared rows: Status (K3 "released 15 July 2026" vs K4 "unreleased"), Total parameters ("2.8T" vs "unverified"), Activated parameters ("104B" vs "unverified"), Experts per token ("16 of 896" vs "unverified"), Context ("1M tokens" vs "unverified") and Price ("$3 / $15" vs "none"), with the footer line "Kimi K3 figures per Moonshot's model card; Kimi K4 has no model card, weights or price."

同じ投稿にある他の3つの名前

GLM-5.5 FlashとGLM-5.4は、数字のせいではなく、むしろより意外な組み合わせだ。Z.aiが公表している上限はGLM-5.3で、これは2026年8月14日に743Bパラメータで登場し、GLM-5.3-Flashが8月26日に続き、BF16およびFlash-BF16の重みの公開は8月25日に行われた。Z.ai自身のドキュメントには、現行のモデル識別子としてglm-5.3、glm-5.3-flash、glm-5.2のちょうど3つが記載されている。GLM-5.4もGLM-5.5もGLM-5.5 Flashも存在しない。そして奇妙なのはその命名の方向性だ。5.5世代が5.4世代より先に来るというのは、Z.aiがこれまでファミリーを番号付けしてきたやり方ではない。リークにおいてバージョン番号が順不同で現れるのはよくある失敗の型であり、それらは新しいベースモデルというよりも、隣接する製品、社内コードネーム、あるいはサービング層のラベルであることが多い。

D​eepSeek V4.1Pは、そのシグナルの発信者が最も関心を持っていると述べている名称であり、4つの中で最も確認が容易なものです。D​eepSeekのAPIドキュメントには、現行のモデル文字列がちょうど2つ記載されています:deepseek-flashとdeepseek-v4-pro。「P」という接尾辞はD​eepSeekのどの識別子にも対応するものがなく、D​eepSeek自身の組織における最新の重み公開は、2026年9月10日に公開されたDeepSeek-V4.1-Flashです。V4.1Pは、最ももっともらしくはそのモデルのProティアの兄弟である可能性が高いですが、「最ももっともらしい」は文字列についての推測であって、製品についてのものではありません。

このうちのどれが現実なのか、あなたにどうして分かるのですか。

その4つの名前は同じテストに同じように失敗する。だから待つのは苦痛どころか、むしろ気楽だ。本物のリリースは成果物を残し、そのどれも確認するのは簡単だ:

• ベンダー自身のHugging Face組織にあるモデルカード。Moonshotの最新エントリは2026年6月13日に作成されたKimi-K3。Z.aiの最新は8月25日付のGLM-5.3ファミリー。DeepSeekの最新は9月10日付のDeepSeek-V4.1-Flash。3社のいずれにも、これより新しいものは存在しない。

• 論争に決着をつける設定。特に K4 の場合、注目すべきフィールドは num_experts と num_experts_per_token — K3 の値は 896 と 16 でした。トークンあたりの数値がより低い K4 の設定は、このリークの主張が単一のファイルで裏付けられるか反証されるかということです。

• ルーティング可能なモデル。カタログに掲載されている名前とは、価格とコンテキストウィンドウ、そしてその背後にプロバイダーを伴う名前のことだ。投稿の中にしか出てこない名前には、それらのどれもない。

Screenshot of the OrcaRouter model page for kimi/kimi-k3 by MoonshotAI, dated 2026-07-15, with Vision, Tools, JSON and Reasoning capability chips and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

今日ルーティングできるもの

このリークの実用的な意味は、それが描いている世代が、そのまま基盤として築けるものではないということだ。実際に稼働しているのは前の世代であり、ルーターの役割は、世代間のギャップを移行プロジェクトではなくルーティングの判断に変えることにある。Kimi K3 は現在利用可能で、100万トークンのフルコンテキストとネイティブビジョンを備え、価格は入力100万トークンあたり $3.00、出力100万トークンあたり $15.00、キャッシュ読み取りは $0.30 —— プロバイダー料率での請求でマークアップはゼロ。だからこそ K3 のベンダー価格の変更は、次回の価格改定サイクルではなくその日のうちに請求へ反映される。OrcaRouter の Kimi K3には、完全な仕様表と現在の料金が掲載されています。

同じことはラインナップの残り全体にも当てはまります。GLM-5.3、GLM-5.3-Flash、DeepSeek V4.1 Flash はすべて Kimi K3 と並んで、単一の OpenAI 互換エンドポイント経由でルーティング可能です。そのエンドポイントは200以上のモデルをカバーしており、プロバイダーが劣化したときの自動フェイルオーバーと、コスト上限・品質下限・レイテンシ予算といった選好を、呼び出しごとのロジックではなくポリシーとして表現するためのルーティング DSL を備えています。Kimi K4、GLM-5.5 Flash、DeepSeek V4.1P が登場したときの移行は、ルーティングポリシーの文字列を変更するだけで、それ以外に何も必要ありません。モデルフュージョンを使えば、タスクにそれが有益な場合に、同じエンドポイント上で複数のモデルの出力を組み合わせることができます。

それが何ではないかを明確に言うと、漏えいした4つの名前はいずれも、現在のOrcaRouter上のルートではありません。当社はそれらをホストしておらず、提供することもできません。

結論

ここで興味深いのはバージョン番号ではない。メカニズムだ — 次世代のフラッグシップが、前世代と比べてより少ないパラメータを活性化するのであれば、それはMoonshotが、生の活性化数ではなく、押し進める価値のある軸だと考えているという表明であり、K3の896分の16というエキスパート構成は、すでにその方向を裏付ける論拠となっている。主張のどの部分も検証されていない。K​imi K4、GLM-5.5 Flash、GLM-5.4、D​eepSeek V4.1Pにはモデルカードも、重みも、API識別子も、価格もなく、各ベンダー自身のカタログもいずれも1世代前で止まっている。これらの名前は答えではなく、問いの予告編として扱うべきだ — そして今日、100万コンテキストでフロンティア級のオープンウェイトが必要なら、Kimi K3こそがすでに存在するモデルだ。

Kimi K4が実際に登場するとき、自動フェイルオーバーこそが、移行がインシデントに発展するのを防ぐ鍵となります