
Kimi Linearは広がりつつある:検証できるすべてのモデルが実際にKDAを実行する
- metaNEWMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenNEWQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 198 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
- grokxAI: Grok 4.52026-07-0856知能72コーディング
- tencentTencent: Hy32026-07-0642知能59コーディング
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232知能42コーディング
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226知能39コーディング
- anthropicAnthropic: Claude Sonnet 52026-06-3055知能72コーディング
- klingKling: Kling 3.0 Turbo2026-06-1757知能52コーディング57数学
- z-aiZ.ai: GLM 5.22026-06-1653知能69コーディング60数学
「すごい!Kimi-Linearが採用され始めている!これで私が目にする外部モデルは3つ目だ。」それが投稿のすべてだった——2026年8月5日の@teortaxesTexによる一行で、スクリーンショットが添付されているだけで、モデル名は一つも挙げられていなかった。その短縮リンクはリポジトリではなく画像へと導かれるため、クリックして確認できるものは何もなく、裏付けになるものもない。とはいえ、この主張は検証可能であり、その重要性は一文が示唆する以上に大きい。もしMoonshot AI以外のラボが今、背後にあるアテンション設計(すなわちKimi-Linear-48B-A3B-InstructおよびKimi K3)を土台に構築しているのだとしたら、Kimi Delta Attentionはもはや一つのラボの社内テクニックではなく、他のプレイヤーが採用する構成要素になりつつある。そこで私たちはスクリーンショットではなく実際のモデルを探しに行った。簡単に言えば、最も有力なケースはLing-3.0-flashであり、そのモデルカードにはKDA層とMLA層の5:1スタックが記載されている。最も有用なケースは、純粋なKDAのコストを定量化した米国ラボの研究用チェックポイントであり、そしてフロンティア規模では、Moonshotの外でそれを製品化したところはまだどこもない。
その主張が何であるか、そして何でないか
一人の実践者、一枚のスクリーンショット、モデル名なし、裏付けなし。それが「採用が進んでいる」という主張の根拠のすべてであり、これはニュースとしてではなく、確認を促すものとして読むべきだ。私たちはそのスクリーンショットを再現できなかったため、以下の内容はそれを確認するものではない。以下に続くのは、2026年8月5日に私たちが調査した際に公開モデルのメタデータが示していたものと、各研究所がそれぞれのモデルカードで述べていることだ。数値がベンダー自身の計測によるものである場合、そのように明記している。というのも、この特定の話では、ほとんどすべての主要な数値がそうだからだ。
Kimi Linearの1つの画面、「adoption」はこれを採用することを意味するから。
Kimi Linearは、製品ではなく、2025年10月30日にarXiv 2510.26692としてKimi Teamが発表したアテンションアーキテクチャです。その中核はKimi Delta Attention(KDA)であり、Gated DeltaNetを採用しつつ、その粗い忘却ゲートをチャネルごとの細かい減衰に置き換えることで、リカレント状態が全体を一括してではなく、チャネル単位で何を保持すべきかを学習します。更新は、チャンク化されたDiagonal-Plus-Low-Rank形式に再構築され、テンソルコアを遊ばせることなく、確実にテンソルコア上で処理されるようにしています。このハードウェアを重視した枠組みこそが設計の要点です。線形アテンションは理論上は常に低コストでありながら、実際には大抵期待外れだったのです。
リリースされたチェックポイント — Kimi-Linear-48B-A3B-Base および Kimi-Linear-48B-A3B-Instruct — は、合計48Bパラメータでアクティブ3B、100万トークンのコンテキストウィンドウ、MITライセンスを備えている。層はおよそ3:1の割合で交互に配置され、20のKDA層と7つのMulti-Head Latent Attention層からなる。つまり、4層中3層が低コストのリカレント型で、4層ごとに正確なグローバルアテンションが維持される。
Moonshotが報告する内容は、すべて同一のレシピで訓練されたフルMLAベースラインを基準に測定された数値です — ベンダーの数値であり、独立に再現されたものではありません:
• デコードスループット — 1Mコンテキストにおいて、出力トークンあたりの時間がフルMLA比で最大6倍高速
• KVキャッシュ — 最大75%小型化、ここからスループットが生まれます
• 長いコンテキスト — RULER 128k: Kimi Linearは3.98倍の高速化で84.3、MLAベースラインは81.3
MMLU-Pro(4kコンテキスト)でのスコアは51.0で、MLAベースラインの47.2やGated DeltaNetハイブリッドの47.9を上回り、しかもフルアテンションとほぼ同じ速度を維持しています。つまり、この設計は長いコンテキストの速度を追求する代わりに短いコンテキストの品質を犠牲にしているわけではありません。
• 事前学習のアブレーション — 3:1 ハイブリッドは検証困惑度 5.65 に達する一方、フルアテンションは 5.77 である
そのすべてに関する正直な限界は、マッチドベースラインのエビデンスが48Bで止まっていることだ。比較対象となる、フルアテンションの2.8T版というKimi K3の双子モデルを構築した者は誰もおらず、また2026年7月下旬に行われたK3アーキテクチャの主張に対するファクトチェックの時点では、どちらのモデルについても、独立したショートカットフリーの長文脈リコールプローブは公開されていなかった。効率性の説明は十分に裏付けられている。「フルアテンションを上回る」という説明は、論文を書いた研究室によって研究規模で裏付けられている。

これまでのところ、その勢いは他者のアーキテクチャというよりはダウンロード数として現れている。先月のダウンロード数は98,164件、570件のいいね、Hugging Faceに掲載されている推論プロバイダーは1つ、モデルツリーには2つのアダプター、8つのファインチューン、24の量子化がある。明らかに人気だ。コピーされたかどうかは別問題である。
最も強力な採用事例: Ling-3.0-flash
Ling-3.0-flash は、その主張を現実のものにするモデルです。その Hugging Face カードには、Kimi Delta Attention と MLA を5:1の比率で交互に積み重ねたネイティブなハイブリッド線形アテンションアーキテクチャが記述されています。すなわち、124Bパラメータの Mixture-of-Experts モデル上に35層のKDAと7層のゲート付きMLAを備え、トークンあたり5.1Bのパラメータをアクティブ化し、8K→32K→256Kの段階的トレーニングで256Kコンテキストを実現し、MITライセンスで提供されています。これは趣味の開発者による研究用おもちゃではありません。確立された研究所がリリースした製品版モデルであり、そのアーキテクチャ記述には Moonshot のアテンションモジュールが明記されています。
また、これはMoonshotよりもその点で積極的である。Moonshotは4層ごとに1つの厳密アテンション層を維持する一方、Ling-3.0-flashは6層ごとに1つである。設計が負債となるのであれば、それをヘッジするものであり、発明した人々よりも少ないグローバル層数を用いるべきではない。前世代と併せて読むと、これは転換である:このクラスのモデルを分類した2026年2月のアーキテクチャ調査では、前世代のLingフラッグシップがLightning AttentionとMLAを7:1の比率で組み合わせていた。メカニズムは世代間で変化し、その変化の方向はKDAへ向かうものだった。
私たちが隠しておかない2つの注意点があります。これはカードに記載された情報です。私たちはリポジトリ自身のアーキテクチャ説明とその設定を読みました。そこでは、BailingMoeV3実装を備えたカスタムのbailing_hybridモデルタイプが宣言されています。しかし、その計算がKDAそのものであるか、KDAに着想を得たものであるかを確認するためにカーネルを監査したわけではありません。そして、そのリポジトリにはKDAタグは一切付いていません。タグ検索で出てくるのは、他の誰かがラベル付けした第三者のGGUF変換です。これは方法論に関する有益な警告であり、次の2つのセクションに直接つながります。
Arcee AIは、Moonshotが実行しなかった実験を実行した。
KDAの最も参考になる外部活用事例は、そもそも製品ではない。Kimi Linearの論文から約6週間後の2025年12月中旬、Arcee AIはApache-2.0ライセンスの研究用チェックポイント2点(AFM-4.5B-Base-KDA-OnlyとAFM-4.5B-Base-KDA-NoPE)を、独自実装のArceeKDAForCausalLMとともに公開し、明示的に「kimi-delta-attention」とタグ付けした。彼らの問いは、Moonshotのハイブリッド設計が慎重に回避しているもの、すなわち「フルアテンションを完全に置き換えられるか」だった。そこで彼らは24層すべてのアテンション層をKDAに変換し、グローバルアテンション層を一切残さず、元のAFM-4.5B-Baseを教師として32kシーケンス長で蒸留を行った。
彼らの報告した結果、教師対純粋なKDA生徒:
• MMLU — 63.1から55.8へ、確かな低下ではあるが致命的ではない
• GSM8K — 52.1 から 26.8 へ、ほぼ半減
• HellaSwag — 78.0 から 74.3、ほぼ無傷

その損傷の形状こそが興味深い部分だ。広範な知識と常識的な継続生成は、固定サイズのリカレント状態に押し込まれても、ほとんど生き残る。しかし、モデルが数ステップ前に書いた中間結果を正確に取り出す必要がある多段階の算術は、生き残らない。Arcee はまた、長コンテキストでの劣化は緩やかで、急峻な崖はないと報告している。これらを総合すると、本格的な KDA 導入がすべてハイブリッドである理由を示す、最も明確な公的証拠となる。Moonshot の4層に1層のグローバル層と Ant の6層に1層のグローバル層は、臆病さの表れではなく、算術を保持する部分なのである。
これがそうでないもの:大規模KDAに対する判定。これは4.5B蒸留であり、事前学習の実行ではない。変更されたアーキテクチャへの蒸留は、ゼロから事前学習する場合には失われないものを失う。これは、ベンダーが公表する動機を持たなかったアブレーション研究として読むべきだ——答えに利害関係を持たない独立系ラボによるものとして。
ロングテール:1週間のうちに現れた小さなKDAリポジトリの一群
深刻な2件の下には、小規模なものがいくつか散在している。そして、それらに言及する価値があるのは、その日付だ。NEXIVON-1B-BASEは2026年7月31日にアップロードされ、そのモデル種別を文字どおり「kda」と宣言している——Apache-2.0、285ダウンロード、いいねなし。同じ週のqingyi-kda-0.6bは、カスタムのqingyi_kda実装を同梱するQwen3-0.6B-Baseのファインチューンである。同じくその週のScrapegoat-Tiny-Coderは、kdaタグと独自の「二重トラック並列アテンション」設計を組み合わせている。さらに2件、maccy-106m-baseとmaccy-96m-16k-baseは、7月27日と28日にkimi-delta-attentionとタグ付けされた。
これらはどれも単独では重要ではない。一桁のいいね数、無名の著者、研究規模のパラメータ数。総合すると、それらはおそらく「私が見る3番目の外部モデル」の集計が数えているものだろう。しかし、投稿が名前を一切挙げていないため、どの3つなのかは確認できない。それらのシグナルはモデルではなく、10日間にある。4つの独立した小規模トレーニングランが1週間半以内にKDAに到達した。これは、カーネルが研究の成果物ではなくなり、週末にトレーニングスクリプトへ組み込めるものになったときに起こることだ。
スイープが見つけなかったもの
私たちは、kimi_linearモデルタイプを扱うすべてのリポジトリをHugging Faceで検索した。47件あった。そのうち3件を除くすべての名前には「Kimi」が含まれており、Moonshot自身のものではないものは、採用者というよりは派生版である:AWQ、GPTQ、FP8、NVFP4、SINQ、GGUF、MLXによるあらゆるビット深度の量子化、CerebrasによるREAP専門家プルーニング済み35B変種、そしてNVIDIA、MetaX、Hygonアクセラレータ向けのInstructチェックポイントのFlagRelease FlagOSビルドである。最後のグループは別の理由で本当に興味深い——誰かがKDAを中国国産シリコン上で動作させる作業を行ったのだ——しかし、そのどれもが、別の研究所が別のモデルを設計したというものではない。
Moonshot以外のフロンティア規模のモデルはKDAを宣言していない。総パラメータ124B・アクティブパラメータ5.1BのLing-3.0-flashが、現時点における外部導入の上限だ。
そして、この方法には名付ける価値のある穴がある。なぜなら、それは私たち自身の否定的な結果に反するからだ。KDAを再実装するラボは、独自のモデルタイプ——arcee_kda、qingyi_kda、bailing_hybrid——を登録する。そのため、タグ検索は、私たちが探しているまさにその採用者たちを体系的に見落とすことになる。また、モデルはカードに「KDA」と一切書かずにこの仕組みを使うことができる。タグに存在しないことは弱い証拠であり、証明ではない。もし4番目や5番目の静かな採用者がいるなら、まさにこの方法で見えないままになるだろう。
他のみんなは異なる線形アテンションを選んだ
「Kimi Linearが採用されつつある」ことがそもそも話題になるのは、2026年の大半において、そうではなかったからだ。ハイブリッド線形アテンションはオープンウェイト界隈を席巻したが、この変種は違った。2026年2月に公開されたアーキテクチャ調査によると、Qwen3-Next 80B-A3BとQwen3.5-397B-A17BはどちらもGated DeltaNetとゲート付きアテンションを3:1で組み合わせており、つまりQwen3.5-397B-A17Bは60層のうち45層がリカレント層、15層がフルアテンション層となる。従来のLingフラッグシップは、MLAを備えたLightning Attentionを7:1で使用していた。Nemotron 3 Nano 30B-A3BとSuper 120B-A12BはMamba-2ハイブリッドであり、それぞれ52層スタック中わずか6層、88層スタック中8層のアテンション層を持つ。GLM-5はMLAを維持し、その上にスパースアテンションを追加した。MiniMax-M2.5はまったく逆のアプローチをとり、信頼性のためと報じられているプレーンなマルチヘッドアテンションを維持した。そして、K3以前のMoonshot自身のフラグシップであるKimi K2.5はMLAだった。同研究所は2025年10月にKDAを発表したが、2026年7月までそれをフロンティアモデルに搭載しなかった。
というわけで、カテゴリは勝ち、バリアントは勝たなかった。誰もがあなたのレイヤーの4分の3はリカレントにできることに同意しているが、どのリカレンスにするかについては誰も同意しなかった。KDAの差別化要因はチャネルごとのディケイゲートであり、そのコストは、エコシステムの半分がすでに持っていたGated DeltaNetパスではなく、独自のカーネルとプレフィックスキャッシュの仕組みを必要とすることだ。今月までは、1つの研究所がそのコストを負担していた。
既に起こった採用はサービングスタックの中にあります。
アーキテクチャは、エレガントだから普及するわけではない。インフラがそれを安価にしたときに普及するのだ。KDAではその部分はすでに完了しており、モデルカードの採用よりも速く実現した。vLLMとSGLangはどちらも、Kimi K3のウェイトが2026年7月27日に公開されると同時にデイゼロサポートを提供した。Moonshotはフォークを維持するのではなく、KDAプレフィックスキャッシング実装をvLLM本体にアップストリームした。SGLangは融合KDAおよびGated DeltaNetカーネルを出荷し、同一ハードウェア上で論理KV容量が150万トークンから1220万トークンに増加したと報告した。これはSGLang自身の測定であり、この一連の流れ全体の中で最も具体的な第三者による効率性の数値である。リファレンスカーネルはfla-coreにあり、どの小規模なトレーニングランでもインポートできる。
それが、2025年12月にArceeが意図的な調査努力を必要としたのと、2026年7月のある1週間に4つの匿名リポジトリが何気なくKDAを宣言したこととの違いだ。その仕組みは、インストールする依存関係になった。フロンティアが追随するかは別問題だが、KDAに対する摩擦論はほぼ消え去った。
トークンだけを購入している場合、何が変わるのか。
あなたのコードとは何の関係もない。KDAを呼び出すことは決してない。あなたが体感するのは、100万トークンのコンテキストのコストと、最初のトークンが返ってくるまでの時間だ。Kimi K3は、それが今日商業的に顕在化するモデルである。OrcaRouterでは、入力100万トークンあたり3.00ドル、出力100万トークンあたり15.00ドルで稼働し、完全な100万トークンのコンテキストと、直近7日間に測定されたp50のファーストトークンまでの時間8.88秒を備えている。その経済性は、実質的に3:1のKDAハイブリッドがもたらすものだ。つまり、100万トークンのコンテキストを、法外な価格ではなく単に高価な価格で提供するということだ。

研究用チェックポイントは別の話です。Kimi-Linear-48B-A3B-Instruct は MIT ライセンスで、Hugging Face のページに推論プロバイダーが1つ記載されているだけであり、OrcaRouter には存在しません。実行したい場合は、セルフホスティングかそのプロバイダーを利用することになります。セルフホスティングのコスト計算は、パラメータ数が示唆するより現実的です。bf16 の 48B 重みはおよそ 96 GB なので、80 GB カードが2枚必要ですが、4ビットの MLX および GGUF 変換版は 25〜30 GB 程度になり、1枚のカードまたは十分なスペックの Mac で収まります。Ling-3.0-flash も現在 OrcaRouter にはありません。私たちは、ルーティングに関する主張を通すために、その事実を無視するつもりはありません。
ここでルーティングが重要になるのは、アーキテクチャへの賭けを外したときのコストです。ハイブリッド線形アテンションモデルは、まさにベンダーのベンチマーク表と自社のワークロードが食い違うクラスです。固定サイズのリカレント状態は、どの総合スコアにも現れない検索パターンで失敗します。これは、GSM8Kの数値が半減したという教訓です。200以上のモデルを1つのAPIキーで比較するということは、調達サイクルではなくモデル文字列を変えるだけでテストができるということであり、プロバイダーの定価で当社のマークアップは0%、さらに自動フェイルオーバーにより、まだ評価中の長文脈モデルが本番パスの単一障害点になることもありません。ご自身の長文脈トラフィックで1日試してみてください。それは、当社のものも含め、どのベンチマーク表よりも安価な答えです。
実際に尋ねる価値のある質問
Kimi LinearはKimi K3と同じものですか?
いいえ。両者を混同することは、両者に関する報道において最もよくある誤りです。Kimi Linearは、アーキテクチャ論文に加えて、総パラメータ48B・アクティブ3Bの研究用モデルであり、1Mコンテキストを備え、KDAを多用したハイブリッドが同等の学習条件でフルMLAに勝つことを実証するために、2025年末にMITライセンスで公開されました。Kimi K3は、Moonshot社が2026年7月に発表した2.8兆パラメータのフラッグシップモデルで(アクティブ104B、ネイティブなマルチモーダル対応、1Mコンテキスト)、KDAを3:1で用いるアイデアをフロンティア規模に拡張し、さらにAttention Residuals(アテンション残差)という別の手法を追加したものです。同社の報告によれば、この手法は追加コスト2%未満で約25%の学習効率向上をもたらします。メカニズムは共通していますが、規模・能力・価格はまったく異なります。一方のベンチマークから、もう一方についてわかることはほとんどありません。
多くの研究室がGated DeltaNetを選ぶなか、なぜKDAを選ぶ研究室があるのでしょうか?
KDA は Gated DeltaNet の厳密な改良版であり、問題は、その改良が切り替えコストに見合うかどうかです。改良点はゲートです。Gated DeltaNet は、1ステップごとに1つのスカラーでリカレントメモリを減衰させますが、KDA は特徴チャネルごとに減衰率を学習します。これにより、状態は、変数名が現れた文をフラッシュしつつ、その変数名を1万トークンにわたって保持できます。Moonshot のアブレーションでは、その効果は48B時点の検証困惑度にして約0.12とされています。また、KDA のチャンク化された DPLR 定式化はテンソルコアを遊ばせないように設計されているため、追加の表現力は、得られるスループットを犠牲にしません。その一方で、Gated DeltaNet は、どちらの方式もまだ注目されていなかった頃から、幅広いカーネルとフレームワークのサポートを備えており、これは実際のエンジニアリング時間に見合う価値があります。2026年の答えは、大方「やる価値はない」というものでした。Ling-3.0-flash は、その逆方向への初の本番規模の賭けです。
これらによって、今四半期にデプロイする内容は変わるべきでしょうか?
長いコンテキストを実行している場合に限ります。プロンプトが約32kトークン未満であれば、ハイブリッド線形注意は実装詳細に過ぎず、モデル選択に影響を与えません。通常どおり品質、価格、レイテンシーで選んでください。128k以上を扱う場合、その長さでコストを妥当に保つモデルがますますKDAハイブリッドになっていること、そしてそれらが公表している長いコンテキストのスコアは敵対的リコールプローブではなく総合ベンチマークであることを知っておく価値があります。RULERスコアを信頼するのではなく、実際のコンテキスト長で検索をテストしてください。そのアドバイスは、メカニズムがGated DeltaNetであれMamba-2であれ同じです。
これがその主張をどういう状況に置くのか
方向性としては正しいが、聞こえるほど大きな話ではない。2026年8月5日時点で検証可能なのは、確立された研究所によるプロダクションモデル1件、正直な欠点を公表した米国の独立系研究所による研究ペア1件、過去10日間のサブ1Bリポジトリ数件、そしてカーネルをすでに取り込んだサービングエコシステムである。それは「ひとつの研究所のトリック」以上であり、標準と呼ぶにはほど遠い。注目すべき数値は外部モデル3件ではない。注目すべきは、Moonshot以外の研究所による次のフロンティア級オープンウェイト公開がチャンネル単位のゲーティングを搭載するかどうか、そしてMoonshot以外の誰かが、固定サイズの状態が実際に何を忘れるかを検証するリコールプローブを公開するかどうかである。そのどちらも、もう一枚のスクリーンショットよりも多くのことを教えてくれる。
