
Qwen 4 Max vs Kimi K3:オープンウェイトの約束がオープンウェイトの実現と出会う
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
Moonshot AIは2026年7月16日にKimi K3をリリースし、その後、ほとんどのラボが口にするだけのことを実行した。すなわち、重みを公開したのだ。2.8兆パラメータのチェックポイントは、ローンチから11日後の2026年7月27日にModified MITライセンスの下で公開された。一方、2026年9月22日の雲栖(Yunqi)カンファレンスでは、Qwen 4 Maxが、オープンウェイトのQwen 4 27Bを含む4ティアのQwen 4ファミリーのフラッグシップとして発表された。ただしそのティアは約束されたもので、まだ出荷されていない。この2つの事実が比較そのものだ。Qwen 4 Maxに関するその他のことは現在不明であり、約束されたオープンティアと実際に提供されたティアの間のギャップこそ、この対決が実際に語るべきものを持つところである。
Kimi K3が7月に打ち出したもの
Kimi K3は2.8兆パラメータのMixture-of-Expertsモデルで、トークンごとに896個のエキスパートのうち16個を活性化するため、1ステップあたり約1,040億パラメータが稼働します。入力側と出力側の両方で1,048,576トークンのコンテキストウィンドウを備え、テキスト・画像・動画の入力を受け付けてテキストを出力します。ファーストパーティAPIの価格は入力トークン100万個あたり3.00ドル、出力トークン100万個あたり15.00ドル、キャッシュ済み入力トークン100万個あたり0.30ドルで、サードパーティの料金はそれを下回ります。
アーキテクチャは、アリババ自身のプレビューが呼応している部分だ。Kimi K3 は Kimi Delta Attention と Attention Residuals に基づいており、Moonshot によれば、Kimi K2 と比べてスケーリング効率が約2.5倍優れ、100万トークンのコンテキストでは最大6.3倍高速なデコーディングを実現するという。これは Qwen の QSA が狙うのと同じ課題だ — 極端に長い文脈でもアテンションを手頃なコストで扱えるようにすること — つまり両ファミリーが競っているのは、規模そのものよりも、どちらの疎なアテンション設計がより長く通用するかである。
Moonshotがローンチ時に公表したスコアは、ベンダー報告によるもので、当時は再現されていなかった:
• Artificial Analysis Intelligence Index — 57、当時はClaude Fable 5とGPT-5.6 Solに次ぐ3位。この数値はそれ以前のインデックス改訂版で記録されたもので、その後インデックスは2度再構築されているため、現在の値ではなく過去の記録である
• Frontend Code Arena — 1,679 Eloで1位、総合インデックスでそれを上回った両モデルより上位
• Terminal-Bench 2.1 — 88.3
• SWE-Marathon — 42、Opus 4.8とGPT-5.6 Solを上回る
• DeepSearchQA — 0.95で第1位、MATH-Visionも0.98で第1位
• GPQA-Diamond — 0.94
Moonshot自身の発表資料は、K3が総合能力で依然としてClaude Fable 5とGPT-5.6 Solに後れを取っていることを認めている。これは、その上に並ぶ一位という主張のどれよりも有益な一文だ。数字の興味深い構図は、総合指標で3位のモデルがフロントエンドコードで1位、長期的な検索で1位になったことだ——このプロファイルは、総合指標が汎用ツールを説明しているのではなく、特化型ツールを隠していることを示している。

Alibabaが約束したこと、そして約束の価値とは何か
Qwen 4の発表では4つのティアが示された。フラッグシップとしてQwen 4 Max、スループット向けにQwen 4 Flash、バランスの取れた中間としてQwen 4 Plus、そしてオープンウェイトのローカルティアとしてQwen 4 27B。Qwen LLM責任者のLiu Da Yiheng氏は、このファミリーは新世代アーキテクチャでトレーニングされていると説明し、間もなく登場すると述べた。4つのいずれについても、日付、モデルカード、API識別子、クラウド上の掲載、価格、公開されたスコアはない。
その発表について、2つの具体的な点が誤って報じられており、どちらも、それを踏まえて計画を立てようとする人にとって重要だ:
• Qwen 4の報道に付随する5兆~10兆パラメータという数字は、Qwen 4の仕様ではありません。それはQwen 4.5およびQwen 5のロードマップに属するものです。Qwen 4 Maxについては、いかなる種類のパラメータ数も公表されていません。
• ティア名が引き継がれても、仕様がそのまま引き継がれるわけではない。Qwen 4 Max のコンテキストウィンドウ、価格、ライセンスは不明であり、出荷されている Qwen3.8-Max の数値 — 100万トークンあたり $2.00 と $6.00 — は別のモデルを指している
27Bティアが興味深いものである理由は、ベンチマークとは何の関係もない。それは、Qwen 4ラインにおいて歴史的にオープンウェイトで提供されてきた唯一のティアであり、Qwen 3.8世代はそれが何を解き放つかを示した。27Bの重みが公開されてから数日以内に、コミュニティはMLX変換、NVFP4量子化、あらゆる種類のファインチューンを生み出していた。発表された27Bは下流エコシステムへのコミットメントであり、ロードマップ上で最も予測可能な提供物である。
しかし、予測可能であることは実現していない。Kimi K3の重みは、今日ダウンロードできるファイルだ。Qwen 4 27Bの重みは、カンファレンスの講演に出てくる一行にすぎない。
オープンウェイトと実行可能なウェイトは別の主張である
Kimi K3をオープンウェイトの答えとして扱うことには罠があり、これは中国のフロンティアモデルに関する報道で最もよく見られる過大主張なので、はっきりと言っておく価値がある。2.8兆パラメータの専門家混合(MoE)は、データセンター規模の成果物である。重みが公開されているとは、それを実行することを許され、検査でき、ファインチューンでき、量子化できるという意味だ。ワークステーションで実行できるという意味ではない。その規模のチェックポイントを効率的にサービングするには数十台のアクセラレータが必要であり、オープンリリース後に続く量子化作業——数週間以内に出回るNVFP4やREAP系のバリアント——は、モデルを小さくすることと同じくらい、モデルをサービング可能にすることに関するものでもある。
なので、Kimi K3のライセンスを正直に読むと、その範囲はより狭く、それでも依然として重要です。すなわち、監査可能で、改変可能で、セルフホスト可能なフロンティアモデルであり、Modified MITライセンスの下、それを提供するためのハードウェアを持つ組織向けです。これは真の戦略的資産であり、「open weights」を「自分のラップトップで動く」と読んだ人にはまったく適しません。
同じ注意事項は、Qwen 4 27B が出荷される場合、そしてその時が来れば、同モデルにも当てはまる——ただし、その当てはまり方はより緩やかだ。27B のオープンウェイトティアは、2.8T のフラッグシップとは違って、真にローカル規模だからである。まさにそれゆえ、この比較では Max ティアよりも Qwen 4 27B ティアのほうが、より注目に値する。たとえ発表が真っ先に打ち出したのが Max ティアだったとしても。

ライセンスの問題の下にある商業的な問題
Kimi K3のファーストパーティ料金は、100万トークンあたり入力3.00ドル、出力15.00ドルというプレミアムな位置づけであり、Moonshotは中国市場の安価な側より意図的に高く設定していると明言している。Qwen3.8-Maxの2.00ドルと6.00ドルに対して、入力料金は1.5倍、出力料金は2.5倍となる。この差は十分に大きく、Kimi K3固有の強み——その中にはフロントエンドのコードや長期的な探索も含まれる——をワークロードが重視していなければ、割増分を支払う価値があるとは言いにくい。
OrcaRouterは、kimi/kimi-k3をQwen 3.8ファミリーと並んで、マークアップ0%の単一のOpenAI互換エンドポイント上でルーティングします。つまり、請求されるのはマークアップされた相当額ではなく、ベンダーの定価です。出力価格の差が2.5倍になる比較において、プラットフォームのマージンが存在しないことは端数の話ではありません——$15.00の出力レートに10パーセント上乗せすると100万トークンあたり$1.50となり、これはこの組み合わせにおけるより安価なモデルの入力コスト全体を上回ります。同じエンドポイントは自動フェイルオーバーと、ポリシーを明示的に表現するためのルーティングDSLを備えており、これにより、これまで運用したことのないベンダーに経路全体を賭けることなく、本番トラフィックの一部でKimi K3のプロファイルを持つモデルを試すことができます。
OrcaRouterが取り扱っていないのは、Qwen 4 MaxやQwen 4のいかなるティアでもありません。なぜなら、それらはまだ製品として存在しないからです。

注目すべきこと、無視すべきこと
この比較を動かす3つのシグナルがあり、どれも注視するのに十分なほど具体的だ:
• Qwen 4 27Bの重み。Maxティアのベンチマーク表ではなく、27Bチェックポイント、そのライセンス、そしてそのサイズ。それこそが、この世代におけるアリババのオープンウェイトへのコミットメントが前回と同じくらい本物かどうかを教えてくれるリリースだ。
• Qwen 4 Maxのライセンス(もしあるなら)。もしAlibabaがQwen3.8-Maxのときと同じように自社のフラッグシップの重みを公開すれば、この対決におけるオープンウェイトの論点はKimiの優位ではなくなり、互角になる。
• Kimi K3に関する新たな独立評価。Moonshotのローンチ時のスコアは自己申告であり、その後Artificial Analysisのインデックスは2回再構築されているため、57とFrontend Code Arena Eloはどちらも、現在の何かと比較する前に基準を再設定する必要がある。
無視すべきなのは、Alibabaがモデルカードを公開する前に出回るQwen 4 Maxの仕様表と、Kimi K3のオープンウェイトがそれをローカルで実行可能にするという主張だ。どちらの誤りもすでに出回っている。それまでの間、実際に行動に移せる比較は、存在する2つのモデル間のものだ。すなわち、提供済みのウェイトと真に差別化されたコーディングプロファイルを備え、プレミアムな料金設定のKimi K3と、出力料金が半分未満で、一律100万トークンのウィンドウと独自のウェイトを備えたQwen3.8-Maxである。これは現実的な選択であり、双方に価格が設定されており、カンファレンスのスライドが製品化するのを待つ必要はない。
この記事で比較したモデル3
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
