Qwen 3.8 vs Kimi K3:中国の二大巨頭、そして今、一方がより安くなった
Guides & Insights

Qwen 3.8 vs Kimi K3:中国の二大巨頭、そして今、一方がより安くなった

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

これらは2026年の中国のフロンティアモデルの中で最も重要な2つであり、近い従兄弟のような存在です。どちらも巨大なスパースMixture-of-Expertsシステムであり、1Mトークンのコンテキスト、マルチモーダル、オープンウェイトの約束を備えています。Kimi K3はMoonshot製で、実際には大きい方で、2つのうち総パラメータがQwenの2.4Tに対して2.8Tです——パラメータ数はランキングではないという有益なリマインダーです。

2026年8月3日まで、この比較は特定の点で一方的でした。Kimi K3は、監査済みのArtificial Analysis Intelligence Index 57.1、LMArenaのフロントエンドコードランキング第1位、公開された価格設定、そして出荷済みのウェイトを備えていた一方、Qwen3.8-Maxは2.4Tという見出しだけで、他には何もありませんでした。GAは経済性を決定的に変えました。Qwenは現在、100万トークンあたり$2/$6を公表しており、Kimiの$3/$15と比較すると、より大規模で、より実績のあるモデルが大幅に高価なものになっています。

ビルダーへの注意 — これを解決する最速の方法は、自分のプロンプトで両方を実行してみることです。OrcaRouterは200以上のモデルを1つのOpenAI互換エンドポイントの背後に配置しているため、2つのSDKを組み込むことなく、同じタスクでQwen 3.8 MaxとKimi K3を競わせることができます。

TL;DR 総評: Kimi K3は証明力では依然として優位:監査済みのAA Intelligence Index 57.1(#3)LMArenaフロントエンドコード部門第1位(1679)、そして実際に使えるオープンウェイトを備えている。Qwen3.8-Maxは独立系評価機関によるスコアがまだ一切ない。しかしGAはQwenに2つの現実的な利点を与えた。価格面では、現在大幅に安く — $2/$6 対 $3/$15、つまり出力コストは2.5分の1。そして、存在する唯一のサードパーティ直接対決テストでは、Qwenは主要スコア80対83で敗れたものの、明らかに挙動の良いエージェントだった:リポジトリ引用354件対274件、ゲートウェイリクエスト22件対53件、失敗したツールコールは0件対2件。監査済みの品質ならKimi、より安くクリーンなエージェント実行ならQwen。

重要なポイント

Kimi K3はより大きなモデルです — Qwenの2.4Tに対して2.8TのMoE、およそ400B多い — これは、パラメータ数を能力の代理指標として扱うことに対する良い反論です。

Qwen3.8-Maxは2026年8月3日よりGAです。価格は$2 / $6(1Mあたりフラット)で、Kimi K3の$3 / $15(AAブレンド約$2.31)と比較すると、Qwenは現在出力が2.5倍安くなっています。

Kimi K3は監査済みの評価を保持しています: AAインテリジェンス指数 57.1 (#3)で、Fable 5とGPT-5.6 Solに次ぎ、さらにLMArenaフロントエンドコード#1 (1679)も保持しています。Qwen3.8-Maxはまだ未評価です。

唯一の直接テスト(Trilogy AI)では、KimiがQwenを83対80で上回ったが、総合的にはQwenはより多くのリポジトリ引用(354対274)より少ないゲートウェイリクエスト(22対53)、そしてツール呼び出しの失敗はゼロ(2回に対して)で、ツール使用評価は9/10でKimiの8/10に対していた。

Qwenは現在、エージェントおよびコーディングの数値を報告しています:Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1、FrontierSWE 73.5 (従来版の40.7から) — すべてAlibabaによる報告。

公開のタイミングは依然としてKimiに有利だ:Kimiのウェイトは実質的に準備ができており、Qwenのウェイトは今週中に提供される予定だが、まだライセンスもリポジトリもない。

正確性に関する注記: Qwen3.8-Maxの品質数値はすべてAlibaba社の報告によるものであり、第三者による検証は行われていません。Kimi K3の数値はArtificial AnalysisおよびLMArenaからのものです。直接比較はTrilogy AIによる単一のテストであり、一般的なランキングではなく、一つのデータポイントとして解釈すべきです。Qwenの料金はGAレートカードに基づくものであり、7月のプレビュー割引に優先します。

スペックと価格、並べて比較

これが確かなデータです。各数値はその出典が明記されています。

• 開発元 / ステータス — Qwen3.8-Max: Alibaba; GA(2026年8月3日); Kimi K3: Moonshot; オープンウェイト公開

• アーキテクチャ — Qwen3.8-Max: 合計約2.4T、スパースMoE(アクティブパラメータ数は非公開のまま);Kimi K3: 2.8T MoE、ネイティブビジョン(Artificial Analysis)

• コンテキストウィンドウ — Qwen3.8-Max: 1Mトークン (思考時983,616; 最大出力131,072); Kimi K3: 1Mトークン (Artificial Analysis)

• AA Intelligence Index — Qwen3.8-Max: 未スコア; Kimi K3: 57.1 — #3(Artificial Analysis)

• アリーナ / リーダーボード — Qwen3.8-Max:公開スコアなし;Kimi K3:フロントエンドコード #1、1679(LMArena)

• ベンダー報告のスコア — Qwen3.8-Max: Terminal-Bench 2.1 86.6、GPQA Diamond 92.6、OSWorld-Verified 86.1 (Alibaba報告); Kimi K3: スコアは第三者計測

• 料金(入力/出力)— Qwen3.8-Max: $2.00 / $6.00 1Mあたり、定額;キャッシュ入力は $0.25;Kimi K3: $3 / $15 1Mあたり(AAブレンド ~$2.31)、キャッシュヒット $0.30

• オープンウェイト — Qwen3.8-Max: 今週中の提供を約束 (ライセンスは未定); Kimi K3: オープンウェイト; ウェイトは準備済み

• 速度 — Qwen3.8-Max: p50 TTFT 1.64秒 (OrcaRouter 7日間テレメトリ); Kimi K3: 冗長で遅い (~34秒 TTFT、AA による)

この比較を形作るものは2つあり、そのうちの1つは8月3日に完全に逆転した。

まず、価格関係は逆転した。7月までは、Kimi K3が実価格のモデルで、Qwenが割引クーポンのモデルだった。現在は両者ともレートを公開しており、実績がありより大きなモデルの方が高価だ:$3 / $15 against $2 / $6。出力面では、推論とコード生成がコストを費やす部分で、Kimiは2.5倍のコストがかかる。Qwenはまた、100万トークンのコンテキスト全体にわたって均一料金を課し、キャッシュされた入力は$0.25で、Kimiのキャッシュヒット率$0.30をわずかに下回る。高負荷のワークロードにとって、Qwenの経済性は今や明らかに優れている。

第二に、証明のギャップは変わっておらず、それがKimiが依然として勝つ理由だ。Kimi K3の57.1というインテリジェンス指標は、それを総合3位に位置づけており、上位はFable 5とGPT-5.6 Solのみである。これは中立的な評価者の判定だ。LMArenaのフロントエンドコード#1(1679)は、多くのブラインド比較から得られたクラウドソーシングの結果だ。QwenのTerminal-Bench 86.6とGPQA Diamond 92.6は実数ではあるが、Alibaba自身の数値であり、他の誰も実行したことがないハーネスによるものだ。有用な基準の一つとして、前世代のQwen3.7-MaxはAA指標で46を記録し、Kimiの57.1に対して、Qwenは並ぶためだけに大きな世代間ジャンプを必要とする。

また、レイテンシーに関して注目すべきねじれがある。それは通常の説に反するものだ。Artificial AnalysisはKimi K3について、最初のトークンが返ってくるまでの時間をおよそ34秒と測定している——確かに遅い。OrcaRouterのGAテレメトリでは、Qwen3.8-Maxのp50 TTFTは1.64秒である。これらの測定値は出どころが異なり、管理された比較ではないが、プレビュー時代に「Qwenの方が遅い」とされていた前提を覆しかねない。

唯一の直接対決テスト、注意深く読んでください。

これはシリーズ中で唯一、第三者が両モデルを同じタスクで互いに競わせたマッチアップであり、勝者を決める形に要約するよりも、じっくり読む価値があるものです。

Trilogy AIは、アーキテクチャ理解タスク——実際のリポジトリを理解し、正しいアーキテクチャの結論に到達する——を実施し、結果をスコアリングしました:

• 総合スコア — Qwen3.8-Max: 80 / 100;Kimi K3: 83 / 100

• リポジトリ引用数 — Qwen3.8-Max: 354; Kimi K3: 274

• ゲートウェイリクエスト — Qwen3.8-Max:22;Kimi K3:53

• 失敗したツール呼び出し — Qwen3.8-Max: 0; Kimi K3: 2

• ツール使用評価 — Qwen3.8-Max: 9 / 10; Kimi K3: 8 / 10

• キャッシュヒット率 — Qwen3.8-Max: >90%; Kimi K3: >90%

Kimiは3ポイント差でヘッドラインを獲得した。しかし、プロセス列を見てほしい。エージェント工学にとっては、スコアよりもそれらが重要だからだ。Qwenは同じ中核的アーキテクチャの結論に達するのに使用したのはゲートウェイリクエストの半分未満であると同時に生成したのは29%多いグラウンディング引用であり——エージェントを構築する人なら誰でも関心を持つであろう詳細だが——Kimiの2回に対する失敗ツール呼び出しがゼロだった。

ツール呼び出しの失敗こそが、実際に本番エージェントを壊す原因です。それは連鎖します。不正な呼び出しがエラーを生み、モデルはそれを解釈しなければならず、ターンを消費し、さらなるエラーのリスクを招きます。あるモデルが22回の正常なリクエストを行うのに対し、別のモデルが2回の失敗を含む53回を行う場合、たとえ回答スコアが3ポイント低くても、前者の方が運用が安価で予測可能です。Qwenの出力レートが2.5倍安いことと合わせると、その実行の運用経済性はQwenを大幅に有利にします。

注意点は、これは1つのタスク、1つの評価者、1回の実行である。これはベンチマークスイートではなく、一般化もされない。Kimi の 57.1 インデックスと #1 フロントエンドランキングは、この単一のテストが示す証拠よりもはるかに多くの証拠に基づいている。正しい結論は限定的である。すなわち、少なくとも1つの現実的なエージェントタスクにおいて、Qwenはより規律正しいツール利用者でありながら、出力品質ではわずかに劣っていた。

実際のコスト:エージェンティックは大規模に実行される

リポジトリ分析エージェントを例にとると、1回の実行につきコードコンテキストが250,000トークン、出力が12,000トークンです。

Qwen3.8-Max: 0.25M × $2 = $0.50、プラス 0.012M × $6 = $0.072。≈ 1回あたり $0.57。

Kimi K3: 0.25M × $3 = $0.75、プラス 0.012M × $15 = $0.18。≈ 1回あたり $0.93。

• 1日1,500回の実行で: Qwen ≈ $858/日;Kimi ≈ $1,395/日 — 月額約$16,000の差です。

• 安定したリポジトリでのキャッシュ使用時: Qwenのキャッシュ済み入力は$0.25/1Mで、実行コストは ≈ $0.14; Kimiのキャッシュヒット価格$0.30では、≈ $0.26.

ギャップは両端で現実のものだが、Trilogyの結果がそれをさらに増幅する。Qwenが同等の作業を完了するために実際に使うゲートウェイリクエストが半分未満であれば、エージェンティックタスクにおける実効コスト差は、レートカードだけが示唆するよりも大きい。

両モデルとも思考トークンを出力として課金するため、推論を多用する構成はどちらの場合でも単純な見積もりよりもコストがかかる。しかし、Qwenの$6レートはそのペナルティを2.5分の1に抑える。

開放性:ほぼ同等、異なるタイミング

ここが両者が最も似ている軸であり、違いは純粋に準備状況にあります。Kimi K3のウェイトは公開されており、実質的に利用可能です。Qwen3.8-Maxのウェイトは今週中に提供されると約束されていますが、ライセンス文書もモデルカードもリポジトリもまだありません。そして、モデルを商用利用できるかどうかを決定するのはライセンスなのです。

実際には、どちらのフラッグシップも通常のチームではセルフホストできません。2.4TのQwenは4ビットで約1.2TBで、H200一枚あたり約141GBに対して;2.8TのKimiはさらに大きいです。両方とも8基以上の最上位アクセラレータが必要で、Alibabaがアクティブパラメータ数を非開示にしているため、Qwenのスループットすらモデル化できません。

だからこそ、同時に発表されたQwen3.8-27Bがここで重要になる。また、オープンウェイトを採用し、約17GBのVRAMで動作すると報じられており、Qwenファミリーに、2.4Tも2.8Tのフラッグシップも提供しない、真のオンプレミス展開の選択肢をもたらす。オープンウェイトがこの2つを選ぶ実際の理由なら、27Bはどちらの巨大モデルよりも計算を変える。

よくある質問

Qwen 3.8はKimi K3より優れていますか?

監査済みの証拠に基づくものではない。Kimi K3は独立したAAインテリジェンス指数57.1(第3位)を保持し、LMArenaのフロントエンドコード部門で第1位を獲得している。一方、Qwen3.8-Maxはあらゆる第三者評価機関で未評価のままである。利用可能な唯一の直接テストでは、Kimiが83対80で勝利した。Qwenの利点は、価格(出力が2.5倍安い)と、その同じテストにおけるツール使用のクリーンさである。

どちらのモデルの方が大きいですか?

Kimi K3は総パラメータ数2.8Tで、Qwen3.8-Maxの2.4Tと比べて——およそ400B多い。とはいえ、両者ともこの差を有意義にするのに十分な情報を開示していない。AlibabaはQwenのアクティブパラメータ数を一度も公表しておらず、その数値こそがMixture-of-Expertsモデルにおいてサービングコストを実際に決定するものだからだ。

どちらの方が安いですか?

Qwen3.8-Max、明らかに、GA以来だ。Kimi K3の$3 / $15に対し、1Mあたり$2 / $6を提示している。入力は33%安く、出力は2.5倍安い。Qwenのレートは1Mコンテキスト全体でフラットであり、キャッシュ入力の$0.25はKimiのキャッシュヒット率$0.30をわずかに下回る。

直接対決テストは実際に何を示したのか?

Trilogy AIのアーキテクチャ理解タスクでは、Kimiが83点、Qwenが80点を獲得した。しかし、QwenはKimiの274件に対して354件のリポジトリ引用を生成し、ゲートウェイリクエストはKimiの53回に対して22回を使用し、失敗したツール呼び出しはKimiの2回に対して0回を記録し、ツール使用ではKimiの8/10に対して9/10を獲得した。Kimiはより良い回答を提供した一方、Qwenはより規律あるエージェントだった。これは1つのタスクに過ぎないため、ランキングではなく1つのデータポイントとして扱うべきだ。

I don't have specific information about a model called "Qwen 3.8 Max" or its preview status. I'd recommend checking the official Qwen blog or documentation for the latest updates on model releases and availability.

はい、2026年8月3日に、公開済みのレートカードとOpenAIおよびDashScope互換のエンドポイントを備えて提供されます。7月のQoderクレジットキャンペーンでは、その販売方法についてはもはや説明されていません。

どちらが速いですか?

今のところ、おそらくQwenが優位だろう。これはプレビュー時代の前提を覆すものだ。Artificial AnalysisはKimi K3のtime-to-first-tokenを約34秒と測定している。一方、OrcaRouterの7日間のGAテレメトリでは、Qwen3.8-Maxのp50 TTFTは1.64秒だ。測定元が異なり統制された比較ではないが、両モデルとも冗長な出力で知られており、Kimiの測定されたTTFTは実際に遅い。

どちらもセルフホストできますか?

フラッグシップ規模では現実的ではない——2.4Tおよび2.8TモデルにはH200クラスのGPUが8基以上必要だ。Kimiのウェイトは本日利用可能だが、Qwenのウェイトは今週中に提供予定で、ライセンスはまだない。真のオンプレミスオプションとしては、同時に発表されたQwen3.8-27B(VRAM約17GBと報告されている)がQwenファミリーの中で実用的な選択肢だ。

結論

Qwen 3.8 vs Kimi K3はこのシリーズで最も接戦であり、一般提供はそれを2つの軸に沿って明確に分けました。Kimi K3は、審判が測定した指標によって品質の王座を維持しています。インテリジェンス指数で57.1、総合3位、そしてLMArenaのフロントエンドコード部門でトップの座です。これらは主張ではなく結果であり、Qwenには同等のものはありません。

{{1}}8月3日にQwenが勝ち取ったのは経済性であり、しかも決定的な勝利だった。100万トークンあたりフラットな価格で$2/$6 対 $3/$15、キャッシュもわずかに安い。{{/1}} {{2}}さらにTrilogyの調査結果では、Qwenは同等のエージェント型タスクを、ゲートウェイリクエスト半分・ツール呼び出し失敗ゼロで完了した。これを加味すると、Qwenは精度では劣る場面でも、運用効率ではより優れたモデルに見える。{{/2}} {{3}}注目すべきイベントが2つある。Qwen3.8-Maxの初の独立系Intelligence Indexスコアと、ライセンス付きでのウェイト公開だ。{{/3}} {{4}}もしQwenがKimiの57.1に近いスコアを獲得すれば、価格差により、大量処理の用途でKimiを選ぶ正当性はほぼ失われる。{{/4}} {{5}}それまでは、Kimiが信頼できるモデルであり、Qwenは実行コストを負担できるモデルだ。そして正直な選び方は、自社のリポジトリで試すことだ。{{/5}}

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新