
MiMo-V2.6-Flash 対 Qwen3.8-Max:ダウンロード 対 メーター、そしてスコアを持っているのはそのうち一方だけ
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
この比較が通常どのように書かれるかを決めるのは1つの数字であり、それはベンチマークではない。Qwen3.8-Maxは、Artificial Analysisが継続的に測定しているホスト型モデルであり、再調整されたv4.3スケールで現在のIntelligence Indexは45、出力速度は毎秒39.2トークン、定価は入力100万トークンあたり2.00ドル、出力100万トークンあたり6.00ドルとなっている。MiMo-V2.6-Flashは、Xiaomiが2026年9月21日にダウンロード可能な重みとして公開したもので、そうしたものは一切備えていない。プロバイダーの料金表も、Xiaomiが発表したモデル識別子も、Artificial Analysisのページすら存在しない。MiMo-V2.6-Flashの能力について公開されているすべては、Xiaomi自身のモデルカードにある評価表に由来する。Xiaomiの社員ではない誰かによって再実行された数値は1つもない。
その非対称性は、モデルに対するマイナス評価ではない。それは、それぞれがどのような種類の購入なのかという事実であり、直接対決から実際に何を結論できるかを変える。本稿の残りでは、本当に比較できる3つのこと――主張の性質、トークンのコスト、ライセンス――に加えて、実在し、独立に測定され、見出しのどちらのモデルにも属さない1つの数値について述べる。
まず、どのQwen 3.8で、どのMiMo?
あの見出しにある両方の名前は、チェックポイントを装った一族であり、しかもその置き換えは無害ではない。
• Qwen3.8-Max — Alibabaのホスト型フラッグシップ。2026年8月3日に発表。2.4兆パラメータのスパース混合エキスパートモデルで、トークンあたり約950億パラメータがアクティブ、100万トークンのコンテキスト、テキスト・画像・動画入力に対応。本記事の残りでは、このモデルを対戦相手として扱う。
• Qwen3.8-Max (0902) — 同一モデルの9月2日付スナップショットで、同じ$2.00と$6.00の価格設定、および131,072トークンの出力上限を持つ独立したエントリとして提供されています。現在のArtificial Analysisページはこのビルドを対象としており、インデックススコアを引用する際には重要です。
• Qwen3.8-2.4T-A95B — 同じコアのオープンウェイト版チェックポイントで、2026年8月12日以降、Qwen3.8-Maxライセンスの下でダウンロードできます。テキスト専用で、思考は常にオン、ネイティブコンテキストは100万ではなく262Kです。これが見出しのモデルではありません。
• MiMo-V2.6-Flash — Xiaomiの総パラメータ数309B、アクティブ15Bのスパースなmixture-of-expertsチェックポイント。Hugging FaceでMITライセンスのもとゲートなしで公開され、ネイティブなオムニモーダルで、1Mトークンのコンテキストを謳っています。これは2つのチェックポイントのリリースのうち効率重視のモデルであり、フラッグシップはMiMo-V2.6-Proで、総パラメータ数1.02T、アクティブ42Bです。
• MiMo-V2-Flash — 2025年12月のモデル。総パラメータは同じ309B、アクティブは同じ15B、128トークンのスライディングウィンドウも同じ。学習実行が異なり、ベンチマーク表も異なり、コンテキストは256K。『MiMo-V2-Flash』をQwenモデルと比較して順位付けしているページは、誤った世代を比較しているのであり、仕様表だけではそれを見抜けない。
MiMo の衝突は二つの罠のうちより鋭い。というのも、そのモデルを識別する数字は、たまたま 2025 年と 2026 年のチェックポイント間で同一の数字でもあるからだ。Qwen の衝突はより穏やかだが、代償が伴う。オープンな 2.4T の重みとホスト型 API は、異なる条件を持つ別個の成果物であり、両者を取り違えた比較は、能力とライセンスの両方を誤ることになる。
インデックスは再構築され、ほとんどのページが今も印刷しているあの番号は消えてしまった
スコアが表示される前に注意すべき失敗モードは次のとおりです。
Artificial Analysisは2026年9月7日にIntelligence Indexをv4.3に再調整した。その日付より前のスコアは、それ以降のスコアとは比較できない。また、公開中のQwen3.8-Maxページには更新済みバッジが付いており、再算出された結果であることを示している。広く流布しているQwen3.8-Maxの58という数値は旧スケールに属する。現在のQwen3.8-Max(0902)は45を示し、Artificial Analysisがそのクラスに位置づける202モデル中19位である。
これは揚げ足取りではない。58が46の隣に並ぶと、12ポイントの差として読める。同じ現行スケール上では、その同じ2つのモデルはわずか1ポイント差しかない——しかも46は、この記事が扱っているモデルですらない:
• Qwen3.8-Max (0902)、独立に測定 — v4.3 の Intelligence Index は 45。出力速度は毎秒39.2トークンで、202件中151位、ページ自体が遅いと注記している。Intelligence Indexタスクあたりのコストは$5.41。インデックスを完了するために生成された出力トークン数:190M。
• MiMo-V2.6-Pro、独立した測定による — インテリジェンス指数46、オープンウェイトクラス114モデル中第1位。出力速度は毎秒134.3トークン。インテリジェンス指数タスクあたりのコストは$0.13。指数を完了するための出力トークン数:140M。
• MiMo-V2.6-Flash、実際の対象 — Artificial Analysisのページは存在しません。引用できるものは何もありません。
それら三つを一緒に読むと、正直な要約は両ベンダーにとって居心地の悪いものになる。誰もが望む比較点——中立スケールでのFlash対Qwen3.8-Max——は存在せず、ベンダーの表から構築することもできない。なぜなら、2社は異なる時期に異なるチェックポイントで異なるハーネスを実行し、さらに自社のモデルを、自分たちが実行した他社のモデルと比較したからだ。実際に存在するのは、フラッグシップQwenとXiaomiのより大きなチェックポイントとの間の1ポイントの差であり、インデックスタスクあたりのコストは約40分の1である。これがこの対決で最も興味深い実数であり、見出しのどちらの側も名を挙げていないモデルに関するものだ。

ベンダー表が教えてくれることと教えてくれないこと
両ベンダーは数値を公開している。それらは同じ種類の数値ではなく、列ごとに並べると知見ではなくグラフができあがる——しかし、主張の形は依然として読む価値がある。なぜなら、それは各ラボが何に最適化したのかを教えてくれるからだ。
• コードエージェント — XiaomiはMiMo-V2.6-FlashがDeepSWE v1.1で67.9、Terminal Bench 2.1で87.6、ProgramBenchで26.0、MiMo Code Benchで61.2だと報告している。AlibabaはQwen3.8-MaxがSWE-bench Proで67.7、Terminal-Bench 2.1で86.6だと報告している。Terminal-Benchの数値は十分に近く、順位を決めているのはモデルではなくハーネスである可能性が高い。
• 汎用エージェント — XiaomiはFlashについて、AutomationBench v1.0.6で52.3、Toolathlon-Verifiedで73.6、OSWorld-Verifiedで80.8、Agents' Last Examで27.6を報告している。AlibabaはQwen3.8-Maxについて、OSWorld-Verifiedで86.1、WideSearchで81.9、Agent's Last Examで52.4を報告している。両社が実施した2つのベンチマークでは、Qwenの報告値が上回っている — ただしAlibaba自身のハーネス上で。
• 知識とセキュリティ — XiaomiはCyberGym(Flash 95.1)、MiMo Cyber Bench(77.2)、ExploitGym(6.0)、ExploitBench(25.3)、SEC Bench Pro(47.5)を実施している。AlibabaはGPQA Diamond(92.6)、Humanity's Last Exam(43.6)、PaperBench(93.0)を実施している。ほとんど重複がないため、比較できるものもほとんどない。
ベンダーの表が示せる本当に有用なことの一つは内部の不整合であり、Xiaomiの表にはそれがある。9月まで訓練実行を配信していた同社の公開RLダッシュボードは、MiMo-V2.6-Flashを65.68として、DeepSWE v1.1でmini-swe-agentハーネスを使った3回平均において公開した。完成したモデルカードには、リリースされた重みについて67.9と記載されている。これらはそれぞれ訓練スナップショットとリリース済み成果物を記述したもので、その2ポイントの差はXiaomiの2つのチェックポイント間のギャップと同じ大きさだ。先週からダッシュボードの数値を引用しているなら、それはもう古い。
法案、そこが二つのモデルが比較できなくなるポイントだ
これは配備を決めるセクションであり、決して僅差ではない。
• Qwen3.8-Maxは従量課金制です。アリババの国際料金表では入力トークン100万あたり2.00ドル、出力100万あたり6.00ドルで、Artificial Analysisが測定したキャッシュ割引は88%、Intelligence Indexのタスクあたりコストは5.41ドルです。アリババの中国リージョンのドキュメントには、同じ組み合わせについて100万あたり12元と36元が記載されています。今日の午後にも呼び出して、請求書を受け取れます。
• MiMo-V2.6-Flash はダウンロード対象です。Xiaomi は自社サイトで MiMo-V2.6 世代のトークンあたり料金を公開しておらず、どちらのチェックポイントについても呼び出し可能な識別子を発表していないため、計量すべきものは何もありません。代わりにあるのは、65 シャードにまたがる 172.9 GB の FP8 重みデータ(100 万トークンコンテキスト用の KV キャッシュはまだ含みません)と、Tensor Parallel 16・データ並列係数 2 での SGLang、または Tensor Parallel 8 での vLLM レシピを推奨するデプロイメントセクションです。つまり、マルチノードのサービングジョブです。
• サードパーティの掲載情報は料金表ではない。カタログページには MiMo-V2.6 シリーズの数字が実際に掲載されており、Artificial Analysis は、MiMo-V2.6-Pro を100万トークンあたり $0.435 と $0.87 で提供する API プロバイダーを1社だけ数えている。それはより大きなチェックポイントについてのプロバイダーの掲載情報であり、Xiaomi の価格ではなく、Flash についてはまったく存在しない。
つまり、その算段は設備投資の判断に対する従量課金の明細項目だ。月に数億トークンなら、Qwen3.8-Max は予測できる請求書であり、Flash は Xiaomi の外部では誰も測定したことのないモデルを提供するために購入することになるノードだ。月に数十億トークンになると、オープンの道がコストで勝ち始め、ここがライセンスが法的な脚注であることをやめ、調達の入力要素になる地点だ。
ライセンスは同じ許可ではありません
MITは、オープンウェイトとしてはほぼこれ以上ないほど寛容なライセンスだ。Qwen3.8-MaxライセンスはMITではなく、その違いには実効性がある。
MiMo-V2.6-FlashはMITの下で提供されており、収益のしきい値も、ユーザー数によるトリガーも、別個の商用契約も、研究条項もありません。商用展開、改変、再配布、追加学習はすべて許可されており、リポジトリはゲートされていません。
Qwen3.8-Maxライセンスは、使用、改変、配布、サブライセンス、販売、デプロイ、ホスティング、ファインチューニングを、2つの条件のもとで許諾します。月間アクティブユーザー数が1億人を超える製品またはサービスまたは月間収益が2,000万米ドルを超えるものは、そのインターフェースにモデル名を目立つ形で表示しなければなりません。また、モデル・アズ・ア・サービスまたはAIワークアシスタント事業で、連続する12か月間のいずれかにおける総収益が5,000万米ドルを超える場合、商用利用の前にアリババから別途ライセンスを取得する必要があります。内部利用は除外されますが、それはモデルまたはその機能が第三者に公開されない場合に限られます。
ほとんどのチームにとって、どちらの条件も拘束力を持たない。成功するプラットフォーム事業にとっては、一方が拘束力を持ち、しかもそれは、モデルが不可欠な支えとなったまさにその時点で効いてくる。また、これらの条件は、ダウンロード可能な2.4Tの重みに付随するものであり、ホスト型APIには付随しない。ホスト型APIには代わりにプロバイダーの規約が適用される。この2つの経路には異なる義務があり、これは、オープンなチェックポイントとホスト型のものを同一製品であるかのように比較すべきでない、さらなる理由である。
OrcaRouterが適する場面と、適さない場面
Qwen3.8-MaxはOrcaRouter上でルーティング可能です。ベースエントリと日付付きの0902スナップショットの両方が対象で、プロバイダー定価のままマークアップ0%がそのまま通る1つのAPIキーを通じて。これがここで特に重要なのは、2つの理由からです。第一に、0902ビルドは黙って置き換えられるのではなく別個のエントリであるため、ルーティングDSLが再現性に敏感なトラフィックを日付付きスナップショットに固定できる一方で、それ以外はすべてベース階層に従います — 2つ目の統合もコード変更も不要です。第二に、定価はマークアップされるのではなくそのまま通されるため、Alibabaの料金表の変更は次の契約更新時ではなく当日にあなたの側へ反映されます。これにより、価格が動いても上記の従量課金対ノードの計算が正直に保たれます。キャッシュを多用するワークロードも、プロバイダーのキャッシュ割引の一部をリセラーのマージンに奪われることなく、そのまま享受できます。

MiMo-V2.6-Flash はどこでもルーティングできません。当社のも含めて。当社は Xiaomi のモデルを一切ルーティングしておらず、Xiaomi 自身のカードにある可用性の行は、Xiaomi 自身のチャネル、すなわち MiMo API プラットフォーム、AI Studio、MiMo Code、デスクトップアプリを指しています。このチェックポイントが欲しいなら、172.9 GB をダウンロードして、ノードを探すことになります。

どちらを、そしていつ
ハードウェアなしで能力を求めるなら、利用量が不確かなら、あるいはコミットする前に独立した数値を確認する選択肢が欲しいなら、Qwen3.8-Maxを選べ。現在のインデックスにおける45はトップではなくフロンティアの中位の位置であること、毎秒39.2トークンはエージェントループ内で問題になるほど遅いこと、そしてIntelligence Indexを完了するのに190M出力トークンが必要なのは中央値のおよそ2倍であることを受け入れよ。冗長さは、メーターの出力課金側ではコストになる。
制約がライセンス、データ経路、または償却できる長期的な請求額であり、かつそのノードを確保できるなら、MiMo-V2.6-Flashを選べ。収益ゲートのないMIT条件は、MAU閾値とレベニューシェアのトリガーを伴うライセンスとは本当に異なる許可であり、大きくなることを見込む企業にとっては、それがこれを選ぶ理由だ。マルチノードサービングの予算を組み、リポジトリページではなく公開された重みデータに基づいてサイジングし、Xiaomiのカードにあるあらゆる数値は、ラボ外部の誰かがそれを再実行するまではベンダー報告値として扱え。
そして、次の四半期ではなく今日選ぶのであれば、まずは従量制オプションを試しましょう。Qwen3.8-Max を1か月使えば、あなたのワークロードが実際に何を必要としているかが分かります。ノードは、あなたがそうであってほしいと願ったことしか教えてくれません。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
