
Qwen3.8-Omni-Flash 対 Qwen 3.8:スペシャリストのBill 対 フラッグシップのもの
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 984 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 196 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
手短に言えば:Qwen3.8-Omni-Flashはトークンあたりおよそ13倍安くよりQwen 3.8、しかも2つのうち、1時間分の音声・映像の中に収まっても息切れしないように作られているのはこちらだけだ——一方、Qwen 3.8は、Qwen3.8ラインの頂点に立つ2.4兆パラメータのオープンな中核であり、答えに求められるのが正確さではなく安さであるときに使うモデルだ。そして2つのうち、重みをダウンロードできるのもこちらだけだ。両者はコンテキスト長もファミリー名も、8月から9月という投入時期も同じだ。両者は代替品ではなく、この比較の価値はすべて、自分が実際にどちらの問いを立てているのかを分かっていることにある。
名前について正確に述べておく。というのも、この一族は混み合っているからだ。Qwen 3.8とは、ここでは2.4T-A95Bのmixture-of-expertsオープンコア、すなわちQwen3.8-Maxエンドポイントの背後にあるモデルを指し、Alibabaが2026年8月3日に発表し、8月12日に重みを公開したもので、Artificial AnalysisはそのIntelligence Indexで40と評価している。Qwen3.8-Omni-Flashは、Alibabaが2026年9月18日にAPIサービスへ投入したネイティブなオムニモーダルモデルで、Qwen3.8-Flashアーキテクチャ系に基づいて構築され、テキスト、画像、音声、動画を入力として受け取り、テキストを返す。フラッグシップに関するあらゆる事柄は、注記のとおりベンダー報告または独立系の指標によるものであり、オムニモデルに関するあらゆる事柄はベンダー報告のみによるものである。なぜならそれは公開からまだ数時間しか経っておらず、Alibabaの外部で測定した者はいないからだ。
2つのモデル、1つのファミリー、正反対のデザインブリーフ
これを、同じ世代の大規模モデルと小規模モデルの関係——たとえば Qwen3.8-Max と Qwen3.8-Flash を対比して読むように——読んでしまう誘惑がある。だが、その読み方は間違っており、しかも金銭的損失を招く。Qwen 3.8の中核は、たまたま画像や動画も受け付ける推論エンジンである。そのスループットは難問における毎秒トークン数で測られ、価格は950億アクティブパラメータのフォワードパスにかかる計算コストを反映するように設定され、評価シートは推論およびコーディングのベンチマーク一覧だ。Qwen3.8-Omni-Flashは、たまたま推論も行う知覚・行動エンジンである。その価格は何時間分ものメディアを取り込むコストを基準に設定され、評価シートは音声、動画、ツール呼び出しのベンチマーク一覧だ。一方はトークンあたりの深さに最適化されている。もう一方はコンテンツ1時間あたりのトークン数に最適化されている。
その違いが最も鋭く現れるのは、マーケティングが触れていないある点だ。両モデルとも約100万トークンを受け付け、どちらも動画を扱える。しかしQwen3.8-Omni-Flashは、長時間という問題を明示的に中心に据えて設計されている——1回の呼び出しで最大1時間の連続音声・映像を扱い、Agentic Understandingモードでは、モデルが全フレームを処理する代わりに何をサンプリングするかを自ら選び、クエリあたりのトークンを145,736から79,117へ削減しつつ、OmniVideoBenchでの精度を63.4から67.8へ高める。Qwen 3.8には、それに相当する公表された仕組みがない。2時間の動画を投入することは理屈の上では可能だが、財務チームの検証に耐える価格でそれを実現するのはまた別の話であり、それこそがこのomniモデルが答えを出すために作られた問いなのだ。
実際にそれを決める要素
• 価格 — Qwen3.8-Omni-Flash は入力100万トークンあたり0.15ドル、出力100万トークンあたり0.47ドルで、Qwen 3.8 の2.00ドルと6.00ドルに対して。キャッシュ読み取り:0.016ドル 対 0.25ドル。
オープンウェイト — Qwen 3.8は2026年8月12日、独自ライセンスの下でウェイトを公開。Qwen3.8-Omni-FlashはAPI限定で、Alibabaはこれをリリースするとは明言していない。
• コンテキスト — 両側とも100万トークン、omniモデルでは最大入力991K、最大出力131K、推論バジェット262K。
• メディアの継続時間 — 1回のomni呼び出しで最大1時間の連続した音声・映像。フラッグシップは映像入力に対応するとドキュメントに記載されているが、1時間あたりのコストに関する説明は付随していない。
• 出力モダリティ — どちら側もテキストを出力する。オムニモデルの系譜にもかかわらず、どちらも音声を生成しない。
• 独立スコア — Qwen 3.8はArtificial Analysis Intelligence Indexで40に位置する。Qwen3.8-Omni-Flashには、まだいかなる種類の独立スコアも存在しない。

なぜベンチマークの表ではこれを決着できないのか
一対一の比較表は存在せず、近いうちに登場することもない。アリババの発表資料は、Qwen3.8-Omni-Flashを専ら比較対象としてベンチマークしている:Qwen3.5-Omni-Plus、その直接の前身、および Gemini 3.8 Flash との比較で。フラッグシップの数値は、まったく別の推論・コーディング評価群から来ている。この2つの表は1行たりとも共通していない。同じ軸上に両者を並べた表を公開している者は、その軸を自ら作ったのだ。
正直に言えるのは方向性を示すものだ。ベンダー自身の数値では、omniモデルはそれが置き換えるomniラインから大きく前進している——約30の評価で平均26%超の向上、WildClawBench-MMは71.0、UniClawBenchは69.6、LongAudioSpanは82.7——そしてGemini 3.8 Flashに対しては本物だが部分的な前進であり、SpotSoundBench(39.7に対して67.2)やMMAU(76.9に対して81.8)のような音声中心のベンチマークではリードし、純粋な動画推論のAgenticVBench(45.0に対して36.8)では後れを取っている。フラッグシップ側では、Qwen 3.8のIndexスコア40は独立した測定値であり、上記のどれよりも価値がある。これらは種類の異なる証拠であり、一緒に平均すべきではない。

前提を明記したコスト比較の計算例
長文書と動画の解析ジョブを考えてみましょう。入力トークン300,000、出力トークン20,000で、これはスライド付きの90分の録画会議にありそうな規模です。Qwen3.8-Omni-Flashでは、300,000 × $0.15/100万 = $0.045の入力と、20,000 × $0.47/100万 = $0.0094の出力、つまり約5.4セントです。Qwen 3.8では、同じ呼び出しが300,000 × $2.00/100万 = $0.60、および20,000 × $6.00/100万 = $0.12、つまり約72セントです。同じトークン数でコストは13倍を少し上回ります。
意思決定を変える数字は、比率ではなく量だ。こうしたジョブが1日100件なら、1日およそ5ドル対およそ72ドル——出荷する機能とスコープを縮小する機能の違いになる。しかし、タスクが300Kトークンの契約書からの難しい抽出1件で、誤った回答が人間のレビュー1時間分のコストを伴うなら、13倍の割増は無関係であり、より強力な推論モデルは最初の誤りを犯さないという点で勝つ。価格の行を見る前に前提を設定せよ、見た後ではなく。
それぞれが実際に優位に立つ点
Qwen3.8-Omni-Flashは、時間単位で測られるあらゆるものにおいて優位に立つ。話者分離を伴う会議の文字起こしとフォローアップタスクの抽出、長時間動画の要約、音声映像リサーチレポート、字幕生成パイプライン、そして、録音のどの分が重要かを自ら判断しなければならないあらゆるエージェント。ベンダー報告による話者分離の改善 — AliMeetingの話者誤り率が88.11から3.35に低下 — は、手動でレビューされるパイプラインを自動化されたものに変えるような差分だ。ただし、ローンチに関する中国の技術分析は、その利得の多くはモデル自体からではなく、モデルを包むフロントエンドと話者分離のエンジニアリングから来ていると主張している。そのため、人間のレビュー工程を廃止する前に、自分の音声でベンチマークを行ってほしい。オムニモデルはまた、そのテキスト品質が十分である大量のテキストワークロードにおいて、価格で単純に優位に立つ。Alibabaは、それが同サイズのテキスト専用モデルに匹敵すると主張している — 未再現の主張であり、想定するのではなくテストする価値がある。
Qwen 3.8 は、出力が数えられるのではなく評価されるあらゆる場面で勝つ:難しい推論、長期的なエージェント作業、大規模なコード作業、合成自体が成果物となる百万トークンの文書分析。ベンチマークとは何の関係もない次元でも勝っている——それはオープンウェイトである。あなたの制約がデータ所在地、オンプレミス展開、ファインチューニング、あるいは単に推論経路にベンダーを入れたくないことなら、omni モデルは候補にすらならないし、どんな価格優位もその差を埋めない。その単一の制約は、上のすべての数字よりも多くの実際の導入を決める。
2つの契約なしでそれらを実行する
このような比較における実務上の摩擦は、めったにモデルの選択ではありません。むしろ、どちらが欲しいのかを知るために、結局2つのベンダー、2つの請求関係、2つのクライアントコードを統合することになるのです。Qwen3.8-Max — 2.4兆パラメータのオープンコアを搭載するエンドポイント — はOrcaRouterで稼働中ですモデルID qwen/qwen3.8-maxで、入力100万トークンあたり$2.00、出力100万トークンあたり$6.00、100万トークンのコンテキストとテキスト・画像・動画入力に対応し、1つのキーで200以上の他のモデルをプロバイダー定価・マークアップ0%で利用でき、エンドポイントが劣化した場合にはプロバイダー間で自動フェイルオーバーします。Qwen3.8-Omni-Flashはそのカタログには含まれていません — Alibaba自身のプラットフォームで動作します — そのため、現時点で正直な構成は、当社のルート上のフラッグシップと、直接呼び出すomniモデルであり、ルーティングレイヤーは、テストを実行した後に敗れた方を置く場所を提供します。

評決
入力が長く、出力が短く、ボリュームによって単価が拘束条件となる場合は、Qwen3.8-Omni-Flashをお選びください。入力が密で、出力が成果物そのものであり、正確性またはデプロイの制御が譲れない条件である場合は、Qwen 3.8をお選びください。両者が重なる領域——動画理解——こそ、真の直接対決が成立する唯一の場所であり、その領域では、オムニモデルがコストと所要時間の論拠を握り、フラッグシップが推論とオープンウェイトの論拠を握ります。コミットする前に、両方を自社のデータで実行してください。オムニモデルにはまだ独立した評価がなく、ローンチ当日の価格優位性は、発表ではなく請求書で確認する価値のある類のものだからです。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
