
Qwen3.8-Omni-Flash 開始から5日:ひとつの扉、重みなし、そしてアリババ以外が付けた初のスコア
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ベンダーがQwen3.8-Omni-FlashをAPI顧客に開放してから5日後も、このモデルの拠点は依然としてただ一つしかない。それはベンダー自身のQianwenプラットフォームとBailianクラウドサービス上で動作しており、ローンチ以降に現れたサードパーティの掲載は、同じエンドポイントの前段に置かれたプロキシにすぎず、モデルが存在する第二の場所ではない。重みは一切公開されていない。ローンチ当日の数値——音声1時間のコストを98%削減、Qwen3.5-Omni-Plus比で平均26%向上、100万トークンのコンテキスト、テキストのみの出力——は、依然としてベンダー自身によるもので、再現されていない。この5日間で実際に変わったのはモデルではなく、その周囲の状況だ。サードパーティによるスコアの薄い層が現れ、フレームワーク対応は初日に実現し、誰もが手を伸ばす比較対象は、Gemini 3.8 FlashではなくQwen3.8-Flash。このモデルと並んで作られた。これらのどれも、ローンチ時の報道が与えたよりも注意深く見る価値がある。
その扉は良い扉で、それだけしかない
可用性は広がったが、複数化したわけではない。モデルはOpenAI形式のリクエストにそのまま応答するので、既存のクライアントコードはほとんどそのまま動く。壊れるのはエンドポイントだ。国際版と中国本土版のホストは別々のサービスで、課金も別だからだ。デフォルトを指すコードは、失敗するか、誤った通貨で課金されるかのどちらかになり、時間単価の話が成り立つのは国際版だけだ。オープンソースのクライアントライブラリはこのモデルのday-zeroサポートを提供したが、それは本当に便利であり、同時に第二のプロバイダーでもない。Bailianと通信するライブラリは、同じ単一の供給源を包む便利なラッパーにすぎない。
それは名指しする価値のある構造的リスクです。単一ソースのモデルにはフェイルオーバー経路がありません。エンドポイントがレート制限をかけたり、性能が低下したり、あるリージョンが落ちたりした場合、行き先はどこにもなく、クライアントライブラリのサポートをどれだけ充実させてもそれは変わりません。また、それが私たちがそうではないとほのめかすのではなく、自らの立場を率直に述べている理由でもあります。Qwen3.8-Omni-Flashは私たちのカタログにはありません。私たちはそれをホストしていませんし、それをルーティングできると期待して登録した読者は誤解させられることになります。ルーティング可能なのはファミリーの残りのモデルです — Qwen3.8-FlashとQwen3.8-Maxはどちらも私たちのAPIで稼働しており — そしてOrcaRouterはプロバイダーの定価を0%のマークアップでそのまま通すため、Alibabaのomniの価格が動いたとき、あるいはomniモデルがルーティング可能になる日には、その変更は次回の契約更新時ではなく当日に顧客へ届きます。

アリババのものではない最初のスコアは乏しく、お世辞にも良いとは言えない
Artificial Analysisにはこのモデルについて何も存在せず、その不在こそが5日目時点での正直な見出しだ。隣接モデルについて誰もが引用するリーダーボードには、オムニモデルの行がまだない。その空白は別の何かによって埋められている。第三者の評価プラットフォームがこのモデルに対する実行結果を公開し始めており、その要約は、どれほど多くを語っていないかというまさにその点ゆえに一読に値する。メール分類は99.0%の精度(86パーセンタイル)、倫理は95.0%(23パーセンタイル)、推論は56.0%で、これは28パーセンタイルに位置づけられ、顕著な弱点とされている。速度は21パーセンタイル、コストは58パーセンタイル、全体の成功率は89%である。
それらは大いに慎重に扱うべきだ。しかも、その理由はサンプルが小さいからだけではない。同じページでは、このモデルのリリース日が9月20日とされ、それはAlibabaがそれを出荷した2日後であり、どの結果についても実行日が示されておらず、表に含まれていない数値を説明する要約の下に、空のベンチマーク表が表示されている。これは、測定に基づく評価というよりも、初期段階で監督の薄いハーネスの特徴であり、正直に読めば、これらは最初の信頼できるデータ点ではなく、最初の非ベンダー由来のデータ点だということになる。これらは自分でモデルを試す理由であって、何かを結論づける理由ではない。ただし、方向性は、ベンダー自身の資料が省略によって示唆している内容と一致している。これは知覚と長尺メディアのモデルであり、推論重視のベンチマーク群はその狙いではなかった。
検索結果には、今後数週間にわたって人々を引っかける罠もある。Qwen 3.8というテキストモデルは、Artificial Analysis Intelligence Indexが40台であり、その数字はあたかもomniモデルを表すかのように、複数の要約で引用されてきた。しかしそうではない。両者は異なる仕事を持つ別のモデルであり、omniモデルにはまだインデックス自体が存在しない。

ベンチマーク表は依然として、あるベンダーが自社と比較しているだけだ
ローンチ時の数字 — 約30の評価全体で平均26%超の改善 — は、完全にQwen3.5-Omni-Plusに対して測定されたものだ。それはファミリーが前進したことを示している。だが、あなたがすでに金を払っているかもしれない何かと比べてこのモデルがどこに位置するかは示していないし、同時に出回った選択的な比較もその溝を埋めてはくれない。Gemini 3.8 Flashに対するベンダー報告の全体像は、音声系ベンチマークでは紛れもない勝利であり、エージェント的な動画作業を測るベンチマークでは敗北だ。WildClawBench-MM は71.0対58.9、SpotSoundBench は67.2対39.7である一方、AgenticVBench は36.8対45.0、OmniGAIA は74.0対78.6となっている。Alibaba自身の要約表現 — 音声・動画性能はGeminiに「近づきつつあり」、音声性能全体ではそれを上回る — は、それが生み出した見出しよりも慎重であり、その慎重な版こそが正確なのだ。
• コンテキスト — 1Mトークン、最大入力は約991K(思考モードでは約983K)、最大出力は131K。
• モダリティ — テキスト、画像、音声、動画を入力として受け付け、出力はテキストのみ。ベースモデルでは音声生成は行いません。
• 継続時間 — 1回の呼び出しにつき最大1時間の連続した音声または音声・映像を扱えるため、分割せずに会議や長尺メディアの処理を行えます。
• 言語カバレッジ — ローンチ資料では74言語に加えて39の中国語方言を認識し、音声入力については他の資料でより広い数値(113言語と方言)が引用されています。
入力の詳細 — ステレオおよび4チャンネルの空間オーディオを受け付け、Realtimeバリアントは音によってターゲットを特定できる初のオムニモーダルモデルと説明されている。
• 価格 — 国際向けでは入力トークン100万あたり$0.15、キャッシュ済み$0.016、出力$0.47、そして比較できない別個の中国本土向け価格表がある。
98%は本当で、あなたの請求書ではありません
アリババ自身の方法論によれば — 2分のサンプルを30倍し、動画を720p・毎秒1フレームでサンプリングする — 音声入力1時間あたりは$0.28から$0.01未満に下がり、音声と動画を合わせた1時間あたりは$3.27から$0.20に下がる。これらは大きく、具体的で、ベンダーが報告した削減であり、しかも1つの費目における削減にすぎない。重要な計算は、あなたのワークロードの中でその費目がどれだけの割合を占めるかだ。出力、キャッシュされたコンテキスト、または毎秒1枚より高密度にサンプリングされた動画フレームにトークンの大半を費やすパイプラインでは、請求書上で動く割合は見出しが約束するよりもはるかに小さくなる。しかもその見出しは入力音声についてのもので、総額についてではない。テキストのみの出力を加えると、ギャップはさらに広がる。話し返す必要があるものは2つ目のモデルを必要とし、そのモデルは別途課金される。
ここが、ルーティングがその価値を発揮する場面だ。パススルールーターの価値は割引ではない——ベンダー自身の価格表どおりに支払えること、そして、ワークロードを複数のモデルに分散できるため、単一ソースのモデルが依存先ではなく構成要素になることにある。呼び出せるのがオムニモデルだけである場合、それは可用性と価格設定の両方の層における単一障害点となる。

5日間の制作が実際に何を教えてくれるのか
3つのことが、未解決の疑問に決着をつけるだろう。AliMeetingのダイアライゼーション結果の独立した測定——誤り率が88.11から3.35へ、cpWERが89.61から17.18へ低下すること——は、それがモデルによるものなのか、その周囲に組み込まれたダイアライゼーションとフロントエンドエンジニアリングによるものなのかを示すだろう。少なくとも1件の中国語による技術分析は、利得の大半を後者に帰している。エージェントモードのトークン削減の再現テスト——OmniVideoBenchで精度が63.4から67.8に上昇する一方、クエリあたりのトークン数が145,736から79,117に減少した——は、このリリースで最も有用な主張、つまりモデルが同時により良くかつ安くなり得ることを裏付けるだろう。そしてArtificial Analysisかアリーナの行があれば、上記のあらゆるベンダー数値が比較可能なものになる。これは、モデルが試されるだけでなく選ばれるための前提条件である。
それまでは、妥当な姿勢は、ホストが1つで独立した評価もない、生まれて5日のモデルに当てはまるものと同じだ。自分の音声と動画で測定する価値はあるが、パイプラインを通る唯一の経路にする価値はない。あなたのワークロードが中国語または英語の長尺会議やメディア分析で、コストが出力トークンではなく入力時間数に支配されているなら、ここでの経済性は今週テストを正当化するほど強い。ワークロードが音声を返す必要がある場合、またはプロバイダーが劣化したときのフォールバックが必要な場合、今日のままのモデルは完全な答えにはなり得ない — そして、どれだけ day-zero のフレームワークサポートがあってもそれは変わらない。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
