
Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash:一方は動画を観て、もう一方は動画を創る
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
結論から言うと、この2つは代替品ではありません。「omni」をひとつのカテゴリーとして扱うのをやめて初めて、この比較は意味を持ちます。Qwen3.8-Omni-Flashは、ベンダーが2026年9月18日にAPI顧客向けに開放したもので、テキスト・画像・音声・動画を入力として受け取り、テキストを返します。つまり、1時間分の会議や映像を読み込んで、何が起きたかを教えてくれるモデルです。Gemini Omni 1.1 Flashは、ベンダーが2026年8月27日に出荷したもので、テキストまたは画像のプロンプトを受け取り、同期した音声付きの動画を返します。つまり、映像を作り出すためのモデルです。一方はメディアを消費し、もう一方はそれを生成します。パイプラインが両方を必要とするなら、両方が必要です。そして正直に問うべきは、どちらが優れているかではなく、実際にどちらが足りていないかです。
どちらのモデルもオープンウェイトではなく、どちらもOrcaRouter経由でルーティングできず、しかも両者は相互に換算できない軸で価格設定されている——一方はトークン、もう一方は生成動画の秒数だ。「omni vs omni」という枠組みが示唆するよりも、両者が本当に重なる部分は狭く、その重なりは価格計算の前に明確にしておく価値がある。というのも、価格計算こそ、この2つが最も頻繁に誤って比較される場面だからだ。
まず片付ける価値のあるカテゴリー錯誤
アリババの発表資料はQwen3.8-Omni-FlashをGemini 3.8 Flashと比較しており、その後に出回った多くの報道は、それを「Geminiに勝った」と一言に圧縮してしまった。これはGemini Omni 1.1 Flashとは別のGoogleモデルであり、この二つは置き換え可能な比較対象ではない。Gemini 3.8 Flashは汎用マルチモーダルモデルであり、Gemini Omni 1.1 Flashは動画生成モデルで、価格表もAPIサーフェスも別々になっている。発表以降に出回っているQwen対Geminiの数字——WildClawBench-MMは71.0対58.9、SpotSoundBenchは67.2対39.7、AgenticVBenchは36.8対45.0——はいずれもGemini 3.8 Flashに対するもので、Omni動画モデルに対するものではなく、そもそもどれも独立した数字ではない。この記事に登場する2つのモデルを同じ軸に並べたスコアボードを持ってここに来たのなら、それはほぼ間違いなく、右側の列に間違ったGoogleモデルが入っている。
それぞれが実際に何をするのか
• 入力として受け付けるもの — Qwen3.8-Omni-Flashはテキスト、画像、音声、動画に対応し、ステレオおよび4チャンネルの空間オーディオも扱えます。Gemini Omni 1.1 Flashはテキストと画像のプロンプトに加えて、最大3秒の参照動画を受け付けます。
• 返してくれるもの — Qwen3.8-Omni-Flash はテキストのみを返します。Gemini Omni 1.1 Flash はネイティブに同期した音声付きの動画を返し、シーンは10秒単位で最大40秒まで延長できます。
• 制御面 — Qwen3.8-Omni-Flashはコンテキスト、サンプリング、そして何を参照するかを自ら判断するエージェントモードを公開している。Gemini Omni 1.1 Flashは最初のフレームと最後のフレームの制御、連続性のための10秒間のルックバック、そしてGoogleがコスト約3分の1、約60%高速と説明する360pのドラフトティアを公開している。
• 解像度と仕上がり — Qwen3.8-Omni-Flash はメディアを生成しないため出力解像度はありません。Gemini Omni 1.1 Flash は 720p、1080p、4K で出力します。
• コンテキストと継続時間 — Qwen3.8-Omni-Flashは、1回の呼び出しで100万トークンと最大1時間の連続した音声映像を扱える。Gemini Omni 1.1 Flashは、入力ウィンドウではなく、生成中のクリップによって制限される。
• 支払い方法 — {{1}}Qwen3.8-Omni-Flash{{/1}}はトークン単位で課金されます。国際価格表では、入力100万トークンあたり{{2}}$0.15{{/2}}、キャッシュ済みで{{3}}$0.016{{/3}}、出力で{{4}}$0.47{{/4}}です。{{5}}Gemini Omni 1.1 Flash{{/5}}は生成動画の秒単位で課金され、Googleが公表している料金は720pで{{6}}1秒あたり$0.10{{/6}}です。
• オープン性 — 双方クローズド。どちらのモデルも重みは非公開で、現時点ではどちらも当社のAPI経由でルーティングすることはできません。

重なっている領域は動画理解であり、それは非対称である
購入者がこの2つを妥当に並べて比較できる唯一の場面は、映像素材を理解することと生成することの両方を担わなければならないパイプラインだ。たとえば、長い録音を読み込み、残す価値のある瞬間を見つけ出し、カットを生成する編集アシスタントのようなものだ。理解の側では、Qwen3.8-Omni-Flashはまさにこのために作られている。1回の呼び出しにつき1時間の連続した音声と映像、話者分離、そしてベンダーのOmniVideoBenchでの精度を63.4から67.8へ引き上げつつ、クエリあたりのトークンを145,736から79,117へ削減するエージェントモードを備えている。生成の側では、Gemini Omni 1.1 Flashが、同期した音声付きで結果のクリップを生成できる唯一の存在であり、Qwenのモデルは映像の1フレームも生成できない。
非対称性は逆方向にも働いており、そちらのほうが見落としやすい。動画生成モデルにとって理解はあくまで手段である――10秒延長してもショットの一貫性を保てるだけの場面理解が必要だが、これは会議の3時間目に何が言われたかという質問に答えることとは異なる要件だ。Googleのモデルは生成品質については実績が長く、長尺分析については短い。Alibabaのモデルはその逆だ。あなたのタスクが「この録音で重要な3分を見つけること」なら、生成モデルはそのためのツールではない。タスクが「このブリーフに合う30秒のクリップを作ること」なら、理解モデルもまたそのためのツールではない。
なぜ価格比較はいつも間違ってしまうのか
秒単位の料金とトークン単位の料金は換算できず、換算しようとするとこの対決を支配する2つの誤りが生じる。1つ目は、生成されたクリップ全体をトークン単位の入力料金と比較し、動画モデルの方が数百倍も高価だと結論づけることだ。これは事実ではあるが無意味である。なぜなら、両者は同じものを販売しているわけではないからだ。2つ目は、入力価格だけを比較し、アリババの98%の音声割引が入力音声の時間数に適用される一方、Googleの料金は出力動画の秒数に適用されるという点を見落とすことだ。つまり、この2つの「割引」はそもそも同じメーターの側にすらないのである。
正直に言えるのはこうだ。Alibaba自身の手法——2分間のサンプルを30倍する、動画は720p・毎秒1フレーム——に基づけば、音声と動画を合わせた入力1時間をQwen3.8-Omni-Flashで処理する費用は約$0.20と見積もられ、前世代の$3.27から下がっている。720p動画を40秒生成するのにGemini Omni 1.1 Flashを、Googleが公表している毎秒$0.10で使うと$4.00、同じ40秒を360pで下書き生成すると、Googleの3分の1コストという枠組みでは$1.20近くになる。どちらの数字もベンダー報告であり、どちらも独立に再現されてはいない。有用な結論はどちらの数字が小さいかではなく、1時間の映像を分析することとその40秒を生成することが同じ桁に入るということであり——これこそ、両方を行う制作パイプラインが勝者ではなくコストモデルを必要とする本当の理由だ。
これもまた、2つの契約ではなく1つのキーに両者をまとめておくべき理由です。現在、どちらのオムニモデルもOrcaRouter経由でルーティングすることはできません:Qwen3.8-Omni-FlashはAlibaba独自のプラットフォーム上でのみ動作し、GoogleはOmni動画APIを第三者によるルーティングに開放していないため、当社はどちらもホストしておらず、ホストしているふりをするつもりもありません。当社のカタログで実際に利用可能なのは、各ファミリーの兄弟モデル、すなわちQwen3.8-FlashとGemini 3.8 Flashで、どちらも現在1つのエンドポイントからプロバイダー定価・マークアップ0%で呼び出せます。だからこそ、どちらかのベンダー自身の数値とのA/B比較は、2つ目の統合ではなく設定変更の問題で済むのです。

それぞれが優位に立つ場面を、明快に述べる
Qwen3.8-Omni-Flashは、入力が時間単位で測られるあらゆる領域で優位に立つ。会議の文字起こしと話者分離、長時間録音の要約、音声を多用するエージェント的なツール利用、そして処理したメディア1時間あたりのコストだ。ベンダー報告による音声タスクの結果は強力で、弱点はモデルがそもそも狙いとしていなかったところ——推論重視のベンチマーク——にある。そこでは最初のサードパーティによる実行で、推論は28パーセンタイル、速度の数値は21パーセンタイルとなり、しかもサンプルが十分に小さいため、この数値は判決ではなく検証を促すサインとして扱うべきだ。
Gemini Omni 1.1 Flashは出力で優位に立つ。同期した音声を伴うショット生成、長尺シーン全体にわたる連続性、フレーム単位の制御、そして納品パイプラインがどうしても必要とする4Kの仕上げだ。その強みはベンチマークのスコアではない。もう一方のモデルではその作業をそもそもまったくこなせない、という点にある。逆に弱いのは、1時間分のコンテキストを保持する必要があるあらゆる場面だ。そのようには設計されていないからだ。
決定、そして注目すべきこと
もし両者のどちらかを選ぶのであれば、問うべきはパイプラインのどちら半分が満たされていないかです。すでに動画を生成していて、長い録画を理解する必要があるチームは、今週、Qwen3.8-Omni-Flashを自社の音声で試すべきです。メディアを分析していて、それを制作する必要があるチームは、Gemini Omni 1.1 Flashを試すべきです。両方が必要なチームは、2つのベンダー、2つの課金モデル、2つの統合を相手にすることになります。そしてまさにそうした状況では、単一のルーティング層はもはや便利さのためのものではなく、コストモデルを読みやすく保つための仕組みになるのです。
この見方を変えるものが2つある。Qwen3.8-Omni-Flashの独立した評価が得られれば、上記のベンダー数値はすべて比較可能な数値に置き換わる——だがそれはまだ存在せず、その不在はこの比較における最大の単一の欠落である。もう1つ、Google による 1080p および 4K 出力の公表レートがあれば、ハイエンドの価格計算を検証できるようになる。現在、これらの数値は Google 自身の料金表としてではなく、市場の推計としてのみ出回っている。

最後に、位置づけについて一言。もはや「Omni」は何か正確なものを指す言葉ではなくなった——今やそれは、1時間の会議音声を読み込むモデルから、音声付きの40秒クリップを生成するモデルまでを覆っており、この語をカテゴリーとして扱うと、買い手はトークンあたりの料金と秒あたりの料金を比べて、そこから結論を引き出してしまう。両モデルはごく一部が重なる補完関係にあり、それぞれのリリースから5日後であれ4週間後であれ、両者に対して取るべき正しい姿勢は同じだ。自分の素材で測定し、もう一つの経路を開いておくこと。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
