
Qwen-Image-2.1 対 Gemini Omni 1.1 Flash:一方は PNG を返し、もう一方は返せない
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
について最も役立つのは、Qwen-Image-2.1とGemini Omni 1.1 Flash両者が競合しないということです。Gemini Omni 1.1 Flashに静止画を求めるとエラーが返ります。ベンダー自身のドキュメントでは、画像生成、画像編集、画像とテキストのインターリーブ出力は、このモデルではサポートされていない機能として記載されています。Qwen-Image-2.1に動画を求めると、アルファチャンネル付きの2048×2048の静止画が返ってきます。それらを2つの列に並べた比較表は、カメラとプロジェクターを比べているようなものです。本当の問い——実際にコストがかかるのは——それらを連鎖させたときに何が起きるか、そしてその連鎖が料金表と突き合わせても成り立つかどうかです。Qwen-Image-2.1は2026年9月20日に公開されました。Gemini Omni 1.1 Flashは2026年8月27日から一般提供されています。
各モデルが物理的に返すもの
これが比較のすべてであり、他のすべてはそこから導かれる。
• 出力形式 — Qwen-Image-2.1は静止画を返します。ネイティブでは40推論ステップで最大2048×2048、オプションで実際のアルファチャンネル付きです。Gemini Omni 1.1 Flashは動画を返し、10秒の生成呼び出しと延長呼び出しから組み立てられた最大40秒の動画に対応しますが、静止画モードは一切ありません。
• 透過性 — Qwen-Image-2.1は64チャネルのRGBA潜在空間でノイズ除去を行うため、アルファチャンネルはサンプラーから出力されます。Gemini Omni 1.1 Flashには透明背景の出力がなく、要求しても失敗します。
• 参照入力 — Qwen-Image-2.1は複数被写体の合成のために最大10枚の参照画像を受け付けます。Gemini Omni 1.1 Flashはプロンプトごとに最大10枚の画像を*入力*として、また最大3本の3秒参照動画クリップを受け付けます。
• 解像度の上限 — Qwen-Image-2.1はネイティブ2Kです。Gemini Omni 1.1 Flashは360p、720p、1080p、4Kを提供しますが、1080pと4Kはネイティブ生成ではなく、ネイティブ720pレンダリングのアップスケールです。
• コスト — Qwen-Image-2.1にはホスト型エンドポイントが存在しないためホスト型価格はなく、コストは自身のGPU時間です。Gemini Omni 1.1 Flashは720pでは毎秒0.10ドル、360pのドラフトティアでは毎秒約0.03ドルを請求します。
• ライセンス — Qwen-Image-2.1は2026年9月20日付のQwen Research License Agreementの下で提供され、非商用限定です。Gemini Omni 1.1 Flashは商用APIであり、その出力にはデフォルトでSynthIDとC2PAの来歴情報が付与されています。
一番下の行は、みんなが流し読みして飛ばしてしまう行だ。片側には、ダウンロードはできるが販売はできないモデルがある。もう片側には、ダウンロードはできないが自由に販売できるモデルがあり、しかも全フレームに不可視のウォーターマークが入っている。
なぜそれでも「対決」の構図が繰り返し現れてしまうのか
2つの名前を一緒に検索すれば、両者を直接比較してランク付けしたページが見つかる。その理由は、たとえ枠組みが間違っていても、根底にある問いは本物だからだ。どちらのモデルも同じクリエイティブのパイプラインに位置しており、そしてどちらもその中で最も新しいものである。人々が実際に決めようとしているのは、静止画がどこで終わり、動きがどこから始まるのかということだ。
Gemini Omni 1.1 Flash は、ベンダー自身の数値ではなく独立系の数値によって、その問いにおける地位を勝ち取った。Artificial Analysis では、2026年9月2日時点で、音声なしカテゴリーのテキストから動画へのアリーナと画像から動画へのアリーナの両方で首位に立ち、Elo は1324と1364だった。音声を有効にすると、Elo は1237と1180に下がる——2位と4位だ。この音声の差は、スペックシートが隠し、リーダーボードが露呈する類の詳細である。
Qwen-Image-2.1のエビデンスはより薄く、しかも種類が異なる。ベンダー自身のQwen-Image-Benchでは60.28で、Nano Banana 2.0の59.82、GPT Image 1.5の59.65を上回り、オープンモデルの中では首位だ。しかしそれはベンダーが実施したベンチマークであり、差は1ポイント未満で、第三者による再現でもない。独立したテストは今のところ、GenAI Showdownの人間採点による7/15のみで、これは元のQwen-Imageの4/15から上昇したものだが、Ideogram 4の8/15には及ばない。執筆時点で、このモデルはArtificial Analysisの画像ボードにエントリーがなかった。低スコアではない——スコアがないのだ。


引き継ぎ、そしてそれが実際に要するコスト
もし静止画とクリップの両方が必要なものを作っているなら、そのパイプラインは一方向だけです。Qwen-Image-2.1 がフレームを作り、Gemini Omni 1.1 Flash がそれをアニメーション化します。逆は存在しません。
一度計算してみると、この算数は容赦ない。Gemini Omni 1.1 Flashで10秒の720pクリップを生成すると、請求は約1.00ドルになる。360pのドラフトティアなら、同じ10秒でおよそ0.30ドル、720pの完全な40秒シーン——1回の生成と3回の延長呼び出し——なら4.00ドル近くになる。一方、すべての起点となるスチルは、自分のカードの電気代以外には何もかからない。つまり、興味深いコスト判断は「どのモデルか」ではなく「何テイク重ねるか」だ。スチルは無料で反復できるが、動画はそうはいかない。動画生成を試行ごとではなくアセットごとに予算化しているチームが不意を突かれるのは、最初のフレームは無料でも、リトライは無料ではないからだ。
ハンドオフにも品質の罠がある。Gemini Omni 1.1 Flash はネイティブで720pレンダリングし、1080pと4Kにアップスケールする。もしあなたのスチルがクリーンなアルファチャンネルを持つ2048×2048のQwen-Image-2.1フレームなら、それを720pでレンダリングしてアップスケールするビデオパスに流し込むと、画像モデルが与えてくれたものの大半を捨てることになる——しかもアルファチャンネルは完全に失われる。透過ビデオ出力が存在しないからだ。透過性はコンポジタ内で生き残り、モデルチェーン内では生き残らない。コンポジットはクリップが戻ってから計画せよ、その前ではなく。
ルーティング層の位置づけ
この組み合わせの厄介な点は、どちらのモデルも、おそらくあなたのスタックの残りの部分がそうであるようにはアクセスできないことです。Gemini Omni 1.1 Flash は、独自のキーと独自の秒単位のメーターを持つベンダー API です。Qwen-Image-2.1 は約 33 GB のダウンロードで、7B の拡散トランスフォーマーに Qwen3-VL 8B のテキストエンコーダーを加えたもので、非商用利用のみを許可するライセンスの下で自分で提供するものです。2 つの課金モデル、2 つのアクセス経路、1 つのプロジェクト。
OrcaRouter は、まさにその周辺部分のために存在しています:200 以上のモデルに対応する単一の OpenAI 互換エンドポイント、プロバイダーの定価をマークアップゼロでそのまま適用、プロバイダー間の自動フェイルオーバー、フォールバックを組み合わせるためのルーティング DSL、そしてパネル形式の呼び出しに向けたモデルフュージョンです。ここでそれが何をカバーするのかを正確に述べておくことは重要です。当社はいかなるバージョンの Qwen-Image モデルもルーティングしていないため、Qwen-Image-2.1 は当社側で呼び出せるルートではありません — お客様のハードウェアで動かすか、さもなければ動かないかのどちらかです。また、Gemini Omni 1.1 Flash もルーティングしていません。モーション側で当社が提供しているのは Kling の動画ラインナップで、kling-v3、kling-v3-omni、kling-video-o1、さらに MiniMax H3 が含まれます — つまり、このパイプラインのアニメーション部分には、別のベンダーとの契約を必要としないホスト型ルートがあり、画像側では OpenAI GPT-Image ファミリー、Google の Imagen 4 の各ティアと Gemini の画像プレビュー、そして xAI の Grok Imagine 画像エンドポイントを提供しています。定価はマークアップされるのではなくそのまま適用されるため、これらのいずれかでベンダーが値下げを行えば、当社でも同日に反映されます。
実際に必要なのはどれ?
• 必要なのは映像ではなく素材 — Qwen-Image-2.1、その理由はアルファチャンネルです。透過した商品の切り抜き、アイコン、スプライト、レイヤー合成こそ、RGBA を出力するサンプラーがマッティングパイプライン全体を節約できる場面です。
• モーションが必要で、しかも計測可能でなければならない — Gemini Omni 1.1 Flash。2つの中で、ボード上位に入る独立系アリーナの結果を持つ唯一のものであり、予測に組み込める毎秒価格が公開されている唯一のものです。
• 両方が必要 — 動画側の予算はアセット単位ではなく試行単位で配分し、アルファチャンネルがそのまま通ると想定してはいけません。
• 出力を販売する必要がある — Gemini Omni 1.1 Flash、そして Qwen が Qwen-Image-2.1 の商用条件を公開するまでは Gemini Omni 1.1 Flash のみです。そのライセンスについて、今日時点で公開された価格や条件書は存在しません。
正直にまとめると、それらを順位付けする比較は間違った成果物だ。次に注目すべきは、QwenがQwen-Image-2.1に商用条件を付けるかどうか、そしてGoogleがOmniのリーダーボードで音声の差を埋めるかどうかだ——もう一つのスコアボードではなく、この二つの事実が、このパイプラインのどちらの半分に予算が付くかを決める。

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
