
Qwen-Image 2.1 対 Nano Banana 2:画像1枚あたりに支払うものと、それを所有するために支払うもの
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
この2つのモデルのうち、表計算ソフトに書き込める価格が付いているのは片方だけだ。Nano Banana 2——2026年5月28日から一般提供されている Gemini 3.1 Flash Image モデル——は、1024×1024の画像1枚あたり約0.067ドル、2048×2048では0.101ドル、4Kではおよそ0.151ドルで、バッチモードは約半額、テキスト入力は別途100万トークンあたり0.25ドルで課金される。Qwen-Image 2.1は、2026年9月20日に Qwen-Image チームがオープンソース化したものだが、画像1枚あたりの価格は一切ない。購入できるホスト型エンドポイントが存在しないからだ。研究ライセンスのもとで配布される33 GB の重みのダウンロードで、商用利用は禁止されている。つまり、この対決で最初に問うべきは、どちらのモデルが優れているかではない。画像を買うのか、それとも画像を作る機械を買うのか、ということだ。そしてこの2つの購入は、スペック表が示唆するようには比較できない。
予測可能性こそが、画像ごとの価格が実際に買っているものだ
Googleの価格設定は、画像カテゴリでは、その換算があまりに明快である点で異例です。このモデルは出力100万トークンあたり60ドルを課金し、画像出力は予測可能な形でトークン化されるため、何かを生成する前に検討できる画像1枚あたりの数値に換算されます。
• Nano Banana 2 — 1024×1024で約0.067ドル、2048×2048で0.101ドル、4Kではおよそ0.151ドル、バッチモードではこれらの約半分、さらにテキスト入力は100万トークンあたり0.25ドル。2K画像1,000枚で約101ドルと、1ドル単位で予測可能です。
• Qwen-Image 2.1 — 公開価格はありません。コストは33 GBのバンドルに対する自身のGPU時間であり、制約のあるハードウェア向けにモデルカードが勧めているのはpipe.enable_model_cpu_offload()によるCPUオフロードですが、これは修正策ではなく緊急避難的な手段にすぎません。
従量制価格で買えるものは、単に画像だけではない。自社のハードウェアをまずベンチマークしなくても、「この機能は月に1万枚の画像でいくらかかるのか」に答えられることだ。これは本当の利点であり、過小評価されやすい。なぜなら、もう一つの選択肢であるセルフホスティングには、計算するのが本当に難しいコストがかかるからだ。それは利用率、カード、電気代、そしてそのマシンがそうでなければ遊休状態だったかどうかによって変わる。正直な比較は、1,000枚あたり$101対無料ではない。1,000枚あたり$101対、自分で算出しなければならない償却後の数値なのだ。そして計算をするほとんどのチームは、利用率が非常に高くなるまでは、従量制価格が競争力を持つとわかる。
ライセンスとは、「フリーウェイト」が“フリー”でなくなるまさにその地点だ
これは二つのモデル間の最も際立った違いであり、その差は歴然としている。
Nano Banana 2は商用条件を伴う商用製品です。画像1枚ごとに料金を支払い、制作したものをそのまま出荷できます。一方、Qwen-Image 2.1は2026年9月20日付のQwen Research License Agreementのもとで提供されており、同契約は「FOR NON-COMMERCIAL PURPOSES ONLY」の権利を付与し、商用利用にはベンダーへの別途ライセンス申請が必要であると明記しています。これは、Apache 2.0のもとで提供されていた従来のQwen-Imageシリーズからの変更点です。つまり、この比較におけるオープンな選択肢とは、読んで実行できるという意味でのオープンであり、それを土台にビジネスを築けるという意味ではありません。
研究チーム、趣味で使う人、あるいはベンチマークを取るだけの人にとって、それは申し分ないライセンスであり、ダウンロードは本当に無料だ。しかし製品チームにとっては、この比較で画像1枚あたりの価格が設定されていないモデルには商用利用の道もないということであり、それによってコスト比較は完全に崩壊する。つまり、選択の対象は101ドルと、それより安い何かではない。出力を販売できるモデルと、そうでないモデルのどちらを選ぶか、という話なのだ。
解像度とアスペクト比――オープンモデルが真の強みを発揮する領域
ライセンスの話は脇に置いておくと、Qwen-Image 2.1 は Nano Banana 2 にはできないことを、特定のワークフローにとって重要な形でやってのける。
• Qwen-Image 2.1 — ネイティブ2K対応。40推論ステップ時のドキュメント上のデフォルトは2048×2048で、7種類のアスペクト比プリセット、最大10枚の参照画像、そしてRGBA出力:本物のアルファチャンネル、透明レイヤーの編集、RGB写真からの被写体抽出。
• Nano Banana 2 — 1:4や1:8といった極端な比率を含む珍しいアスペクト比に対応した4K出力。これはほとんどのモデルがどちらの方向でも提供する範囲を超えており、1回の生成で5体のキャラクターと14個のオブジェクトの一貫性数値を公表している。
注目すべきはアルファチャンネルだ。Googleのモデルは透過を生成するとは文書化されておらず、Qwen-Image 2.1はそれをネイティブで行う。つまり、本来なら手作業になる合成工程——被写体を切り抜き、柔らかいエッジを保ち、別のものの上に配置する——が、モデルの後ではなくモデルの内側にあるということだ。レイヤー化されたアセットを作って生計を立てているなら、それはワークフローの違いであり、品質についての主張ではない。また、はっきり言っておく価値があるのは、両モデルともほとんどの仕事が必要とするより大きなサイズをレンダリングするということだ。4Kも2048×2048も、制約が出力先ではなくモデルにあるという段階をはるかに超えている。

約束に対する公表された数値
Googleのモデルは春以降、Artificial Analysisの両方の画像ボードに掲載されており、9月のスナップショットではテキストto画像と画像編集のトップ5に入っており、テキストto画像ではElo約1,320である。その一貫性の数値—5人のキャラクター、14個のオブジェクト—はGoogle自身のものだが、独立したスコアボードの隣に位置している。つまり、モデルがブラインド比較で実際にどのように機能するかに対して検証できる。
Qwen-Image 2.1には独立したスコアはない。あるのは、第三者が誰も再現していないQwen-Image-Benchのチャートを掲載したベンダーブログ記事と、Qwen Ambassadorプログラムのテスター1名による早期アクセスの実機レポートが1件だけだ。そのテスターは最終ウェイトをModelScope Studioのインターフェースで実行し、テキストから画像生成がおよそ10~15秒、編集が18~23秒、カメラ位置と複数キャラクターの役割処理に強く、マルチリファレンスの一貫性は入力画像が約3枚以降から低下すると報告している。レビュアーは1名、タイマー表示はなく、公開されたプロンプトセットもない。これは公開されている中で、このモデルに関する唯一の外部観測であり、測定値ではなくヒントとして読むべきものだ。
また、サードパーティの報道で Qwen-Image 2.1 を20層のトランスフォーマーと表現する数字も出回っています。これはモデルカードと矛盾します。モデルカードには、視覚生成コンポーネントが7Bパラメータの32層シングルストリーム拡散トランスフォーマーであり、Qwen3-VL 8B テキストエンコーダーと、16×の空間圧縮を行う64チャネル RGBA VAE を備えると記載されています。モデルカードに従ってください。
両方でできる唯一のこと
このバッチの中で、対戦相手が当社が実際にルーティングしているモデルである唯一の記事です。Nano Banana 2 は OrcaRouter 上で google/gemini-3.1-flash-image-previewとして、他の画像系ラインナップ — OpenAI の GPT-Image ファミリー、Google の Imagen 4 の各ティア、その他の Gemini 画像プレビュー、xAI の Grok Imagine 画像エンドポイント — と並んで提供されています。いずれもプロバイダー定価・マークアップゼロの、単一の OpenAI 互換エンドポイントの背後にあります。Qwen-Image 2.1 は当社がルーティングするモデルには含まれておらず、本記事はそれが含まれているかのような示唆はしません。
この判断にとって実際に意味するところは、売り込み文句より狭く、しかしそれより役に立つ。自分のプロンプトで両モデルを比較したいなら、Google 側は API キーと 2K で 1 枚あたりおよそ 0.1 セントの費用で済み、しかも普段呼び出している他のすべてと同じエンドポイント上にある。Alibaba 側は 33 GB のダウンロード、GPU、そして出力を商用利用する前に研究ライセンスの審査が必要だ。プロバイダー間の自動フェイルオーバーが、ここで重要なもう一つの要素だ。あるルートが実測済みモデルで本番トラフィックを流しながら、その横で未実測のモデルを評価できるので、評価がクリティカルパス上に乗ることはない。


どれを、誰のために
• 出荷するなら Nano Banana 2 を選びましょう。商用ライセンスがあり、1ドル単位まで予測できる価格、両方のボードで独立系トップ5に入るスコア、4K出力、そしてこの比較の中で最も広いアスペクト比の範囲を備えています。2K画像1,000枚のコストは約101ドルで、今日の午後には生成を始められます。
• 研究目的ならQwen-Image 2.1を選びましょう。無料でダウンロードでき、アーキテクチャとプロンプト書き換えシステムのプロンプトを完全に検査できます。2048×2048でネイティブに描画し、本物の透過に対応し、最大10枚の参照画像を使い、円・塗り注釈・マスクによるローカル編集が可能です。ただし、生成物を販売することはできず、その品質がどれほど優れているかを測定した人は誰もいません。
これら2つの段落の間の隔たりは、モデル間の隔たりであり、品質の差ではない。成熟度の差であり、それは予定通りに縮まりつつある。Qwenの早期アクセステスターは、2026年9月29日までにサンプルまたはレビューを公開するよう求められていた。それらが公開されれば、このオープンモデルは未知の存在ではなくなり、比較可能になり、残る唯一の問いはライセンスになる。注目すべきはその数字であり、それはベンチマークではなくライセンスファイルだ。
