
Qwen-Image-2.1 対 Nano Banana 2 Lite:1万枚の画像に340ドル、それともGPU 13時間
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
1024ピクセル画像1万枚をNano Banana 2 Liteで生成すると約340ドルかかります。1万枚の画像をQwen-Image-2.1で生成すると、24 GB GPUでおよそ13時間と、それらを販売することを禁じるライセンスが必要です。一行で言えばこれがトレードオフであり、このファミリーで2つのモデルが実際に同じ瞬間に同じ仕事をする唯一の比較です。Qwen-Image-2.1は2026年9月20日にオープンウェイト化されました。Nano Banana 2 Lite — ベンダーのモデルID google/gemini-3.1-flash-lite-image、正式にはGemini 3.1 Flash-Lite Image — 2026年6月30日に登場し、Nano Bananaラインで最も安価な静止画生成モデルです。
正直に値付けされた2人の候補者
Nano Banana 2 Liteは1K画像を約4秒で生成し、Gemini 3.1 Flash Imageより約2.7倍高速で、1K画像あたり一律$0.034を請求します。その数字の背景にあるGoogleのトークン単価は、入力トークン100万あたり$0.25、画像出力トークン100万あたり$30で、1Kでは約$0.0336になります。バッチモードでは半額の約$0.0168になります。無料枠はなく、すべての出力には不可視のSynthIDウォーターマークが付きます。
Qwen-Image-2.1 に価格はありません。購入できるものが何もないからです。これは約 33 GB のダウンロードで、7B、32 層のシングルストリーム拡散トランスフォーマーと Qwen3-VL 8B テキストエンコーダーを組み合わせたもので、自分でホストして提供します。料金表に最も近いものは SGLang-Diffusion の実測レイテンシです。Cache-DiT と INT8 カーネルを使用した 24 GB RTX 4090 でのノイズ除去パスが 4.74 秒、RTX PRO 6000 Blackwell でのフル 1024×1024、40 ステップ生成が 8.23 秒でピークフットプリント 40.1 GiB、単一の B200 では 2.748 秒です。これらは記載されたコンポーネントを含む単一リクエストのレイテンシであり、スループットの数値ではないため、1 万枚の画像に 13 時間というのはベンチマークではなく桁の目安として扱ってください。
それらを並べて比べると、計算は「340ドル対無料」にはならない。340ドル対、すでに所有しているかレンタルしているカードの13時間分、さらにサービングスタックを立ち上げるためのエンジニアリング時間なのだ。損益分岐となる処理量は、ほとんどのチームが想定するよりはるかに低い――ただし、そのカードが月の残りの間アイドル状態になっていない場合に限り、そしてその出力があなたに生成を許可されているものである場合に限る。
3つのワークロードと、それぞれをどのモデルが担当するか
ボリュームは単独では誤った軸だ。作業の種類のほうがそれをより速く決める。
• 大量のオンスクリーン向けアセット — ソーシャル用クロップ、サムネイル、A/B バリアント。 Nano Banana 2 Lite はほぼすべての構成要素で優位に立つ。1画像あたり4秒、1:4 や 8:1 を含む14種類のアスペクト比、セント単位まで予測できる定額の1画像単価、バッチモードは半額。このワークロードにはアルファも 2K も一切必要なく、出力を出荷するときにはウォーターマーク付きの商用ライセンスこそがまさに求めているものだ。
• プリント、大判合成、あるいは思い切りクロップするもの。 Qwen-Image-2.1、そしてこれは接戦ではない。40ステップでのネイティブ 2048×2048 対、約1メガピクセルでハードキャップされ、2K モードもアップスケーリングも、それを引き上げる API パラメータもないモデル — Google は 2K および 4K の作業を Nano Banana 2 または Nano Banana Pro に振り向けている。フレームの3分の1を切り落としてもなお使えるアセットが必要なら、Lite ではそこに到達できない。
• 透明な切り抜き、アイコン、スプライト、レイヤー合成。 Qwen-Image-2.1。アルファチャンネルはサンプラーがデノイズする64チャンネル RGBA 潜在空間の構成要素なので、セグメンテーションパスもマッティングパスも不要だ。さらにこのモデルは、通常の写真から被写体を透明レイヤーへ切り出すこともできる。Nano Banana 2 Lite には透明背景出力に関する記載がない。
• 商用ライセンスが必要なものすべて。 Nano Banana 2 Lite、無条件で。Qwen-Image-2.1 は2026年9月20日付の Qwen Research License Agreement の下で提供されており、非商用の研究および評価のみを許可している。商用展開には Hangzhou Tongyi Laboratory Technology からの別途ライセンスが必要で、その価格や条件表は公表されていない。
そのリストにはもう1行入るべきであり、それはオープンモデルに不利に働く。Nano Banana 2 Lite は物事を知っている——2025年1月の知識カットオフを備え、Gemini 3.1 Flash Lite をバックボーンに構築されたプロンプト追従性プロファイルを持ち、中国語、日本語、韓国語を含む画像内テキスト描画に強い。Qwen-Image-2.1 の指示追従に関する独立した証拠は薄く、評価も分かれている。Nano Banana 2 Lite と Qwen 画像モデルを対戦させた AI 審判によるアリーナ比較——このエントリはバージョンを特定していないため、2.1 固有ではなくファミリーに関するシグナルとして読むべき——では、Lite が奇妙な空間プロンプト(「馬に乗った宇宙飛行士」「カピバラのタクシー運転手」)とテキスト描画で勝利した。後者では Qwen の出力がハロウィン招待状のタイトルを「Hallofarty Invitation」と描画した。Lite 自身について文書化されている弱点は、小さな顔、細かいテキストのディテール、高密度のインフォグラフィック、複雑なマスク編集である。どちらのモデルも、奇妙な指示に従うことに関して信頼できるほど優れているわけではなく、失敗する箇所が異なる。

参照画像の疑問、未解決
マルチ画像編集は、大量処理パイプラインが一方のモデルをもう一方で代替できなくなる領域であり、公開情報が矛盾している行でもある。
Qwen-Image-2.1は最大10枚の参照画像を受け入れ、さらにその上でバーチャル試着、集合ポートレート、ワードローブ構成をサポートします。Nano Banana 2 Liteについては、情報源の間で見解が大きく分かれています。あるプロバイダーのモデルページには、スタイル転送とマルチ参照編集のために最大14枚の参照画像をサポートすると記載されています。一方、比較記事は正反対のことを述べています。Liteは編集用に1枚の画像を受け入れ、14枚参照の機能は完全版のNano Banana 2に属し、最大5人と6オブジェクトまでである、と。この矛盾を踏まえると、擁護できる立場は、Liteが画像入力とマルチ画像構成をサポートするが、その参照容量こそがGoogleがNano Banana 2と区別するために用いる差別化要因である、というものです。シリーズを通して一貫した6人のキャラクターにワークフローが依存しているなら、それを前提に設計する前に、Google自身のモデルカードで上限を確認してください。
これはまた、より広い意味でモデルが互換的でなくなる地点でもある。GoogleはNano Banana 2 LiteとGemini Omni Flashをペアとして位置づけている。静止画モデルと動画モデルであり、連鎖させるために作られている。Qwen-Image-2.1には動画の相棒がなく、そのアニメーションの仕掛けは、ローカル領域編集を連鎖させたもので、簡単なフレーム単位のループを構築するのであって、動画モデルではない。
ルーティング層が真価を発揮する場面
これらのモデルはいずれもOrcaRouterにはありません。当社はいかなるバージョンのQwen-Imageモデルもルーティングしていないため、Qwen-Image-2.1はセルフホストするか、使えないかのどちらかです。Nano Banana 2 Lite — gemini-3.1-flash-lite-imageという識別子 — も当社のカタログにはありません。当社が提供しているGoogleの画像ルートはgoogle/gemini-3.1-flash-image-preview、google/gemini-2.5-flash-image、google/gemini-3-pro-image-preview、および3つのImagen 4ティアに加え、OpenAIのGPT-Image-2、GPT-Image-1.5、GPT-Image-1-mini、そしてxAIのGrok Imagine画像エンドポイントです。
そうした構成が混在パイプラインにもたらすのは、この比較で何度も突き当たるあの問題です。つまり、アセットごとに変わる判断です。量産系のアセットは安価なホスト型ルートへ、透過切り抜きは自前のカードへ回り、ホスト側のベンダー価格改定はその日のうちに反映されます。なぜなら当社は自前で価格を決めるのではなく、プロバイダーの定価をゼロマークアップでそのまま通しているからです。さらにプロバイダー間の自動フェイルオーバー、フォールバックを組み立てるためのルーティング DSL、パネル形式の呼び出し向けのモデル融合を加えれば、ホスト型の半分はモデルごとに管理しなければならないベンダーとの関係ではなくなります — 200 以上のモデル、OpenAI 互換の単一エンドポイント、単一のキー。セルフホスト側の半分は依然としてあなたの課題であり、それが研究ライセンスのチェックポイントを自前のハードウェアで動かすことの正直なコストです。
どちらを選ぶべきか、そしてそれを覆す条件
商用のオンスクリーン素材を大量に制作しているなら、答えは Nano Banana 2 Lite で、ライセンスの問題はそもそも生じない。1画像あたり $0.034、4秒、予測可能、販売可能。2K、ネイティブ透過、または参照画像10枚が必要なら、この2つのうちそれらのいずれかを備えているのは Qwen-Image-2.1 だけで、その代償としてハードウェア、エンジニアリング時間、そして非商用ライセンスを払うことになる。そのライセンスは、これを制作上の依存先ではなく研究用の道具にする。
一つの事実があれば、この隔たりは消える。Qwen-Image-2.1の商用タームシートが公表され——実際に署名できる価格と条件が示されれば——13時間のGPUジョブは340ドルと競合する一行の費目に変わり、その時点で解像度とアルファの優位性が、現在は既定でLiteに流れているワークロードを獲得し始める。それが存在するまでは、役割分担は明快だ。出荷するものにはLite、建物の中に留まるものにはQwen-Image-2.1、そして後者向けのサービングスタックは自分で運用する。


この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
