
Qwen-Image-2.1 対 GPT-Image-2.5:その差はたった一つの数字であり、品質ではない
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
並べQwen-Image-2.1とGPT-Image-2.5て仕様を見比べると、両者はまるで兄弟のように見える。どちらも生成と編集を統合した画像モデルで、どちらも透過背景の出力に対応し、どちらもこの5週間のうちにリリースされ、どちらも2Kクラスの静止画を生成できる。両者のどちらを選ぶかを決める違いはたった1つの数字であり、それはベンチマークスコアではない。Qwen-Image-2.1は無料でダウンロードでき、販売することは不可能だ。GPT-Image-2.5はダウンロードすることが不可能で、販売するのはきわめて容易だ。それ以外のすべて——アーキテクチャ、レイテンシ、透過処理の実装——は、その下流にある。Qwen-Image-2.1は2026年9月20日にオープンソース化され、GPT-Image-2.5は2026年9月8日にAPIモデルが利用可能な状態で発表された。
透明性を高める2つの方法、1か月違い
両方のモデルが数週間のうちに相次いで透過的な出力を手に入れたのは、理解に値する偶然だ。というのも、その2つの実装は等価ではないからである。
Qwen-Image-2.1 はアルファをモデル内部に組み込みます。64チャンネルの RGBA 潜在空間で、空間圧縮 16× によりノイズ除去を行うため、アルファチャンネルはサンプラーが生成するものの第一級の構成要素です。セグメンテーション工程もマッティング処理もありません。それに加えて、珍しい追加機能があります。モデルはプロンプトごとに RGB 画像を出力するかアルファチャンネル画像を出力するかを決められるため、通常の写真から被写体を切り出し、バイナリマスクではなく透明レイヤーとして返すこともできます。
GPT-Image-2.5はパラメータ方式を採用しています。OpenAIのAPIはbackground設定としてauto、opaque、transparentを受け付け、モデルはそれに応じて応答します。これは潜在空間の性質ではなく、ホスト型エンドポイント上の機能トグルであり、意識する必要がないという利点があります。フラグを設定すれば切り抜きが得られ、次に進めます。その代わりに得られるのは、エンドポイントが決めた解像度とコストで、エンドポイントが与えるものそのものです。
どちらが優れているかは、本当に決着がついていない。執筆時点で、Qwen-Image-2.1 のアルファエッジを専用のマッティングモデルと比較した公開比較は存在せず、Qwen 側で公開されている唯一の検証は機能面のものだった——透明 PNG 出力は合格し、アルファは 0~255 の全範囲にわたって保持され、単一サンプルでの RGBA PSNR は 60.69 dB だった。それは正確性の確認であり、品質の判定ではない。そのチャンネルが実在することを示しているだけだ。
実際に測定できるもの
• パラメータ — Qwen-Image-2.1 の生成コンポーネントは 7B・32 層のシングルストリーム拡散トランスフォーマーで、Qwen3-VL 8B のテキストエンコーダーと組み合わせて使用されます。重みは合計でおよそ 33 GB で、うち DiT が約 14 GB を占めます。OpenAI は GPT-Image-2.5 のパラメータ数を公表していません。
• 解像度 — Qwen-Image-2.1 は 40 推論ステップでネイティブ最大 2048×2048 を出力し、7 つのアスペクト比プリセットを備えています。GPT-Image-2.5 は最大 3840×2160 および 2160×3840 のサイズに対応し、各辺は 3840 px が上限で、16 の倍数であることが必須です。
• 参照画像 — Qwen-Image-2.1 はマルチ被写体の合成やバーチャル試着のために最大 10 枚まで受け付けます。OpenAI の画像モデルも編集用の参照入力を受け付けますが、実際の上限と忠実度の挙動はモデルごと、品質ティアごとに異なります。
• レイテンシ — SGLang-Diffusion は、単一の B200 上での 1024×1024、40 ステップの生成に 2.748 秒、Cache-DiT と INT8 カーネルを用いた 24 GB の RTX 4090 で 4.74 秒(デノイズのみ)を公表しています。OpenAI は GPT-Image-2.5 の Flare バリアントが GPT-Image-2 より最大 50% 低いレイテンシであると報告しており、あるローンチパートナーは 2~4 倍と測定しています。それぞれベンダー報告とパートナー報告であり、管理された比較ではありません。
• 価格 — Qwen-Image-2.1 にはホスト型エンドポイントが存在しないため、ホスト型の価格はありません。コストは自身の GPU 時間です。GPT-Image-2.5 は GPT-Image-2 と同じトークン単価で課金されます。画像入力トークン 100 万あたり $8.00、画像出力トークン 100 万あたり $30.00、テキスト入力トークン 100 万あたり $5.00。
• ライセンス — Qwen-Image-2.1 は 2026 年 9 月 20 日付の Qwen Research License Agreement の下で提供され、非商用利用に限られます。GPT-Image-2.5 は商用 API であり、C2PA による来歴と出力への不可視ウォーターマークを備えています。
そのリストの1行は、見た目より中身が薄い。OpenAIはGPT-Image-2.5の画像1枚あたりの価格を公表しておらず、公表しているのはトークン料金のみで、画像トークンの消費量は解像度と品質ティアによって変動する。第三者の測定では、1:1のアスペクト比で、1K、2K、4Kにわたり、低・中・高設定で、画像1枚あたりおよそ$0.0059から$0.712の範囲とされている。これは桁の目安としては有用だが、見積もりとしてではない。予測するのであれば、他の誰かが測定した画像1枚あたりの数値からではなく、トークン数と自社のプロンプト分布から見積もりを組み立てるべきだ。

誰も同じ列に置かない2つのコスト
この比較に単純な答えが出せないのは、2つのモデルがあなたに請求する通貨が異なり、その為替レートはあなた自身の状況によって決まるからです。
GPT-Image-2.5はトークン単位で課金される。つまり、メーターは可視化され、予測可能で、利用量に比例して線形に増えていく。これはトラフィックが既知のプロダクトにとっては確かな利点だ。予算に組み込めるし、ベンダーが値下げすればその日のうちにコストが下がる。一方でこれは、試行錯誤に対する課税でもある。なぜなら、プロンプトの10回目の反復も1回目と同じコストがかかるからだ。input_fidelityの挙動によって、この性質は表向きの料金から受ける印象よりも際立ったものになる。APIは画像入力に対して自動的に高忠実度を適用することがあり、その場合、料金表をざっと見ただけでは想像できないほど多くの入力トークンを消費するため、編集ループのコストは一般に引用される画像あたりの数値よりも高くつく。
Qwen-Image-2.1 はその両方の性質を逆転させる。100回目の生成の限界費用は電気代だ。だからこそ、反復やバッチでのバックフィル、そしてプロンプトをまだ探っている段階のあらゆる用途にとって、より優れた道具になる。それが与えないのは、財務シートに載せる数字だ——GPU は稼働中でもアイドル中でも支払いが発生する——そして、出力を販売する権利も与えない。Qwen Research License Agreement は非商業的な研究と評価を認めており、商業展開には Hangzhou Tongyi Laboratory Technology からの別途ライセンスが必要だと明記している。そのライセンスには公表された価格も、示された条件もない。これは脚注ではない。商業パイプラインにとっては、それこそが意思決定のすべてだ。
2つ目の契約なしで両方を実行する
ほとんどのチームにとって現実的な答えは、どちらか一方ではなく、両方だ。GPT-Image-2.5は、出力が顧客に届き、トークン単位の課金が請求明細の1行になる本番経路を担う。Qwen-Image-2.1は、透明な商品カットのバリエーションを200点必要とし、そのボリュームを妥当な価格で売ってくれるベンダーが存在しない探索経路を担う。
摩擦は、この2つがまったく異なる経路でやってくることです。一方はAPIキーです。もう一方は33 GBのダウンロード、Python環境、そして自分で所有するGPUです。OrcaRouterはホスト型の半分をカバーします:単一のOpenAI互換エンドポイントの背後にある200以上のモデル、プロバイダー定価のゼロマークアップでのパススルー、プロバイダー間の自動フェイルオーバー、フォールバックを表現するためのルーティングDSL、複数のモデルを1回の呼び出しにまとめるモデルフュージョンです。このモデルについて正確に述べることが重要です — 当社は現在GPT-Image-2.5をルーティングしていません。当社のOpenAI画像ルートはGPT-Image-2、GPT-Image-1.5、GPT-Image-1-miniで、すべてOpenAIの定価です。そして、上流プロバイダーがgpt-image-2.5識別子を追加したその日には、同じキーでコード変更なしにそれらを呼び出せます。当社はいかなるバージョンのQwen-Imageモデルもルーティングしていないため、Qwen-Image-2.1は当社側ではルートにまったく存在しません。その間、パススルー価格設定があなたにもたらすのは、OpenAIが料金を動かせば、当社側の数字も遅れではなくそれに追随して動くということです。
勝者ではなく条件として述べられた評決
もし出力が販売されるものであるなら、これは接戦ではない。GPT-Image-2.5 は、あなたがライセンスを受けて使える二つのうちの唯一のものであり、トークン課金はその対価である。出力が研究、社内ツール、あるいは評価用であれば、Qwen-Image-2.1 のほうが強力な道具だ——ネイティブ 2K、サンプラーからのアルファ出力、参照画像十枚、そしてハードウェア代を払ってしまえば限界費用はゼロ。両方が必要なら両方を動かし、ライセンスを、ある仕事をどちらのパイプラインに流すかを決める境界線として扱えばよい。
これを変えるものが2つある。Qwen-Image-2.1の商用利用条件を記したタームシートが公開されれば、ライセンスの行の差は縮まるだろう。現状、この比較ではライセンスの行がほぼすべてを左右している。そして、Qwen-Image-2.1が独立系の画像リーダーボードに掲載されれば、ベンダーのQwen-Image-Benchの結果——60.28で、Nano Banana 2.0の59.82、GPT Image 1.5の59.65を上回り、オープンモデルの中で首位——が、それを生み出したラボの外でも通用するかどうかが分かる。どちらもまだ存在しない。それらが出そろうまでは、正直な推奨は、スコアボードではなくライセンスと従量課金で選ぶことだ。


