「GPT-Image-2.5 vs LLaDA-Image」の比較を表すヒーロータイトルカード。サブタイトルは「100万トークンあたり30ドルのAPI vs 無料の6B拡散モデル」。左側に「GPT-Image-2.5・クローズド・フラッグシップAPI — トークン従量制・ホスト型」と表示された角丸カード、右側に「LLaDA-Image・オープンウェイト — セルフホスト型・Apache-2.0カード」と表示された角丸カードを配置し、天秤アイコンで結んでいる。OrcaRouterのロゴは右下に配置されている。
Guides & Insights

GPT-Image-2.5 vs LLaDA-Image:$30/MトークンAPI対無料6B拡散モデル

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

画像生成にかかるコストを問うたところ、わずか1週間違いで、2つの研究所が正反対の答えを出した。2026年9月8日、OpenAIはGPT-Image-2.5をリリースした。これはChatGPT Images 2.5の背後にあるモデルで、APIではGPT-Image-2.5 FlareおよびGPT-Image-2.5 Sunburstとして販売され、トークンカードの価格は画像入力トークン100万件あたり8ドル、画像出力トークン100万件あたり30ドルに設定されている。その5日前の9月4日には、Ant Groupが出資する研究所でLLaDA言語ファミリーを手がけるinclusionAIが、LLaDA-Imageを静かに公開した。これは60億パラメータの拡散トランスフォーマーによる画像生成・編集モデルで、重みは無料でダウンロードできる。一方は、OpenAIがこれまでにトークンメーターの背後に置いた中で最も商業的に強力な画像モデルであり、もう一方は、強力な画像モデルがオープンな学習レシピで構築でき、無償で提供できることを証明しようとする試みである。両者を比較することは、正面からの対決というよりは、実際にどのコストの定義を支払うのかという判断なのである。

GPT-Image-2.5側の数値はほぼすべてベンダーによる報告であり、独立した検証はまだ一つもありません。OpenAIは、FlareがGPT-Image-2と比較してレイテンシを最大50%削減すること、そしてエージェント企業Manusによる第三者テストで生成速度が2〜4倍速いと測定されたことを述べていますが、2026年9月9日時点では、GPT-Image-2.5のどちらのモデルもArtificial Analysisの画像リーダーボードに掲載されていません。LLaDA-Imageの代表的な数値も同様に再現されていません。inclusionAIはQwen-Image-Benchで英語53.53、中国語53.38を報告しており、リリース時点でオープンウェイトモデルの中で首位ですが、このモデルにはホスト型APIがないため、API限定のリーダーボードにはまったく登場できません。この比較の両側は、各開発者自身の主張に基づいています。このことは、この記事の残りの部分を通して覚えておく価値があります。

かろうじて同じカテゴリーを共有する2つのモデル

GPT-Image-2.5は、2026年4月のChatGPT Images 2.0と同じ系統に属する、ホスト型のクローズドな画像モデルです。入力側ではマルチモーダルに対応し、OpenAIが細部のシャープさ、照明と質感の自然さ、マルチターン編集における安定性が優れていると主張する画像を生成します。Sunburstエンドポイントは、指示制御をより厳密にする代わりに生成速度が遅くても許容される、編集中心の本番作業専用に存在します。一方Flareは、大量生成向けの高速なデフォルトです。出力サイズは最大2048×2048および3840×2160に対応し、透明背景もサポートされます。さらに、すべての出力にはC2PA由来メタデータと不可視の透かしが含まれます。

LLaDA-Imageは、まったく異なる前提に基づく研究向けのオープンリリースです。GPT-Image-2.5がOpenAIのインフラストラクチャによって提供されているのに対し、LLaDA-Imageは自分で実行する重みのセットです。生成側は60億パラメータの拡散トランスフォーマー(DiT)で、モデルカードには言語側を数えると約70億パラメータと記録されています。これに、「理解」側として機能するLLaDA 2.0-mini(合計160億/活性1億パラメータの混合エキスパート拡散言語モデル)が組み合わされ、テキストのプロンプトや編集指示をDiTが追従するシグナルに変換します。arXivレポート(2609.03796)における異例の主張は、学習レシピにあります。累計約2億2000万サンプルの事前学習および中間学習サンプルのうち90%以上が画像のみで、凍結された視覚言語モデルがラベルなし画像からセマンティクスを自己条件付けシグナルとして抽出するため、モデルは「まず描くことを学び、その後で指示に従う」ようになります。段階的な解像度により、学習は256×256から512×512を経て1024×1024のファインチューニングへと進み、その後、テキストから画像への混合学習と編集学習、さらにTwinFlowによる数ステップ蒸留を経て、LLaDA-Image-Turboバリアントが生成されます。

それぞれが実際に得意なこと

GPT-Image-2.5の売りは、商用品質での精度と制御性です。OpenAIの発表では、参照忠実性——設定やスタイルを変更しても人物、ペット、製品の認識可能性を維持すること——と、依頼した変更のみを反映する編集機能が強調されており、1つの会話内で何度も編集を繰り返しても持続します。画像内のテキストレンダリングも具体的に言及され、初期の画像モデルを悩ませていた中国語文字の文字化けが解消されたことも含まれます。これらはまさに、プロダクト、ブランド、広告チームが繰り返し必要とする機能です。

LLaDA-Imageの売りは、オープンなレシピでバイリンガル生成と指示に基づく編集を実現する単一の重みセットです。inclusionAIは、中国語と英語のネイティブなテキスト描画、未変更のコンテンツを保持することを目的としたデュアルパス設計で参照画像を注入する編集パス、そしてQwen-Image-Benchにおいてリリース時点で最高のオープンウェイトスコアを報告しています。リリースから明らかな正直な注意点は、知覚的な編集品質が依然として専用エディタに及ばず、オブジェクトのカウントも弱いままであることです。これは汎用のオープンモデルであり、完成された商用製品ではありません。

A two-column comparison scoreboard for 'GPT-Image-2.5 vs LLaDA-Image': GPT-Image-2.5 rows read Access closed API (Flare + Sunburst) / Price $8 in · $30 out per M tokens / Quality evidence OpenAI-reported, no AA entry yet / Editing multi-turn, Sunburst precision / Max resolution 3840x2160 / Serving hosted, Flare faster; LLaDA-Image rows read Access open weights (Apache-2.0 card) / Price $0 weights, you run it / Quality evidence Qwen-Image-Bench 53.53 EN · 53.38 ZH / Editing native instruction editing / Max resolution 1024x1024 / Serving self-host, Base or Turbo; footer 'Both vendor-reported as of Sept 9 2026; no shared benchmark.'; the OrcaRouter logo is bottom-right.

スコアボードは意図的に画質のコンテストではない — 2つのモデルは同じ評価を受けたことがない。このスコアボードが示しているのは、資金とコントロールがどこに流れているかである。

一枚の画像の価格は、どちらの側もあなたに与えない数字である。

OpenAIは、GPT-Image-2.5のトークン料金表をGPT-Image-2と同一内容で公開している。すなわち、画像入力トークンは100万トークンあたり8ドル、画像出力トークンは100万トークンあたり30ドル、キャッシュされた画像入力は2ドル、テキストトークンは100万トークンあたり5ドルで別途請求される。しかし、特定の画像が消費するトークン数については公開されておらず、公式の画像あたりの価格もコスト計算ツールも存在しない。AAがリーダーボードで前モデルに対して提示した価格、すなわちGPT Image 2の「高」品質における1,000画像あたり約211ドルを基準とすると、トークン従量制のフラッグシップモデルは大量利用時に高コストなツールとなる。ただし、この数字はGPT-Image-2のものであり、2.5には当てはまらない。新モデルの画像あたりのコストは、OpenAIの外部では実際には不明である。

LLaDA-Imageには、正反対の正直さの問題がある。ウェイトは無料で、モデルカードにはApache-2.0のタグが付いているが、実質的なコストはインフラにある。6B拡散トランスフォーマーは、50ステップのBaseバリアントでは高性能なGPUを必要とし、FP8チェックポイント(diffusersレイアウトで約49GB)がほとんどのユーザーにとって現実的な選択肢となる。LLaDA-Image-Turboの2~4ステップ蒸留は、その現実への妥協だ。コミュニティのツール整備は急速に進んでおり、SGLangのプルリクエストではテキストから画像への生成、編集、シーケンス並列、FP8サポートが追加され、RebelAIのComfyUIノードパッケージはINT8およびGGUF量子化によるローカル推論をサポートしている。しかし「無料モデル」とは、依然として「あなたがホスティングプロバイダーになる」ことを意味する。すでにGPUキャパシティを運用しているチームにとって、LLaDA-Imageの限界費用はゼロに近い。それ以外の全員にとっては、エンジニアリング時間を考慮に入れると、サービングにかかる総コストが従量課金のAPI料金を上回る可能性がある。

両方欲しいなら、正直な道

ほとんどのチームにとって、これは二者択一ではありません。本番パイプラインでは、顧客向けで編集が中心、かつ絶対に失敗できない処理にはGPT-Image-2.5のようなホステッドAPIを使い、実験、オフラインのバッチジョブ、そしてプロンプトを第三者に送信できない処理にはLLaDA-Imageのようなオープンモデルを併用できます。この分割こそ、まさにルーティング層が構築される目的そのものです。つまり、実際に使用するホステッドモデルに届く単一のAPIで、プロバイダーのリスト価格をマークアップなしでそのまま通すため、後からホステッドルート経由でオープンウェイトモデルを試しても、プロバイダーに直接アクセスするのと同じコストになります。2026年9月9日時点で、どちらのモデルもOrcaRouterのカタログには掲載されていません。GPT-Image-2.5は当面OpenAI-API限定(前世代のGPT-Image-2はルーティング対象)、LLaDA-Imageはウェイトのみの公開でホステッド推論には対応していません。今日のカタログ内容に関係なく、設計意図は変わりません。

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026: GPT Image 2 (high) is ranked first at Elo 1,178, followed by MAI-Image-2.6, Reve 2.1, Nano Banana 2 (Gemini 3.1 Flash Image) and Meta Muse Image; GPT-Image-2.5 has no entry on the board yet.

どちらを土台にすべきですか?

あなたの仕事が商用画像生成、すなわち編集の失敗がクライアントとの関係を損なう仕事(商品写真、キャンペーン用クリエイティブ、参照画像と一貫性のある画像、長いマルチターンの編集セッション)であるなら、GPT-Image-2.5 はその仕事に全設計を合わせたモデルであり、独立したスコアがまだ存在しない段階でも注目すべき理由となるのが Sunburst エンドポイントです。リスクは、画像1枚あたりの価格が不透明なことと、品質に関する主張がすべて OpenAI 自身のものであることです。あなたの仕事が研究、大量の実験、中国語と英語のバイリンガル生成、あるいは自社環境や自社データで実行する必要があるものであれば、LLaDA-Image のほうが興味深いリリースです。公開されたレシピを備えた真のオープンウェイトですが、その代わりに自前のインフラが必要となり、再現されていないスコアを受け入れることになります。両モデルはリリースが1週間違いですが、運用モデルは大きく異なります。正しい選択は、実際に支払えるコストに合うほうです。

Screenshot of the Hugging Face model page for inclusionAI/LLaDA-Image captured September 9 2026, showing the model header, the text-to-image and image-editing pipeline tags, the License: apache-2.0 tag, 'Model size 7B params', BF16, 57 likes, and the opening of the model card 'LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes'.