
GPT-Image-2 vs Flux 3:ライブモデルとロードマップの比較
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
これは、通常のモデル同士の比較記事ではありません。なぜならGPT-Image-2とFlux 3は、同じ存在段階にはないからです。GPT-Image-2 は2026年4月21日にリリースされ、5月初旬から OpenAI の API から呼び出し可能となり、今週には新しい機能 — API での透過背景画像生成(8月20日発表、現在利用可能)— も追加されました。Flux 3 は Black Forest Labs のマルチモーダル基盤モデルで、2026年7月23日に発表されましたが、本稿執筆時点で、画像生成部分には公開エンドポイントもモデル ID も料金表もまだありません。一方は有効なキーがあれば午前3時に呼び出すことができますが、もう一方はウェイトリスト登録に申し込めるだけです。したがって、有益な比較は「どちらの方が優れているか」ではなく、リリース済みモデルが今日実際に何をできるのか、未リリースのモデルについてロードマップが何を約束しているのか、そして、稼働中のモデルが改善され続ける一方で延期が続く約束済みモデルを、開発者がどう扱うべきか、ということです。
これらのうちの1つにはエンドポイントがあります。
まず可用性から始めよう。それが他のすべてを左右するからだ。Black Forest Labsは7月23日、画像・動画・音声・ロボットの行動予測をまとめて学習した単一モデルとしてFlux 3を発表した。これは同社がSelf-Flowと呼ぶフローマッチング手法に基づいている。トレーニング計算量の95%以上は動画予測に使われたとされ、実際にリリースされたものにもそれが表れている。一般提供に到達したのはFlux 3 Videoだけで、8月4日に有料APIとして提供開始された。画像版のモデルページには今も「近日公開」のラベルと申し込みフォームが表示されており、「今すぐ始める」ボタンはない。エンドポイントも、文書化されたパラメータも、画像1枚あたりのコストも、誰でも実行できるベンチマークも存在しない。
一方、GPT-Image-2 は本番運用されて4か月になる。OpenAI は5月上旬に API アクセスを公開し、モデル識別子である gpt-image-2 は、ピン留めされたスナップショット gpt-image-2-2026-04-21 と共存できるほど安定している。このモデルは、主要な独立系リーダーボードの両方で現在トップのテキスト画像生成モデルであり — Arena のテキスト画像リーダーボード(ミディアムビルド)で Elo 1381、Artificial Analysis のハイビルドで Elo 1369 — また、CJK を含む多言語テキストをレンダリングし、Web 検索に基づいて生成を行い、最大4Kの出力を生成する。本番トラフィックの4か月は、主張と実績の違いを生む。
GPT-Image-2側の最近の変更
この対決がタイムリーになったきっかけは、Flux 3とは一切関係がない。8月20日、OpenAIはImages APIでGPT-Image-2の透過背景プレビューを公開した。backgroundを「transparent」に設定すると、エンドポイントは実際のアルファチャンネルを持つPNGまたはWebPを返し、切り抜かれてすぐに合成できる状態になる。 これは、Flux 3イメージのロードマップが同じく売りにしている制作業務(商品ショット、アイコン、マーケティング素材)をまさに狙った機能であり、新モデルとしてではなく、すでに稼働中のエンドポイントのパラメータとして実装された。世界が「近日公開」と表示されたままのFlux 3画像エンドポイントを待っている間に、先発製品は、合成パイプラインへの参入を妨げていたギャップのひとつを、ちょうど埋めたのである。
この機能はAPI専用で、ChatGPTのトグルはありません。また、これは新製品ではなく、パラメータです。Images APIの生成エンドポイントと編集エンドポイントの両方が、backgroundフィールドを受け付けます。値は "transparent"、"opaque"、"auto"(デフォルト。モデルが決定)です。アルファチャンネルはPNGまたはWebP出力でのみ保持されるため、リクエストは出力形式を明示的に固定します。OpenAI自身のAPIリファレンスでも、gpt-image-2とそのgpt-image-2-2026-04-21スナップショットのtransparentサポートは「プレビュー中」とされています。これはベンダーの表記であり、正式リリースの発表ではありません。また、そのガイダンスでは、モデルが実際にtransparentリクエストを尊重するよう、プロンプトに背景の記述を含めないことを推奨しています。新しいエンドポイントも、新しいモデルIDも、別途の価格表もありません。従来は不透明なPNGを返していた同じgpt-image-2呼び出しが、今は切り抜き画像を返すようになります。

Flux 3 イメージが約束すること、そして実際に出荷されているもの
Flux 3イメージティアのスペックシートはベンダーのロードマップであり、そのように扱うべきだ。Black Forest Labsは、スタイルや解像度を問わない画像合成と編集、複雑なプロンプト処理の改善、高精度な多言語テキストレンダリング、参照画像からのゼロショットスタイル転送、ファインチューニング不要のキャラクター・ブランド一貫性、そしてテクスチャと照明を保持する非破壊編集を約束している。これらは約束すべき正しい内容だ——現在の市場リーダーたちが競い合っているまさにその機能だからだ——しかし、そのいずれもエンドポイントが存在しないため、現時点ではテスト不可能である。
BFLから実際に呼び出せるのは、ビデオ層と旧来のFLUX画像ラインです。Flux 3 Videoの価格は、フルレンダリングでHDが1秒あたり0.17ドル、FHDが1秒あたり0.29ドル、ドラフトモードが1秒あたり0.06ドルです。同社が報告した数値は、テキストからビデオへが1,135 Elo、画像からビデオへが1,051 Eloで、Luma Ray 3.2、Runway Gen-4.5、Grok Imagine Video、Kling v3 Proに対する嗜好勝ちとなっています。これらはすべてベンダー報告であり再現されておらず、いずれにしても画像層には引き継がれません。静止画像については、現在のBFLの提供品はFLUX.2系統であり、GPT-Image-2が1,369で首位を走る同じArtificial Analysisのリーダーボード上で1,226 Eloです。この差が「Flux 3画像が来る」という実質的な文脈です。今日のBFLの画像APIはOpenAIのものより約140 Elo低く、約束されたモデルこそがBFLがその差を埋めるために必要なものなのです。

価格設定:実際の価格カードは1つだけ存在します
Flux 3 画像の価格は存在しません。なぜなら Flux 3 画像という製品自体がないからです。公表されている数値は GPT-Image-2 のトークン料金のみです。テキスト入力トークンは100万トークンあたり5ドル、画像入力トークンは100万トークンあたり8ドル、画像出力トークンは100万トークンあたり30ドルで、Batch API は最大24時間のターンアラウンドで約半分の料金になります。OpenAI は画像あたりのトークン数を公表していないため、画像あたりの数値は換算値であり、公式の見積もりではありません。低品質の1024×1024で約0.006ドル、中品質で約0.05ドル、高品質で約0.21ドル、4K高品質レンダリングで最大約0.41ドルです。比較対象として、これは台帳の片側に実在する数字です。Flux 3 画像の列は空欄です。

ビルダーは約束されたモデルに対して何をすべきか
{{1}}競合他社のモデルが延期を繰り返すときに賢明な姿勢は、既存のものの上に構築し、未来を再アーキテクチャではなく設定変更にすることです。{{/1}}{{2}}GPT-Image-2は現在、OrcaRouterを通じてルーティング可能です — 1つのAPIキー、OpenAIのリスト価格を0%マークアップでそのまま通過、プロバイダー間の自動フェイルオーバー — そのため、これを使ってアセットを生成するパイプラインは、後日エンドポイントが実際に存在するようになった時点で同じエンドポイントをFlux 3 imageのAPIに向け、ルーティングDSLを使用して呼び出しコードに触れることなくトラフィックの一部をそこにルーティングできます。{{/2}}{{3}}今すぐ出荷済みモデルを入手でき、約束されたモデルが登場したら、プレスリリースではなく実際に動作するベースラインと比較して評価できます。{{/3}}{{4}}待つことには何のコストもかかりません。待っている間に何もない上に構築することには、すべてのコストがかかります。{{/4}}
この判定は意図的に偏っています。今四半期に画像生成が必要なら、GPT-Image-2 が選びであり、二つ目の選択肢はありません。独立系ナンバーワンであり、API に透過背景出力が追加されたばかりで、公開 API と安定した価格も備えています。Flux 3 image は Black Forest Labs に注目しておく理由にはなりますが、プロジェクトを保留する理由にはなりません。アーリーアクセスの開始と最初の独立系ベンチマークを追跡してください。エンドポイントが存在するようになった瞬間、この投稿の比較は実際に実行できるテストになります。
