
GPT-Image-2 vs Flux 3:已上線模型與路線圖的比較
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
這不是一篇普通的模型對比文章,因為 GPT-Image-2 和 Flux 3 並不在相同的存在狀態。GPT-Image-2 於 2026 年 4 月 21 日推出,自 5 月初起即可透過 OpenAI 的 API 呼叫,並在本週獲得了一項新能力——在 API 中生成透明背景圖像,此功能於 8 月 20 日公布,現已可用。Flux 3 是 Black Forest Labs 的多模態基礎模型,於 2026 年 7 月 23 日發布,但截至本文撰寫時,其圖像層級仍沒有公開端點、沒有模型 ID,也沒有定價表。這兩者之中,一個是只要有有效金鑰,凌晨 3 點也能呼叫;另一個則是你只能報名排進候補名單。因此,有用的比較不是「哪個更好」——而是已推出模型現在實際能做什麼、未推出模型在路線圖上宣稱會做到什麼,以及開發者該如何對待一個一再延期、仍停留在承諾階段的模型,而另一個已上線的模型則持續改進。
其中一個有端點
先從可用性說起,因為它決定了其他一切。Black Forest Labs 於 7 月 23 日發表了 Flux 3,這是一個統一模型,聯合訓練於影像、影片、音訊和機器人動作預測,採用該實驗室稱之為 Self-Flow 的流匹配方法。據報導,超過 95% 的訓練算力用於影片預測,這在實際推出的產品中可見一斑:只有 Flux 3 Video 於 8 月 4 日達到全面上市,並提供付費 API。影像版本的模型頁面仍標示「即將推出」,附有申請表單,而非「開始使用」按鈕——沒有端點、沒有文件化的參數、沒有每張影像的費用,也沒有任何人可以執行的基準測試。
GPT-Image-2 相比之下,已投入生產四個月。OpenAI 於五月初開放 API 存取,而該模型的識別符 gpt-image-2 已足夠穩定,因此固定快照 gpt-image-2-2026-04-21 與之並存。它是目前兩大獨立評測平台上排名第一的文字轉圖像模型——在 Arena 的文字轉圖像排行榜(中型建置)上獲得 1,381 Elo,在 Artificial Analysis 的高階建置上獲得 1,369 Elo——並且能渲染包括 CJK 在內的多語言文字,將生成根植於網頁搜尋,並可輸出最高 4K 解析度的結果。四個月的生產流量,正是「宣稱」與「實績」之間的差異。
GPT-Image-2 那一側最近的變更
讓這場對決更具時效性的事件,其實與 Flux 3 無關。8 月 20 日,OpenAI 在 Images API 中開放了 GPT-Image-2 的透明背景預覽:將背景設為 "transparent",端點便會回傳帶有真正 alpha 通道的 PNG 或 WebP,已去背、可直接合成。這項功能直接瞄準了 Flux 3 影像路線圖同樣在推銷的生產工作——產品拍攝、圖示、行銷素材——而且它是作為參數加在一個已上線的端點上,而非推出新模型。因此,當全世界仍在等待那個狀態還寫著 "coming soon" 的 Flux 3 影像端點時,現有業者剛剛補上了讓它被排除在合成管線之外的其中一個缺口。
這項功能僅限 API 使用——沒有 ChatGPT 切換開關——而且它是參數,不是新產品。Images API 的兩個端點(生成與編輯)都接受 background 欄位,值可以是 "transparent"、"opaque" 和 "auto"(預設值,由模型決定)。Alpha 通道僅在 PNG 或 WebP 輸出中保留,因此請求會明確指定輸出格式。OpenAI 自家的 API 參考文件仍將 gpt-image-2 及其 gpt-image-2-2026-04-21 snapshot 的透明背景支援標示為 "in preview"——這是供應商的標籤,而非正式發布公告——其指引也要求提示詞中不要描述任何背景,這樣模型才會真正執行透明背景的要求。沒有新端點、沒有新模型 ID、沒有獨立的價格表:原本回傳不透明 PNG 的同一個 gpt-image-2 呼叫,現在會回傳去背圖片。

Flux 3 影像承諾了什麼,實際又推出了什麼
Flux 3 影像層級的規格表是一份廠商路線圖,所以應該把它當作路線圖來看待。Black Forest Labs 承諾提供跨風格與跨解析度的影像合成與編輯、改善後的複雜提示詞處理能力、高準確度的多語言文字渲染、從參考影像進行零樣本風格轉換、無需微調即可維持角色與品牌一致性,以及保留材質與光影的非破壞性編輯。這些都是值得承諾的正確事項——它們正是當前市場領導者彼此競爭的關鍵功能——但目前沒有一項可以實際測試,因為每一項都還沒有對應的端點。
BFL 實際可呼叫的是影片層級和較舊的 FLUX 影像系列。Flux 3 Video 完整渲染在 HD 下每秒售價 $0.17,在 FHD 下每秒 $0.29,草稿模式則為每秒 $0.06。其自行公布的數字為:文字轉影片 Elo 1,135,影像轉影片 Elo 1,051,且在偏好度上勝過 Luma Ray 3.2、Runway Gen-4.5、Grok Imagine Video 和 Kling v3 Pro——這些全都是廠商自行發布且未經複現的數據,而且無論如何都無法轉移到影像層級。就靜態影像而言,目前 BFL 提供的仍是 FLUX.2 系列,在同樣的 Artificial Analysis 排行榜上以 1,226 Elo 位居,而 GPT-Image-2 以 1,369 領先。這個差距正是「Flux 3 影像即將推出」的實際背景:今日 BFL 影像 API 大約落後 OpenAI 的 140 Elo,而承諾中的模型正是 BFL 縮小差距所需的一切。

定價:只存在一個真正的價格卡片。
Flux 3 影像沒有定價,因為根本沒有 Flux 3 影像產品。唯一公佈的數字是 GPT-Image-2 的 token 費率:每百萬文字輸入 token 5 美元,每百萬影像輸入 token 8 美元,每百萬影像輸出 token 30 美元,而 Batch API 的費用約為一半,處理時間最長 24 小時。OpenAI 並未公佈每張影像的 token 數,因此每張影像的費用是換算值而非報價:低品質 1024×1024 約 0.006 美元,中等品質約 0.05 美元,高品質約 0.21 美元,4K 高解析度渲染最高可達約 0.41 美元。作為比較,那是帳本上真實存在的一欄;Flux 3 影像那一欄則是空的。

建造者應如何處理所承諾的模型
當競爭對手的模型一再延期時,明智的作法是立足於既有的東西,讓未來成為一次設定變更,而非重新架構。GPT-Image-2 現在就能透過 OrcaRouter 路由——一組 API 金鑰、OpenAI 的牌價以 0% 加成直接轉傳、跨供應商自動容錯轉移——因此,用它生成素材的管線,日後可以在端點真正存在的那一天,把同一個端點指向 Flux 3 image 的 API,並用路由 DSL 將一部分流量導向它,完全不需要碰呼叫端程式碼。你現在就能拿到已出貨的模型;等承諾的那個真正落地時,你評估它所依據的是實際運作的基準線,而不是新聞稿。等待本身不花你任何成本;但在等待期間什麼都不建構,代價才是全部。
這個結論本身就是刻意一面倒的。如果你這個季度需要圖像生成,GPT-Image-2 就是首選,沒有第二個問題——它是獨立評測的第一名,剛在 API 中加入透明背景輸出,而且有公開的 API 和穩定的價格。Flux 3 image 是關注 Black Forest Labs 的理由,而不是擱置專案的理由。追蹤早期開放的進度和第一批獨立基準測試;一旦端點存在,這篇文章中的比較就變成了一場你可以實際運行的測試。
