「GPT-Image-2.5 對比 LLaDA-Image」的主視覺標題卡片,副標題為「每百萬 token 30 美元的 API 對比免費的 6B 擴散模型」,包含左側圓角卡片,標示為「GPT-Image-2.5 · 封閉旗艦 API — 按 token 計費、託管」,以及右側圓角卡片,標示為「LLaDA-Image · 開放權重 — 自行託管、Apache-2.0 卡片」,兩者以天平圖示相連;OrcaRouter 標誌位於右下角。
Guides & Insights

GPT-Image-2.5 對決 LLaDA-Image:收費 30 美元/百萬 Token 的 API,對上免費的 6B 擴散模型

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

若問影像生成應該要花多少成本,兩個實驗室在一週之內各自給出了相反的答案。2026年9月8日,OpenAI 推出了 GPT-Image-2.5——也就是 ChatGPT Images 2.5 背後的模型,透過 API 以 GPT-Image-2.5 Flare 和 GPT-Image-2.5 Sunburst 兩種形式銷售——定價為每百萬影像輸入 token 8 美元、每百萬影像輸出 token 30 美元。五天前的9月4日,inclusionAI(螞蟻集團支持的實驗室,也就是 LLaDA 語言家族的背後團隊)低調釋出了 LLaDA-Image,這是一個六十億參數的 diffusion-transformer 影像生成與編輯模型,其權重可以免費下載。一個是 OpenAI 迄今為止放在 token 計費表後方、商業上最強大的影像模型;另一個則是試圖證明,強大的影像模型可以用開放的訓練配方打造出來並免費送出。兩者相比,與其說是正面對決,不如說是你實際上在為哪一種「成本」的定義買單。

GPT-Image-2.5 方面的數字幾乎全部來自廠商自行回報,至今沒有任何一項經過獨立驗證:OpenAI 聲稱 Flare 相較於 GPT-Image-2 可將延遲降低最多 50%,並表示智能體公司 Manus 的第三方測試測得生成速度快 2 至 4 倍;但截至 2026 年 9 月 9 日,GPT-Image-2.5 的兩款模型都尚未出現在 Artificial Analysis 的影像排行榜上。LLaDA-Image 的招牌數字同樣未經重現——inclusionAI 回報其在 Qwen-Image-Bench 上取得英文 53.53 分、中文 53.38 分,於發布時在開放權重模型中居冠——而由於該模型沒有託管 API,根本無法登上僅限 API 的排行榜。這項比較的雙方都依賴各自開發商的自家宣稱,這點在閱讀本文其餘部分時值得銘記。

幾乎不屬於同一類別的兩個型號

GPT-Image-2.5 是一個託管式、封閉的圖像模型,與 2026 年 4 月的 ChatGPT Images 2.0 同屬一個系列。它在輸入端支援多模態,並產生 OpenAI 聲稱在精細細節上更銳利、在光影和紋理上更自然、且在多輪編輯中更穩定的圖像——Sunburst 端點是專門為大量編輯的生產工作而設,在這種場景下,較慢的生成速度可以換取更嚴格的指令控制;而 Flare 則是適用於大量產出的快速預設。輸出尺寸最高可達 2048×2048 與 3840×2160,支援透明背景,且每一項輸出都帶有 C2PA 出處元資料以及一個不可見的浮水印。

LLaDA-Image 是一種研究風格的開放釋出,押注在一個完全不同的方向上。GPT-Image-2.5 由 OpenAI 的基礎設施提供服務,而 LLaDA-Image 則是一組由你自己執行的權重:生成端是一個 60 億參數的擴散轉換器(DiT)——模型卡在計入語言端後記錄約 70 億參數——搭配 LLaDA 2.0-mini,一個 160 億總參數 / 10 億活躍參數的混合專家擴散語言模型,作為「理解」端,將文字提示或編輯指令轉換成 DiT 所遵循的訊號。arXiv 報告(2609.03796)中不尋常的主張在於訓練配方:大約 2.2 億個累積的預訓練與中途訓練樣本中,超過 90% 是僅含影像的樣本,並使用一個凍結的視覺語言模型從未標記的影像中萃取語義,作為自我條件化訊號,因此模型「先學會畫圖,再學會服從」。漸進式解析度將訓練從 256×256 提升到 512×512,再到 1024×1024 的微調,接著是混合式文字轉影像與編輯訓練,以及 TwinFlow 少步驟蒸餾,產生 LLaDA-Image-Turbo 變體。

每個實際上各自擅長什麼

GPT-Image-2.5 的主打賣點是以商業品質實現精準與掌控。OpenAI 的公告強調參考保真度——在變更場景或風格時,仍能維持人物、寵物或產品的高度辨識度——以及只變更你要求變更的內容,並能在同一對話中持續承受多輪編輯。圖片內文字渲染也被特別點名,包括消除了早期影像模型常見的亂碼中文字元。這些正是產品、品牌或廣告團隊會反覆需要的核心能力。

LLaDA-Image 的賣點在於:用一組權重,就能同時做到雙語生成與指令引導編輯,並採用開放配方。inclusionAI 宣稱具備原生中英文文字渲染、透過雙路徑設計注入參考影像的編輯路徑(目的是保留未修改的內容),而且在 Qwen-Image-Bench 上,發表時擁有開放權重模型中的最高分。發表內容中誠實的但書是:感知上的編輯品質仍落後於專業編輯器,而物體計數能力依然偏弱。它是通用型開放模型,而非已完成的商業產品。

A two-column comparison scoreboard for 'GPT-Image-2.5 vs LLaDA-Image': GPT-Image-2.5 rows read Access closed API (Flare + Sunburst) / Price $8 in · $30 out per M tokens / Quality evidence OpenAI-reported, no AA entry yet / Editing multi-turn, Sunburst precision / Max resolution 3840x2160 / Serving hosted, Flare faster; LLaDA-Image rows read Access open weights (Apache-2.0 card) / Price $0 weights, you run it / Quality evidence Qwen-Image-Bench 53.53 EN · 53.38 ZH / Editing native instruction editing / Max resolution 1024x1024 / Serving self-host, Base or Turbo; footer 'Both vendor-reported as of Sept 9 2026; no shared benchmark.'; the OrcaRouter logo is bottom-right.

計分板刻意不是一場關於影像品質的競賽——這兩個模型從未接受過相同的評測。它所顯示的是資金與控制權流向何處。

一張圖片的價格,是任何一方都不會告訴你的數字。

OpenAI 發布了 GPT-Image-2.5 的 token 計價表,與 GPT-Image-2 完全相同:每百萬個圖像輸入 token 收費 8 美元、每百萬個圖像輸出 token 收費 30 美元、快取的圖像輸入每個百萬收費 2 美元,文字 token 則另行計費,每百萬個 5 美元。它沒有公布的,是一張特定圖像會消耗多少 token,這意味著沒有官方的單張圖像價格,也沒有成本計算器。根據 AA 在其排行榜上列出的前代產品價格——GPT Image 2 在「高」品質下約每 1,000 張圖像 211 美元——按 token 計費的旗艦產品在高用量下是昂貴的工具,但那個數字是針對 GPT-Image-2,而非 2.5;新模型的單張圖像成本在 OpenAI 以外確實無人得知。

LLaDA-Image 則有相反的誠實性問題。權重完全免費,模型卡上也帶有 Apache-2.0 標籤,但真正的代價在於基礎設施:6B 擴散 Transformer 需要一張高階 GPU 來執行 50 步的 Base 變體,而 FP8 checkpoint(在 diffusers 佈局下約 49 GB)才是多數使用者實際可行的選項。LLaDA-Image-Turbo 的 2–4 步蒸餾正是對這個現實的讓步。社群工具進展迅速——一個 SGLang pull request 新增了文生圖、影像編輯、序列平行與 FP8 支援,RebelAI 的 ComfyUI 節點套件也支援 INT8 與 GGUF 量化的本地推論——但「免費模型」仍然意味著「你就是託管服務提供者」。對一個已經營運 GPU 算力的團隊而言,LLaDA-Image 的邊際成本趨近於零;對其他人來說,一旦把工程時間算進去,自行部署並提供服務的總成本可能超過按量計費的 API 帳單。

若你兩者都想要,誠實的路是……

對大多數團隊來說,這兩者並非只能二選一。生產管線可以把 GPT-Image-2.5 這類託管 API 用在面對客戶、編輯量大、不容出錯的工作上,同時把 LLaDA-Image 這類開放模型保留給實驗、離線批次任務,以及任何無法將提示詞傳送給第三方的工作。這種拆分正是路由層要處理的問題型態——以單一 API 接通你實際使用的託管模型,供應商定價如實轉傳、不加價,因此日後透過託管路由嘗試開放權重模型時,成本會與直接向供應商取用相同。截至 2026 年 9 月 9 日,這兩個模型都還不在 OrcaRouter 的目錄中:GPT-Image-2.5 目前僅能透過 OpenAI API 使用(上一代的 GPT-Image-2 已可路由),而 LLaDA-Image 目前僅提供權重,沒有託管推論服務。無論目前的目錄如何,這項設計意圖依然成立。

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026: GPT Image 2 (high) is ranked first at Elo 1,178, followed by MAI-Image-2.6, Reve 2.1, Nano Banana 2 (Gemini 3.1 Flash Image) and Meta Muse Image; GPT-Image-2.5 has no entry on the board yet.

你應該在哪一個上面建造?

如果你的工作是商業影像生成,而一次失敗的編輯就可能賠掉一段客戶關係——例如產品照、行銷活動素材、與參考圖一致的影像、長時間的多輪編輯——GPT-Image-2.5 就是整體設計完全瞄準這類任務的模型;甚至在獨立評測分數出現之前,Sunburst 端點本身就足以成為你關注的理由。風險在於每張影像的價格不透明,以及所有品質宣稱都來自 OpenAI 自己。如果你的工作是研究、大量實驗、中英雙語生成,或任何必須在自己環境、用自己的資料上運行的任務,LLaDA-Image 是更值得注意的發布——真正開放的權重搭配已公開的配方,代價是你得自己扛起基礎設施,並接受那些尚未被重現的分數。這兩個模型發布時間僅相隔一週,營運模式卻天差地遠;正確的選擇,取決於哪一個符合你實際上能夠承擔的成本。

Screenshot of the Hugging Face model page for inclusionAI/LLaDA-Image captured September 9 2026, showing the model header, the text-to-image and image-editing pipeline tags, the License: apache-2.0 tag, 'Model size 7B params', BF16, 57 likes, and the opening of the model card 'LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes'.