
Ideogram 4.5 對上 GPT Image 2.5:這場爭鬥是 Ideogram 自己挑起的
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 261 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 216 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
大多數模型比較都是由撰寫者自己彙整而成。這一份則是由Ideogram所彙整。這份發布頁面是針對Ideogram 4.5,自 2026 年 9 月 30 日起上線,提供並排編輯示範,並在說明文字中點名對手:「在 Ideogram 4.5 上進行的相同編輯,對比 GPT Image 2.5 Sunburst、Nano Banana Pro 和 Nano Banana 2。」接著它宣稱觀看者將會看到什麼——「GPT Image 和 Nano Banana 的輸出在幾次編輯後就變得無法使用,而 Ideogram 4.5 則在一次次編輯後依然保持乾淨。」
這異常直接。供應商自己挑選基準目標,還事先告訴你結果,從某個層面來說值得認真看待,但從另一個層面來說則該抱持懷疑。GPT Image 2.5在兩個圖像類別的獨立排行榜上都是最強的,所以是選對了的對手。而且它是一次雙識別名稱的發佈——Flare 和 Sunburst,兩者都在 2026 年 9 月 8 日推出——其公開競技場分數目前是 Ideogram 4.5 比不上的。有趣的問題不是誰贏得競技場,而是 Ideogram 的主張是否在衡量競技場沒有衡量的東西。
確切來說,兩個模型各自的定位為何
• Ideogram 4.5 — 於 2026 年 9 月 30 日推出。精準編輯模型;以四種渲染速度進行生成與編輯;原生 2K;編輯示範的原始解析度最高達 4,016 × 6,016(24.2 MP)。文字轉圖像在 167 個模型中排名第 34,Elo 為 1,014 ± 11(2,247 票);圖像編輯排名第 23,Elo 為 1,064 ± 11(2,382 票)。依速度設定,每張圖像 $0.03–$0.22。
• GPT Image 2.5 Sunburst — 於 2026 年 9 月 8 日推出,是 OpenAI 分拆式影像升級中主打精準度的那一半,API 識別碼為 gpt-image-2.5-sunburst。文字轉圖像 第 1 名,Elo 為 1,197 ± 9(14,023 票);影像編輯 第 1 名,Elo 為 1,182 ± 8(17,899 票)。依該排行榜的換算,價格為每 1,000 張圖片 $210.70。
• GPT Image 2.5 Flare——同一版本中速度較快的那一半,識別碼 gpt-image-2.5-flare。在兩個排行榜上均排名第 2:文字轉圖像 1,190、編輯 1,162。同樣為每 1,000 次 $210.70。
把這兩個編輯數字並列來看,差距是 118 Elo——1,182 對 1,064——信賴區間分別是 ±8 和 ±11。這兩個區間並不重疊。在衡量單次編輯偏好的排行榜上,Sunburst 勝出,而且它勝出時背後約有七倍半的票數支持。
排行榜衡量了什麼、又沒有衡量什麼
這正是決定 Ideogram 的主張能否經得起證據檢驗的部分。
Artificial Analysis 的編輯競技場採用盲測成對人類偏好:投票者會看到同一張來源圖片與同一則指令,取得兩個未標示的編輯結果,然後選出較好的一個。對於「這兩個輸出中,哪一個看起來更符合指令要求」而言,這是一種強而有力的方法。
它無法衡量 Ideogram 所宣傳的那件事。投票者在評判單一編輯時,無法看出模型是否悄悄改動了壁紙、把一張臉移動了兩公釐,或是在畫面其餘部分重新渲染了顆粒。Ideogram 聲稱要修復的那種失敗,只有在一個序列中才會顯現——第四輪、第七輪、第十輪——而沒有主流競技場會向投票者呈現序列。1,064 的 Elo 分數說明 Ideogram 的個別編輯很好。它完全無法說明這些編輯是否會持續良好。
這對 Ideogram 來說是雙面刃,而誠實的說法是:排行榜既不證實漂移的說法,也不駁斥它。它真正駁斥的,是讀者可能從發布頁面得出的那個隱含但更強的主張——4.5 是更好的編輯器,毋庸置疑。對照排行榜,它是排名較低的編輯器,且差距比其誤差範圍還大。

各自能做而對方做不到的事
• 來源解析度編輯——Ideogram 4.5 最與眾不同的工程主張。其頁面展示了一項直接套用於 4,016 × 6,016 來源、未經降尺寸的編輯,並承諾編輯邊界保留得足夠完整,能將裁切區域縫合回原圖。對印刷作業而言,這就是可交付成品與妥協之間的差別。
• 參數面向的廣度——GPT Image 2.5 的。OpenAI 在品質階梯中新增了 xhigh與max,並將透明背景提升為一級參數,可把 background 設為 transparent、opaque 或 auto,並輸出 PNG 或 WebP。透明輸出是 GPT Image 2 的一項缺口,到了 2.5 這對版本則成為主打功能。
• 速度優先通道 — Flare 的存在,就是為了成為預設的快速選項。OpenAI 宣稱其延遲比前一代最多低 50%;Sunburst 則刻意放慢速度,鎖定必須經得起嚴格檢視的編輯工作。
• 價格結構 — Ideogram 依渲染速度按每張圖片計費($0.03 至 $0.22)。OpenAI 則與 GPT Image 2 採用同一費率表,按權杖計費——每百萬個圖片輸入權杖 $8、每百萬個圖片輸出權杖 $30——這正是為何獨立換算成每張圖片後,高品質 1024 × 1024 的價格會落在 $0.21 附近。
價格線在一個尷尬的位置交叉。在 Ideogram 4.5 的 Low 與 Medium 設定下,它每張圖片的價格遠比 OpenAI 那兩款便宜。到了 High——也就是漂移示範所在、也是你會執行 24 百萬像素來源的地方——兩者的數字幾乎相同。多數買家實際上會做的比較,是高品質的 Ideogram 4.5 對上高品質的 Sunburst,而在這項比較中,價格大致打成平手,卻在實測榜上有 118 Elo 的差距。
如果漂移的說法是真的,那倒沒問題。那就是全部的賭注。


沒有人宣傳的無障礙差異
有一項實際的不對稱,方向正好與計分板所示相反。GPT Image 2.5 的兩個識別碼比 OrcaRouter 目錄上的任何項目都新——我們目前的 OpenAI 圖像產品線是每百萬詞元 $8/$32 的 GPT-Image-1.5,以及 $8/$30 的 GPT-Image-2,兩者皆以供應商定價、無額外加價計價。2.5 這兩個型號在 OpenAI 的價目表上以與 GPT-Image-2 相同的 $8/$30 登場,這意味著它們一旦可被路由,就會落在相同的轉嫁價格上,而非另一個新價格,而兩者之間的成本問題也就變成詞元效率的問題,而不是你該呼叫哪一家供應商的問題。
Ideogram 4.5 已在 Ideogram 自家的 API 以及合作夥伴平台上推出。它並不在我們的目錄中。這件事對比較的影響,說穿了很無趣:這兩個模型中,一個可以直接替換給相容於 OpenAI 的用戶端使用,另一個則是需要全新整合。如果你已經透過 OpenAI 形式的端點呼叫 GPT-Image-2,試用 Sunburst 的代價只是改個模型 ID;試用 Ideogram 4.5 的代價則是要再簽一份合約、再用一個用戶端,而這還是在你開始評估品質之前。
路由層並不會消除那個差異——它只會從已經相容的那一側移除底層串接,並讓你將一部分流量導向新進者,而不必把正式生產路徑承諾給它。在這裡,容錯移轉比平常更重要,因為你要試用的是這樣一個模型:其核心主張沒有獨立驗證,而且樣本數只有競爭對手的五分之一。
如何解決它
不要在單張圖片上執行這項比較。那是競技場的方法,而且是用錯了工具——它會告訴你 Sunburst 勝出,這你早就知道了。
在序列上執行它。從你自己的作品中取五或十張圖像,寫下相同的六或八個漸進式編輯鏈,並在 Ideogram 4.5 (High) 和 Sunburst (max) 上執行完全相同的鏈。然後針對每個模型,在你從未要求模型觸及的區域上,比對第一輪與第八輪的差異。計算有變動的像素。那個數字——跨序列的未變區域分歧——就是 Ideogram 聲稱勝出的指標,而據我所知,這兩個模型都沒有公開這個數字。
然後以每個完成的序列為單位,為這兩次執行計價。屆時你得到的答案會比 118 Elo 更有價值,因為它關乎的是你的圖像,而不是投票小組的。
這場對決實際上是什麼
Ideogram 4.5 沒有參加一場它能在排行榜上勝出的競賽,而它似乎也知道這件事——所以發布頁面展示的是一種行為,而不是印出排名。它展示的行為真實到值得測試,也具體到可被否證:重複編輯要麼能保持一致,要麼不能,而用你自己的檔案做一輪十回合測試,一個下午就能定論。
今天合理的解讀是:GPT Image 2.5 Sunburst 是更好的編輯器,根據現存唯一獨立的衡量標準,領先幅度超出誤差範圍,而且這個數字背後有遠更充分的證據——而 Ideogram 4.5 則是在推銷一項更狹隘、未經衡量的特性,其價格在低設定時較便宜,而在其宣稱所依賴的設定下則大致相當。如果多輪保真度是你的生產瓶頸,這個測試成本很低,而這個模型值得一試。如果不是,排行榜已經給出答案了。
