主視覺標題卡寫著「Ming-Image-0.1-Design vs GPT Image 2.5」,副標題為「一個分數是由陌生人投票決定,另一個則由該模型自家團隊所繪製」,並有兩張卡片分別寫著「GPT Image 2.5:在 UI/UX Design 排行榜上獲得 1,227 Elo,1,287 票盲測,每 1,000 張圖片 $210.72」與「Ming-Image-0.1-Design:在其自家儲存庫內發布的排行榜上獲得 1,082 Elo,0 次下載」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Ming-Image-0.1-Design 對決 GPT Image 2.5:實驗室自家的分數,對上一群陌生人的投票

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Ming-Image-0.1-DesignGPT Image 2.5放進同一個句子裡,最顯而易見的比較是品質。真正有用的比較則是來源出處。GPT Image 2.5 在即時更新的 Artificial Analysis UI/UX Design 排行榜上同時拿下第一與第二名,Elo 分別為 1,227 與 1,218,得票數則分別是 1,287 與 1,303 張人類盲投票——換句話說,這份排名是由既沒有參與打造該模型、也不知道哪個輸出出自誰手的人所產生的。Ming-Image-0.1-Design 則只有一個分數掛在它名下,1,082 Elo,而這個分數出現在 inclusionAI 自家 Hugging Face 儲存庫內附的一張排行榜圖上,那份榜單我們在其他任何地方都找不到,而且還是為一個下載次數掛零的模型所設。這兩個數字之中,一個是證據。另一個則是套上了字體排版的宣稱。真正應該左右你我對這兩個模型做出決定的,是這道落差,而不是它們之間那 145 Elo 的差距。

兩個數字並列,以及比較它們時的陷阱

這些數字接近到看起來可以互相比較,但它們在性質上又差異夠大,因此其實不能相提並論。這組數字精確陳述如下。

• GPT Image 2.5,在即時排行榜上——Flare(max)配置以 1,227.0 Elo 位居第一,Sunburst(max)以 1,218.1 位居第二,樣本數分別為 1,287 與 1,303,追蹤價格為每 1,000 張圖片 $210.72。該模型在該榜單上列為於 2026 年 9 月 8 日發布。

• Ming-Image-0.1-Design 獨自佔據一張卡片——以 1,082 Elo 位居第一,領先 1,052 的 Ideogram 4.0(Quality),以及介於 994 至 1,000 之間的 FLUX.2 dev 各變體;這出現在一張標題為「Text to Image Leaderboard: UI/UX Design」的圖表上,頁腳則寫著「Elo scores from blind preference votes in our Image Arena」。圖中未顯示樣本數。未公布任何方法論。就我們所能查到的範圍,這個排行榜本身並未出現在公開網路上。

• 陷阱——Elo 是依看板分別計算的。一項分數只有在與同一個看板上的其他分數相比時才有意義,這就是為什麼同一個 FLUX.2 版本在一般文字轉圖像看板上顯示 1,026,而在 UI/UX Design 類別檢視中顯示 1,065。從 1,227 減去 1,082,你並沒有測量出兩個模型之間的品質差距。你只是從另一個不同的數字中減去了一個數字。

A two-column scoreboard comparing GPT Image 2.5 with Ming-Image-0.1-Design. The GPT Image 2.5 column reads: 1,227 Elo first place, 1,287 blind votes, released 8 Sep 2026, $210.72 per 1,000 images, independent board, callable. The Ming-Image-0.1-Design column reads: 1,082 Elo first place, no vote count published, weights 17 Sep 2026, no published price, vendor-published board, not callable. A footer notes the two Elo figures are not on the same scale.

什麼讓匿名投票成為匿名投票

Artificial Analysis 公布了其方法的足夠細節,以供檢驗。它的圖像競技場將兩個匿名模型的生成結果配對,請投票者選出優勝者,再將結果轉換成 Elo 評分——排行榜上的樣本數,就是每個模型累積的這類比較次數。這樣的結構正是讓分數不受模型自家作者左右的關鍵:訓練 GPT Image 2.5 的人並不在這個流程裡,模型也無法只因為是開發者偏好的那一個就排名第一。它不是完美的工具——投票者群體是自我選擇而來的,提示詞也不是受控的基準測試套件——但至少握有這項工具的人不是供應商自己。

Ming-Image-0.1-Design 儲存庫中的圖表借用了那種格式,卻缺少了讓它可驗證的部分。「盲選偏好投票」是宣稱。「Our Image Arena」是營運方,而營運方是 inclusionAI。沒有公佈的投票數,沒有可見的提示分佈,也無法檢查配對。那張圖背後的評估完全有可能是誠實且嚴謹的——模型團隊會知道。但它也完全無法從外部核查,而如果你是要決定是否基於它進行開發的人,這才是唯一重要的事。

值得補充的是,因為這與那種簡便的說法相牴觸:Ming-Image-0.1-Design 根本不在 Artificial Analysis 的即時榜單上。不在 UI/UX 設計類別中,不在一般文字轉圖像榜單上,也不在開放權重檢視中。它的缺席並不證明它較差——一個零下載次數、又沒有託管端點的模型,根本無從累積票數。它證明的是目前還不存在任何獨立數字,這是不同的陳述。

價格是沒有模糊空間的部分

在成本方面,這兩個模型差距很大,沒什麼好爭論的。

• GPT Image 2.5 是商業端點。Artificial Analysis 在 UI/UX 類別中追蹤其價格為每 1,000 張圖片 210.72 美元——每張約 21 美分,這使它位居該領域價格區間的最高端。就同一排行榜的脈絡而言,Grok Imagine Image 2.0 被追蹤為每 1,000 張 60 美元,MAI-Image-2.6 為 38.9 美元,Muse Image 則為 10 美元。

• Ming-Image-0.1-Design 沒有價格,因為它沒有端點。權重採用 MIT 授權,可免費下載;執行它們的成本,就是一台 80 GiB CUDA GPU 每小時的費用。模型卡驗證過的配置是該等級的單張 GPU,於 2048 x 2048 解析度與 12 個取樣步驟下運行。

• 這兩個數字都不穩定。兩家供應商都會調整價格,而今天寫下的每張圖片比較,保鮮期只有幾週。這正是值得把 OrcaRouter 的成本結構講清楚的地方:我們以 0% 加成原樣反映供應商的標價,因此供應商調價當天,我們這邊就會同步生效,而不必等我們自己跑完一輪重新定價——當兩個候選方案的差距是每張圖片 21 美分對上 6 美分,而且雙方都可能變動時,這一點格外重要。

你今天真正能打的是什麼,以及我們在其中處於什麼位置

可用性是這場比較不再只是紙上談兵的地方。

GPT Image 2.5 是真實存在的產品,背後有真實的 API,由 OpenAI 依自身條件銷售。它無法透過 OrcaRouter 路由——截至 2026 年 9 月 23 日,我們的目錄中並沒有 GPT Image 2.5 這個項目——而我們也不會去描述一條我們並不存在的路由。目錄中確實有同一系列的前一代產品,openai/gpt-image-2,每百萬輸入 token 8.00 美元、每百萬輸出 token 30.00 美元,以及openai/gpt-image-1.5,而這些和我們所路由的其他所有項目一樣,都放在同一把金鑰後面。

Ming-Image-0.1-Design 在任何地方都無法路由。該儲存庫已停用推論,Hugging Face 回報沒有推論供應商部署,而快速入門指向一個會回傳 404 的配套 GitHub 儲存庫。我們的目錄中沒有任何種類的 inclusionAI 模型。唯一能執行它的方法,就是下載分片並自行提供服務。

所以,這個選擇的樣貌是:一個是你今天就能以市場最高價買到的選項,另一個是你今天就能跑起來的選項,代價是一張 GPU 和你自己的工程時間,而且沒有獨立證據顯示它的表現如何。任何告訴你 Ming-Image-0.1-Design 是 GPT Image 2.5 更便宜替代方案的人,都沒有把第二個選項的成本算進去。

The Artificial Analysis text-to-image leaderboard's UI/UX Design category view, captured 23 September 2026, showing GPT Image 2.5 Flare (max) first at 1,227 Elo with 1,287 samples and $210.7 per 1,000 images, GPT Image 2.5 Sunburst (max) second at 1,218, GPT Image 2 (high) third at 1,206, and Grok Imagine Image 2.0 fourth at 1,182. No Ming-Image-0.1-Design row appears on the board.

如何兼顧兩者,而不押注於任何一方

這裡的實用建議比定論來得狹隘,因為這兩個模型目前還無法互相替代。

如果你需要在生產環境中做 UI 或設計品質的圖像生成,GPT Image 2.5 是站得住腳的選擇,而該跟自己好好談的是價格,不是品質——它在獨立排行榜上領先的幅度大到排名根本無須爭論。如果你想知道 Ming-Image-0.1-Design 到底好不好,你有兩個選擇,而其中只有一個不必靠猜:把 MIT 授權的權重載到 80 GiB 的顯卡上跑你自己的評估集,或者等別人來做。在此期間,別把 1,082 當成結果。而如果你真正的需求是可選擇性,而不是非這兩個模型中的哪一個不可,那麼真正有回報的紀律,就是把生成呼叫收在單一介面之後——一把金鑰橫跨 200 多個模型、改個模型 ID 而不必重寫程式、端點出狀況時自動容錯切換——這樣一來,這兩個模型哪一個先交出獨立數字,採用它對你來說只花一行設定,而不是耗掉一個衝刺週期。

關於什麼會改變這篇報導,最後補上一點:若 Ming-Image-0.1-Design 出現在 Artificial Analysis UI/UX Design 看板上,且旁邊附有樣本數,就會把該廠商的 1,082 從一項宣稱變成一個資料點——而這將是 inclusionAI 以外的人首次對這個模型提出任何可衡量的說法。那才是值得關注的事件,而且它比下載計數器更值得監測。

The OrcaRouter models catalogue, captured 23 September 2026, showing the English-language model directory with its search box, the copy-the-model-ID instructions, and the filter panel for input modalities, context length, price, status and series.