MAI-Image-2.5-Pro(Microsoft Foundry 預覽中的高級編輯模型)與 Bernini-Diffusers-v2(ByteDance 的 Apache-2.0 開放權重管線)對戰的 Hero 卡片。
Guides & Insights

MAI-Image-2.5-Pro 對上 Bernini-Diffusers-v2:實測第一名 vs 未經實測的開放權重賭注

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

比較 MAI-Image-2.5-ProBernini-Diffusers-v2,並非真的在比較兩個影像模型。這是在比較同一個問題的兩種不同答案——「我該如何為現有圖片進行良好的編輯?」——其中一方有 6,100 次人類盲測投票支持其位居編輯排名第一,另一方則只有一份 README。MAI-Image-2.5-Pro 是 Microsoft 的品質級影像模型,於 2026 年 7 月 23 日在 Microsoft Foundry 上進入公開預覽,現已位居 Artificial Analysis 影像編輯競技場榜首。Bernini-Diffusers-v2 是 ByteDance 的第二代統一生成框架,於 2026 年 8 月 13 日以 Apache-2.0 權重的形式登陸 Hugging Face,沒有公告,也沒有任何由 ByteDance 以外的人執行過的影像品質基準。這場對決中每個實際差異都源於這兩個事實。

一個你呼叫,一個你運行

MAI-Image-2.5-Pro — 在 Azure AI Foundry 及 MAI Playground 上以公開預覽形式提供的託管 API 模型。屬專有技術,按 token 計量收費,不提供微調,也無法自行託管。您會取得一個端點並按 token 付費;基礎設施由 Microsoft 營運。

Bernini-Diffusers-v2 — Apache-2.0 weights you download from Hugging Face and run yourself. The stack is a Qwen2.5-VL-7B semantic planner driving a Wan2.2-based DiT renderer, and the README's hardware recommendation is Hopper-class GPUs (H100/H800/H200) with Python 3.11.2 / PyTorch 2.5.1+cu124. You bring the cluster.

這就是用一句話說明的決策規則:如果你的組織想要擁有整個技術棧,Bernini 是一個選項;如果你的組織想要發票和 SLA,那麼只有 MAI-Image-2.5-Pro 還在候選之列。它們彼此無法替代。

證據差距才是真正的頭條

這兩個模型在影像 AI 最大的品質問題——衡量輸出——上處於對立的兩端。MAI-Image-2.5-Pro 的編輯能力是獨立評分的——在 Artificial Analysis Image Editing Arena 中排名第一,Elo 1,272,源自約 6,100 次盲測比較,領先 Reve 2.1、GPT Image 2 以及其同門兄弟 MAI-Image-2.5。它的文字轉圖像排名是第七名,Elo 1,292,這正是誠實的平衡點:它是專業的編輯工具,而非空白畫布上的領導者。這些數字只要有瀏覽器就能查核。

Bernini-Diffusers-v2 沒有相應的公開評分。模型卡上記載 EditVerse 8.02、OpenVE 3.96、OpenS2V 63.83 與 VBench 84.46——皆為廠商自行申報,且全屬影片面向的指標。卡片上沒有任何圖片購買者能辨識為文生圖或影像編輯排行榜結果的內容。卡片確實聲稱 Bernini 在字節跳動的內部盲測兩兩對戰中達到封閉式商業模型「第一梯隊」——但這正是那種在具有任何意義之前,需要獨立驗證的廠商自我評估。

MAI-Image-2.5-Pro:圖像編輯 Elo 1,272(獨立,約 6,100 票);文生圖 Elo 1,292(獨立,約 11,500 票)

Bernini-Diffusers-v2:無公開的圖像基準測試;僅有廠商自行回報的影片端指標

Comparison scoreboard for MAI-Image-2.5-Pro and Bernini-Diffusers-v2: editing rank No. 1 at 1,272 Elo versus no public image benchmark; availability Foundry preview versus Apache-2.0 self-host; text rendering 96.8% claimed versus unpublished; price USD 108.50 per 1k versus free weights plus your own compute; editing approach surgical edits versus plan-then-render; scope image-only versus unified image and video

兩種不同的編輯理論

這兩個模型都圍繞著同一個理念:編輯不應等同於重新生成場景。但它們的實現方式不同。

MAI-Image-2.5-Pro 是微軟「精準、外科手術式編輯,且保持一致」的宣傳主軸:更改單一物件、更新圖像內文字、清除動態模糊,同時讓其他一切——主體身份、光線、紋理——保持穩定。這種一致性正是其號稱 94% 多圖像角色一致性背後的機制(此為廠商自行報告,未經獨立驗證)。產品目標是打造一個只進行狹義編輯、完成即止的模型。

Bernini-Diffusers-v2 是一個「先規劃後渲染」的管線:Qwen2.5-VL 規劃器會將指令分解為語意步驟——改變天氣、替換風格、插入物體、保留主體——然後渲染器繪製結果。此設計針對複雜的多步驟指令,且相同的權重涵蓋文字轉影像、影像轉影像以及影片任務(t2i、i2i、t2v、v2v、rv2v、r2v)。廣度是其優點;而未量化的代價則是:7B 規劃器對於非常細微的編輯是一個真正的瓶頸,而且 ByteDance 以外的人尚未量化它如何處理這些編輯。

Screenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the README, the Apache-2.0 license, and the benchmark table with video-side metrics

文字渲染:實際的戰場

圖內文字(in-image text)正是現代影像編輯器展現其價值的所在,而在這方面,雙方的差距極為明顯。MAI-Image-2.5-Pro 的旗艦能力正是精確的文字渲染——微軟宣稱其在英文、中文、日文、韓文和西班牙文上的準確率達 96.8%(此為廠商自行呈報的數據;同一份文件中指出輸出上限接近一百萬像素,因此請將此數字視為方向性參考)。Bernini-Diffusers-v2 則完全沒有公布任何文字渲染準確率。對於需要產出在地化廣告、包裝設計或任何含有可辨識文字的內容的工作流程而言,一方提供了可量測的具體宣稱,另一方則什麼都沒提供。

成本,以及帳單的形狀

MAI-Image-2.5-Pro — 每百萬個文字輸入 token 收費 $5,每百萬個影像輸入 token 收費 $8,每百萬個影像輸出 token 收費 $106。每張影像的費用並未公布;根據 Artificial Analysis 的換算,一張 1024×1024 的影像約為每 1,000 張 $108.50。此為預覽版定價,GA 時可能有所變動。

Bernini-Diffusers-v2 — 權重雖然免費,但自行託管意味著需要 H100 等級的硬體(或雲端租用)、維持運行的運維工作,以及自行擴充規模。這套經濟模式與 API 模式相反:每天十張圖片很昂貴,而大量使用時則很便宜。

對大多數團隊來說,誠實的說法是:Bernini 的總持有成本只有在以下情況下才划算——你已經運行 GPU 機群,且工作負載又大又穩定。否則,費率較高的按量計費 API 才是比較便宜的失敗。

Screenshot of Microsoft's announcement of MAI-Image-2.5-Pro and MAI-Voice-2-Flash, the subject model's vendor page, showing the preview launch and family context

路由器在這裡能做與不能做的事

這兩種模型目前都無法透過 OrcaRouter 路由,原因正好相反:MAI-Image-2.5-Pro 位於 Microsoft Foundry 直接預覽的後方,而 Bernini-Diffusers-v2 根本不是一個端點——它只是權重。這在本次對決中作為一項原則至關重要:路由模式僅適用於此比較中屬於可呼叫 API 的那一半。當 MAI-Image-2.5-Pro 進入可呼叫的第三方 API 時,在不將生產路徑押注於預覽程式碼的前提下採用它的方式,是將一部分流量路由給它,並以經過驗證的模型作為自動故障轉移——在 OrcaRouter 上,這是一個端點,供應商價格以 0% 加價直接轉嫁,以及一個能攔截低票排行榜未能發現之問題的備援方案。開源權重的一方則沒有對應方案:你要麼自己運行 Bernini 的技術堆疊,要麼就別用它。

裁決

MAI-Image-2.5-Pro 是一款高階、可衡量、託管式的編輯器:在獨立評測榜上名列第一,具備真實的文字渲染實力,價格也與之相稱。Bernini-Diffusers-v2 是免費、廣泛、在圖像領域未經驗證的開放權重管線,還能處理影片——如果你自行託管,它確實很有意思;在有人執行公開圖像評測之前,它確實無法評分。如果你的工作流程需要可呼叫的 API 和一個你能捍衛的分數,選擇就是 MAI-Image-2.5-Pro 或它所擊敗的其他託管式編輯器。如果你的工作流程需要自主掌控,而且你能運行相應的硬體,Bernini-Diffusers-v2 值得測試——但要把它當作對未衡量潛力的一場賭注,而不是當作衡量過的第一名的競爭對手。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube