「Bernini-Diffusers-v2 對決 Qwen Image 3.0 的 Hero card,展示你可自行託管的 Apache-2.0 權重,對比一個可將文字渲染至約 10px 的封閉 API,標語為:同一份工作描述,在控制方面卻有相反的答案。」
Guides & Insights

Bernini-Diffusers-v2 對決 Qwen Image 3.0:你擁有的權重 vs 一個能渲染文字的 API

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩家中國實驗室在相隔三週內相繼發布了具備影像能力的模型,最終卻落在該類別最大分歧的兩端。Qwen-Image-3.0由阿里巴巴團隊於2026年7月21日發布,並於8月4日開放國際API,是一個透過HTTP呼叫的封閉權重影像模型。Bernini-Diffusers-v2是字節跳動在2026年8月13日未經公告就推到Hugging Face上的,採用Apache-2.0開放權重,可下載後自行執行。兩者大致工作描述相同——影像生成與編輯——但對於「誰控制模型」這個問題,答案截然相反。接下來的大部分內容都是這一個決定導致的結果,因此這正是本次比較的起點,而非終點。

權重分開

Qwen-Image-3.0 — 封閉權重。截至撰寫本文時,阿里巴巴尚未發布其權重或技術報告;您可以透過 Alibaba Cloud Bailian 或 Qwen 平台上的 API 使用它。輸出帶有 AIGC 來源標籤。您購買的是能力而非保管權:無法自架、無法微調、無法離線使用、無法檢視內部。

Bernini-Diffusers-v2——開放權重。採用 Apache-2.0 授權,包含 Hugging Face 上一個自足的 diffusers 目錄,以及 bytedance/Bernini 儲存庫中的本機推論腳本。你可以微調它、在 air-gapped(完全離線)環境中執行、將資料保留在自己的硬體上,並停止按張圖片付費。自行保管的代價是必須營運它:README 建議使用 Hopper 級 GPU 以及 Python 3.11.2 / PyTorch 2.7.1+cu126 技術棧。

對於圖像包含機密材料的團隊,或其合規規則禁止將數據傳送給第三方API的團隊,這種劃分本身就解決了爭論。

文字與版面保真度

Qwen-Image-3.0 真正與眾不同之處在於文字。根據阿里巴巴發布資料的頭條數字:

• 提示詞視窗 — 最多4,500 tokens的輸入量,是前一代的 4.5 倍,讓它能一次處理高密度的簡報內容,例如報紙頭版或九宮格知識圖譜br />• 小文字 — 可清晰渲染至約10px,包括數學符號、下標、上標和多行公式br />• 語言 — 原生渲染涵蓋12 種語言,以及 20 多種字型和 100 多種藝術風格,並熟悉常見的網頁、遊戲和軟體介面

Bernini-Diffusers-v2在其模型卡片上並未提出同等的文字與排版宣稱。它的優勢在別處——基於規劃的語意編輯與影片處理管線——而在一個以「精確渲染這份資訊圖表」為主要要求的任務上,Qwen-Image-3.0 是經實證的選擇,Bernini 則是未經驗證的選擇。

編輯深度

Qwen-Image-3.0——兼具生成與編輯,並提供一整套專業功能:古畫修復、全景生成、草圖轉簡報、多鏡頭分鏡。其賣點在於生產實用性——構圖穩定、細節逼真——而非特定的編輯架構。

Bernini-Diffusers-v2——透過語意規劃器進行編輯。Qwen2.5-VL 規劃器會將指令分解為「應更改哪些內容」的計畫,再由基於 Wan2.2 的渲染器繪製出來。對於複雜的多步驟編輯——「改變季節、更換汽車、保持取景」——這是極具吸引力的設計,而且它還延伸至競爭對手皆未觸及的影片任務(t2v、v2v、rv2v)。所有這些皆為廠商宣稱,尚未經公開驗證。

Two-column comparison scoreboard for Bernini-Diffusers-v2 and Qwen Image 3.0: weights, price, prompt window, text rendering, editing strengths, and hosted API availabilityScreenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the News and Highlights sections, including the v2 training-recipe change, and the start of the model card table

成本

Qwen-Image-3.0 — 約為 $0.025 每 1K 張圖片,在國際 API 上(約 0.18 元人民幣),支援最高 2048×2048 解析度輸出,每次呼叫最多可生成六張圖片。其定價旨在與 API 圖像生成市場的其他產品激烈競爭——僅為一年前高階託管圖像模型收費的一小部分。

Bernini-Diffusers-v2——免費權重、無每張圖片的費用,取而代之的是硬體帳單。經濟效益會隨數量反轉:偶爾生成圖片時自架伺服器並不划算,而生成越多就越划算,因為每多生成一張圖片的邊際成本趨近於零。

還有第三種成本有利於開放權重陣營,而且很容易被低估:轉換成本。封閉式 API 模型會將你鎖定在其定價、速率限制和路線圖中;而你擁有的模型則可以替換、修補或微調,無需重新協商任何事項。

你是以哪一個 API 為基礎來建置的?

Qwen-Image-3.0 僅提供 API,因此如果你基於它進行開發,就等於承諾在別人的基礎設施上按每張圖像計費——這正是 OrcaRouter 的轉嫁(pass-through)模式至關重要的地方。你在我們這邊看到的價格是 Alibaba 的目錄價,零加價,而且供應商降價當天就會生效,因此每張圖像的成本結構來自供應商,而不是轉售商疊加的加價。跨供應商的自動故障轉移是另一個關鍵點:當你的請求可以繞過故障時,一個在活動中途掛掉的圖像 API 就不再重要。如果你反而選擇開放權重路線,採用 Bernini-Diffusers-v2,那等於今天承擔營運負擔,換取零每圖像費用;而當未來有託管供應商採用這些權重時,同樣的轉嫁模式也適用於該供應商所收取的任何費用。

Decision card for the Bernini-Diffusers-v2 versus Qwen Image 3.0 matchup: Qwen Image 3.0 rents the capability as a text-accurate API at ~$0.025 per image with zero infrastructure; Bernini-Diffusers-v2 owns the model as Apache-2.0 weights that are self-hosted and fine-tunable but unverified

裁決

紙面上,Qwen-Image-3.0 是更強大的純影像模型:經過驗證的文字渲染、巨大的提示詞視窗、多語言版面保真度,以及具有競爭力的 API 價格。對於以文字為重、且工作流程以 API 為主的生產級影像生成需求,它是安全之選。Bernini-Diffusers-v2 則是你能真正擁有的模型——Apache-2.0 權重、可自架、可微調、支援影片——代價是你得自己營運,並信任一份無人複現過的基準測試表。要精確度與零基礎設施,選 Qwen-Image-3.0;要保管權與掌控權,選 Bernini-Diffusers-v2。一句話的決策法則:你想租用這項能力,還是擁有這個模型?

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube