
Bernini-Diffusers-v2 對決 Qwen Image 3.0:你擁有的權重 vs 一個能渲染文字的 API
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
兩家中國實驗室在相隔三週內相繼發布了具備影像能力的模型,最終卻落在該類別最大分歧的兩端。Qwen-Image-3.0由阿里巴巴團隊於2026年7月21日發布,並於8月4日開放國際API,是一個透過HTTP呼叫的封閉權重影像模型。Bernini-Diffusers-v2是字節跳動在2026年8月13日未經公告就推到Hugging Face上的,採用Apache-2.0開放權重,可下載後自行執行。兩者大致工作描述相同——影像生成與編輯——但對於「誰控制模型」這個問題,答案截然相反。接下來的大部分內容都是這一個決定導致的結果,因此這正是本次比較的起點,而非終點。
權重分開
• Qwen-Image-3.0 — 封閉權重。截至撰寫本文時,阿里巴巴尚未發布其權重或技術報告;您可以透過 Alibaba Cloud Bailian 或 Qwen 平台上的 API 使用它。輸出帶有 AIGC 來源標籤。您購買的是能力而非保管權:無法自架、無法微調、無法離線使用、無法檢視內部。
• Bernini-Diffusers-v2——開放權重。採用 Apache-2.0 授權,包含 Hugging Face 上一個自足的 diffusers 目錄,以及 bytedance/Bernini 儲存庫中的本機推論腳本。你可以微調它、在 air-gapped(完全離線)環境中執行、將資料保留在自己的硬體上,並停止按張圖片付費。自行保管的代價是必須營運它:README 建議使用 Hopper 級 GPU 以及 Python 3.11.2 / PyTorch 2.7.1+cu126 技術棧。
對於圖像包含機密材料的團隊,或其合規規則禁止將數據傳送給第三方API的團隊,這種劃分本身就解決了爭論。
文字與版面保真度
Qwen-Image-3.0 真正與眾不同之處在於文字。根據阿里巴巴發布資料的頭條數字:
• 提示詞視窗 — 最多4,500 tokens的輸入量,是前一代的 4.5 倍,讓它能一次處理高密度的簡報內容,例如報紙頭版或九宮格知識圖譜br />• 小文字 — 可清晰渲染至約10px,包括數學符號、下標、上標和多行公式br />• 語言 — 原生渲染涵蓋12 種語言,以及 20 多種字型和 100 多種藝術風格,並熟悉常見的網頁、遊戲和軟體介面
Bernini-Diffusers-v2在其模型卡片上並未提出同等的文字與排版宣稱。它的優勢在別處——基於規劃的語意編輯與影片處理管線——而在一個以「精確渲染這份資訊圖表」為主要要求的任務上,Qwen-Image-3.0 是經實證的選擇,Bernini 則是未經驗證的選擇。
編輯深度
• Qwen-Image-3.0——兼具生成與編輯,並提供一整套專業功能:古畫修復、全景生成、草圖轉簡報、多鏡頭分鏡。其賣點在於生產實用性——構圖穩定、細節逼真——而非特定的編輯架構。
• Bernini-Diffusers-v2——透過語意規劃器進行編輯。Qwen2.5-VL 規劃器會將指令分解為「應更改哪些內容」的計畫,再由基於 Wan2.2 的渲染器繪製出來。對於複雜的多步驟編輯——「改變季節、更換汽車、保持取景」——這是極具吸引力的設計,而且它還延伸至競爭對手皆未觸及的影片任務(t2v、v2v、rv2v)。所有這些皆為廠商宣稱,尚未經公開驗證。


成本
• Qwen-Image-3.0 — 約為 $0.025 每 1K 張圖片,在國際 API 上(約 0.18 元人民幣),支援最高 2048×2048 解析度輸出,每次呼叫最多可生成六張圖片。其定價旨在與 API 圖像生成市場的其他產品激烈競爭——僅為一年前高階託管圖像模型收費的一小部分。
• Bernini-Diffusers-v2——免費權重、無每張圖片的費用,取而代之的是硬體帳單。經濟效益會隨數量反轉:偶爾生成圖片時自架伺服器並不划算,而生成越多就越划算,因為每多生成一張圖片的邊際成本趨近於零。
還有第三種成本有利於開放權重陣營,而且很容易被低估:轉換成本。封閉式 API 模型會將你鎖定在其定價、速率限制和路線圖中;而你擁有的模型則可以替換、修補或微調,無需重新協商任何事項。
你是以哪一個 API 為基礎來建置的?
Qwen-Image-3.0 僅提供 API,因此如果你基於它進行開發,就等於承諾在別人的基礎設施上按每張圖像計費——這正是 OrcaRouter 的轉嫁(pass-through)模式至關重要的地方。你在我們這邊看到的價格是 Alibaba 的目錄價,零加價,而且供應商降價當天就會生效,因此每張圖像的成本結構來自供應商,而不是轉售商疊加的加價。跨供應商的自動故障轉移是另一個關鍵點:當你的請求可以繞過故障時,一個在活動中途掛掉的圖像 API 就不再重要。如果你反而選擇開放權重路線,採用 Bernini-Diffusers-v2,那等於今天承擔營運負擔,換取零每圖像費用;而當未來有託管供應商採用這些權重時,同樣的轉嫁模式也適用於該供應商所收取的任何費用。

裁決
紙面上,Qwen-Image-3.0 是更強大的純影像模型:經過驗證的文字渲染、巨大的提示詞視窗、多語言版面保真度,以及具有競爭力的 API 價格。對於以文字為重、且工作流程以 API 為主的生產級影像生成需求,它是安全之選。Bernini-Diffusers-v2 則是你能真正擁有的模型——Apache-2.0 權重、可自架、可微調、支援影片——代價是你得自己營運,並信任一份無人複現過的基準測試表。要精確度與零基礎設施,選 Qwen-Image-3.0;要保管權與掌控權,選 Bernini-Diffusers-v2。一句話的決策法則:你想租用這項能力,還是擁有這個模型?
