
Bernini-Diffusers-v2 vs Qwen Image 3.0:你拥有的权重 vs 渲染文本的 API
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 362 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
两家中国实验室在不到三周的时间里相继发布了图像模型,却最终站在了这一类别最大分歧的两端。Qwen-Image-3.0由阿里巴巴团队于2026年7月21日发布,并于8月4日向国际API开放,是一个通过HTTP调用的闭源权重图像模型。Bernini-Diffusers-v2则被字节跳动于2026年8月13日悄无声息地推送到了Hugging Face,是采用Apache-2.0许可的开源权重模型,可供下载和运行。两者的大致职责相同——图像生成与编辑——但在“谁控制模型”这个问题上给出了相反的答案。接下来要讲的大部分内容都是这一单一决定的结果,因此这也是本次对比的起点,而非终点。
权重划分
• Qwen-Image-3.0——封闭权重。截至撰写本文时,阿里巴巴尚未发布其权重或技术报告;你可以通过阿里云百炼或Qwen平台上的API使用它。输出带有AIGC溯源标签。你所购买的是能力而非保管权:无法自托管、无法微调、无法离线使用、无法一探究竟。
• Bernini-Diffusers-v2——开放权重。Apache-2.0 许可,Hugging Face 上的自包含 diffusers 目录,以及 bytedance/Bernini 仓库中的本地推理脚本。你可以对其进行微调、离线运行、将数据保留在自己的硬件上,不再按图像数量付费。自行托管的代价是需要运维它:README 推荐使用 Hopper 级 GPU 和 Python 3.11.2 / PyTorch 2.7.1+cu126 技术栈。
对于图像包含机密材料,或合规规则禁止向第三方API发送数据的团队来说,这种分界本身就解决了争论。
文本和布局保真度
Qwen-Image-3.0真正独特之处在于文本。其关键数据来自阿里巴巴的发布材料:
• 提示窗口 — 最高可达 4,500 tokens 的输入量,是上一代的 4.5 倍,使其能够一次性处理信息密集的简报,如报纸头版或九宫格知识图谱br />• 小字文本 — 可清晰渲染至约 10px,包括数学符号、下标、上标和多行公式br />• 语言 — 原生渲染覆盖 12 种语言,配备 20 多种字体和 100 多种艺术风格,并熟悉常见的网页、游戏和软件界面
Bernini-Diffusers-v2在其模型卡上并未提出可与之相提并论的文本与布局能力声明。它的优势在别处——基于规划的语义编辑与视频流水线——而对于以“准确渲染此信息图”为主要诉求的任务,Qwen-Image-3.0 是已被验证的选择,Bernini 则是未经证实的那一个。
编辑深度
• Qwen-Image-3.0——兼具生成与编辑功能,并拥有一系列专业技巧:古画修复、全景生成、草图转PPT、多镜头分镜。其卖点是生产实用性——布局经得起推敲、细节真实可信——而非某种特定的编辑架构。
• Bernini-Diffusers-v2——通过语义规划器进行编辑。Qwen2.5-VL 规划器将指令分解为“应更改什么”的计划,然后基于 Wan2.2 的渲染器将其绘制出来。对于复杂、多步骤的编辑(例如“更换季节、替换汽车、保持取景”)来说,这是一种很有说服力的设计,并且它扩展到视频任务(t2v、v2v、rv2v),而这些是任何竞争对手都未涉及的。以上全部来自厂商报告,尚未经过公开验证。


成本
• Qwen-Image-3.0——大约每1K张图像0.025美元,在国际API上(约0.18元),最高支持2048×2048输出,每次调用最多六张图像。其定价旨在与API图像市场的其他产品激烈竞争——仅为一年前高端托管图像模型收费的一小部分。
• Bernini-Diffusers-v2 — 免费权重,无按图收费,取而代之的是硬件开销。其经济性随用量反转:偶尔生成图片时自托管并不划算,而生成越多越划算,因为每多生成一张图片的边际成本趋近于零。
还有第三种成本,它偏向开放权重一方,而且很容易被低估:切换成本。封闭的 API 模型会把你锁死在它的定价、速率限制和路线图上;而你自己拥有的模型则可以随意替换、修补或微调,无需重新协商任何条件。
你基于哪个API进行构建?
Qwen-Image-3.0 仅提供 API,因此如果你基于它进行构建,就等于承诺在他人基础设施上按图计费——这正是 OrcaRouter 直通模式的关键所在。你在我们这边看到的价格是阿里巴巴的标价,加价率为 0%,供应商降价当天即同步生效,因此单张图片的成本完全取决于供应商本身,而不是转售商在中间加价。跨提供商的自动故障转移是另一半优势:当你的调用能够绕行时,一个在活动期间宕机的图像 API 就不再构成问题。如果你转而选择开放权重路线,使用 Bernini-Diffusers-v2,那等于今天就承担运维负担,以换取零按图费用;当托管服务提供商最终采用这些权重时,同样的直通模式也适用于该提供商的任何收费标准。

裁决
从纸面上看,{{1}}Qwen-Image-3.0{{/1}} 是更强的纯图像模型:经过验证的文本渲染、巨大的提示词窗口、多语言布局保真度,以及有竞争力的 API 价格。对于需求文本密集、工作流以 API 为核心的生产级图像生成,它是稳妥的选择。{{2}}Bernini-Diffusers-v2{{/2}} 是你可以真正拥有的模型——{{3}}Apache-2.0{{/3}} 权重、可自托管、可微调、支持视频——代价是自己运维,并相信一张无人复现过的基准测试表。选择 {{1}}Qwen-Image-3.0{{/1}} 是为了准确性和零基础设施;选择 {{2}}Bernini-Diffusers-v2{{/2}} 是为了掌控权和自主性。一句话决策规则:你是想租用能力,还是拥有模型?
