
Bernini-Diffusers-v2 vs Qwen Image 3.0:你拥有的权重 vs 渲染文本的 API
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
两家中国实验室在不到三周的时间里相继发布了图像模型,却最终站在了这一类别最大分歧的两端。Qwen-Image-3.0由阿里巴巴团队于2026年7月21日发布,并于8月4日向国际API开放,是一个通过HTTP调用的闭源权重图像模型。Bernini-Diffusers-v2则被字节跳动于2026年8月13日悄无声息地推送到了Hugging Face,是采用Apache-2.0许可的开源权重模型,可供下载和运行。两者的大致职责相同——图像生成与编辑——但在“谁控制模型”这个问题上给出了相反的答案。接下来要讲的大部分内容都是这一单一决定的结果,因此这也是本次对比的起点,而非终点。
权重划分
• Qwen-Image-3.0——封闭权重。截至撰写本文时,阿里巴巴尚未发布其权重或技术报告;你可以通过阿里云百炼或Qwen平台上的API使用它。输出带有AIGC溯源标签。你所购买的是能力而非保管权:无法自托管、无法微调、无法离线使用、无法一探究竟。
• Bernini-Diffusers-v2——开放权重。Apache-2.0 许可,Hugging Face 上的自包含 diffusers 目录,以及 bytedance/Bernini 仓库中的本地推理脚本。你可以对其进行微调、离线运行、将数据保留在自己的硬件上,不再按图像数量付费。自行托管的代价是需要运维它:README 推荐使用 Hopper 级 GPU 和 Python 3.11.2 / PyTorch 2.7.1+cu126 技术栈。
对于图像包含机密材料,或合规规则禁止向第三方API发送数据的团队来说,这种分界本身就解决了争论。
文本和布局保真度
Qwen-Image-3.0真正独特之处在于文本。其关键数据来自阿里巴巴的发布材料:
• 提示窗口 — 最高可达 4,500 tokens 的输入量,是上一代的 4.5 倍,使其能够一次性处理信息密集的简报,如报纸头版或九宫格知识图谱br />• 小字文本 — 可清晰渲染至约 10px,包括数学符号、下标、上标和多行公式br />• 语言 — 原生渲染覆盖 12 种语言,配备 20 多种字体和 100 多种艺术风格,并熟悉常见的网页、游戏和软件界面
Bernini-Diffusers-v2在其模型卡上并未提出可与之相提并论的文本与布局能力声明。它的优势在别处——基于规划的语义编辑与视频流水线——而对于以“准确渲染此信息图”为主要诉求的任务,Qwen-Image-3.0 是已被验证的选择,Bernini 则是未经证实的那一个。
编辑深度
• Qwen-Image-3.0——兼具生成与编辑功能,并拥有一系列专业技巧:古画修复、全景生成、草图转PPT、多镜头分镜。其卖点是生产实用性——布局经得起推敲、细节真实可信——而非某种特定的编辑架构。
• Bernini-Diffusers-v2——通过语义规划器进行编辑。Qwen2.5-VL 规划器将指令分解为“应更改什么”的计划,然后基于 Wan2.2 的渲染器将其绘制出来。对于复杂、多步骤的编辑(例如“更换季节、替换汽车、保持取景”)来说,这是一种很有说服力的设计,并且它扩展到视频任务(t2v、v2v、rv2v),而这些是任何竞争对手都未涉及的。以上全部来自厂商报告,尚未经过公开验证。


成本
• Qwen-Image-3.0——大约每1K张图像0.025美元,在国际API上(约0.18元),最高支持2048×2048输出,每次调用最多六张图像。其定价旨在与API图像市场的其他产品激烈竞争——仅为一年前高端托管图像模型收费的一小部分。
• Bernini-Diffusers-v2 — 免费权重,无按图收费,取而代之的是硬件开销。其经济性随用量反转:偶尔生成图片时自托管并不划算,而生成越多越划算,因为每多生成一张图片的边际成本趋近于零。
还有第三种成本,它偏向开放权重一方,而且很容易被低估:切换成本。封闭的 API 模型会把你锁死在它的定价、速率限制和路线图上;而你自己拥有的模型则可以随意替换、修补或微调,无需重新协商任何条件。
你基于哪个API进行构建?
Qwen-Image-3.0 仅提供 API,因此如果你基于它进行构建,就等于承诺在他人基础设施上按图计费——这正是 OrcaRouter 直通模式的关键所在。你在我们这边看到的价格是阿里巴巴的标价,加价率为 0%,供应商降价当天即同步生效,因此单张图片的成本完全取决于供应商本身,而不是转售商在中间加价。跨提供商的自动故障转移是另一半优势:当你的调用能够绕行时,一个在活动期间宕机的图像 API 就不再构成问题。如果你转而选择开放权重路线,使用 Bernini-Diffusers-v2,那等于今天就承担运维负担,以换取零按图费用;当托管服务提供商最终采用这些权重时,同样的直通模式也适用于该提供商的任何收费标准。

裁决
从纸面上看,{{1}}Qwen-Image-3.0{{/1}} 是更强的纯图像模型:经过验证的文本渲染、巨大的提示词窗口、多语言布局保真度,以及有竞争力的 API 价格。对于需求文本密集、工作流以 API 为核心的生产级图像生成,它是稳妥的选择。{{2}}Bernini-Diffusers-v2{{/2}} 是你可以真正拥有的模型——{{3}}Apache-2.0{{/3}} 权重、可自托管、可微调、支持视频——代价是自己运维,并相信一张无人复现过的基准测试表。选择 {{1}}Qwen-Image-3.0{{/1}} 是为了准确性和零基础设施;选择 {{2}}Bernini-Diffusers-v2{{/2}} 是为了掌控权和自主性。一句话决策规则:你是想租用能力,还是拥有模型?
