用于 FLUX 3 Image 与 Bernini-Diffusers-v2 对比的标题卡,将“FLUX 3 Image——2026 年 10 月 1 日上线,1K 每张图像 $0.048,位于 api.bfl.ai”与“Bernini-Diffusers-v2——Apache-2.0 权重,仅支持自托管,无托管 API”进行对比,并指出 OrcaRouter 两者均不路由。OrcaRouter 标志位于右下角。
Guides & Insights

FLUX 3 Image 与 Bernini-Diffusers-v2:付费端点与可下载仓库的对比

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

FLUX 3 Image 和 Bernini-Diffusers-v2 都是今天就能完整获取的图像模型,而且它们都不是可以租用的产品。FLUX 3 Image 于 2026 年 10 月 1 日上线,网址为 api.bfl.ai/v1/flux-3-image,有公布的价目表,却没有公布的评分。Bernini-Diffusers-v2 于 2026 年 8 月 13 日在 Apache-2.0 许可下发布到 Hugging Face,有公布的评分,但除了自己的 GPU 之外别无调用方式。一个附带发票,另一个附带 Python 版本锁定。

这种分野构成了整个对比的核心,值得精确对待,因为通常的“托管 vs 开放权重”框架在这里并不适用。Bernini 不是那种可以直接塞进现有推理栈的开放权重模型。它是一个两阶段系统——位于 Wan2.2-T2V-A14B 扩散解码器之前的 Qwen2.5-VL-7B 规划器——其 v2 版本只是一次训练调度上的修复,而非新的能力层级。FLUX 3 Image 则是一个单一端点,却外挂了异常繁多的控制面:空间定位、0–1000 的坐标网格,以及框选范围的编辑——由你指定哪些区域得以保留。是形态不同的东西。

每一个到底是什么

• FLUX 3 Image — Black Forest Labs' image tier of its unified FLUX 3 family, released October 1, 2026. One HTTP POST to https://api.bfl.ai/v1/flux-3-image with an x-key header; only prompt is required. The call returns a polling URL, and a finished 4K render can take several minutes. Generated samples are downloadable for one hour.

• Bernini-Diffusers-v2 — ByteDance 的规划器加渲染器技术栈,于 2026 年 8 月 13 日推送到 Hugging Face,未附带任何公告。该仓库带有 image-text-to-video 标签,并依赖 diffusers。列出的任务有:文本到图像、图像到图像、文本到视频、视频到视频、参考到视频和参考到图像。没有托管推理服务,也没有价目表——入门路径是 hf download 和一个 Gradio 应用。

• 分发鸿沟——FLUX 3 Image 是你调用的按量计费服务。Bernini 是你自己部署的代码仓库。在任何质量问题还值得一问之前,这两者一个需要 Hopper 级 GPU,另一个只需要一张信用卡。

许可授权正是这两者分歧最大的地方

Bernini-Diffusers-v2 在仓库层面采用 Apache-2.0。对于自托管流水线来说,这一点至关重要:没有按图像计费的计量,无需协商商业协议,也无需用量报告。你只需支付电费和调度器时间,而第一万张图像的边际成本与第一张相同。

FLUX 3 Image 并非开放权重,而 Black Forest Labs 明确表示这只是暂时的。商业权重目前可以在经协商达成的 BFL 许可下获取,而公开的开放权重版本则据称将在接下来几周内发布。这是一个有大体轮廓但没有具体日期的承诺,也是本页最需要重新核实而非想当然的最重要一点。如果你正在为未来两年选择图像技术栈,许可证问题很可能比 Elo 问题更重要——但前提是你准备自行运行一个两阶段的视频原生扩散技术栈。

控制方式:边界框与提示词增强对比

这场对比中真正有意思的地方就在这里,因为这两个模型解决“让它精确到达那里”的方式截然不同。

FLUX 3 Image 会在提示词后追加一个 JSON 数组。坐标在两个轴上都基于 0–1000 的网格,每个框写作 [top, left, bottom, right]。你需要提供一个元素表,其中每个元素都包含 id、bbox 和 desc,另外还要提供一个全局描述,通过名称引用这些 id。在 BFL 自己的示例中,id 形如 animal_1 和 silhouette_1;描述会直接引用它们。在生成调用之上有一个 grounding,默认开启,它会在生成之前运行网络和图像搜索。

FLUX 3 Image 随后将同一坐标系扩展到编辑中。你无需发送蒙版,而是发送一组以框为范围的操作:保留(源框到同一框,来源于 ref_image_0),移动(源框到新的目标框),新建(无源,根据描述生成目标框——添加、替换或重新着色)以及 移除(源框到空目标)。多个操作可放入同一个请求中。

这个限定条件很重要。BFL 的文档称,编辑框之外的像素“通常保持完全一致”。通常。这是一个措辞中自带保留余地的保真声明,而这样发布声明是诚实的做法,也正是你应当在自己的画面上测试、而不是相信演示的原因。

Bernini 没有对应的面向用户的坐标语言。它的参考引导编辑在 v2 中有所改进,原因是训练上的变化——在协同训练开始之前,连接器模块会先进行数千步的预热——字节跳动报告称,这一变化体现为更好的参考引导编辑和 OpenS2V 性能。它是在现有架构内部进行的质量修复,而不是新的控制界面。如果你的工作流依赖于告诉模型要保留哪个矩形区域,那么这两者中只有一个能回答这个问题。

Screenshot of Black Forest Labs' FLUX 3 Image model page, headed 'Maximum control over every pixel', showing the bounding-box and region-editing feature list for the October 1, 2026 image release

这些数字支持什么、不支持什么

Bernini-Diffusers-v2 的页面上有一张七项指标表,将 v2 与 v1 进行对比,其中每个数字均为厂商自行报告。方向好坏参半,这一点值得明说:

• 上升 — OpenS2V 63.83(此前为 62.30),VBench 84.46(此前为 84.37),Bernini-rv2v 3.55(此前为 3.48)。

• 持平 — EditVerse 8.02 保持不变,Bernini-v2v 3.49 保持不变。

• 降级 — OpenVE 3.96,由 4.03 降至。

该页面还称,v2 在内部盲测人类两两对比竞技场中,位居领先闭源商用模型的第一梯队。这一点在字节跳动外部无法核实,应被视为营销宣传,而非测量结果。三个真正的进展就是上文列出的那些,而且它们是同一实验室针对自家 v1 自行报告的。

FLUX 3 Image 目前完全没有数据。Artificial Analysis 的文生图榜单和其编辑榜单分别在 10 月 1 日和 2026-10-02 进行过核查,两者都没有 FLUX 3 Image 这一行——这些榜单上的 BFL 条目止于 FLUX.2 一档,其中 FLUX.2 [max] 在生成榜上以 1021 Elo 位居,在编辑榜上为 996。FLUX.2 [dev] 则以恰好 1000 锚定两个榜单。因此,就目前而言,关于 FLUX 3 Image 画质最诚实的说法是:Black Forest Labs 之外没有任何人发布过它的分数,而现有最接近的参照点就是它的上一代。

这种不对称正是这一比较中实际存在的陷阱。Bernini 的数据由厂商自行发布,但它们确实存在,并且具有方向性参考价值。FLUX 3 Image 的数据则付之阙如。数据缺失并不等于失败——该模型才问世一天——但这确实意味着,目前支撑 FLUX 3 Image 编辑能力这一说法的唯一证据,来自销售它的那家公司。

价格方面,这一点完全不对称

FLUX 3 Image 按图像计费,并根据分辨率层级定价,供应商的费率卡列出了五个层级:

• 768sq — 标价 $0.041,发布窗口期内为 $0.0205。

• 1K(默认)—— 标价 $0.048,优惠价 $0.024。

• 1.5K — 标价 $0.07,优惠价 $0.035。

• 2K — 标价 $0.10,优惠价 $0.05。

• 4K — 标价 $0.607,优惠价 $0.3035。

Screenshot of Black Forest Labs' pricing page captured October 2, 2026, showing the FLUX 3 Image tab and its per-image rates by resolution tier, from 768sq through 4K

参考图像和提示词长度均不额外收费,被拒绝、失败或被审核拦截的请求也不计费——这一点在这里比平时更为重要,因为 4K 调用很慢,而中途放弃请求的诱惑确实存在。首发定价从 10 月 1 日 15:00 UTC 持续到 10 月 8 日 15:00 UTC。从 2K 到 4K 的标价跃升达 6.07 倍,远超像素数量之比,因此你选择哪个分辨率档位,是整个 API 中最关键的成本决策。

这些层级追踪的是像素预算,而不是固定画幅。BFL 的示例输出为 5456 × 3072,约 16.8 兆像素,而 UHD 2160p 为 8.3 兆像素——所以这里的“4K”命名的是一个预算,输出尺寸会舍入到 16 的倍数,实际数值以 output_mp。

Bernini 的价格是按图像为零,且不按小时计费。使用八块 GPU 进行序列并行推理,推荐使用 Hopper 级芯片,Python 3.11.2 搭配 PyTorch 2.7.1 和 CUDA 12.6。与 1K 分辨率下每张图像 $0.048 相比的盈亏平衡点,大约在每月数千张图像左右,完全取决于你为算力支付多少——这是一个真实的数字,而非修辞上的数字。如果你已经在运行推理基础设施,Bernini 的边际图像成本几乎为零。如果没有,FLUX 3 Image 端点比搭建两阶段扩散模型要便宜得多。

路由:这两个都不在我们的产品目录中

值得直说,因为这类说法很快就会过时。OrcaRouter 不路由 FLUX 3 Image,也不路由 Bernini-Diffusers-v2。调用 FLUX 3 Image 意味着直接调用 Black Forest Labs 自己的端点。调用 Bernini 意味着自己部署它。

在像这样的流水线中,OpenAI 兼容路由器真正要负责的,是图像调用两侧的一切。图像描述或提示词重写环节、根据需求简报检查渲染结果的视觉模型、将已批准的静帧制作成动画的视频模型、对输出进行分类的小型文本模型——在这些步骤中,如果能够用一个字符串、一个密钥切换提供商,并且当某个提供商服务降级时让请求自动故障转移,就能省去大量维护工作。OrcaRouter 按提供商的标价原样传递,不加价,因此当供应商降价时,变更当天就会生效,而不是等经销商重新定价;路由 DSL 让你无需改动应用代码就能固定某个特定模型或定义回退顺序。这些都不能让 FLUX 3 Image 变得可路由。这仅仅意味着流水线其余部分无需关心是哪款模型生成了这张静帧。

Screenshot of the Artificial Analysis text-to-image leaderboard, showing FLUX.2 [max] at 1021 Elo and FLUX.2 [dev] fixed as the 1000 anchor, with no FLUX 3 Image entry anywhere on the board

应该基于哪一个来构建

三个问题清晰地区分了这些,且它们没有共同的答案。

你需要控制各个元素放在什么位置吗?FLUX 3 Image 是两者中唯一具备坐标语言的,其以框为作用域的编辑操作——保留、移动、添加、删除——与文本指令式编辑是一种真正不同的交互界面。如果你的工作涉及合成、版式或产品图像,且其中各区域必须保持不变,那么这一点就是决定性的;而“通常会保持一致”这种模糊表述,是需要你去实测而非想当然接受的。

在做出承诺之前,你需要知道它有多好吗?Bernini 有数据,全部由供应商报告,而且走势好坏参半。FLUX 3 Image 则没有。如果你无法自行评估,你就是在有实测数据的模型和没有实测数据的模型之间做选择,而有实测数据的那个是较旧的架构。

你能运行一个两阶段扩散栈吗?那才是 Bernini 真正的门槛。一个 Qwen2.5-VL-7B 规划器为一个 Wan2.2-T2V-A14B 解码器提供输入,在 Hopper GPU 上运行,并带有一个指向 OpenAI 兼容端点的提示词增强器钩子。许可证很宽松,但计算账单可不是。如果你做不到,这个问题就没有意义,而每张图 $0.048 就是答案。

最快改变这个页面的因素,是 BFL 开放 FLUX 3 Image 的权重,而公司表示这还要等数周。这会让许可上的不对称从决定性的变为轻微的,并让控制面差异成为真正的比较点。在那之前,准确的总结是:这是两个好模型,却有着相反的分发模式;而人们做出选择时,早在根据质量做决定之前,就已经根据许可和控制做出了决定。