
FLUX 3 Image 对比 FLUX 3:两个名称,两款产品,相隔九周
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
自2026年10月1日起,“FLUX 3”一直指代两种不同的东西,而第二种含义才是带有价目表的那个。FLUX 3 Image是当天上线的图像层级,地址为api.bfl.ai/v1/flux-3-image,按图像计费,每张 0.041 美元起。FLUX 3则是它所属的更庞大的事物——Black Forest Labs 于 2026 年 7 月 23 日宣布、此后分部件交付的统一多模态模型,其中视频和一个机器人动作头是已经投入生产运行的部分。这不是旗舰与其较小同级产品之间的比较。这是整个家族与其三个工作部件之一之间的比较。
这种区分很容易被忽略,而 BFL 自己的命名方式也帮不上忙:系列页面、视频文档、许可条款和 API 参考在某些地方都写着 FLUX 3,但实际上它们指的是更窄的范围。如果你读过一份 FLUX 3 规格表,却仍不确定它描述的是图像模型、视频模型还是一个研究项目,那并不是你粗心。这两个名称都在被积极使用,指代的是同一发布版本中相互重叠的子集。
两个重要的日期
• 2026年7月23日—— FLUX 3 在 Early Access 标签下发布。一个 Self-Flow 统一架构,涵盖图像、视频和音频生成以及动作预测。有意思的是算力披露:超过 95% 的训练算力用于视频,而分配给音频的 token 不足 0.5%。
• 2026年10月1日——图像层级将作为按量计费的端点开放。这使得从发布公告到大多数人以为“FLUX 3”所指的那种模态真正到来之间,留下了大约十周的空白期。
读懂这一算力分配,就能看出 Black Forest Labs 认为真正的难题在哪里。一个把几乎所有训练预算都花在视频上的模型家族,并不是在为静态图像做优化、把动态视为附带的延伸。情况恰恰相反,图像层级继承的,是视频优先的训练所产出的一切。

每个层级是什么,以及它的费用是多少
7月宣布的四种模态中已有三种上线。图像层级是最新推出的,也是唯一一种行为方式类似传统付费API的。
• FLUX 3 Image — 一次 POST 请求、一个 x-key 请求头,外加一个用于轮询的返回 URL。按分辨率档位逐张计费:768sq 为 $0.041,1K(默认)为 $0.048,1.5K 为 $0.07,2K 为 $0.10,4K 为 $0.607。上线优惠 50% 折扣持续至 10 月 8 日 15:00 UTC。参考图和提示词长度均包含在内;失败和被审核拦截的请求不计费。它最多接受十张参考图,每张介于 256×256 像素到 16 兆像素之间。
• FLUX 3 Video——现已全面开放,按秒计费而非按图像计费。文生视频和图生视频在 Draft HD 下为 $0.06/秒,HD 为 $0.17/秒,FHD 为 $0.29/秒,QHD 为 $0.40/秒,UHD 为 $0.80/秒,而视频转视频的价格则全面更高。片段时长最长可达 20 秒,并带原生同步音频,模式包括关键帧转视频和续写。Draft 模式仅支持 HD。QHD 和 UHD 输出已于 2026 年 9 月 10 日推出。
• FLUX 3 Action——一个 7B 世界-动作模型,也是 FLUX 3 中唯一可以下载参数的组成部分。2026 年 9 月 22 日,Hugging Face 上出现了三个检查点:一个基础检查点、一个 SO-101 机械臂变体和一个 DROID 变体。其访问权限面向合作伙伴受控开放,而非完全开放,已展示的用途是机器人操作。
• 尚未发布的内容——FLUX 3 开放权重主干模型。BFL 的自托管层级目前仍仅涵盖 FLUX.2 [klein] 和 FLUX.2 [dev]。具体到图像层级,商用权重需通过协商许可获取,而公开的开放权重据称还需数周才会推出。
没人会做的成本比较

按图片和按秒计费看起来没法比,而这正是值得算一次的原因。
五秒钟的标准 HD 文本转视频为 0.85 美元。五秒钟的 UHD 为 4.00 美元。图像档位的单张 4K 静帧标价为 0.607 美元,在发布窗口期内为 0.3035 美元——虽然图像档位的“4K”指的是像素预算,而非固定帧(BFL 的示例输出为 5456 × 3072,约 1680 万像素,而 UHD 2160p 为 830 万),但它与视频档位按秒计费所生成内容的分辨率处于同一数量级。
结果是,生成一个 UHD 关键帧的成本只是生成一秒 UHD 视频的一小部分,而关键帧正是你在迭代时会反复生成的东西。如果你的流程是“先把画面弄对,再让它动起来”,那么图像层就是成本更低的那一半,而且低了不止一个数量级,同时它也是可供使用时间最短的那一半。
图像侧有一个视频侧没有的注意事项。一次 4K 图像调用可能需要几分钟,而返回的样本可下载一小时。处理缓慢,并且结果可在一小时内取回,这与视频任务是不同的运行形态,而正是这类细节决定了批处理流水线是否需要队列。
边界框存在于这两个名称之一。
操纵面不在各层级之间共享,这是该名称与系列之间最显著的实际差异。
图像层级会接收附加在提示词后的 JSON 数组,两个轴的坐标都基于 0–1000 的网格,每个框写作[top, left, bottom, right]。你传入一个元素表,其中每个元素带有id、一个bbox和一个desc,以及一段引用这些 id 的全局说明文字——BFL 的示例使用像animal_1这样的名称。同一套坐标系统也驱动编辑:保留某个区域、移动某个区域、在目标框中生成一个新区域,或移除某个源框。多个操作可以放在单个请求中,由ref_image_0指代引用列表中的第一个条目。文档称,编辑框之外的像素“通常保持完全相同”——这个含糊其辞的说法值得按字面理解。
在图像层级中,接地默认开启:生成之前会先运行网页和图像搜索。输出尺寸会舍入到 16 的倍数,实际数值通过 output_mp 返回。
这些都不出现在视频层级的参数里。FLUX 3 Video 有自己的控制体系——关键帧、续接、首帧与末帧条件控制——但没有坐标语言。这些部分共享的是架构,而不是接口。
仔细阅读供应商自己的对比
Black Forest Labs 发布了 FLUX 3 Video 的偏好结果,这些结果值得连同其出处一并引用。这些运行由厂商执行,属于初步结果,评分依据是 10 秒 720p 输出上的胜率:
• 对比 Luma Ray 3.2 — 93% 的用户更偏好 FLUX 3 Video。
• 对比 Runway Gen-4.5 — 77%。
• 对比 Grok Imagine Video — 69%。
• 对比 Kling v3 Pro — 60%。
• 对比 Happy Horse v1 和 v1.1——59% 和 57%。
• 对 Seedance 2.0 与 Gemini Omni Flash——分别约为 52%,即便该数字高于半数,实质上仍属统计上的平局。
那份列表中从93%一路降到52%的跨度,比任何单独一行都更能说明问题。除BFL之外,还没有人做过这些比较,而底部那些低于55%的结果,才真正告诉你这个模型在哪些地方受到挑战。
FLUX 3 Image 完全没有对应的数字。Artificial Analysis 的文生图与编辑榜单分别于 2026 年 10 月 1 日和 10 月 2 日进行了核查,两者均未收录 FLUX 3 Image 的条目。BFL 公布的分数仍然止步于 FLUX.2 系列:FLUX.2 [max] 在生成榜上为 1021 Elo,在编辑榜上为 996,而 FLUX.2 [dev] 在两榜上均固定为 1000 的基准锚点。该图像层级问世仅一天,尚无实测数据。
![Screenshot of the Artificial Analysis text-to-image leaderboard captured October 2, 2026, listing FLUX.2 [max], FLUX.2 [flex] and FLUX.2 [dev] as the 1000-point anchor, with no FLUX 3 Image row present](https://cms.orcarouter.ai/api/media/file/4-1496.png)
在名称之间进行选择
与其说这个选择关乎哪个模型更好,不如说它关乎你的问题属于三档已发布层级中的哪一档。
如果你需要具有空间控制的静帧,FLUX 3 Image 是唯一具有坐标语言的档位,而且每张 1K 图像 0.048 美元,它足够便宜,可以好好评估,而不是争论不休。从那里开始,在你自己的帧上测试“通常保持相同”的说法,并留意当你设定批次大小时,2K 到 4K 的标价跃升 6.07 倍。
如果你需要动态画面,FLUX 3 Video 是一款按量计费的产品,提供最高可达 UHD 的分辨率档位,并可生成时长 20 秒、带同步音频的片段。请将它与其旨在取代的那些模型进行比较,而不是与图像档位比较——它们彼此并非替代关系。
如果你需要权重,如今在合作伙伴协议下是 FLUX 3 Action,否则就是 FLUX.2。视频层级和图像层级都无法下载,而图像层级的开放发布只是一项没有日期的意向声明。
FLUX 3 和 FLUX 3 Image 都不在 OrcaRouter 的模型目录中,因此调用其中任何一个都意味着直接对接 Black Forest Labs。对于围绕这一模型家族搭建的流水线来说,一个厂商中立的路由器所带来的价值,在于生成调用之外的那一层:提示词改写、将渲染结果与需求简报进行比对的视觉检查、把输出分入接受与拒绝两类桶的分类器。这些步骤的变动频率远高于图像模型本身,而要在同一个 OpenAI 兼容端点背后更换提供方——按提供方原样透传、不加价的列表价格,后端性能下降时自动故障转移,以及当你希望有意固定或回退时使用的路由 DSL——正是流水线能否跟随市场变化、还是每次模型被弃用都得重新部署的分水岭。
坦诚的收尾是一种命名惯例。当有人说 FLUX 3,并递给你一张价目表时,他们指的是图像端点。当有人说 FLUX 3,并递给你一份关于音频 token 分配的规格说明时,他们指的是七月的那次发布。那两份文件之间相隔九周和三个已交付的层级,而且这个差距仍在扩大。
