
Vidu Q4 Preview 对比 Seedance 2.5:参考预算并非真正的差异
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
已公布的参考素材额度看起来是 Seedance 2.5的一场完胜:最多支持 30 张图片、10 个视频和 10 段音频,而 Vidu Q4 Preview只有 15 张图片和 3 段音频。图片数量是两倍,音频是三倍,仅凭这一点就足以分出高下。但事实并非如此,因为真正关键的数字不是数量,而是第二种模态。Seedance 2.5 接受视频作为输入参考。Vidu Q4 Preview 只接受图片和音频,且没有任何文档说明它能够导入已有片段。
Seedance 2.5 于 2026 年 7 月 31 日发布,是字节跳动进军长视频领域的作品,单次运行即可生成一段 30 秒的片段,并可通过多轮续写生成长序列。Vidu Q4 Preview 于 2026 年 10 月 7 日由生数科技推出,是其下一代旗舰模型的预览版,具备两种模式——图像生视频与参考生视频——以及两个已有文档记录的 API 端点。两者都是高度依赖参考的模型。它们被打造出来,是为了承载不同的东西。
每种输入模态实际能解锁什么
一个以图像为参考的模型能够保持角色阵容和视觉风格的一致性。Vidu Q4 Preview 的文档描述了如何跨角色、场景和风格组合 1–15 张图像,使主体在多镜头片段中保持一致,并最多可使用 3 段 3–12 秒的 mp3 音频参考来克隆声音并保持表达方式对齐。在单个场景的角色阵容、服装、道具和灯光上分配十五个槽位是一个协调一致的配额,这也是该模型在图像到视频偏好榜上并列榜首的原因。
一个还能以视频作为参考的模型,可以直接对准现成的影像素材。Seedance 2.5 可接受最多 10 个视频输入,外加 30 张图像和 10 段音频片段,这意味着参考集可以包含取自现有片段的运动、节奏和镜头行为,而不必用提示词来描述。这是一种不同的能力,而不是同一能力的更大版本;正是它让 Seedance 2.5 登上了 Artificial Analysis 的视频编辑榜单——截至 2026 年 10 月 8 日读取的数据,以 1,161 Elo、5,162 票位居第二——可根据文本指令编辑视频并保留音频。Vidu Q4 Preview 不在该榜单上,原因在于它的端点列表,而不是它的得分。
实际对比:
• 图像参考 — Vidu Q4 Preview 最多 15 张,而 Seedance 2.5 最多 30 张
• 视频参考——Vidu Q4 Preview 无记录对比 Seedance 2.5 最多 10 个
• 音频参考 — Vidu Q4 Preview 最多 3 个 3–12 秒的 mp3 片段,而 Seedance 2.5 最多 10 个
• 单次生成时长 — Vidu Q4 Preview 在图生视频中为 3–16 秒,在参考生视频中为 1–16 秒,而 Seedance 2.5 单次生成可达 30 秒,并可在此基础上进行多轮延长
• 模式 — Vidu Q4 Preview 的图生视频和参考生视频,对比 Seedance 2.5 的文生视频、参考生视频和视频输入参考,并将编辑路线提上日程
• 输出分辨率 — Vidu Q4 Preview 提供 540p 至 4K 的按价格划分的生成档位,其中 2K 和 4K 为 10-bit 色彩;相比之下,Seedance 2.5 在公布其设置的主机上为 480p 和 720p,更高档位则通过超分达到交付分辨率
把这两者并排放到一起看,它们并不是在争夺同一份任务简报。一个是用十五张参考图生成的 4K 十六秒镜头,另一个是用三十张参考图、带视频输入的 720p 三十秒镜头,它们回答的是两个不同的制作问题。
定价单位无法换算,这就是全部。
大多数对这两者的比较就是在这里出错的,而问题出在单位上,而不是算术上。
Seedance 2.5 并不由其供应商按秒出售。字节跳动依据官方价目表,以视频 token 为单位对该模型计费,该价目表在中国通过火山引擎方舟(Volcano Engine Ark)发布,在国际市场则通过 BytePlus ModelArk 发布。一段片段的花费取决于分辨率、时长以及实际 token 用量,因此按秒计算的价格只对某一种分辨率和某一种时长成立——而且失败的生成与成功的生成计费相同。提供 Seedance 2.5 的第三方托管商会在其之上加上自己的利润,并公布自家的按秒或按片段价格,这就是为什么十几个页面会给出十几个不同的数字,而其中没有一个数字是供应商的价格。
Vidu Q4 Preview 的定价方式则相反:采用固定的每秒积分的费率,仅随你所选择的分辨率档位而变化,由生数公开发布。540p 为每秒 9 积分,720p 为 19 积分,1080p 为 24 积分,2K 为 38 积分,4K 为 78 积分,对应的平台标称积分费率为 0.005 美元,目前还有限时套餐折扣,最高可享 30%。按标价计算,曲线从 540p 的约每秒 0.045 美元,到 4K 的约 0.39 美元。发布公告中提到的每秒 0.014 美元,是 540p 档位在折扣后的价格。
这意味着这两张价目表无法逐行比较,任何这样做的页面,都是在拿供应商的公开报价单去比平台上的加价。可以拿来比较的,是供应商就各自计费形态所公布的内容:Vidu 的费用随分辨率和时长而变化,在你按下生成之前就能知晓;Seedance 则按 token 计量,因此取决于模型选择如何在你这段提示词上消耗 token。一个是可预测的,另一个是按量计费的。两者都谈不上错,但它们适合不同的买家——而为第二个做预算更危险,因为波动落在供应商那一侧。
在独立榜单上,记录下来的每分钟数值只应被当作数量级参考来解读。Artificial Analysis 在图生视频榜单上记录到 Vidu Q4 Preview 为每分钟 7.20 美元,而 Dreamina Seedance 2.5 在文生视频上为每分钟 34.12 美元、在编辑上为 40.82 美元。这些列是各模型在默认设置下生成一分钟 1080p 输出的成本——而 Seedance 2.5 默认采用其价目表所定价的更长、更重的配置,Vidu Q4 Preview 的默认设置则是单次生成片段。它们衡量的是不同的默认行为,而不是四到五倍的效率差距。
十六秒对三十秒,是实实在在的差别。
有一项比较确实不受单位问题的影响,那就是时长。单次生成三十秒,几乎是 Vidu Q4 Preview 十六秒上限的两倍,而 Seedance 2.5 的多轮扩展意味着还能在此基础上继续延长序列。对于叙事类作品——一个带有情节弧线的场景、一则有意铺陈与收束的广告——十六秒与三十秒之间的差别,就是一个镜头与一场戏之间的差别。
在低价端则正好相反。Vidu Q4 Preview 可从三秒起生成,其 540p 档位的价格大约只有自家 720p 费率的三分之一,因此在投入全分辨率渲染之前,先低成本地试排构图变得很划算。已公布的 Seedance 2.5 费率结构中没有任何东西能起到这一作用:其 480p 主机档位确实比 720p 便宜,但厂商自身的计费是按 token 计量的,因此一次短时低分辨率测试并没有一个清晰公布的、可供据此规划的价格。
哪一个,简要说明
当工作涉及你已有的素材时,选择 Seedance 2.5。如果任务是对现有片段进行延长、重新风格化或重新剪辑,或者参考集需要承载动态而不只是外观,那么视频输入就是决定性能力,Vidu Q4 Preview 无法替代。再加上 30 秒单次生成,对于叙事弧线更长的叙事和广告类工作来说,结论就很清楚。
在项目是需要保持连贯的演员阵容、且交付规格要求超过 720p 时,选择 Vidu Q4 Preview。原生 2K 和 4K 生成、10 位色彩,这是 Seedance 2.5 在厂商层面并未公布的规格档次,而按秒计价让一次 4K 拍摄成为一个真正可以纳入预算的用量,而不是一个按量计费的未知数。十五个图像参考和三个声音参考足以支撑单场景的演员阵容,而 540p 的预演档位让反复迭代变得成本低廉。
什么会改变这一点:Vidu Q4 的正式完整版发布若新增视频输入模态,就会消解这一结构性差异,使这两者成为直接竞争对手,而生数自己的材料也表明,预览版的存在正是为了收集反馈、以塑造最终版本。另一方面,如果字节跳动在更多设置下公布一张 token 费率示例表,那么计量式与可预测式之间的不对称就会变得容易规划得多。在这两者中任何一项落地之前,对“30 个参考对 15 个参考”的正确解读是:这两个模型中有一个能接收视频输入,另一个则不能。
一把密钥,畅用真正可调用的视频模型
OrcaRouter 将视频模型和语言模型置于同一个兼容 OpenAI 的端点之后,只需一个密钥,按供应商的标价原样透传、不加任何加价,因此供应商调价当天即可生效,而不必等到续约时。Vidu Q4 Preview 和 Seedance 2.5 目前并非 OrcaRouter 的路由,本页面也无意暗示并非如此。我们实际提供的视频路由——Kling 3.0及其 Turbo 和 v2.6 变体也在其中——与语言模型并列在同一端点、相同的请求格式上,路由之间自动故障转移,而无需为每个模型单独签约。
正是这种结构,让像这样的比较变得可以完成:在你自己的需求简报上、用你自己的设置来运行候选方案,并让接受率来做决定,而不是去比较两张单位不同的费率卡。



