
Vidu Q4 Preview首登图生视频榜单第三——却在另一榜单中缺席
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Vidu Q4 Preview以 1,179 的 Elo 跻身 Artificial Analysis AA-Video-I2V v1.0 排行榜第三名,而它取代的、Vidu 此前排名最高的模型,Vidu Q3 Pro,则以 1,056 位列第十九。这是一次发布中 123 分的跃升,而在一个置信区间宽度约为 20 分的榜单上,它的价格是生成视频每分钟 7.20 美元,而非旧模型所对应的 9.60 美元。Shengshu Technology 于 2026 年 10 月 7 日发布 Vidu Q4 Preview,作为其下一代旗舰产品的首次公开预览,明确早于完整版 Q4 模型,并请创作者在最终版本仍在打磨期间将其用于真实项目。
初次亮相的数字最抓眼球。而它的缺席才是更耐人寻味之处,也正是这一点,让这成了一篇文章,而不再只是一张图表。
10月7日实际发布了什么?
Vidu Q4 Preview 是一款原生支持音频的视频生成模型,通过 Vidu 自有的网页产品和 API 平台对外发售。生数的发布材料描述了三个方向的研发工作:角色表演(面部表情、情绪、肢体动作与声音协同配合,而非分层叠加)、快速动作场景中的镜头与剪辑连贯性,以及视觉特效——爆炸、粒子、烟花——这些特效融入场景之中,而非浮于场景之上。
供应商所述的规格:
• 最高分辨率——4K,其中 2K 和 4K 支持 10 位色深;完整的分辨率档位为 540p、720p、1080p、2K、4K
• 最长片段时长 — 16 秒,但划分不均:Image-to-Video 为 3 至 16 秒,Reference-to-Video 为 1 至 16 秒
• 参考额度 — 最多 15 张参考图片(角色、服装、道具、产品、同一设定中的环境)以及最多 3 段参考音频片段
• 上线定价——每秒 0.014 美元起,这是供应商提供的数据,并且明确属于促销性质
该厂商还提出了一项它自身很难被追究到底的对比性主张:在可比的输出规格与计费条件下,Vidu Q4 Preview 能够"以相同预算实现多达五倍的输出量"。这是一项效率主张,而非质量主张;而由于"可比的输出规格与计费条件"这一短语承担了那句话的全部论证负担,在有人成功复现它之前,值得把它当作一种营销话术来对待。Shengshu 自己随附发布的免责说明是:最终定价、支持的 resolutions、功能可用性以及使用条款可能因套餐和地区而异。

这两个董事会对于该模型的用途意见不一
Artificial Analysis 运行着各自独立的视频排行榜,采用独立的 Elo 评分体系和独立的投票池,而它们之间的差异正是这里的关键所在。
On AA-Video-I2V v1.0 — image-to-video, ranked from pairwise human preference votes with audio kept in — Vidu Q4 Preview is third at 1,179 ±10 over 5,543 samples, dated October 2026, priced at $7.20 per minute. Only two models are above it: MiniMax H3 Max at 1,195 ±9 over 5,894 samples ($4.80/min, August 2026) and MiniMax H3 at 1,181 ±8 over 7,284 samples ($7.80/min, July 2026). Gemini Omni Flash is fourth at 1,178 ±7 over 12,327 samples. The board's own notice says two models were added in the last 30 days: Vidu Q4 Preview and HiDream-O1-Video-1.0, which is sixth at 1,175 ±10.
在 AA-Video-T2V v2.0 上——文生视频,这是一个基于不同用例分类体系构建的另一份榜单——Vidu Q4 Preview 完全没有出现。其中最好的 Vidu 条目是 Vidu Q3 Pro,以 941 ±10 在 4,088 个样本上排名第 25。Wan 3.0 以 1,156 ±9 位居该榜单榜首。
把这两句话放在一起读,发布的轮廓就清晰了。这是一个图像与参考模型。Vidu 自己的产品页面为其列出了恰好两种模式,{{1}}图像到视频{{/1}}和{{2}}参考到视频{{/2}},没有文本到视频标签,API 文档也与之吻合。一场在厂商营销中看似通用旗舰的发布,在独立板块上却是一场有针对性的发布。
关于这个排名本身,还有一点需要提醒。I2V 榜单的十分区间从第三名到第六名高度重叠——1,179、1,178、1,176、1,175——所以“第三名”只是噪声范围内的一个位次,并不代表与第四名有明确区分。真正不在噪声范围内的,是它与被它取代的模型之间的差距。Vidu Q3 Pro 与 Vidu Q4 Preview 之间 123 Elo 的差距,比榜单前六名的整个分差还要大。

你实际调用的是什么,以及它的开销
这个 API 并不花哨,而是非常具体。图生视频会向 /ent/v2/img2video 发起 POST 请求,模型名为 viduq4-preview,接收单张起始帧图像(png、jpeg、jpg 或 webp,最大 50MB)、最长 20,000 个字符的提示词、3 到 16 秒的时长(默认为 5 秒),以及 540p 到 4K 的分辨率(默认为 720p)。参考生视频会向 /ent/v2/reference2video 发起 POST 请求,接收 1 到 15 张图像,外加 0 到 3 个时长各为 3 到 12 秒的 mp3 音频参考,并提供 1:1、9:16、16:9、3:4 和 4:3 的宽高比,默认为 16:9。
值得注意的参数是 audio,其默认值为 true。Vidu Q4 Preview 默认会随画面一起生成声音——包括对白和音效——需要你主动把它关掉。返回的创作 URL 有效期为 24 小时,如果你批量生成、之后再渲染,这个时长就短得足以产生影响。
在价格方面,实打实的算术是这样的:流传的那两个数字——"每秒 $0.014"和 Artificial Analysis 记录的每分钟 $7.20——并不是同一款产品。每秒 $0.014 相当于每分钟 $0.84,约为榜单数字的九分之一,这正是最低分辨率下的促销底价,与生产级分辨率下的实测费率放在一起时所呈现的差距。你依据发布数字做出的任何预算,都应根据自己的分辨率和时长重新推算,而不是照搬标题上的数字。

预览 SKU 带来的实际问题
按照厂商自己的说法,Vidu Q4 Preview 尚未完成。它在 Q4 正式版之前就已提前发布,目的就是让有关性能、创意控制和日常制作需求的反馈来指导最终版本的发布。其定价为促销价。功能可用性因套餐和地区而异。API 文档中甚至还有一个拼错的别名——viduq4-previerw它与正确的viduq4-preview一同出现在模型参数说明中——而这件小事恰恰真实地反映了这个构建版本在发布流程中所处的位置。
那不是反对使用它的论据。那是反对在没有计划应对促销价格结束或预览版被取代后会发生什么的情况下,把它放在关键路径上的论据;对于以这种方式发布的模型来说,这是以周而非以季度计的问题。
如果你想在不拿生产管线冒险的情况下试用它,OrcaRouter 正是为这种情况而生:一个兼容 OpenAI 的端点,覆盖 200 多个模型,跨提供商的自动故障转移,以及按提供商标价原样传递、不加任何加价。对于预览版本来说,故障转移这一半比平时更重要,因为它正是让你在预览路由不可用时,能用同一个密钥将请求路由到稳定模型的东西。关于路由,说得直白一点:Vidu Q4 Preview 目前不是 OrcaRouter 的路由。我们确实提供的视频模型——包括 MiniMax H3,这个榜单上排名第一的模型——可以在与文本模型相同的端点上调用,视频的按秒计费率是一个单项条目,而不是一份单独的合同。
看什么
三件事会推动这个故事。
首先,是文生视频榜单。Artificial Analysis 表示,AA-Video-I2V v2.0 即将推出,与 T2V v2.0 分类体系保持一致,并全程覆盖 1080p 视频。如果 Vidu Q4 Preview 是一个图像与参考模型,它也不会出现在那里——而如果它出现了,那就说明 Shengshu 发布的模型比预览版所暗示的覆盖范围更广。
其次,是完整的 Q4 发布版。从预览版到最终版,通常正是促销定价结束的阶段,也是功能集要么保持、要么悄然收窄的阶段。15 张图像和 3 段音频的参考额度,是规格中最有可能留存下来的部分,因为整个发布所依托的差异化优势正是它。
第三,样本量。5,543 票是真实的测量结果,但还很年轻;随着榜单逐渐填满,置信区间会收窄,排名也会上下浮动。任何把“第三”当作既定事实来引用的人,都应该说明自己读到它时的日期。
值得抓住的问题比营销宣传所暗示的要更窄。Vidu Q4 Preview 可衡量地是 Vidu 迄今打造的最好的图生视频模型,领先幅度大于榜单自身前六名之间的分差,且每分钟价格低于其前代。这究竟会成为一个持久的地位,还是预览版带来的短暂冲高,当前任何数字都无法回答。
