
HiDream-O1-Video-1.0 在 Artificial Analysis 上首次亮相即排名第六——而其公开 API 的规模远小于其发布时的规模
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百万 tokens · 73 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 359 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
HiDream-O1-Video-1.0在 Artificial Analysis 的 Image-to-Video 排行榜上位列第六,Elo 为 1,175,获得了 3,231 票,价格为每生成一分钟视频 5.80 美元。这是其制造商公布的名次——只不过 HiDream.ai 于 2026 年 9 月 17 日发布的发布稿说的是第四名。两个数字都是真实的,只是描述的是不同的事情:发布稿引用的是该模型在宣布当天所持的名次,而榜单此后已经发生了变化。在 2026 年 10 月 10 日开启音频筛选条件后查看,HiDream V1 依次排在 MiniMax H3 Max、MiniMax H3、Vidu Q4 Preview、Omni Flash 和 Dreamina Seedance 2.0 720p 之后。
更有意思的地方不在于排名,而在于:HiDream-O1-Video-1.0 发布时宣称自己是一个接收文本、图像和视频,并输出五到二十秒、带原生同步音频的 1080p 视频的模型——而如今你实际能调用的版本,只接受一张参考图和一段可选的文本提示词,别的什么都不接受。这两种说法都有文档记录。在基于这个模型做开发之前,两者之间的落差才是真正值得了解的东西。
董事会,正确解读
Artificial Analysis 以分层方式运行其视频排行榜,每个层级都有各自的 Elo 量表和投票池,因此分数无法在层级之间通用。在保留音频的 AA-Video-I2V v1.0 上,前六名之间相差 20 个 Elo 分,置信区间的宽度在 7 到 10 分之间。截至 2026 年 10 月 10 日,前六名如下:
• MiniMax H3 Max — 在 5,894 个样本上为 1,195 ±9,2026年8月,$4.80/分钟
• MiniMax H3 — 1,181 ±8,基于 7,284 个样本,2026 年 7 月,$7.80/分钟
• Vidu Q4 Preview — 1,179 ±10,基于 5,543 个样本,2026 年 10 月,$
• Gemini Omni Flash — 在 12,327 个样本中为 1,178 ±7,2026 年 5 月,$6.00/分钟
• Dreamina Seedance 2.0 720p — 在 15,721 个样本上为 1,176 ±7,2026 年 3 月,$9.07/分钟
• HiDream-O1-Video-1.0 — 在 3,231 个样本上为 1,175 ±10,2026 年 8 月,$5.80/分钟
把这些区间作为一个整体来看,诚实的总结是:第一到第六名在统计上属于同一场角逐,只是拖了一条很长的并列尾巴。那道 不在噪声范围之内的差距,出现在 HiDream V1 与其余参赛者之间:第七名,阿里巴巴的 Wan 3.0,为 1,164——比第六名低十一分、整整差一个区间,却领先它近三百票。HiDream 自身的样本数是前六名中最小的,这意味着它的区间属于最宽的一档,其位次也最不稳固。

Artificial Analysis 关于该榜单本身所述的两点值得延续下去。它记录到过去 30 天内仅新增了一个模型,并表示 AA-Video-I2V v2.0 即将推出,与 AA-Video-T2V v2.0 的分类体系对齐,全程为 1080p。对于一个发布时宣称围绕 1080p 以及文本和视频条件控制的模型来说,这很重要:它首次亮相的榜单明确是一个过渡性榜单,而替代它的版本会改变被衡量的内容。
模型不在之处
HiDream-O1-Video-1.0 只出现在 Artificial Analysis 的一个视频榜单上。它并未出现在文本生成视频榜单 AA-Video-T2V v2.0 中,也未出现在视频编辑榜单中。我在 2026 年 10 月 10 日查看了这两个榜单——Wan 3.0 以 1,156 分领跑文本生成视频,并以 1,157 分领跑视频编辑,FLUX 3 以 1,128 分位列文本生成视频第六,而 HiDream 在两个排名中都未见踪影。
这种缺失是一个信号,而非取消资格。一个只接收参考图像的模型无法进入文生视频的投票,而一个只能做动画的模型也无法进入编辑对比。实际后果是,对于 HiDream V1 在文生视频或视频编辑方面的表现,不存在任何独立测评,而这恰恰是其发布版本所宣传的三种输入模式中的两种。
两个日期,以及它们之间的九十天
这些日期记录中有一处出入,任何引用这些数字的人都应谨慎处理。Artificial Analysis 将 HiDream-O1-Video-1.0 的发布日期记录为 2026 年 8 月 28 日,将其被引入榜单的日期记录为 2026 年 9 月 10 日。HiDream 自己的发布公告日期为 9 月 17 日。此后出现的第三方模型引用则称其发布于 9 月 15 日,并于 9 月 17 日得到验证。
这种模式描述的是:一个模型在进入新闻稿之前就已经进入了评估流程——这很正常,也意味着榜单上的发布日期是两个日期中较早的那个,而不是错误。它描述的并不是一个三月的模型在八月被重新发布,而这正是本博客此前吃过亏的那种失败模式。HiDream-O1-Video-1.0 确实是全新的:榜单基础设施本身就将其出现时间定在过去两个月内。
发布活动宣称了什么,以及是谁说的
该架构的说法来自 HiDream,尚未被独立复现。据厂商称:HiDream-O1-Video-1.0——即 HiDream V1,或称 HD-V1——在同一个生成过程中联合建模文本、视频和音频,而不是先生成画面再添加声音,从而使唇部动作、环境音和肢体动作共享同一条时间线。时长是规划出来的而非固定的,模型会根据所描述的事件在五到二十秒之间选择长度。物理行为——重力、碰撞、惯性、形变、光衰减——作为生成约束被训练进模型。后训练使用扩散强化学习,针对一个与人类感知对齐的多模态奖励模型进行优化。生成分三个阶段运行,公司将其描述为:先规划,再联合生成,最后对齐。
HiDream 将该模型定位在一个基于共享统一 Transformer 基座构建的四大系列产品组合之中——HiDream-O1-Image、HiDream-O1-Video、HiDream-O1-World 和 HiDream-O1-Embodied——并援引了这些同门模型此前取得的基准测试排名,其中包括 HiDream-O1-Image 1.5 在 Artificial Analysis 文生图榜单上位列全球第二,以及 HiDream-O1-World 在 WBench 上排名第一。这些是厂商针对该系列其他模型给出的数据,此处陈述时并未经独立证实。该公司的企业资料还将其基础模型技术栈描述为"超过 2000 亿"参数;这是平台层面的表述,并非 HiDream-O1-Video-1.0 的规格说明,而且没有任何来源公布该检查点的参数数量。该模型尚未发布任何开放权重。

你实际上可以称呼的
这里的文档异常清晰,而且范围比公告要窄。HiDream 通过其 MaaS 平台 HiHarness 提供该模型。视频端点是向 /api/maas/gw/v1/videos/generations 发起 POST 请求,模型标识符为 HiDream-O1-Video-1.0。必需的输入恰好是一张参考图像——一个公开 URL,或没有 data-URL 前缀的 Base64,大小在 40 KB 到 20 MB 之间。文本提示词是可选的,默认为空。生成是异步的:你提交后会收到一个 task_id,然后轮询 /api/maas/gw/v1/videos/generations/results,直到 result.status 显示为 1。
该模式中有三处遗漏值得明确指出,因为每一项都是首发版所宣传的能力。
• 参考视频——公告将视频列为该模型的输入之一;而文档中记载的请求却没有相应的字段。
• 明确的分辨率 — 公告声称支持 1080p;但文档记录的请求中并没有分辨率选择器,结果反而保留了参考图像的宽高比。
• 音频控制 —— 公告声称具备原生同步音频;但文档记载的请求并未暴露任何音频输入或音频生成参数。
schema 所实际暴露的是 force_10s,一个默认值为 false 的布尔值。保持为 false 时,由模型选择时长。设为 true,就会得到十秒。不存在数值型时长字段,因此所宣称的五到二十秒范围只是模型层面的说法,公开请求接口除了让你在两种模式中选择其一外,无法让你调控它。

该响应契约中有一个实现细节,会让那些照着其他视频 API 的模式匹配来编写的集成方案栽跟头。result.status = 1意味着所有子任务都已进入终态——并不代表生成成功。你仍然需要读取 sub_task_results[].task_status,其中 1 表示成功,3 表示生成失败,4 表示安全审核失败。如果客户端把终态当作成功,就会把一个并不存在的视频 URL 交到你手上。
价格,置于背景中
根据 Artificial Analysis 记录的每分钟 5.80 美元,HiDream V1 在其所属档位中属于中等定价,而非便宜。在该榜单前六名中,它比 MiniMax H3(7.80 美元)和 Dreamina Seedance 2.0(9.07 美元)便宜,比 MiniMax H3 Max 和 Vidu Q4 Preview 更贵。与它最常被拿来比较的模型相比,价差更大:Google Veo 3.1 为每分钟 24.00 美元,Kling 3.0 1080p Pro 为 20.16 美元,Alibaba Wan 2.7 为 9.00 美元,Wan 3.0 为 12.00 美元,而 Grok Imagine Video 1.5 为 8.40 美元。
那些每分钟费率不能直接比较,因为一分钟输出对应的是哪种分辨率和哪种音频,恰恰是该模型的 API 文档未作说明的内容。把这个数字当作你自己计算的起点,而不是一份费率表。
尝试一条未经验证的路线,而不把整条管线押在上面
这里主张谨慎,并不是因为这个模型不好,而是因为一个预览时代的服务面——单一输入类型、一个时长开关、一个两态终止标志——根本不是硬编码生产路径的地方。HiDream-O1-Video-1.0 并不是我们今天在 OrcaRouter 上提供的模型,所以下文没有任何内容是在声称托管它:我们的产品真正能帮上忙的地方,是在决策的另一侧——你想拿一条新的视频路由与现有方案做对比测试,并且随时都能抽身而退。一个兼容 OpenAI 的端点,覆盖 200 多个模型,自动故障转移,让一条开始悄悄出错的路由不会成为你最终上线的路由;提供商标价原样透传、不加任何加价;以及一套路由 DSL,让你在同一个请求里对比两个模型,而不是做两次集成。这一切都不需要专门用到 HiDream 的模型。
什么会改变这件作品?
三种事态发展会改变局面,按可能性从高到低排列。
首先,是更宽泛的服务契约。如果 HiHarness 增加一个参考视频字段、一个分辨率选择器,或有文档说明的音频控制,那么公告与 API 之间的差距就会弥合,1080p 和文本到视频的宣称也就变得可验证了。那是文档改动,不是模型改动,而且它可能在任何一周落地。
第二,AA-Video-I2V v2.0 榜单。Artificial Analysis 表示该榜单即将推出,并与 T2V v2.0 分类体系保持一致,全程采用 1080p。一个仅限 1080p 的榜单将成为首个独立评测环境,使 HiDream V1 的分辨率声明真正具有意义——而如果在新分类体系下,该模型仍无法进入文本到视频榜单,那么它在该榜单上的缺席就会成为一个实质性发现,而不是旧分类造成的人为产物。
第三,样本量。3,231 票是一次真实的测量,而且是一次年轻的测量,是前六名中最单薄的。现在的区间是 ±10,并将随着选民把它推向哪个方向而收窄。任何把“第六”当作既定事实来引用的人,都应该说明自己读到它时的日期,因为第六只是六方并列中的一个并列。
值得保留的问题不是 HiDream-O1-Video-1.0 是否有竞争力——在唯一能衡量它的榜单上,它显然有,而且有着站得住脚的每分钟价格。问题在于,最终通过广泛开放的 API 落地的模型,是否就是当初宣布的那个。根据目前的文档,它们仍然是两个不同的产品。
HiDream-O1-Video-1.0 不是我们今天提供的路由之一,但同类的接口正支撑着200 多个模型,提供商标价直接透传,不加任何加价。
