为 HiDream-O1-Video-1.0 生成的主视觉卡片,其眉题“OrcaRouter · 模型雷达 — 视频”位于标题“榜单第六,API 中只有一个输入”上方,左侧卡片“榜单”列出 AA 图生视频 80+ 中第 6、Elo 1,175 ±10、3,231 个样本和每分钟 .80,右侧卡片“有文档的 API”列出一张参考图像、一个可选提示词、仅 force_10s,以及视频、分辨率和音频未公开,四个标签分别写着发布于 2026 年 8 月、宣布于 2026 年 9 月 17 日、权重:未发布,以及在 T2V 或编辑榜单上无条目。
Engineering & Research

HiDream-O1-Video-1.0 在 Artificial Analysis 上首次亮相即排名第六——而其公开 API 的规模远小于其发布时的规模

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

HiDream-O1-Video-1.0在 Artificial Analysis 的 Image-to-Video 排行榜上位列第六,Elo 为 1,175,获得了 3,231 票,价格为每生成一分钟视频 5.80 美元。这是其制造商公布的名次——只不过 HiDream.ai 于 2026 年 9 月 17 日发布的发布稿说的是第四名。两个数字都是真实的,只是描述的是不同的事情:发布稿引用的是该模型在宣布当天所持的名次,而榜单此后已经发生了变化。在 2026 年 10 月 10 日开启音频筛选条件后查看,HiDream V1 依次排在 MiniMax H3 Max、MiniMax H3、Vidu Q4 Preview、Omni Flash 和 Dreamina Seedance 2.0 720p 之后。

更有意思的地方不在于排名,而在于:HiDream-O1-Video-1.0 发布时宣称自己是一个接收文本、图像和视频,并输出五到二十秒、带原生同步音频的 1080p 视频的模型——而如今你实际能调用的版本,只接受一张参考图和一段可选的文本提示词,别的什么都不接受。这两种说法都有文档记录。在基于这个模型做开发之前,两者之间的落差才是真正值得了解的东西。

董事会,正确解读

Artificial Analysis 以分层方式运行其视频排行榜,每个层级都有各自的 Elo 量表和投票池,因此分数无法在层级之间通用。在保留音频的 AA-Video-I2V v1.0 上,前六名之间相差 20 个 Elo 分,置信区间的宽度在 7 到 10 分之间。截至 2026 年 10 月 10 日,前六名如下:

• MiniMax H3 Max — 在 5,894 个样本上为 1,195 ±9,2026年8月,$4.80/分钟

• MiniMax H3 — 1,181 ±8,基于 7,284 个样本,2026 年 7 月,$7.80/分钟

• Vidu Q4 Preview — 1,179 ±10,基于 5,543 个样本,2026 年 10 月,$

• Gemini Omni Flash — 在 12,327 个样本中为 1,178 ±7,2026 年 5 月,$6.00/分钟

• Dreamina Seedance 2.0 720p — 在 15,721 个样本上为 1,176 ±7,2026 年 3 月,$9.07/分钟

• HiDream-O1-Video-1.0 — 在 3,231 个样本上为 1,175 ±10,2026 年 8 月,$5.80/分钟

把这些区间作为一个整体来看,诚实的总结是:第一到第六名在统计上属于同一场角逐,只是拖了一条很长的并列尾巴。那道 不在噪声范围之内的差距,出现在 HiDream V1 与其余参赛者之间:第七名,阿里巴巴的 Wan 3.0,为 1,164——比第六名低十一分、整整差一个区间,却领先它近三百票。HiDream 自身的样本数是前六名中最小的,这意味着它的区间属于最宽的一档,其位次也最不稳固。

A generated scoreboard titled 'HiDream-O1-Video-1.0 — announced versus served', contrasting the vendor's launch claims (inputs: text, image and video; output: 1080p, 5 to 20 seconds; audio: natively synchronised; duration planned from narrative; generation as one joint multimodal process; physics of gravity, collision and inertia) against the HiHarness request surface (one reference image; aspect ratio preserved; no audio parameter; force_10s boolean only; no resolution selector documented; physics not exposed as a control), with a footer stating the launch claims are vendor-reported.

Artificial Analysis 关于该榜单本身所述的两点值得延续下去。它记录到过去 30 天内仅新增了一个模型,并表示 AA-Video-I2V v2.0 即将推出,与 AA-Video-T2V v2.0 的分类体系对齐,全程为 1080p。对于一个发布时宣称围绕 1080p 以及文本和视频条件控制的模型来说,这很重要:它首次亮相的榜单明确是一个过渡性榜单,而替代它的版本会改变被衡量的内容。

模型不在之处

HiDream-O1-Video-1.0 只出现在 Artificial Analysis 的一个视频榜单上。它并未出现在文本生成视频榜单 AA-Video-T2V v2.0 中,也未出现在视频编辑榜单中。我在 2026 年 10 月 10 日查看了这两个榜单——Wan 3.0 以 1,156 分领跑文本生成视频,并以 1,157 分领跑视频编辑,FLUX 3 以 1,128 分位列文本生成视频第六,而 HiDream 在两个排名中都未见踪影。

这种缺失是一个信号,而非取消资格。一个只接收参考图像的模型无法进入文生视频的投票,而一个只能做动画的模型也无法进入编辑对比。实际后果是,对于 HiDream V1 在文生视频或视频编辑方面的表现,不存在任何独立测评,而这恰恰是其发布版本所宣传的三种输入模式中的两种。

两个日期,以及它们之间的九十天

这些日期记录中有一处出入,任何引用这些数字的人都应谨慎处理。Artificial Analysis 将 HiDream-O1-Video-1.0 的发布日期记录为 2026 年 8 月 28 日,将其被引入榜单的日期记录为 2026 年 9 月 10 日。HiDream 自己的发布公告日期为 9 月 17 日。此后出现的第三方模型引用则称其发布于 9 月 15 日,并于 9 月 17 日得到验证。

这种模式描述的是:一个模型在进入新闻稿之前就已经进入了评估流程——这很正常,也意味着榜单上的发布日期是两个日期中较早的那个,而不是错误。它描述的并不是一个三月的模型在八月被重新发布,而这正是本博客此前吃过亏的那种失败模式。HiDream-O1-Video-1.0 确实是全新的:榜单基础设施本身就将其出现时间定在过去两个月内。

发布活动宣称了什么,以及是谁说的

该架构的说法来自 HiDream,尚未被独立复现。据厂商称:HiDream-O1-Video-1.0——即 HiDream V1,或称 HD-V1——在同一个生成过程中联合建模文本、视频和音频,而不是先生成画面再添加声音,从而使唇部动作、环境音和肢体动作共享同一条时间线。时长是规划出来的而非固定的,模型会根据所描述的事件在五到二十秒之间选择长度。物理行为——重力、碰撞、惯性、形变、光衰减——作为生成约束被训练进模型。后训练使用扩散强化学习,针对一个与人类感知对齐的多模态奖励模型进行优化。生成分三个阶段运行,公司将其描述为:先规划,再联合生成,最后对齐。

HiDream 将该模型定位在一个基于共享统一 Transformer 基座构建的四大系列产品组合之中——HiDream-O1-Image、HiDream-O1-Video、HiDream-O1-World 和 HiDream-O1-Embodied——并援引了这些同门模型此前取得的基准测试排名,其中包括 HiDream-O1-Image 1.5 在 Artificial Analysis 文生图榜单上位列全球第二,以及 HiDream-O1-World 在 WBench 上排名第一。这些是厂商针对该系列其他模型给出的数据,此处陈述时并未经独立证实。该公司的企业资料还将其基础模型技术栈描述为"超过 2000 亿"参数;这是平台层面的表述,并非 HiDream-O1-Video-1.0 的规格说明,而且没有任何来源公布该检查点的参数数量。该模型尚未发布任何开放权重。

A screenshot of the Artificial Analysis AA-Video-I2V v1.0 image-to-video leaderboard with the audio filter applied, captured 10 October 2026, headed by MiniMax H3 Max at Elo 1,195 and .80 per minute, with HiDream-O1-Video-1.0 sixth at Elo 1,175 over 3,231 samples, released August 2026 at .80 per minute, and a banner noting that AA-Video-I2V v2.0 is coming soon with 1080p videos throughout.

你实际上可以称呼的

这里的文档异常清晰,而且范围比公告要窄。HiDream 通过其 MaaS 平台 HiHarness 提供该模型。视频端点是向 /api/maas/gw/v1/videos/generations 发起 POST 请求,模型标识符为 HiDream-O1-Video-1.0。必需的输入恰好是一张参考图像——一个公开 URL,或没有 data-URL 前缀的 Base64,大小在 40 KB 到 20 MB 之间。文本提示词是可选的,默认为空。生成是异步的:你提交后会收到一个 task_id,然后轮询 /api/maas/gw/v1/videos/generations/results,直到 result.status 显示为 1。

该模式中有三处遗漏值得明确指出,因为每一项都是首发版所宣传的能力。

• 参考视频——公告将视频列为该模型的输入之一;而文档中记载的请求却没有相应的字段。

• 明确的分辨率 — 公告声称支持 1080p;但文档记录的请求中并没有分辨率选择器,结果反而保留了参考图像的宽高比。

• 音频控制 —— 公告声称具备原生同步音频;但文档记载的请求并未暴露任何音频输入或音频生成参数。

schema 所实际暴露的是 force_10s,一个默认值为 false 的布尔值。保持为 false 时,由模型选择时长。设为 true,就会得到十秒。不存在数值型时长字段,因此所宣称的五到二十秒范围只是模型层面的说法,公开请求接口除了让你在两种模式中选择其一外,无法让你调控它。

A screenshot of the HiHarness documentation page for the HiDream-O Series video models, captured 10 October 2026, describing HiDream-O1-Video-1.0 as a single-image-to-video model that generates a video from one reference image and a text prompt, with Model ID HiDream-O1-Video-1.0, input as one reference image by public URL or Base64, output of one video, resolution that preserves the input aspect ratio, a dynamic or fixed ten-second duration, and an asynchronous workflow of submitting a task and polling the result endpoint until result.status is 1.

该响应契约中有一个实现细节,会让那些照着其他视频 API 的模式匹配来编写的集成方案栽跟头。result.status = 1意味着所有子任务都已进入终态——并不代表生成成功。你仍然需要读取 sub_task_results[].task_status,其中 1 表示成功,3 表示生成失败,4 表示安全审核失败。如果客户端把终态当作成功,就会把一个并不存在的视频 URL 交到你手上。

价格,置于背景中

根据 Artificial Analysis 记录的每分钟 5.80 美元,HiDream V1 在其所属档位中属于中等定价,而非便宜。在该榜单前六名中,它比 MiniMax H3(7.80 美元)和 Dreamina Seedance 2.0(9.07 美元)便宜,比 MiniMax H3 Max 和 Vidu Q4 Preview 更贵。与它最常被拿来比较的模型相比,价差更大:Google Veo 3.1 为每分钟 24.00 美元,Kling 3.0 1080p Pro 为 20.16 美元,Alibaba Wan 2.7 为 9.00 美元,Wan 3.0 为 12.00 美元,而 Grok Imagine Video 1.5 为 8.40 美元。

那些每分钟费率不能直接比较,因为一分钟输出对应的是哪种分辨率和哪种音频,恰恰是该模型的 API 文档未作说明的内容。把这个数字当作你自己计算的起点,而不是一份费率表。

尝试一条未经验证的路线,而不把整条管线押在上面

这里主张谨慎,并不是因为这个模型不好,而是因为一个预览时代的服务面——单一输入类型、一个时长开关、一个两态终止标志——根本不是硬编码生产路径的地方。HiDream-O1-Video-1.0 并不是我们今天在 OrcaRouter 上提供的模型,所以下文没有任何内容是在声称托管它:我们的产品真正能帮上忙的地方,是在决策的另一侧——你想拿一条新的视频路由与现有方案做对比测试,并且随时都能抽身而退。一个兼容 OpenAI 的端点,覆盖 200 多个模型,自动故障转移,让一条开始悄悄出错的路由不会成为你最终上线的路由;提供商标价原样透传、不加任何加价;以及一套路由 DSL,让你在同一个请求里对比两个模型,而不是做两次集成。这一切都不需要专门用到 HiDream 的模型。

什么会改变这件作品?

三种事态发展会改变局面,按可能性从高到低排列。

首先,是更宽泛的服务契约。如果 HiHarness 增加一个参考视频字段、一个分辨率选择器,或有文档说明的音频控制,那么公告与 API 之间的差距就会弥合,1080p 和文本到视频的宣称也就变得可验证了。那是文档改动,不是模型改动,而且它可能在任何一周落地。

第二,AA-Video-I2V v2.0 榜单。Artificial Analysis 表示该榜单即将推出,并与 T2V v2.0 分类体系保持一致,全程采用 1080p。一个仅限 1080p 的榜单将成为首个独立评测环境,使 HiDream V1 的分辨率声明真正具有意义——而如果在新分类体系下,该模型仍无法进入文本到视频榜单,那么它在该榜单上的缺席就会成为一个实质性发现,而不是旧分类造成的人为产物。

第三,样本量。3,231 票是一次真实的测量,而且是一次年轻的测量,是前六名中最单薄的。现在的区间是 ±10,并将随着选民把它推向哪个方向而收窄。任何把“第六”当作既定事实来引用的人,都应该说明自己读到它时的日期,因为第六只是六方并列中的一个并列。

值得保留的问题不是 HiDream-O1-Video-1.0 是否有竞争力——在唯一能衡量它的榜单上,它显然有,而且有着站得住脚的每分钟价格。问题在于,最终通过广泛开放的 API 落地的模型,是否就是当初宣布的那个。根据目前的文档,它们仍然是两个不同的产品。

HiDream-O1-Video-1.0 不是我们今天提供的路由之一,但同类的接口正支撑着200 多个模型,提供商标价直接透传,不加任何加价。