主视觉标题卡显示“HeyGen Video”,副标题为“heygen-video-1 —— 一个 MiniMax H3 后训练”,三个标签分别写着“$0.01 / 秒”、“5-15 秒片段”和“768p + 音频”,页脚一行写着“厂商报告数据;尚无独立评分。”OrcaRouter 标志合成在右下角。
Guides & Insights

HeyGen 以每秒 0.01 美元上线:HeyGen 对 Mini H3 的后训练实际上

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

HeyGen Video 于 9 月 30 日上线,整个 10 月按每秒 0.01 美元计价,而这个数字本身就是全部故事。一段十秒的片段只要一毛钱。在 HeyGen 自家的对比图表上,它所调优出的那个基础生成版本——2026 年 7 月 31 日发布的 MiniMax H3——在同样 768p 带音频的条件下计费为每秒 0.08 美元,而图表上的其他参照点最高达到 Goo​ogle's Veo 3.1 的每秒 0.40 美元。这次发布本身毫无奇崛之处:一个模型、三种提示模式、声音在同一次调用中生成。不同寻常的是,一家公司拿一个开放权重的基础模型,为自己的垂直领域做后训练,并把结果定价到比它所源自的模型低了将近一个数量级——同时又说盲测者把它排在了那个基础模型之前。两项说法都出自 HeyGen 之口,而它们背后的算术,才是买家的决策真正落脚的地方。

HeyGen Video 究竟是什么

HeyGen Video 是一款通用视频模型,而不是虚拟形象引擎,如果你之前用过 HeyGen,这个区别就很重要。该公司自己的文档明确划出了界限:它的虚拟形象渲染引擎只是基于你已写好的脚本,为你已有的形象制作动画,而这一款则是根据一段描述,同时创造出主体、场景、光线和声音。它以标识符 heygen-video-1 发布,位于 POST /v3/models/videos,通过 x-api-key 请求头进行身份验证,并且仅在付费 API 密钥下运行。

三种模式涵盖了调节:

• text_to_video — 仅需提示词,输出默认为 16:9。

• image_to_video — 提示词加一张图片,该图片将成为字面意义上的第一帧(包括其 EXIF 方向);输出会遵循该图片的宽高比例。

• 参考生视频 — 默认模式。提示词加上最多九张参考图片、三个参考视频和三个参考音频片段,共十二项。列表顺序会成为你在提示词中引用的标签:在参考图片中,第一项是<Picture 1>,第一个视频是<Video 1>,并且图片、视频和音频独立编号。

输出包络很紧凑,值得在价格之前一读:

• 持续时间 — 从5到15的任意整数秒,默认为5。

• 分辨率 — 480p 或 768p,默认为 768p。在 16:9 下即 1344 × 768;在 9:16 下即 768 × 1344。

• 帧率和音频——MP4/H.264 容器中的 24 fps,配以 32 kHz 立体声 AAC 音频,承载生成的对话、环境声和效果声。

• 宽高比 — 21:9、16:9、4:3、1:1、3:4 和 9:16,以及自适应(用于参考模式,会继承第一张参考图的形状)。

• 提示词增强 —— turbo为默认选项,quality可进行更长时间的处理,disabled则会原样发送你的文本。

该 schema 很严格——未知字段会被拒绝,而不是被忽略——而 seed 是一个无符号 32 位整数,当你固定它并每次只改动一个子句时,它能让同一个镜头可复现。下载链接是带签名且会过期的,所以要靠轮询来刷新它们;回调每个任务只尝试一次,HeyGen 自己也建议你把它当作一种延迟优化,而非一种保证。

供应商自己提供的数据,以及这些数据中本身所包含的保留条件

HeyGen 在发布页面上放了一张对比图,而这是整篇文章中唯一的定量论断,因此值得仔细剖析,而不是简单复述。

这张质量图表是一张 Elo 排名表:HeyGen Video 位居榜首——1000——随后是 Dreamina Seedance 2.0 的 955,H3 Max 系列从 952 一路排到 860,Kling 3.0 Pro 为 857,Veo 3.1 为 744。脚注大有讲究:这些分数来自一套内部评测集,基于 Artificial Analysis Arena 的查询,共有 4,800 票,而HeyGen 自身的分数被归一化为 1000,以便更直观地比较。厂商把自己归一化到自己图表的榜首,并不能证明它就领先;这只是一种呈现方式的选择。真正有信息量的是它下方的相对间距。

更有用的是正面对比。HeyGen 表示,在 650 次投票中,盲测者在 55.8% 的对比里更偏好其模型而非 fal 的 H3 Max,区间为 49–62%。这个区间才是诚实的细节:在低端它跨在 50% 上下,因此按照 HeyGen 自己的数字,对 H3 Max 的偏好并不能清晰地区别于噪声。各维度的细分结果同样好坏参半——在忠实于源图像上为 65%,在时序上为 66%,而在一致性上只有 43%,在音乐上为 45%——这看起来像一个能很好地保持单个限定镜头、但在更长镜头上会漂移的模型。

A generated explainer scoreboard card for HeyGen Video with six rows: Launch price $0.01 / second (through October), Standard price $0.02 in HeyGen prose versus $0.03 in HeyGen chart, Clip length 5 to 15 seconds, Resolution 480p or 768p (no 2K path), Native audio yes generated in the same call, Independent Elo none yet, and a footer reading 'All figures vendor-reported from HeyGen's launch page, 30 September 2026; unaudited.'

速度是最无可争议的数据。HeyGen 报告称,其扩散推理生成一段十秒的图像到视频片段耗时 3.7 秒,相比之下 H3 Max Turbo 为 4.1 秒,H3 Max 为 8.3 秒,字幕生成时间因随模式而异未计入。任何低于其所生成片段时长的用时都快于实时。

价格,以及 HeyGen 自身文案中的一处出入

HeyGen 的两个来源给出了两种不同的标准费率。发布文案称,10 月之前定价为每秒 $0.01 起,并称这是标准价 $0.02 的 50% 折扣——也就是说,10 月是按促销价计费,而 $0.02 才是标价。同一页面上的成本图表以脚注标明,其价格为 768p 含音频的每秒标价 在发布促销之前,将 HeyGen Video 定为 $0.03。

那不是四舍五入造成的差异;而是 HeyGen 的文字说明所称的标准费率与 HeyGen 图表所示之间存在 50% 的差距。图表中的其他行与外部定价一致——MiniMax 对基础版 MiniMax H3 按每秒 0.08 美元计费,这与 Artificial Analysis 为其记录的每分钟 4.80 美元相符——因此 H3 系列的数字并不是那个异常值。在 HeyGen 发布 API 定价页面之前,请将 0.01 美元视为已确认,因为它是当前的促销费率;并将 10 月之后的数字视为介于每秒 0.02 美元到 0.03 美元之间。

A screenshot of the cost and quality charts from HeyGen's own HeyGen Video launch page, captured 30 September 2026: a cost bar chart listing HeyGen $0.03/s, H3 Max Turbo $0.04/s, H3 Max $0.08/s, H3 Max balanced $0.08/s, Kling 3.0 Pro $0.168/s, Seedance 2.0 $0.303/s and Veo 3.1 $0.40/s, footnoted 'List price per second at 768p, with audio, before launch promotions'; a quality chart scoring HeyGen 1000, Seedance 2.0 955, H3 Max 952, H3 Max Turbo 920, H3 Max balanced 860, Kling 3.0 Pro 857 and Veo 3.1 744, footnoted 'HeyGen's Elo is normalized to 1000 for simpler comparison'; and a blind-preference panel showing 55.8% preferred HeyGen over H3 Max on 650 votes with a range of 49-62%.

一千秒的代价是多少

这是真正重要的对比:在 768p 并带音频的情况下,针对一千秒的生成视频——一百个十秒片段:

• 10月 HeyGen 视频 — 每秒 $0.01,共 $10。

• 十月之后的 HeyGen 视频 — $20 按 $0.02 计算,若图表上 $0.03 无误则为 $30。

• 在 OrcaRouter 上使用 MiniMax H3——按供应商每秒 0.08 美元的标价计算为 80 美元,0% 加价,因此供应商的任何价格变动都会在同一天于此实时同步。

• fal 的 H3 Max — 按图表所示每秒 $0.08 计算,为 $80。

• Kling 3.0 Pro — $168,每秒 $0.168。

• Veo 3.1 — 400 美元,每秒 0.40 美元。

对于批量生成、并丢弃大部分成品的团队——社交平台剪辑、广告变体、产品循环视频——真正的成本项是丢弃率,而以一毛钱一次的十秒尝试成本来看,迭代的经济账就变了模样。问题在于上限:768p、24 fps 并不是 2K 交付格式,而“制作级质量”是 HeyGen 的说法,不是一项规格。基础版 MiniMax H3 通过 MiniMax 托管 API 上一个单独的重生成模块达到 2K,价格为每秒 0.13 美元,而 HeyGen Video 没有对应功能——所以如果你的交付目标高于 768p,那便宜的一秒并不是你需要的那一秒。

对于想要比较这两者的团队,MiniMax H3 已在 OrcaRouter 上以 minimax/minimax-h3 的形式提供,价格为每秒 0.08 美元,因此可以将基础模型和后训练模型放在同一个密钥之后,而不是分属两份合同。HeyGen Video 本身如今在这里并不是一个路由模型——它通过 HeyGen 自有 API 和若干第三方平台提供服务——而这正是 自动故障转移存在的场景:你可以针对一个已发布数天的模型进行原型验证,而不必把生产路径押在它上面;如果它被接入某个路由提供商,它会以标价而非加价后的价格出现。

A screenshot of the OrcaRouter model page for MiniMax-H3 (minimax/minimax-h3, captured 1 October 2026) showing the model header at $0.08 per second, a p50 latency of 416 ms, and the description noting MiniMax-H3 is the Hailuo 3 generation released 31 July 2026, generating 4-15 second videos at 768P or 2K with native stereo audio, billed at $0.08/s at 768P and $0.13/s at 2K, alongside the /v1/video/generations endpoint and the on-page pricing panel.

HeyGen 说自己不擅长什么

HeyGen 文档中最有用的一段,就是列出各类失败模式的那一段,因为厂商很少会写这些内容。用该公司自己的话说,HeyGen Video 在过长的屏幕文字方面最不可靠,在柔和自然的运动(如花瓣、纸张和头发)方面,以及在精细的手部操作(如装配或操作设备)方面也同样如此。它最擅长的是短小、封闭的镜头:一个主体、一个地点、一个动作,摄影机固定不动或几乎不动。

该画像与上文按各轴给出的盲评数字相吻合——对提供图像的贴合度良好,一致性偏弱——并且它应当影响你测试它的方式。发布影片最倚重的能力是镜头内生成的文字:其中的每个标题都是画上去、印上去或压进场景里的,而不是合成上去的。HeyGen 自己的指南指出,逐字拼写的短句能可靠渲染,这是一个适用范围很窄的说法,同一份文档也警告不要在屏幕上放长文本。如果你的工作流依赖可读的字体排版,那这就是首先要探查的界限。

五周内的第二次 MiniMax H3 后训练

有趣的结构性事实是:HeyGen Video 并非首个通过微调 MiniMax H3 打造而成的商业产品。fal 于 8 月 27 日发布了 H3 Max,它是对同一基础模型进行后训练、并与 fal 的推理栈协同优化的产物,一经推出便登顶 Artificial Analysis 的带音频图生视频榜单。如今,HeyGen 针对另一个垂直领域——商务视频、产品演示、培训、房产导览——做了同样的事,并且定价低于基础版。

这种模式才是真正的信号。MiniMax 决定根据自家社区许可证发布 H3 的权重,使该模型成为一种底层基础,其他公司可以将其专门化并转售,而五周内出现第二个此类产品,说明转化率是真实存在的。这也意味着“MiniMax H3”正变成一个系列,而非单一模型:基础版、fal 的 H3 Max 和 HeyGen Video 如今以不同价格、不同分辨率相互竞争,而买家在把“H3”与其他任何东西比较时,必须说明是哪一个 H3。

Artificial Analysis 的文生视频排行榜显示出这能产生多么强烈的效果。其带音频的第二名模型 Elo 为 1150,是 Utopai X——Artificial Analysis 脚注注明其基于 MiniMax H3——领先于以 1138 位列第四的基础版 MiniMax H3 本身。无论基础模型自身得分如何,基于它构建的衍生模型至少在某个独立排行榜的盲测人类偏好中胜过它。

什么仍然未经验证

读者应该保持开放的三个问题。

首先,HeyGen Video 没有独立评分。截至 10 月 1 日,它并未出现在 Artificial Analysis 的三个视频榜单——文生视频、图生视频或视频编辑——中的任何一个上,因此目前还没有针对它的盲测第三方 Elo。本文中的每一个质量数字都来自 HeyGen 自己,基于 HeyGen 用 4,800 票汇总的 Arena 查询评估集。这是一种站得住脚的方法论,也是厂商自测结果,应当如此看待。

其次,HeyGen 对是否发布权重只字未提。它所微调所依据的模型是开放权重的,但后训练是一种新产物,而 HeyGen 自己的许可证也由它自己决定;发布材料中没有任何内容承诺会发布或不会发布。

第三,文档自相矛盾。API 参考文档称提示词最多接受5,000 个 Unicode 字符,而模型页面上的参数表给出的范围是1 到 32,000 个字符——同一个硬性输入上限却相差 6 倍。较低的那个数值出现在参考文档和更新日志摘要中,因此在 HeyGen 统一这两处说法之前,请按 5,000 来做规划。

谁该行动,谁该等待

如果你的视频作品适合收在一个受限镜头里——长凳上的一件产品、带缓慢推轨的房间、单一主体加固定机位——而你交付的分辨率是 768p 或更低,那么持续到十月的价格,就是当前任何人在发布的、规模化生成带旁白、带配乐素材的最便宜且可信的方式。趁促销还有效,这个月就去测试,并且围绕 HeyGen 承认自己薄弱的三个方面来设计测试,而不是围绕那支发布影片。

如果你的交付目标是 768p 以上,如果你需要较长的屏幕文字,或者可读性在多个镜头之间保持一致才是重点,那就再等等。基础版 MiniMax H3 仍是可路由的 H3,768p 为每秒 $0.08,而其托管的 2K 路径为每秒 $0.13——两者都在 OrcaRouter 上通过同一个密钥接入,按提供商标价提供,无任何加价,因此如果 HeyGen 在 10 月后的价格变成 $0.03 而不是 $0.02,你会在这里当天就看到修正,而不是一个月后。最快改变结论的,是一份独立的 Elo:一旦 HeyGen Video 出现在第三方盲测排行榜上,厂商的 55.8% 要么站得住脚,要么站不住脚。