一张"Tavus Griffin vs HeyGen Video 1"的主视觉卡片,带有三个标签:"HeyGen Video — 每秒 $0.01"、"Griffin — 无价格,需申请访问"以及"HeyGen Video — 768p 下 5 至 15 秒",位于六行信息之上:HeyGen 上线时间:2026 年 9 月 30 日;Griffin 发布时间:2026 年 10 月 1 日;HeyGen 价格:每秒 $0.01;Griffin 价格:未公布;HeyGen 输出:5 至 15 秒的片段;Griffin 输出:实时会话。页脚:"HeyGen Video 于 2026 年 9 月 30 日上线;Griffin 于 2026 年 10 月 1 日作为预览版发布。"
Guides & Insights

Tavus Griffin 与 HeyGen Video 1:相隔三十六小时,只有一个可以购买

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

两次发布在三十六小时内相继落地,落在市场的同一个角落,而对这一组合来说,最有趣的恰恰是日历上的时间。HeyGen Video 于 2026 年 9 月 30 日上线,整个 10 月期间每秒 0.01 美元,基于 MiniMax H3 调校,并以标识符heygen-video-1发布。Tavus Griffin 于 2026 年 10 月 1 日发布,同时公布了一项实时面对面研究:54 名参与者中有 26 人相信自己的对话伙伴是真人。它只面向部分受信任的测试者开放,需通过申请表申请,没有标识符、没有端点,也没有价格。两者都关乎生成一个令人信服的人类。去比较Tavus Griffin与HeyGen Video 1的诚实理由,并不在于买家会在两者之间做选择——如今两者中只有一个能买到——而在于这一差异恰好解释了它们各自被造来做什么,以及一秒生成的人类究竟价值几何。

一个卖的是片段,另一个卖的是对话

HeyGen Video 是一个通用视频模型,恰好特别擅长人物。它接收一个提示词,或提示词加一张图像,或提示词加最多九张参考图像、三个参考视频和三个参考音频片段,并返回一段时长 5 到 15 秒、分辨率为 480p 或 768p、24 fps 的视频,带 32 kHz 立体声 AAC 音频,承载生成的对话、环境音和音效。三种模式覆盖条件控制——text_to_video、image_to_video和reference_to_video,后者是默认模式——而列表顺序会成为你在提示词中称呼的标签,因此 reference_images 的第一项是 <Picture 1>。请求中的未知字段会被拒绝而不是忽略,而种子是一个无符号 32 位整数,当你保持它不变并一次改动一个子句时,它能使镜头可重复。这是一个具有确定性边界的生产工具。

Griffin 几乎颠覆了上述每一个特性。它从单张参考照片生成 720p 视频,以 320 毫秒为一组、25 fps 分块生成,并在解码每一块时立即播放,因此无需指定片段长度,也无需交回文件。一个持续对话建模(Continuous Conversational Modeling)引擎会接收音频和视频,并以亚秒级间隔重新评估交流,决定是保持沉默、发出信号、给予反馈性回应,还是接过话轮;其表现力控制会并行驱动流式语音生成器和流式视频生成器。在句子中途做出的决定,会在同一个微话轮内体现在声音和脸上。你不写提示词;你与它交谈,而它会对一个停顿、一次移开目光或一次打断做出回应。

这就是为什么,尽管两者都能生成一个人,它们却不能相互替代。HeyGen Video 被要求呈现一个被描述的时刻是什么样子。Griffin 被要求判断接下来应该发生什么。

在可以购买秒数的那个上,每秒要花多少钱

HeyGen Video 的首发价截至 10 月为每秒 $0.01,而 HeyGen 自己的文字说明将其描述为标准价 $0.02 的五折。同一页面上的成本图表脚注注明,这是发布促销前带音频的 768p 每秒标价,却将其列为 $0.03。在供应商自家的发布材料中,文字说明和图表之间出现了 50% 的差距;在 HeyGen 发布 API 定价页面之前,稳妥的解读是:$0.01 已得到确认,因为它已经上线生效,而 10 月之后的价格则在 $0.02 到 $0.03 之间。

按一千秒来算——也就是一百个十秒片段——这才是批量团队实际会采用的思考单位:

• 10月 HeyGen 视频 — 每秒 $0.01,共 $10。

• 十月之后的 HeyGen Video——按 $0.02 计为 $20,或按图表中的 $0.03 计为 $30。

• MiniMax H3,即其微调所基于的基础模型——按 MiniMax 每秒 0.08 美元的标价计算,为 80 美元。

• Kling 3.0 Pro — $168,每秒 $0.168。

• Veo 3.1 — 400 美元,每秒 0.40 美元。

HeyGen 发布会的头条之所以是这笔算术,原因在于弃用率。制作社交短片、广告变体和产品循环的团队,其生成量远超实际发布量;而当十秒一次的尝试只需一角钱时,把候选内容丢弃的经济账就完全变了样。问题在于上限:768p、24 fps 并不是 2K 的交付格式,而 MiniMax H3 是通过 MiniMax 自有托管 API 上独立的重新生成模块达到 2K 的,每秒 0.13 美元,HeyGen Video 上没有对应的功能。如果你的交付目标高于 768p,那么便宜的那一秒并不是你需要的那一秒。

Griffin 在该列表中的那一栏是空的,而且情况并不乐观。Tavus 尚未公布费率,因为 Griffin-Lite 是一个研究预览版,其自己的公告称目前不会供客户使用,也不在 Tavus 平台上。在以千秒为单位的模式下,没有什么可填的。任何为 Griffin 报出数字的人都是在编造。

质量数据,以及由谁评分

这两个模型都没有独立评分,这一点值得一开始就说明,因为两家厂商都提供了图表。

HeyGen 的是一张 Elo 表,其中 HeyGen Video 归一化为 1000,接着是 Dreamina Seedance 2.0 的 955,H3 Max 系列从 952 一路分布到 860,Kling 3.0 Pro 为 857,Veo 3.1 为 744。脚注承担了大部分关键作用:这些分数来自 Artificial Analysis Arena 查询的内部评测集,共有 4,800 票,而 HeyGen 自身的分数被归一化为 1000,以便更简单地进行比较。厂商把自己归一化到自家图表的首位,这是一种呈现方式的选择,并不能证明它领先。其下方各者之间的相对间距才是有信息价值的部分。

更有用的是正面交锋,这是 HeyGen 唯一一次与并非自己构建的对象进行测试。HeyGen 称,在 650 票中,盲测者在 55.8% 的对比中相比榜单上的 H3 Max post-train 更偏好其模型,区间为 49–62%。这个区间才是诚实的细节:在低端,它横跨 50%,因此按照厂商自己的数字,对该对手的偏好并不能与噪声清晰区分开。各维度的细分表现参差不齐,读起来像一种特定的失败画像——在忠于源图像上为 65%,在时序上为 66%,而一致性为 43%,音乐为 45%。

Griffin 的数据来自别人打造的测量工具,而这正是关键差异。NVIDIA 的 VideoFDB 是一个全双工音视频对话基准,按两条赛道评分,而 NVIDIA 构建了它,并用自家评判模型依据公开评分细则进行评估。Griffin-Lite 在生成方面得分 3.83(满分 5 分),人类参考为 3.92,次高的已发表系统为 2.80;在感知方面得分 3.73,人类参考为 4.20。Tavus 还报告,在 H100 上,其生成器相比四个已发表的流式扩散基线,实现了 0.43 秒的真实音频到视频延迟。这些保留意见仍然成立——在由语言模型评判的五分制评分细则上,与人类相差 0.09 分是“接近”,而非“等同”,而且感知优势的一部分是对比未使用视频输入的系统测得的——但评分方并非厂商。

• 独立质量评分——两者都没有。截至 2026 年 10 月 2 日,HeyGen Video 未出现在 Artificial Analysis 的三个视频榜单中的任何一个上,Griffin 也同样如此。Griffin 可能永远都不会有:基于短片的成对偏好投票无法为实时对话打分。

同样的榜单确实收录了基础模型。MiniMax H3 在文生视频(带音频)上以 Elo 1,139 位列第 4,在图生视频上以 1,181 位列第 2,两者均为 $4.80/分钟——因此,HeyGen 的后训练模型是在一个已被独立竞技场评为接近顶级的基底上参与竞争,而这是对其最有利的论据,且该论据并非出自 HeyGen 自己之手。

A screenshot of the top of Artificial Analysis's text-to-video-with-audio board, captured 2 October 2026: Wan 3.0 first at Elo 1,157 and $12.00/min, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at Elo 1,139 with 7,496 votes and $4.80/min, MiniMax H3 Max (based on MiniMax H3) fifth at 1,134 with 5,510 votes, and FLUX 3 sixth at 1,127, with release months and per-minute API pricing columns visible.

两者都廉价或无法定价,出于同样的原因

这两次发布背后共同的结构性事实是:造出一个足以乱真的人类已经变得很便宜,而两家公司的成本优势都不来自它们正在出售的东西。

HeyGen Video 是 MiniMax H3 的后训练产物,MiniMax 发布 H3 时,其权重以自身社区许可证提供。这使 H3 成为其他公司可以专精并转售的基底,而 HeyGen 是五周内第二个针对不同垂直领域这样做的产品——商业视频、产品演示、培训、房产导览。这种模式正是 HeyGen 能够定价低于基础模型的原因:它不承担基础模型的成本,而基础模型是别人发布的开放权重。

Griffin 押的是相反的赌注。Tavus 围绕交互本身构建了整个系统——编解码器、流式语音生成器、流式视频生成器、对话模型——分三个阶段把一个大型双向扩散教师模型蒸馏成少步自回归生成器,从而让长时程推演不会发生漂移。这是一项昂贵的研究,且没有可依托的开放基座,这很可能也是该发布被设限的部分原因:其底层没有廉价的基座可供摊销成本。

两家公司也从不同方向抵达了同一个令人不安的境地。HeyGen 自己的文档列出了该模型最不擅长的地方,这很少见,也值得一读:屏幕上大段文字、像花瓣、纸张和头发这样柔和的有机运动,以及诸如组装或操作设备这类近距离的手部动作。它最擅长短小、封闭的镜头——一个主体、一个地点、一个动作,摄影机固定或几乎不动。Griffin 的局限不是一列失败模式,而是一个尚未解决的安全问题:Tavus 直言不讳地指出,那些让人际交互模型成为更好界面的特性,也会让它更擅长说服别人相信正在与自己对话的是真人,并且它正在构建披露机制期间暂缓推出预览版。

买家目前实际能做些什么

HeyGen Video 现已可调用。它通过POST /v3/models/videos运行,需使用x-api-key请求头,仅限付费 API 密钥。下载链接经过签名且会过期——因此轮询会刷新这些链接——每个任务仅尝试回调一次,HeyGen 官方建议将其视为延迟优化手段,而非保证。如果你本月进行测试,0.01 美元的促销秒数已生效,输出上限为 768p,提示增强模式是一个真实的成本杠杆:默认使用 turbo,quality 会进行更长时间的推理,禁用则原样发送你的文本。

Griffin 目前无法调用。访问方式是填写申请表单,并且仅限研究预览。没有密钥,没有标识符,没有端点,也没有 SLA;而关于其可用性,唯一公开发布的声明是:等 Tavus 想清楚如何安全地发布它之后,它才会到来。

这两者的共同点在于,它们都不是路由器能帮你触达的模型;就 Griffin 而言,这属于类别问题,而不是暂时性问题——实时全双工会话并不是请求—响应式调用。在任何一条流水线中,路由器真正能帮上忙的,是视频周边的那一层。提示词扩展、参考图清单、分镜描述、字幕生成和审核摘要,全都是文本调用,而来自 OpenAI、Google 及其他厂商的这些调用,都汇聚在 OrcaRouter 目录中,通过同一个 OpenAI 兼容端点访问,同一个密钥即可使用 200+ 个模型,按提供商标价、零加价,因此供应商一旦调价,当天即可生效。至于视频模型本身,有一个有用的事实:MiniMax H3——HeyGen Video 正是基于它调优而来,而 HeyGen 的 $0.01 低价所压制的,正是它的每秒单价——在此处路由为minimax/minimax-h3,每秒 $0.08,2K 版本为 $0.13。HeyGen Video 本身不在我们的目录中,Griffin 也不在;两者都通过各自供应商的 API 以及若干第三方平台提供。

A screenshot of OrcaRouter's own model page for MiniMax-H3, captured 2 October 2026, showing the model id minimax/minimax-h3 labelled "text + image + video + audio", an Output type of video, a p50 time-to-first-token of 375 ms, and the OrcaRouter navigation and pricing panels alongside.

哪一个,给谁的

• 如果交付成果是简短、内容集中、以人物为中心且带内置声音的镜头素材,并且你能接受 768p、24 fps,那就使用 HeyGen Video。把 10 月之后的价格预算为每秒 $0.02 到 $0.03 左右,而不是促销期的 $0.10;在把工作流正式交给它之前,先测试较长的屏幕文字和手部特写,因为 HeyGen 已经告诉过你,这些正是它出问题的地方。

• 不要围绕 Griffin 做规划。如果你的问题是在一分钟通话中,一个人能否分辨出生成出来的人和真人,或者你需要在把路线图押注到渲染片段之前,先看清实时交互层将走向何方,请申请访问权限。

• 盯住披露问题,因为它才是能同时推动双方的那一件事。HeyGen Video 的客户有一个现成的答案——该模型是对开放权重基础模型做后训练得到的,而输出文件来源可追溯——而 Tavus 之所以特意压住一款模型不发布,正是因为它目前还没有这样的答案。哪家公司能拿出更好的披露机制,谁就解决了那个更有价值的问题。

A two-column scoreboard titled "Tavus Griffin vs HeyGen Video 1 — the scoreboard". Left column "Tavus Griffin": Status: research preview; Price: none published; Output: live session; Resolution: 720p at 25 fps; Clip length: none - a session; Independent score: none. Right column "HeyGen Video 1": Status: live 30 September 2026; Price: $0.01 per second; Output: video file; Resolution: 768p at 24 fps; Clip length: 5 to 15 seconds; Independent score: none yet. Footer: "HeyGen price per HeyGen's launch page, October 2026. Neither has an independent score."