'Tavus Griffin vs MiniMax H3' 主视觉标题卡,副标题为"双工对话模型遇上已落地的视频生成器",上方有四个信息标签:Tavus Griffin 研究预览版,仅限测试人员;MiniMax H3 开放权重,已发布;MiniMax H3 在 768P 下 $0.08/秒;Griffin:无 API,无定价。
Guides & Insights

Tavus Griffin 与 MiniMax H3:双工对话模型遇上已正式发布的视频生成器

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Tavus Griffin 和 MiniMax H3 都能在屏幕上呈现出一个会动、会说话的人,但抛开这第一印象,它们几乎算不上同一类产品。Griffin 是一款Human Interaction Model——一个为实时双向对话而打造的视频生视频系统,由 Tavus 于 2026 年 10 月发布,目前仅限少数精选的早期测试者使用。而 MiniMax H3 是一款全模态视频生成器:你给它一段提示词,再加上可选的图像、视频和音频参考素材,它就会返回一段成品短片。一个仍在闭门评估之中,另一个则已经可供下载、授权和计费长达数月。决定二者中谁该进入你的技术栈的,正是这一差别——而非分辨率或帧率。

每一个到底是什么

Griffin 是 Tavus 为打造这样一种模型所做的尝试:它的行为更像一位参与者,而非一个渲染器。该公司称其为首个“人类交互模型”(Human Interaction Model),其公开的架构将这项工作拆成两部分:连续对话建模(Continuous Conversational Modeling),负责决定这个数字人每一刻应当做什么;以及音视频生成(Audio-Visual Generation),负责实时输出与之匹配的语音与面部画面。关键在于,它是全双工的——它一边说话一边观察和聆听,因此可以被打断,能在话语中途做出反应,也不必等到清晰的“轮次结束”信号才回应。Tavus 自己的说法是,以往的系统学的是生成人脸,而 Griffin 的目标是从人身上学习对话行为。

MiniMax H3 就是 Hailuo 3 代,于 2026 年 7 月 31 日发布,并于 2026 年 8 月 3 日以 MiniMax H3 社区许可证开源,同时公开发布了 H3-Base-FL2VA 和 H3-Base-Ref2VA 两个变体。它把文本、图像、视频和音频参考作为统一的上下文来读取,并返回一段 4 到 15 秒、768P 或 2K 分辨率、带原生立体声的片段,通过三阶段流水线生成(先是 H3-Context-IR,然后是以 768p 运行的 H3-Base,最后是 H3-Regenerate-2K)。它是一个输入面异常宽广、许可证又真正宽松的生成器——而这一切恰恰是 Griffin 目前所不具备的。

规格,并排对比

Two-card board titled 'One Is a Product'. Left card, MiniMax H3: omni-modal video generator, Hailuo 3 generation; released 31 July 2026 with open weights on 3 August 2026; 4 to 15 seconds at 768P or 2K with native stereo audio; text, image, video and audio inputs in one context; $0.08 per second at 768P and $0.13 at 2K; hosted and billable today. Right card, Tavus Griffin: duplex Human Interaction Model, video to video; announced October 2026 as a research preview; 720p at 25 fps in 320-millisecond chunks; the live participant's video and audio as input; no published price; selected testers only, not for customer use.

为什么"duplex"是个有意思的词

每一款视频生成器,包括 H3 在内,评判标准都是片段完成后的样子。而 Griffin 的评判标准则是片段无法展现的东西:在你打断它之后的 200 毫秒内会发生什么。这正是 Human Interaction Model 这一框架所指向的问题,也是为什么 Tavus 的核心数字是行为层面的,而不是视觉层面的。

最常被引用的数字是,48% 的人在一分钟的视频通话后相信 Griffin 是真人——54 名参与者中有 26 人——而 Tavus 之前由 Phoenix-4.5、Sparrow-2 和 Raven-1 组成的技术栈只有 2.4%,也就是 41 人中有 1 人。Tavus 还报告称,未被说服的人往往会在前 20 秒内产生怀疑,这比那个标题数字更有用:它意味着这种错觉要么很早就成立,要么很早就崩塌。

第二组数字来自 NVIDIA 的 VideoFDB 基准测试,评分于 2026 年 9 月进行;Tavus 称,在一项针对面对面 AI 的独立测试中,Griffin 排名第一。在生成方面,Griffin 得分为 3.83,而报告中最强的基线(Gemini 2.5 加 Anam 配置)为 2.80,人类参考分为 3.92,任务目标达成率为 62.8%。在感知方面,其得分为 3.73,而 MiniCPM-o 4.5 为 3.44,Gemini 2.5 Flash Native 为 3.17,纯音频 OpenAI gpt-realtime 配置为 2.97,人类参考分为 4.20,任务目标达成率为 73.8%,共评估了十五个模型。Tavus 还声称,Griffin 在即时反应方面领先第二好的系统 37%。这些是厂商报告的数据,依托于 NVIDIA 构建的基准测试,因此也应按此来看待——但其中的人类对比点才是值得保留的,因为 3.83 对 3.92 的人类得分,其差距比视频生成历史上所展现的要小得多。

今天你可以买什么

在这里,这两个模型完全不再具有可比性。

MiniMax H3 是一款产品。它采用托管服务,按生成输出的秒数计费,而其开放变体正放在一个模型中心里等待下载。如果你想要一段十五秒、2K、立体声的、现实中并不存在的东西的片段,今天下午就能拿到;如果你不想租用这些权重,也可以自己运行。

Tavus Griffin 不是一款产品。Tavus 在 Griffin 的说明中明确表示,研究预览版 Griffin-Lite 今天已面向一小群早期测试者开放,后续将更广泛地发布一个更强大的模型,而且 Griffin 目前尚未登陆 Tavus 平台,只有在公司想清楚如何安全发布之后才会推出。一家厂商对自己最引人注目的成果如此坦诚,实属罕见,这对规划很重要:你不能把 Griffin 作为依赖项列入产品路线图,也无法给它定价,因为根本还没有价格。

所以,诚实的规划问题不是“哪个更好”,而是“哪一个存在于我所需要的层级上”。

Screenshot of Artificial Analysis's 'AA-Video-T2V v2.0' leaderboard, the Overall board for text-to-video, captured 2 October 2026: Wan 3.0 first at Elo 1,157, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at 1,139 and MiniMax H3 Max fifth at 1,134, with samples, release month and per-minute API pricing columns. The board lists MiniMax H3 and MiniMax H3 Max fourth and fifth with audio, though the with-audio filter itself is not applied in this capture.

OrcaRouter 的定位

MiniMax H3 已收录在我们的目录中。模型页面位于 minimax/minimax-h3,其计费方式与提供商一致:768P 下每秒生成输出 $0.08,2K 下每秒 $0.13。OrcaRouter 按 0% 加价透传提供商的标价,因此 MiniMax 的价格变动会在公布当天就反映在我们的定价卡上,而不是等到下一个计费周期。Griffin 尚未收录在目录中,在 Tavus 将其交付给客户之前也不会收录——我们不会托管无法提供服务的模型,而仅限选定测试人员使用的研究预览,也不是路由器能够路由的对象。

实际后果是:这两个模型中的一个距离接入你的应用只有一行代码之遥,另一个则不过是一篇附了电话号码的研究论文。如果你已经在为多个视频和语言模型做路由,H3 的按秒计费也使它成为一种值得置于自动故障转移之后的路由:命中已饱和提供商的请求会改为向健康的提供商重试,而不是直接抛出超时;路由 DSL 还能让你把 2K 任务固定到特定提供商,同时让 768P 草稿落到容量最便宜的地方。模型融合是这里另一个值得一提的杠杆——H3 的按秒价格足够低,以至于在生成前花一个文本模型来改写并重新剪辑提示词,往往比一次糟糕的首轮尝试所浪费的秒数更便宜。

Screenshot of the OrcaRouter model page for MiniMax-H3, showing the model id minimax/minimax-h3, the description 'omni-modal video generation model (the Hailuo 3 generation), released July 31, 2026', a price of $0.08 per second, p50 time to first token of 375 ms and p95 of 416 ms over seven days.

比较可能反转的情况

有三件事会改变这个比较,而且只有三件。

第一,如果 Tavus 将 Griffin 放到具有公开费率的商业 API 上,那么整个“对话还是片段”的框架就变成了真正的购买决策,而非排期决策,而 48% 的面对面比例也开始直接与生成输出的质量展开竞争。第二,如果 H3 的实时表现有所提升——而 MiniMax 一直在积极交付——那么一个能够流式输出的按秒计费生成器将削弱 Griffin 的核心优势。第三,如果 NVIDIA 或其他中立第三方在纳入 H3 或其继任者的情况下重新运行 VideoFDB,那么 Griffin 是面对面 AI 领域第一这一说法就不再是无法证伪的了。Tavus 表示,它预计在安全问题得到解决后很快就会发布 Griffin;这句话就是整个时间表。

最重要的一点

MiniMax H3 和 Tavus Griffin 目前并非竞争对手,因为两者之中只有一个能买得到。H3 是一款已交付、开放权重、按秒计费的全模态生成器,有公开定价,输出窗口为 4 到 15 秒;Griffin 是一款双工对话模型,拥有目前任何人公布过的最佳面对面指标,但没有 API、没有价格,其自家厂商还明确表示客户目前无法使用它。如果你今天就需要视频生成,H3 就是答案,而且它的成本可以精确到每秒几分钱。如果你需要一个能被随时打断的实时人脸,那就关注 Tavus——但请先把产品的其余部分做出来,因为它的发布时间只是一句说辞,而不是一个具体日期。