
Tavus Griffin 与 MiniMax H3:双工对话模型遇上已正式发布的视频生成器
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Tavus Griffin 和 MiniMax H3 都能在屏幕上呈现出一个会动、会说话的人,但抛开这第一印象,它们几乎算不上同一类产品。Griffin 是一款Human Interaction Model——一个为实时双向对话而打造的视频生视频系统,由 Tavus 于 2026 年 10 月发布,目前仅限少数精选的早期测试者使用。而 MiniMax H3 是一款全模态视频生成器:你给它一段提示词,再加上可选的图像、视频和音频参考素材,它就会返回一段成品短片。一个仍在闭门评估之中,另一个则已经可供下载、授权和计费长达数月。决定二者中谁该进入你的技术栈的,正是这一差别——而非分辨率或帧率。
每一个到底是什么
Griffin 是 Tavus 为打造这样一种模型所做的尝试:它的行为更像一位参与者,而非一个渲染器。该公司称其为首个“人类交互模型”(Human Interaction Model),其公开的架构将这项工作拆成两部分:连续对话建模(Continuous Conversational Modeling),负责决定这个数字人每一刻应当做什么;以及音视频生成(Audio-Visual Generation),负责实时输出与之匹配的语音与面部画面。关键在于,它是全双工的——它一边说话一边观察和聆听,因此可以被打断,能在话语中途做出反应,也不必等到清晰的“轮次结束”信号才回应。Tavus 自己的说法是,以往的系统学的是生成人脸,而 Griffin 的目标是从人身上学习对话行为。
MiniMax H3 就是 Hailuo 3 代,于 2026 年 7 月 31 日发布,并于 2026 年 8 月 3 日以 MiniMax H3 社区许可证开源,同时公开发布了 H3-Base-FL2VA 和 H3-Base-Ref2VA 两个变体。它把文本、图像、视频和音频参考作为统一的上下文来读取,并返回一段 4 到 15 秒、768P 或 2K 分辨率、带原生立体声的片段,通过三阶段流水线生成(先是 H3-Context-IR,然后是以 768p 运行的 H3-Base,最后是 H3-Regenerate-2K)。它是一个输入面异常宽广、许可证又真正宽松的生成器——而这一切恰恰是 Griffin 目前所不具备的。
规格,并排对比

为什么"duplex"是个有意思的词
每一款视频生成器,包括 H3 在内,评判标准都是片段完成后的样子。而 Griffin 的评判标准则是片段无法展现的东西:在你打断它之后的 200 毫秒内会发生什么。这正是 Human Interaction Model 这一框架所指向的问题,也是为什么 Tavus 的核心数字是行为层面的,而不是视觉层面的。
最常被引用的数字是,48% 的人在一分钟的视频通话后相信 Griffin 是真人——54 名参与者中有 26 人——而 Tavus 之前由 Phoenix-4.5、Sparrow-2 和 Raven-1 组成的技术栈只有 2.4%,也就是 41 人中有 1 人。Tavus 还报告称,未被说服的人往往会在前 20 秒内产生怀疑,这比那个标题数字更有用:它意味着这种错觉要么很早就成立,要么很早就崩塌。
第二组数字来自 NVIDIA 的 VideoFDB 基准测试,评分于 2026 年 9 月进行;Tavus 称,在一项针对面对面 AI 的独立测试中,Griffin 排名第一。在生成方面,Griffin 得分为 3.83,而报告中最强的基线(Gemini 2.5 加 Anam 配置)为 2.80,人类参考分为 3.92,任务目标达成率为 62.8%。在感知方面,其得分为 3.73,而 MiniCPM-o 4.5 为 3.44,Gemini 2.5 Flash Native 为 3.17,纯音频 OpenAI gpt-realtime 配置为 2.97,人类参考分为 4.20,任务目标达成率为 73.8%,共评估了十五个模型。Tavus 还声称,Griffin 在即时反应方面领先第二好的系统 37%。这些是厂商报告的数据,依托于 NVIDIA 构建的基准测试,因此也应按此来看待——但其中的人类对比点才是值得保留的,因为 3.83 对 3.92 的人类得分,其差距比视频生成历史上所展现的要小得多。
今天你可以买什么
在这里,这两个模型完全不再具有可比性。
MiniMax H3 是一款产品。它采用托管服务,按生成输出的秒数计费,而其开放变体正放在一个模型中心里等待下载。如果你想要一段十五秒、2K、立体声的、现实中并不存在的东西的片段,今天下午就能拿到;如果你不想租用这些权重,也可以自己运行。
Tavus Griffin 不是一款产品。Tavus 在 Griffin 的说明中明确表示,研究预览版 Griffin-Lite 今天已面向一小群早期测试者开放,后续将更广泛地发布一个更强大的模型,而且 Griffin 目前尚未登陆 Tavus 平台,只有在公司想清楚如何安全发布之后才会推出。一家厂商对自己最引人注目的成果如此坦诚,实属罕见,这对规划很重要:你不能把 Griffin 作为依赖项列入产品路线图,也无法给它定价,因为根本还没有价格。
所以,诚实的规划问题不是“哪个更好”,而是“哪一个存在于我所需要的层级上”。

OrcaRouter 的定位
MiniMax H3 已收录在我们的目录中。模型页面位于 minimax/minimax-h3,其计费方式与提供商一致:768P 下每秒生成输出 $0.08,2K 下每秒 $0.13。OrcaRouter 按 0% 加价透传提供商的标价,因此 MiniMax 的价格变动会在公布当天就反映在我们的定价卡上,而不是等到下一个计费周期。Griffin 尚未收录在目录中,在 Tavus 将其交付给客户之前也不会收录——我们不会托管无法提供服务的模型,而仅限选定测试人员使用的研究预览,也不是路由器能够路由的对象。
实际后果是:这两个模型中的一个距离接入你的应用只有一行代码之遥,另一个则不过是一篇附了电话号码的研究论文。如果你已经在为多个视频和语言模型做路由,H3 的按秒计费也使它成为一种值得置于自动故障转移之后的路由:命中已饱和提供商的请求会改为向健康的提供商重试,而不是直接抛出超时;路由 DSL 还能让你把 2K 任务固定到特定提供商,同时让 768P 草稿落到容量最便宜的地方。模型融合是这里另一个值得一提的杠杆——H3 的按秒价格足够低,以至于在生成前花一个文本模型来改写并重新剪辑提示词,往往比一次糟糕的首轮尝试所浪费的秒数更便宜。

比较可能反转的情况
有三件事会改变这个比较,而且只有三件。
第一,如果 Tavus 将 Griffin 放到具有公开费率的商业 API 上,那么整个“对话还是片段”的框架就变成了真正的购买决策,而非排期决策,而 48% 的面对面比例也开始直接与生成输出的质量展开竞争。第二,如果 H3 的实时表现有所提升——而 MiniMax 一直在积极交付——那么一个能够流式输出的按秒计费生成器将削弱 Griffin 的核心优势。第三,如果 NVIDIA 或其他中立第三方在纳入 H3 或其继任者的情况下重新运行 VideoFDB,那么 Griffin 是面对面 AI 领域第一这一说法就不再是无法证伪的了。Tavus 表示,它预计在安全问题得到解决后很快就会发布 Griffin;这句话就是整个时间表。
最重要的一点
MiniMax H3 和 Tavus Griffin 目前并非竞争对手,因为两者之中只有一个能买得到。H3 是一款已交付、开放权重、按秒计费的全模态生成器,有公开定价,输出窗口为 4 到 15 秒;Griffin 是一款双工对话模型,拥有目前任何人公布过的最佳面对面指标,但没有 API、没有价格,其自家厂商还明确表示客户目前无法使用它。如果你今天就需要视频生成,H3 就是答案,而且它的成本可以精确到每秒几分钱。如果你需要一个能被随时打断的实时人脸,那就关注 Tavus——但请先把产品的其余部分做出来,因为它的发布时间只是一句说辞,而不是一个具体日期。
