一張「Tavus Griffin vs HeyGen Video 1」的主視覺卡片,三個標籤分別寫著「HeyGen Video — 每秒 $0.01」、「Griffin — 未公布價格,需申請存取」以及「HeyGen Video — 768p 下 5 至 15 秒」,置於六列資料上方:HeyGen 推出:2026 年 9 月 30 日;Griffin 發布:2026 年 10 月 1 日;HeyGen 價格:每秒 $0.01;Griffin 價格:未公布;HeyGen 輸出:5 至 15 秒短片;Griffin 輸出:即時工作階段。頁尾:「HeyGen Video 於 2026 年 9 月 30 日推出;Griffin 於 2026 年 10 月 1 日以預覽形式發布。」
Guides & Insights

Tavus Griffin 對上 HeyGen Video 1:相隔三十六小時,只有一款買得到

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩款產品在三十六小時內先後登場,落在市場的同一個角落,而行事曆是這對組合最有趣的地方。HeyGen Video 於 2026 年 9 月 30 日正式上線,整個十月期間每秒 0.01 美元,以 MiniMax H3 調校而成,並以這個識別碼發布:heygen-video-1Tavus Griffin 於 2026 年 10 月 1 日發表,並附上一項即時面對面研究,其中 54 名參與者有 26 人相信自己的對話夥伴是真人;它僅開放給特定受信任的測試者,須填寫申請表單,沒有識別碼、沒有端點,也沒有價格。兩者都是關於生成一個令人信以為真的人。坦白說,值得把Tavus Griffin與HeyGen Video 1拿來相比的理由,並不是買家會在兩者之間做選擇——如今只有其中一款買得到——而是這個差異說明了各自是為了什麼而打造,以及生成人類的一秒究竟值多少。

一個賣的是片段,另一個賣的是對話

HeyGen Video 是一款通用型影片模型,卻特別擅長處理人物。它接受一段提示詞,或提示詞加一張圖片,或提示詞加最多九張參考圖片、三段參考影片和三段參考音訊,並回傳一段長度介於 5 到 15 秒、480p 或 768p、24 fps 的片段,音訊為 32 kHz 立體聲 AAC,承載生成的對話、環境音與音效。三種模式涵蓋了條件設定——text_to_video、image_to_video,以及 reference_to_video,後者為預設——而清單順序會成為你在提示詞中稱呼的標籤,因此 reference_images 的第一個項目是 <Picture 1>。請求中的未知欄位會被拒絕,而非忽略,而 seed 是無號 32 位元整數,當你固定它並一次只改一個子句時,能讓鏡頭可重複。它是一款具有確定性邊界的製作工具。

Griffin 幾乎顛覆了上述每一項特性。它從單張參考照片生成 720p 影像,以 320 毫秒為區塊、25 fps 播放,並在解碼每個區塊時即時播放,因此無需指定片段長度,也沒有檔案需要交回。一套 Continuous Conversational Modeling 引擎會接收音訊與視訊,並以不到一秒的間隔重新評估交流,選擇要保持沉默、發出訊號、回應附和或取得發言權,而其表達控制會平行驅動串流語音生成器與串流視訊生成器。在句子中途做出的決定,會在同一個微型輪次內反映在聲音與臉上。你不必撰寫提示詞;你直接對它說話,而它會回應停頓、移開目光或打斷。

這就是為什麼儘管兩者都能生成人,它們仍不是彼此的替代品。HeyGen Video 被問的是,一個被描述的時刻看起來是什麼模樣。Griffin 被問的則是接下來應該發生什麼。

在可以購買秒數的那一個上,每一秒要花多少錢。

HeyGen Video 的上市優惠價在十月之前是每秒 $0.01,而 HeyGen 自家的文字說明將其描述為標準價 $0.02 的 50% 折扣。同一頁面上的成本圖表,註腳標明那是 768p 含音訊、上市促銷前的每秒定價,則把價格列為 $0.03。在廠商自家的上市資料中,文字說明與圖表之間竟有 50% 的落差;而在 HeyGen 公布 API 定價頁面之前,穩妥的解讀是:$0.01 已獲確認,因為它正在實行;至於十月之後的價格,則介於 $0.02 與 $0.03 之間。

算一下一千秒的數字——也就是一百支十秒短片——這正是量產團隊實際思考的單位:

• 十月的 HeyGen 影片 — 每秒 $0.01,共 $10。

• HeyGen Video 十月之後 — $20(以 $0.02 計),或 $30(以圖表上的 $0.03 計)。

• MiniMax H3,它是微調所依據的基礎模型——以 MiniMax 每秒 0.08 美元的定價計算,為 80 美元。

• Kling 3.0 Pro — 每秒 $0.168,總計 $168。

• Veo 3.1 — 每秒 $0.40,共 $400。

算術之所以成為 HeyGen 此次發布的頭條,原因在於捨棄率。製作社群短版、廣告變體與產品循環影片的團隊,產出的素材遠多於實際發布的數量,而以每十秒嘗試一毛錢的成本來看,隨手丟掉候選素材的經濟邏輯就徹底改觀了。問題在於上限:768p、24 fps 並不是 2K 的交付格式,而 MiniMax H3 是在 MiniMax 自家的託管 API 上,透過獨立的重新生成模組達到 2K,每秒要價 0.13 美元,HeyGen Video 則沒有對應的功能。如果你的交付目標高於 768p,那個便宜的一秒就不是你需要的一秒。

Griffin 在該清單中的那一欄是空白的,而且不是什麼好兆頭。Tavus 尚未公布費率,因為 Griffin-Lite 是一項研究預覽,其自家公告表示目前不會開放客戶使用,也不在 Tavus 平台上。在千秒計價模式下,沒有東西可填。任何為 Griffin 報出數字的人都是在憑空捏造。

品質數據,以及誰是評分者

這兩個模型都沒有獨立評分,這一點值得先說清楚,因為兩家廠商都有圖表。

HeyGen 的圖表是一張 Elo 表,其中 HeyGen Video 被標準化為 1000,接著 Dreamina Seedance 2.0 為 955,H3 Max 系列則從 952 一路分佈到 860,Kling 3.0 Pro 為 857,Veo 3.1 為 744。註腳做了大部分的工作:這些分數來自一組內部評估集,該評估集包含 Artificial Analysis Arena 的查詢,共有 4,800 票,而 HeyGen 自身的分數被標準化為 1000,以便更簡單地比較。一家供應商將自己標準化到自己圖表的頂端,是一種呈現方式的選擇,而非它領先的證據。其下方的相對間距才是具有資訊價值的部分。

更有用的是正面對決,這是 HeyGen 唯一針對並非由自己打造的東西進行測試的地方。HeyGen 表示,在 650 票中,盲測者在 55.8% 的比較裡更偏好它的模型,勝過圖表所列的 H3 Max post-train,範圍介於 49–62%。那個範圍正是誠實的細節:在低端它跨越了 50%,因此就該廠商自己的數據而言,相對於那個競爭對手的偏好並未明顯與雜訊區隔開來。各軸線的細分結果好壞參半,讀起來像是一種特定的失敗特徵——在忠於來源圖像方面為 65%、在時序方面為 66%,相較之下,一致性為 43%、音樂為 45%。

Griffin 的數字來自別人打造的評量工具,而這正是關鍵差異所在。NVIDIA 的 VideoFDB 是一項全雙工視聽對話基準測試,分兩個軌道評分,而 NVIDIA 建置了它,並以自家評審依據公開的評分標準進行評估。Griffin-Lite 在生成方面於滿分 5 分中拿下 3.83,人類參考分數為 3.92,而次高已發表系統為 2.80;在感知方面則拿下 3.73,人類參考分數為 4.20。Tavus 也報告,該生成器在 H100 上相較於四個已發表的串流擴散基線,達到 0.43 秒的真實音訊轉視訊延遲。但這些注意事項依然適用——在以語言模型評判的五分制評分標準上,與人類相差 0.09 分算是「接近」,而非「相等」,而且部分感知領先是相對於在沒有視訊輸入下運作的系統所測得——但評分者並不是供應商。

• 獨立品質分數——兩者都沒有。截至 2026 年 10 月 2 日,HeyGen Video 未出現在 Artificial Analysis 的三個影片排行榜中的任何一個,Griffin 亦然。Griffin 可能永遠不會:針對短片的成對偏好投票無法為即時對話評分。

同樣的榜單確實收錄了基礎模型。MiniMax H3 在文字轉影片(含音訊)以 Elo 1,139 排名第 4,在圖片轉影片以 1,181 排名第 2,兩者皆為每分鐘 4.80 美元——因此 HeyGen 的後訓練是在一個獨立競技場已評為接近頂尖的基底上競爭,而這正是對其最有利、但 HeyGen 自己並未發布的最強論據。

A screenshot of the top of Artificial Analysis's text-to-video-with-audio board, captured 2 October 2026: Wan 3.0 first at Elo 1,157 and $12.00/min, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at Elo 1,139 with 7,496 votes and $4.80/min, MiniMax H3 Max (based on MiniMax H3) fifth at 1,134 with 5,510 votes, and FLUX 3 sixth at 1,127, with release months and per-minute API pricing columns visible.

兩者之所以廉價或無法定價,都是因為同樣的原因。

兩次發布背後共同的結構性事實是:製造一個逼真的人類變得便宜了,而兩家公司的成本優勢都不是來自它們所販售的東西。

HeyGen Video 是 MiniMax H3 的後訓練版本,而 MiniMax 是以自家社群授權條款釋出權重的。這讓 H3 成為其他公司能夠特化並轉售的基底,而 HeyGen 是五週內第二個這麼做的產品,鎖定不同的垂直領域——商業影片、產品展示、培訓、房產導覽。這個模式正是 HeyGen 能將價格壓在基礎版本之下的原因:它不必承擔基礎模型的成本,而基礎模型是別人發布的開放權重版本。

Griffin 是相反的賭注。Tavus 圍繞互動本身打造了整套系統——編解碼器、串流語音生成器、串流視訊生成器、對話模型——並分三階段將大型雙向擴散教師模型蒸餾成少步數自迴歸生成器,讓長程推演不會漂移。這是昂貴的研究,且沒有開放基礎可依托,而這也很可能是它為何採取限制發布的原因之一:其底下沒有便宜的子層可供攤銷。

兩家公司也從不同方向抵達同一個令人不安的境地。HeyGen 自家的文件列出了該模型最不擅長的事項,這很少見且值得一讀:冗長的螢幕文字、柔軟的有機運動(如花瓣、紙張和頭髮),以及近距離的手部動作(如組裝或操作設備)。它最擅長簡短、封閉的鏡頭——一個主體、一個地點、一個動作,固定或幾乎不動的攝影機。Griffin 的限制不是一堆失敗模式,而是一個未解決的安全問題:Tavus 明確表示,那些讓人類互動模型成為更好介面的特性,也讓它更擅長說服某人相信他們正在與真人交談,而且它正在建立揭露機制的同時,暫緩推出預覽。

買家今天實際上能做什麼

HeyGen Video 現在可以呼叫了。它運行於 POST /v3/models/videos,並帶有 x-api-key 標頭,僅限付費 API 金鑰使用,下載連結經過簽章且會過期——因此輪詢會刷新它們——而每個工作只會嘗試回呼一次,HeyGen 本身也告訴你要把它視為延遲最佳化,而不是保證。如果你這個月要測試它,每秒 $0.01 的促銷價已上線,輸出上限為 768p,而提示增強模式是一項實實在在的成本槓桿:預設為 turbo,quality 用於較長的處理流程,disabled 則讓你的文字原樣送出。

Griffin 無法呼叫。存取方式是一份申請表單和研究預覽。沒有金鑰、沒有識別碼、沒有端點,也沒有 SLA;而唯一已發布關於可用性的聲明是:等到 Tavus 想出如何安全地發布它之後,它就會推出。

兩者有一個共同點:它們都不是路由器能幫你觸及的模型,而就 Griffin 而言,這是類別上的問題,而非暫時性的問題——即時全雙工工作階段並非請求—回應式的呼叫。在這兩條管線中,路由器真正幫得上忙的,是影片周邊的那一層。提示詞擴充、參考圖像清單、鏡頭描述、字幕生成與評論摘要全都是文字呼叫,而來自 OpenAI、Google 及其他廠商的這些呼叫,都放在 OrcaRouter 目錄中,透過同一個 OpenAI 相容端點、以同一把金鑰存取 200+ 個模型,以供應商牌價提供,未加收任何加成,因此供應商一調價,當天即生效。至於影片模型本身,有一個實用的事實:MiniMax H3——HeyGen Video 所微調自的基礎模型,也是 HeyGen 每秒 $0.01 的價格所壓低的那個對象——在此以 minimax/minimax-h3 路由,每秒 $0.08,2K 則為 $0.13。HeyGen Video 本身不在我們的目錄中,Griffin 也是;兩者都透過各自廠商的 API 及多個第三方平台提供服務。

A screenshot of OrcaRouter's own model page for MiniMax-H3, captured 2 October 2026, showing the model id minimax/minimax-h3 labelled "text + image + video + audio", an Output type of video, a p50 time-to-first-token of 375 ms, and the OrcaRouter navigation and pricing panels alongside.

哪一個,以及給誰?

• 如果交付成品是簡短、範圍有限、以人物為主、內建聲音的影片素材,而且你能接受 768p、24 fps,就使用 HeyGen Video。請把十月之後的費率編列為每秒 0.02 至 0.03 美元之間,而不是促銷價的 0.10 美元;並在把工作流程投入之前,先測試長篇螢幕文字與手部特寫,因為 HeyGen 已經告訴你,這些正是它會出問題的地方。

• 不要以 Griffin 為核心來規劃。如果你的問題是:在一分鐘通話中,人是否分辨得出生成的人類與真人;或者你需要在把路線圖押在渲染片段之前,先看清即時互動層的發展方向,那就請申請存取權限。

• 留意揭露問題,因為它是唯一能同時推動雙方的事情。HeyGen Video 的客戶有現成且直接的答案——該模型是對開放權重基礎模型進行後訓練的成果,而輸出是帶有已知來源的檔案——而 Tavus 則刻意暫緩推出一款模型,正因為它還沒有這樣的答案。哪家公司能發布更好的揭露機制,就能解決更有價值的問題。

A two-column scoreboard titled "Tavus Griffin vs HeyGen Video 1 — the scoreboard". Left column "Tavus Griffin": Status: research preview; Price: none published; Output: live session; Resolution: 720p at 25 fps; Clip length: none - a session; Independent score: none. Right column "HeyGen Video 1": Status: live 30 September 2026; Price: $0.01 per second; Output: video file; Resolution: 768p at 24 fps; Clip length: 5 to 15 seconds; Independent score: none yet. Footer: "HeyGen price per HeyGen's launch page, October 2026. Neither has an independent score."