「Tavus Griffin vs Runway Gen-4.5」的主視覺標題卡,副標為「對話與渲染是兩筆不同的帳單」,上方有四個資訊標籤:Gen-4.5 每秒影片 $0.12;Gen-4.5 2–10 秒短片,無音訊;Griffin 全雙工,可打斷;Griffin 未公布價格。
Guides & Insights

Tavus Griffin vs Runway Gen-4.5:對話與渲染是兩筆不同的帳單

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

把 Tavus Griffin 和 Runway Gen-4.5 放在一起比較,你首先會注意到的是,它們並不共用同一種計量單位。Griffin 由 Tavus 於 2026 年 10 月以研究預覽形式發布,是一種人類互動模型(Human Interaction Model)——一套影片對影片系統,能進行即時面對面交談,並在通話進行時生成另一名參與者的臉孔與聲音。Runway Gen-4.5 於 2025 年 12 月 1 日發布,並自 12 月 12 日起向付費訂閱者推出,是一款文字轉影片與圖像轉影片生成器,依其渲染的影片秒數向您收費。其中一個是按對話回合計費,另一個是按秒計費,而唯一誠實的比較方式,就是注意到 Griffin 的一分鐘與 Gen-4.5 的一分鐘並不是同一種一分鐘。

兩個時鐘朝相反方向運行

Gen-4.5 交到付費客戶手中已將近一年。它能依據文字提示或靜態圖像生成二到十秒的短片,支援 720p、每秒 24 或 25 幀,以及六種長寬比。它沒有音軌、沒有多鏡頭分鏡,也沒有對白——它是一個渲染引擎,而且是一個自律的渲染引擎。它的 API 是非同步的,這對一項耗時超過單一請求應有長度的工作而言,正是恰當的形式。Runway 自家的 API 除了提供自家模型,也供應第三方影片模型;而該公司推出了一個世界模型 GWM-1,這透露了 Runway 認為有趣的問題所在:不在於進行對話,而在於為場景建模。

Griffin 走的是相反的路線。Tavus 已公開架構中的每一項設計決策,著眼點都是延遲,而非保真度。Tavec 編解碼器以 48 kHz 運作,每秒 100 幀、每幀 40 個數值,不使用碼本,採用完全因果的解碼器,封包最小僅 10 毫秒。視訊路徑以 320 毫秒為單位輸出 720p,其中一個潛在表示涵蓋 25 fps 下的八幀,而每個潛在表示需要三個擴散步驟。在 H100 上,音訊到視訊的延遲平均為 0.43 秒;Tavus 表示,這大約是其測量到次快方法的一半。那套技術堆疊裡,沒有任何部分試圖渲染出精美的十秒鐘。其中每一部分都努力及時渲染出接下來的 320 毫秒。

所以,規格比較是真實的,但它不是計分板:

• 計費單位 — Runway Gen-4.5 以輸出秒數計費;你在按下生成前就能知道費用。Griffin 完全沒有公布價格,因為它沒有公開產品。

• 片段長度 — Gen-4.5 可產生兩到十秒的片段;Griffin 則會持續到通話結束為止。

• 解析度與幀率 — Gen-4.5 以 24 或 25 fps 渲染 720p;Griffin 則以 320 毫秒的區塊串流 720p、25 fps 的畫面。

• 音訊 — Gen-4.5 不會產生音軌;Griffin 則同時生成語音與影片,並可從約 10 秒的樣本複製聲音。

• 互動性 — Gen-4.5 是單向非同步請求;Griffin 則是全雙工,且可在說話中途被打斷。

• 動態與調色附加功能 — Gen-4.5 提供 ProRes 和 PNG 匯出,每秒加收 5 點數,HDR 則為每秒 20 點數,超過約四百萬像素時升至 40 點;Griffin 沒有對應功能,因為它不匯出檔案。

• 可用性 — Gen-4.5 自 2025 年 12 月 12 日起已對付費訂閱者開放;Griffin 處於研究預覽階段,僅供特定測試人員使用,而 Tavus 表示其尚未開放客戶使用。

Board titled 'Two Clocks, Two Bills' with six labelled rows comparing Runway Gen-4.5 (left) against Tavus Griffin (right): billing unit 'Runway Gen-4.5 - 12 credits per second of video' versus 'Tavus Griffin - no price, no product'; clip length 2 to 10 seconds versus as long as the call runs; resolution 720p at 24 or 25 fps versus 720p at 25 fps in 320 ms chunks; audio no audio track versus speech and face generated together; interactivity one asynchronous request versus full duplex, interruptible; availability live for subscribers since 12 December 2025 versus research preview, not sellable.

白話解讀 Gen-4.5 法案

Runway 將 Gen-4.5 定價為每生成一秒影片 12 點。以每點一美分的標準價格計算,這相當於每秒 0.12 美元,或者說,如果你能連續生成,整整一分鐘的影片素材約為 7.20 美元——但你做不到,因為該模型上限為十秒,所以一分鐘代表要將六段以上的個別生成結果拼接起來,而這會帶來任何可能的連貫性錯誤。ProRes 與 PNG 輸出每秒加收 5 點,HDR 每秒加收 20 點,若超過約四百萬像素則升至 40 點。API 點數與應用程式訂閱點數分開計費,這個細節會讓團隊在網頁應用程式中製作原型、之後轉向 API 時措手不及。

Board titled 'What One Minute Costs'. Left card, a minute of Runway Gen-4.5: rate 12 credits per second, about $0.12; hard limit 10 seconds per generation; so a minute means six or more separate generations; list price if it could run straight through about $7.20; extras ProRes or PNG +5 credits per second; HDR +20 credits per second, up to +40 above 4 MP. Right card, a minute of Tavus Griffin: rate none published; product research preview for selected testers; so a minute means not obtainable at any price; published evidence 0.43 s average audio to video on H100s; vendor statement not available for customer use at this time; availability no API, no price, no date.

Gen-4.5 是透過哪裡取得也很重要。你可以透過 Runway 自家的 API,以及數個第三方平台來使用它。它不是 OrcaRouter 的一條路由——我們並不代管它,也不會暗示你可以在這裡取得它。

Griffin 的代價是多少,以及為什麼那是個錯誤的問題

Tavus Griffin 目前沒有價格。Tavus 的發布資料指出,研究預覽版 Griffin-Lite 今日已提供給一小群精選的早期測試者使用,之後會更廣泛地發布更強大的模型,Griffin-Lite 目前不會開放給客戶使用,而 Griffin 尚未登上 Tavus 平台——待該公司研擬出如何安全發布後,它才會推出。

那段文字發揮了很大的作用。這意味著本文中的比較並非採購決定,而且在 Tavus 公布價格之前,也不可能成為採購決定。這也意味著,對於大多數供應商會以附有「聯絡銷售」按鈕的產品頁面來發布的成果,Tavus 卻異常直白。

Griffin 確實有發表的是關於行為的證據。在與倫敦瑪麗女王大學合作進行的一項研究中,54 名參與者中有 26 人——48%——在一分鐘的視訊通話後相信 Griffin 是真實的人,相較之下,Tavus 先前的 Phoenix-4.5、Sparrow-2 與 Raven-1 技術組合只有 41 人中的 1 人(2.4%)。在 NVIDIA 的 VideoFDB 基準測試中——於 2026 年 9 月評分——Tavus 回報在面對面 AI 上拿下第一名:生成項目 3.83,對比所回報最強基準的 2.80 以及人類參考的 3.92;感知項目 3.73,對比所回報最佳基準的 3.44 以及人類的 4.20,並在感知部分、十五個受評估模型中取得 73.8% 的任務目標達成率。這些是廠商自行回報的數字,且立基於 NVIDIA 所打造的基準測試之上,而它們關乎的是對話,不是電影攝影。

Screenshot of the Tavus website's Griffin announcement, captured 2 October 2026: the headline 'The First Human Interaction Model' under 'Introducing Griffin', a paragraph describing a video-to-video system that listens while the other person talks, and three statistic tiles reading 48% of people believed Griffin was a real person after a one-minute video call, #1 on NVIDIA's independent test of face-to-face AI, and 37% ahead of the next best AI at reacting in the moment, dated October 1st, 2026.

不同的職務,簡單說明

如果你想要一個黃昏城市的鏡頭,搭配能符合參考畫面的運鏡,Gen-4.5 是一款確實存在、而且今天就能做到的工具,價格大約是每秒十二美分。Griffin 在任何情況下都幫不上你,因為 Griffin 不接受提示詞,也不會回傳檔案。

如果你想要一張會傾聽、會被打斷,並能在數分鐘內讓對話保持連貫的臉,Gen-4.5 幫不上忙,因為它在請求送出後就不再接受輸入。一段含有說話者頭像的十秒短片並不是對話;它是一段對話的影片,而這個區別正是 Tavus 所推銷的。

重疊之處比「AI 影片」這個標籤所暗示的還要狹窄:兩者都輸出人物的像素,且兩者都以 720p 和 25 fps 運作。在那之上的所有東西都不同,包括發票上的單位。

為什麼路由器正好在這個位置很有用

到頭來兩者都需要的團隊,通常是吃了苦頭才發現——某個產品想要一個生成的定場鏡頭與一個會說話的虛擬化身,而這兩者來自不同供應商,各有不同的驗證方式、不同的額度系統和不同的故障模式。這正是單一端點證明自身價值的情況。OrcaRouter 用一把金鑰承載超過兩百個模型,直接按供應商定價提供,並收取0% 加價,因此供應商一調價,當天就會反映在價目上,而且會改向健康的供應商重試;當某條路由失敗時,會這麼做而不是丟給你一個逾時錯誤。路由 DSL 讓你將低風險草稿送到容量最便宜的地方,並把任何面向客戶的內容綁定到特定供應商;模型融合則讓你可以在昂貴的生成呼叫前面放一個便宜的文字模型,先改寫提示詞,再花那幾秒。

就這場對決而言,它涵蓋與不涵蓋什麼,說得精確一點:Gen-4.5 不是我們的路由之一,Griffin 也不是。目錄的影片部分包含minimax/minimax-h3,MiniMax 的全模態生成器,在 768P 下每輸出秒 $0.08,在 2K 下每秒 $0.13——與 Runway 同一比較基準上的每秒價格,而且來自我們今天確實能為你提供服務的模型。如果你需要的是生成出來的秒數,並希望它們與其他所有項目列在同一張帳單上,那就是誠實的建議。

要圍繞哪一個來規劃?

Gen-4.5 是安全得多的依賴選擇,而且領先幅度極大:自 2025 年 12 月起就已交到付費客戶手中,其 API 有完整文件記載,其點數有明確定價,而它的限制——十秒、無音訊、不支援分鏡——是公開載明的,而非等到使用時才發現。需要生成影像素材的團隊,本週就能開始。

Griffin 是上限更高、下限更低的押注。它的 48% 與 0.43 秒平均延遲描述的是某種真正嶄新的東西,而 Tavus 目前拒絕販售它,這件事所透露的是那個東西的成熟度,而非行銷決策。不要把它當作依賴項目放進路線圖;把它列入觀察清單,等安全註記消失時再回來查看。