
Tavus Griffin 對決 Kling 3:即時對話對上十秒短片
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
這場對決的真實輪廓,是一種路由上的不對稱。Kling 3是一個可呼叫的模型,有價格、有參數介面,也在我們自家目錄中佔有一筆;Tavus Griffin則是研究預覽版,僅限特定受信任的測試者透過申請表單取用,於 2026 年 10 月 1 日發表,沒有識別碼、沒有端點,也沒有公開費率。Kling 3.0 在 OrcaRouter 目錄中以kling/kling-v3的名義收錄,定價為每次請求 $0.084,供應商標價原樣轉嫁,未加收任何費用。Griffin 無法透過路由取用,而這並不是因為還沒有人抽空去做——一個即時全雙工的工作階段,模型一邊聆聽、一邊以 320 毫秒為單位生成 720p 畫面,這並不是請求—回應式的呼叫,即使 Tavus 明天就大開方便之門,它也套不進同樣的形式。所以這不是買方能靠價格來決斷的比較。它比較的是兩個答案,針對「生成的人類究竟是為了什麼」這個問題。
Kling 3.0 究竟是什麼
Kling 3.0 於 2026 年 2 月 5 日推出,為一個包含四款模型的系列——Video 3.0、Video 3.0 Omni、Image 3.0 與 Image 3.0 Omni。其標誌性功能是自動多鏡頭編排:模型會自行規劃鏡頭轉換,而自訂模式可讓你設定鏡頭數量與每個鏡頭的時長,評論者回報,單一提示詞即可產出多達約六個不同鏡頭的可用序列,且每個鏡頭都能指定鏡頭尺寸、攝影機運動與敘事節拍。每次生成的時間上限為 15 秒,下限為 3 秒。在 OrcaRouter 方面,它以旗艦級文字轉影片與圖像轉影片模型的形式登場,具備多鏡頭、主體與動態控制、3 至 15 秒的片段,並宣稱最高可達原生 4K,透過 POST /v1/video/generations 提供服務。
音訊是在同一道流程中原生生成的。快手版本支援中文、英文、日文、韓文與西班牙文,能處理單一片段中的多語混雜對話,在多角色場景中為每個角色綁定獨特嗓音,並提供地區口音——美式、英式與印度英文;東北、北京、台灣、粵語與四川中文。唇形同步一致性是獨立實測評測中最常被點名的單一弱點,有項測試回報大約每五段對話片段就有兩段需要重拍,而回報的瑕疵也集中在嘈雜環境中的對話,水聲與風聲背景會讓語音變得悶糊。
用一段話說明 Griffin 究竟是什麼
Griffin 並非具備對話模式的影片生成器。它是兩個同時運作的引擎。連續對話建模引擎(Continuous Conversational Modeling engine)會接收一個人的音訊與視訊,以不到一秒的間隔重新評估這段交流,並在每個間隔決定要維持沉默、發出訊號、附和回應,還是接過發言權——它輸出的是承載時間點、立場、面部表情與手勢的表現力控制訊號,而不只是詞語。音視覺生成引擎則把這些控制訊號同時化為聲音與像素:一個自迴歸擴散 transformer,從編碼的說話者前綴逐個潛在區塊生成語音;以及一個少步數自迴歸影片生成器,能從單一張參考照片,以 25 fps 生成每塊 320 毫秒的 720p 影片。這裡沒有提示詞、沒有片段長度,也沒有檔案。在音訊方面,它報告指出在 H100 上的真實音訊轉影片延遲為 0.43 秒,對比四個已發表的串流擴散基線,Tavus 形容這是次快方法的一半。
價格,以及單面表
Kling 3.0 的定價是本文中唯一一處,在比較的兩邊都有確切數字,而其中一邊卻是空的。
• Kling 3.0 在 OrcaRouter 上 — 每次請求 $0.084,供應商定價以 0% 加成直接傳遞,因此 Kuaishou 的費率變更或促銷降價會在同一天於此處生效,而不是等到合約週期之後。
• Kling 3.0 在獨立競技場上——於 2026 年 10 月 2 日讀取的文字轉影片(含音訊)排行榜,列出 1080p Pro 層級為每分鐘 $10.08,Omni 1080p Pro 層級為每分鐘 $8.40。同一排行榜對 Kling 3.0 的四個層級給出四種不同價格,因此「Kling 3.0 的價格」並非單一數字。
• Griffin — 無價格。Griffin-Lite 以研究預覽形式提供給部分精選的受信任測試者,並未上架 Tavus 平台,且其自身的公告表示目前不會開放供客戶使用。沒有可報價的每請求費率、每秒費率,也沒有免費方案,該模型只有在 Tavus 找出安全發布方式之後才會推出。
那就是整個價格部分;與其根據運算足跡憑空捏造出每秒估算,不如就讓它維持原樣,這才誠實。
這些計分板衡量的內容不同,且並不一致。
這兩個模型都是由其供應商以外的人,以無法相互比較的工具評分的。
Kling 3.0 名列 Artificial Analysis 的影片競技場,其中的 Elo 分數來自人類對短片進行的盲測成對偏好比較。同一天取得的兩份讀數卻說出不同的故事,而這正是值得點名的陷阱:在含音訊的文字轉影片排行榜上,Kling 各層級位居中段,但在含音訊的圖片轉影片排行榜上,它們的排名明顯更高——然而 Kling 各層級並非全都同時出現在這兩張榜上。只有 Pro 與 Omni Pro 1080p 版本有出現在文字榜上;720p Standard 層級僅在圖片轉影片上受評,別無其他。
• Kling 3.0 在文字轉影片(含音訊)中——1080p Pro 排名第 16,Elo 1,000,4,844 票,每分鐘 $10.08;Omni 1080p Pro 排名第 16,Elo 987,2,741 票,每分鐘 $6.90。兩者中較貴的層級得分反而較低,這與此排行榜上其他各處的層級差距所顯示的同樣「無結果」如出一轍。
• Kling 3.0 於圖片轉影片(含音訊)——1080p Pro 位居第 18 至第 20 名,Elo 1,055(±6),共獲 14,896 票,每分鐘 $20.16;720p Standard 位居第 18 至第 20 名,Elo 1,051(±6),共獲 14,692 票,每分鐘 $15.60;Omni 1080p Pro 位居第 21 至第 22 名,Elo 1,044(±8),共獲 2,945 票,每分鐘 $16.80;Omni 720p Standard 位居第 21 至第 24 名,Elo 1,036,每分鐘 $13.44。
解讀是:Kling 3.0 從外部提供的圖像起步時,比從文字起步時更強,而圖生影片榜單的票數是後者的三倍,因此它在該榜的排名是較為明確的。那也正是多數商業作品採用的模式。留意這四個等級能換得什麼:在圖生影片類別中,它們橫跨十六個 Elo 分,價格範圍從每分鐘 13.44 美元到 20.16 美元,而四者中最便宜的那個並非排名最低的。為 Kling 3.0 付更多錢,並不會讓它在這個榜單上往上爬。

Griffin 的分數來自 NVIDIA 的 VideoFDB,它會以兩條軌道為全雙工視聽對話評分,並由 NVIDIA 使用自家評審、依據公開的評分量表建置與執行。Griffin-Lite 在生成方面,於人類參考分數 3.92 之下拿到 5 分中的 3.83,並在次高已發表系統中拿到 2.80;在感知方面,於人類參考分數 4.20 之下拿到 3.73,接管率對齊為 62.8% 與 73.8%。那些數字完全無法說明一段片段在 1080p 下看起來是否正確,而 Kling 的 Elo 也無法說明一個模型能否在句子中途被打斷。對兩者唯一誠實的用法,就是把它們放在各自所屬的問題裡。
沒有人在衡量的落差:延遲與長度之對比
這裡存在一個真正的工程差異,是兩個排行榜都未能呈現的,而對於任何正在規劃產品的人而言,這正是這項比較中最有用的部分。
Kling 在有界生成中針對長度與結構進行最佳化:最長十五秒、最多約六個規劃鏡頭、可逐鏡頭控制。其成本隨輸出時長而增加,而品質則取決於提示的具體程度。當使用者還在說話時,它完全不會運行,而這並不是缺陷——而是這個類別的本質樣貌。
Griffin 在無界工作階段中針對延遲進行最佳化:320 毫秒的區塊、25 fps、每隔不到一秒就做出一次決策,沒有片段需要規劃,因為對話沒有結束。其成本,無論最終為何,都會隨對話時長而非渲染秒數增減;而其品質則取決於另一端的人有多自然,而非取決於簡報。將其進行三階段蒸餾、變成一個以自身歷史訓練的自迴歸生成器,之所以存在,正是因為這個架構的失效模式是長時間推演中的漂移,而非單一鏡頭不佳。
把這兩者並排放在一起看,實際後果就是它們會朝相反方向失敗。Kling 3.0 的失敗看得見,而且來得早——一段勉強可用的鏡頭,你可以花幾美分刪掉重新生成,重拍預算已內建在工作流程中。Griffin,如果它真如外界所述那樣運作,則會以看不見且延後的方式失敗,因為它不是它表面上看起來的樣子,而這正是 Tavus 扣住它的原因。
路由器真正有幫助的地方,以及沒有幫助的地方
Kling 3.0 已收錄於 OrcaRouter 目錄中,型號為 kling/kling-v3,每筆請求 $0.084,使用與 200+ 個其他模型相同的金鑰和相同的 OpenAI 相容端點。這與同時持有快手帳戶,以及為你的管線所需的任一文字模型另外做一套整合,有著實質差異:因為我們不會在供應商價格上加價,快手的價格調整當天就會在我們這邊生效;而如果上游供應商效能下降或進行速率限制,自動容錯移轉會在回應開始前先轉移請求,而不是向你的應用程式回傳錯誤。對於一次呼叫的成本可能超過一千次文字呼叫的影片管線來說,讓請求挺過上游出問題的一分鐘,比你不必支付的加價更有價值。
Griffin 不在我們的型錄中,也不在任何人的型錄中,而且不可能在——全雙工會話模型不是路由請求。唯有提交使用申請才能觸及它。Tavus 自己把有意開發者引向其較舊模型、而非 Griffin,這正是端倪:那三個前代模型支撐著 150,000 名開發者和企業已在使用的 PAL,而 Griffin 並不在其中。

哪一個,做什麼用的?
• 若你打算用單一提示詞規劃多鏡頭序列,請選 Kling 3.0;若要做圖生影,而它在無音訊競技場的排名強勁、票數踴躍,也請選它;若要製作橫跨五種語言的多語對白,並為每個角色綁定各自的語音;若要在鏡頭移動之間維持元素一致性;若要使用 4K,前提是你以書面確認該方案層級——快手自家的文件宣稱原生 4K,但其使用指南僅列出 720p 與 1080p,而且第三方對 4K 的點數費率在不同來源之間相差超過兩倍。
• 如果重點在於對話,請先測試 Kling 3.0 的脣形同步,因為獨立實測評論指出,這正是它會出錯的地方,而這個失誤會導致最多重拍。
• 不要圍繞 Griffin 做規劃。如果你需要解答的問題是:在一分鐘的通話中,人能否分辨出生成的人類與真人;或者,知道互動層將往哪裡發展,是否應該影響你現在在短片層上打造的東西,那就申請存取權。
• 要觀察兩件事,而不是一件事。在 Kling 這邊,要看層級差距是否開始反映價格,因為這四個層級目前在圖像轉影片上的 Elo 分數彼此相差不超過十九分,價格卻相差五成,而且最便宜的層級並非排名最差。在 Griffin 這邊,要看揭露機制與模型卡是否會出現;如果出現了,這項比較就不再是設計論述,而會開始變成採購決策,本文也就需要重寫。

