「Tavus Griffin 對決 Google Veo 3.1」的主視覺卡片,內含三個標籤,分別寫著「Veo 3.1 — 每一幀皆套用 SynthID」、「Griffin — 在一項實際研究中騙過 48% 的受試者」,以及「Veo 3.1 Standard — 每秒 0.40 美元起」,置於六列資料之上:Griffin 溯源:未公布;Veo 溯源:SynthID 加上 C2PA;Griffin 價格:未公布;Veo 價格:每秒 0.40 美元;Griffin 狀態:研究預覽;Veo 狀態:正式開放使用。頁腳:「Veo 3.1 的費率為 Google Gemini API 的定價;Griffin 為研究預覽,尚未提供定價。」
Guides & Insights

Tavus Griffin vs Google Veo 3.1:一個為每一幀加上浮水印,另一個騙過了房間裡 48% 的人

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

把 Tavus Griffin和Google Veo 3.1並排放在一起,傳統的比較方式——每秒價格、Elo 評分、片段長度——立刻就會崩解,因為兩者之中只有一個有定價,也只有一個能在買家查得到的任何指標上被評分。但底下確實存在一條真實的軸線,而那條軸線不是品質。Google 對合成媒體的因應之道,是讓它可被偵測:每一份 Veo 3.1 的輸出都帶有 SynthID,這是一種隱形浮水印,逐格寫入像素之中,也寫入音訊頻譜,另有 C2PA Content Credentials 記錄檔案出處,而 Google 已在 Gemini 應用程式中推出偵測器,讓使用者能詢問某段影片是否由 Google AI 製作。Tavus Griffin 以預覽形式而非正式產品存在的所述理由,正是鏡像的另一面:在 Tavus 自家的實測研究中,54 名參與者有 26 人在結束一分鐘的視訊通話後,相信對方是真人,而在該公司先前的技術堆疊上,這個數字是 41 人中的 1 人;Tavus 表示,在釐清該如何揭露其本質之前,他們會暫緩推出這個模型。這兩家供應商之中,有一家賣的是偵測。另一家目前正是偵測之所以重要的原因,而它自己也心知肚明。

兩款建立在相反假設上的產品

Veo 3.1 是一款刻意把適用範圍設定得極為狹窄的影片片段生成器。在 Google 的 Gemini API 上,它每次生成 4、6 或 8 秒的內容,影格率為 24,原生解析度為 720p,而 1080p 與 4K 則是透過 2026 年 1 月更新所加入的升頻處理程序達成。延伸功能每次會增加七秒,最多可重複二十次,理論上限約為 148 秒,但輸入必須是 Veo 生成、長度不超過 141 秒、720p、16:9 或 9:16 的影片片段;此外,八秒的長度對延伸功能、參考圖像輸入,以及任何高於 720p 的設定而言都是必要條件。你無法製作出四秒的 1080p 影片片段。輸出是歸你所有的檔案,帶有浮水印,並附上已簽章的來源出處紀錄。

Griffin 不產生檔案。它運行一段對話。一個連續對話建模引擎接收音訊和視訊,並以次秒級間隔重新評估交流,選擇保持沉默、示意、附和或取得發言權,並發出表達控制,共同驅動串流語音生成器和串流視訊生成器。視訊生成器以 320 毫秒為區塊,從單一參考照片以 25 fps 生成 720p,一次一個潛在向量,並在解碼時播放每個區塊。沒有片段長度,因為沒有片段;只有一個持續進行的會話,直到有人停止說話。

那個區別決定了這項比較中幾乎所有其他項目。Veo 3.1 的容許範圍是一組製作流程可據以規劃的限制——八秒的鏡頭清單、為較長鏡頭提供的延伸階梯、固定的 24 fps,以及已知的解析度階梯。Griffin 的輸出則完全無法事先分鏡,因為它渲染出的內容取決於那個人接下來做什麼。

Veo 3.1 在各個方案層級的費用是多少

Google 公布的 Gemini API 費率包含音訊,以輸出每秒計價,而且 Veo 3.1 的任何層級都沒有免費方案。在該 API 上無法停用音訊——每次請求都會產生音訊——這點很重要,因為第三方來源所描述的 Vertex AI 價目表中,無聲影片的價格大約是含音訊價格的一半。Google 自家的文件並未提供該切換選項。如果無聲費率對你的帳單有影響,請依據你自己的 Vertex 帳單來確認,而不是參考比較頁面,包括本頁。

• Veo 3.1 Standard — 720p 與 1080p 每秒 $0.40,4K 每秒 $0.60。

• Veo 3.1 Fast — 720p 每秒 $0.10、1080p 每秒 $0.12、4K 每秒 $0.30。

• Veo 3.1 Lite — 720p 為每秒 $0.05,1080p 為每秒 $0.08,且沒有 4K 等級。

把八秒規則套進那些費率,每次嘗試的成本就是創意團隊實際編列預算時會算的數字:Standard 方案下一段八秒 1080p 片段是 32 美分;相同解析度下一段四秒是 80 美分,因為八秒下限在低於 720p 時不適用;而單一段八秒 4K 片段則是 4.80 美元。最後那個數字才是真正該停下來細想的一個,因為為了找到一個可用的 4K 鏡頭而嘗試四次,成本就略低於二十美元,而八秒的要求意味著你不能用一半的長度、一半的價格來測試這個點子。

Griffin 沒有價格、沒有免費方案,也沒有任何形式的費率表。Griffin-Lite 以研究預覽的形式,透過申請表提供給特定獲信任的測試者使用,並未登上 Tavus 平台,而且公告明確表示,現階段不會開放給客戶使用。Tavus 在該頁面上的結語是,Griffin 將在公司找出如何安全推出它之後問世。本文中每一項在任何類似購買決策的層面上比較兩者的說法,在 Griffin 的那一半都有漏洞,而且再怎麼研究也補不起來。

這兩個計分板實際上衡量的是什麼

這兩個模型之所以由不同的工具來評估,正是因為它們難以相互定價。

Veo 3.1 現身於 Artificial Analysis 的影片競技場,其中的 Elo 分數來自人類對短片的盲測成對偏好。於 2026 年 10 月 2 日在含音訊的文字轉影片排行榜上讀取:

• Veo 3.1 — 第 18–21 名,Elo 968(±11),在 2,857 票中,每分鐘 $24.00。

• Veo 3.1 Fast — 第 18–21 名,3,595 票中 Elo 961(±10),每分鐘 $7.20。

• Veo 3.1 Lite — 第 21–24 名,Elo 949(±11),獲得 2,762 票,每分鐘 $4.80。 • Veo 3.1 在圖片轉影片(含音訊)項目中 — 34 個中的第 11 名,Elo 1,082,獲得 7,049 票,每分鐘 $24.00。這是它在任何排行榜上的最佳名次,也是獲得最多票數支持的一次。

由此可見兩件事。三個等級彼此相差不到十九個 Elo 分,且信賴區間互相重疊,因此標準等級高出四倍的每秒價格,並未換來可量測的盲測偏好。而 Google 自家較新的 Gemini Omni Flash 產品線,在同一排行榜上排名高於所有 Veo 3.1 等級——以 7,801 票、Elo 1,117 並列第 7 至第 8,價格為每分鐘 $9.12,領先全部三個等級,每分鐘成本卻只有其四分之一到五分之一——這是每個 Veo 3.1 買家都該提出的問題,而本文並不適合回答這個問題。

Griffin 的數據來自 NVIDIA 的 VideoFDB,這是一套全雙工視聽對話基準測試,由 NVIDIA 於 2026 年 9 月獨立建置並評分。Griffin-Lite 在生成賽道上以 5 分制拿下 3.83 分,對比人類參考基準 3.92,而次高分的已發表系統為 2.80;在感知賽道上則拿下 3.73 分,對比人類參考基準 4.20。Tavus 也報告,該生成器的真實音訊轉視訊延遲為 0.43 秒,這是在 H100s 上與四個已發表的串流擴散基準相比的結果,並形容其為次快者的一半。

這兩組結果都無法互相推論。短片段偏好投票得出的 Elo 分數,完全無法說明一個模型是否能被打斷;評審針對對話給出的評分標準分數,也完全無法說明一段片段在 4K 下看起來是否正確。而且這些但書是雙向的:Griffin 與人類參考值之間 0.09 分的差距,在由語言模型評判的五分制評分標準上小到「接近人類」是誠實的解讀,而且其感知優勢有一部分是相對於完全沒有影片輸入的系統測量出來的。

A screenshot of the middle of Artificial Analysis's text-to-video-with-audio board, captured 2 October 2026, covering rows eleven to twenty-four: grok-imagine-video-1.5 at Elo 1,046, HappyHorse-1.1 at 1,045, Wan2.7-260612 at 1,032 with 4,645 votes and $9.00/min, HappyHorse-1.0 at 1,026, Kling 3.0 Omni 1080p Pro at 1,018, Kling 3.0 1080p Pro at 1,000 with 4,844 votes, PixVerse V6 at 987, Veo 3.1 at 968 with 2,857 votes and $24.00/min, Veo 3.1 Fast at 961 with 3,595 votes and $7.20/min, MAGI-2 Preview (0912) at 960, LTX-2.5 Fast at 950, Veo 3.1 Lite at 949 with 2,762 votes and $4.80/min, LTX-2.5 Pro at 944 and Vidu Q3 Pro at 941.

溯源,這才是真正的產品差異

對任何負有揭露義務的企業來說,這是唯一真正重要的章節,而且差距懸殊,毫無懸念。

Veo 3.1 的輸出會透過 SynthID 將標記逐幀嵌入像素與音訊頻譜之中,其設計能在壓縮、縮放、裁切與螢幕錄製後依然留存;而 C2PA Content Credentials 則記錄檔案來源與編輯歷程,並可與 Adobe 及 Microsoft 的實作互通。Google 已將偵測功能導入 Gemini 應用程式,因此使用者可以上傳影片,詢問是否由 Google AI 製作,偵測結果會指出標記位於音訊或視訊軌的哪個區段。這項限制真實存在,也值得說明:該偵測器只認得 Google 自家的模型。阿里巴巴或快手目前沒有任何可比擬的技術,Tavus 也是如此。

A screenshot of Google DeepMind's SynthID page, captured 2 October 2026: the Google DeepMind wordmark, the "SynthID" heading, the strapline "A tool to watermark and identify content generated through AI", the section tabs Overview / How it works / Hands-on, the heading "What is SynthID?", and a "Build with Gemini" panel with a Try Gemini link.

Tavus 尚未為 Griffin 發布浮水印、偵測器或內容憑證流程。它已經發布的,是它為何需要這些東西的理由。這項面對面研究對這種失效模式異常直白:超過半數的參與者表示,通話期間他們從未想過對方可能是 AI,而這一群人幾乎全都認定他們的對話對象是真實的人,至於那些確實起了疑心的人,多半在前二十秒內就識破了。相信者平均有 79% 的信心,懷疑者則有 81%。這是一個其欺騙性並非生成品質的副作用——而就是生成品質本身的模型。

Tavus 的回應是在公告中,而非在註腳裡:讓 Human Interaction Models 成為自然溝通強大介面的那些特性,也讓它們能欺騙人類,使人相信它不是 AI;若要安全發布,還需要進一步的對齊與安全程序,而該公司正在開發安全揭露功能,並與致力於應對 AI 安全的組織合作。這就是這道關卡存在的原因。Griffin-Lite 目前不會開放供客戶使用。

Google 帶來的企業術語,而 Tavus 則沒有

Veo 3.1 透過 Vertex AI 提供服務,並伴隨區域基礎架構、IAM,以及這所隱含的企業合約介面;而 Google 會依司法管轄區限制模型能做什麼:透過人物生成參數,歐盟、英國、瑞士與中東北非地區僅允許成年對象,其他地區則可允許所有對象。這是一套有文件記載、具區域感知的政策介面,而對受監管的買方而言,其重要性可能勝過排行榜名次。

這樣的形態是有代價的。Veo 3.1 在 Gemini API 上的模型 ID 仍屬預覽版 ID——veo-3.1-generate-preview及其同系列模型——而 Vertex 的 SKU 則採用正式可用(GA)的命名方式,第三方報告指出預覽版配額大約只有正式版配額的五分之一。Google 已於 2026 年 6 月 30 日淘汰較舊的 Veo 3.0 SKU,這說明了世代交替是如何處理的,任何以預覽版 ID 建構的東西都值得把這點計入成本。消費者端也確實受到限制:Flow 需要 Google AI Pro 或 Ultra 訂閱,且在歐盟、英國、印度、印尼、中國大陸與俄羅斯遭到封鎖,並未提供 VPN 變通方式。

Griffin 沒有服務條款可讀,因為根本沒有服務。使用權限是一份申請表和研究預覽。Tavus 表示正與安全組織合作進行評估,並希望人們參與其中,這是一種研究姿態,而非商業姿態。

取得兩者中的任何一個

Veo 3.1 可透過 Gemini API、Vertex AI、Google AI Studio 與 Flow 使用,而透過 Gemini 應用程式則僅支援 720p。在中國以外,它是兩者中取得金鑰容易得多的一方,差距懸殊;這一點削弱了上述的品質論點,也是這項比較儘管有這些數字,仍持續值得關注的主要原因。

只要提交存取要求並獲選為受信任的測試人員,即可取得 Griffin。這就是全部的採購途徑。

路由器在 Veo 管線中真正能幫上忙的地方,是緊鄰影片模型而非在其內部。Google 的文字模型——Gemini 3.5 Flash、Gemini 3.1 Pro Preview、Gemini 3.6 Flash 以及該系列其餘成員——都在 OrcaRouter 目錄中,並且可透過與 200 多個其他模型相同的 OpenAI 相容端點呼叫,以供應商定價、加收 0% 溢價。鏡頭清單、提示詞擴展、字幕生成、八秒片段之間的連戲註記,以及審閱摘要,全都屬於文字工作,而這正是能夠在大量處理階段使用便宜模型、在最終階段使用前沿模型只需改一項設定、而非進行一次遷移的那一層。Veo 3.1 本身我們並不提供路由,Griffin 也一樣;這一點值得明確說清楚,而不是讓像這樣的一段文字暗示並非如此。

老實說,哪一個?

• 當交付成果需要可追溯的來源紀錄、當買方受監管、當發布必須是附帶憑證的檔案,或當 4K 不可妥協時,請選擇 Veo 3.1。在每個成本模型中都要為八秒下限編列預算,並在用它建立面向客戶的路徑之前,先檢查預覽 ID 的生命週期。

• 不要選擇 Griffin,因為你辦不到。如果你的問題是:在一分鐘的通話中,人能否分辨 AI 與真人,或者你需要在把路線圖投入 clip layer 之前先知道互動層的走向,那就請申請存取權。

• 看偵測器,而不是看示範。如果 Tavus 發布了一套能在日常對話中經得起考驗的揭露機制,這兩家供應商之間的差距就會大幅縮小。如果沒有,Griffin 就是一個值得引用的結果,而 Veo 3.1 仍是兩者之中唯一能交給合規團隊審查的產品。

A two-column scoreboard titled "Tavus Griffin vs Google Veo 3.1 — the scoreboard". Left column "Tavus Griffin": Provenance: none published; Price: none published; Clip length: no clip - a session; Resolution: 720p at 25 fps; Loop: full duplex; Status: research preview. Right column "Google Veo 3.1": Provenance: SynthID plus C2PA; Price: $0.40 per second; Clip length: 4, 6 or 8 seconds; Resolution: 720p native; Loop: one generation; Status: generally available. Footer: "Veo 3.1 per Google's Gemini API pricing, 2 October 2026."