「Tavus Griffin vs Alibaba Wan 2.7」主視覺卡片,附有兩個標籤,分別寫著「Tavus Griffin — 未公布定價」與「Alibaba Wan 2.7 — 1080p 每分鐘 $9.00」,位於六列資訊上方:產出:即時對話;相對:2 至 15 秒的短片;Griffin 價格:未公布;Wan 2.7 價格:每分鐘 $9.00;Griffin 狀態:研究預覽;Wan 2.7 狀態:正式推出。頁尾:「Wan 2.7 的費率為 Alibaba Cloud 定價表價格;Griffin 為研究預覽,並無價目表。」
Guides & Insights

Tavus Griffin 對決 Alibaba Wan 2.7:對話式模型對抗生成式模型

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

要比較 Tavus Griffin 和 Alibaba Wan 2.7,最直覺的方式是按影片每秒計價,但這種比較根本無從成立。Wan 2.7 有公開的價目表——在阿里雲國際新加坡節點上,1080p 每分鐘 9.00 美元,北京與東京節點則有更便宜的級距——而 Tavus Griffin 完全沒有價目表,因為 Griffin-Lite 是在 2026 年 10 月 1 日以研究預覽的形式發布,僅限特定受信任的測試者透過申請表單取得。這兩者唯一共有的,是「影片」這個詞。除此之外,它們回答的是不同的問題。一個被問的是對話接下來該發生什麼;另一個被問的是所描述的場景看起來是什麼樣子。真正有意思的比較不在於品質,而在於兩者各自需要你先提供什麼才會產出任何東西,以及你會拿回什麼。

差別在於迴圈,而非解析度

Wan 2.7 會依提示逐段生成影片。你寫下一段描述,得到一段素材,看過之後,再寫下一段。Wan 2.7 是一套由四個模型組成的套件——文字轉影片、圖像轉影片、參考轉影片與影片編輯——而它的互動本質上是交易式的:一個輸入、一份算繪輸出,以及決定要不要保留它。在你還在思考要提出什麼要求時,它不會進行任何運作。

Griffin 的建構方式正好相反。它是一個全雙工系統:一個連續對話建模引擎,會接收音訊與視訊,並以不到一秒的間隔重新評估對話,決定要維持沉默、發出訊號、應答附和,還是取得發言輪次,並發出表達性控制訊號,平行驅動串流語音生成器與串流視訊生成器。它能從單一參考照片生成 720p、以 320 毫秒為區塊的內容,而真正重要的主張是:在句子說到一半時所做的決定,會在同一個迷你輪次內反映在聲音與臉上。這件事的評判標準不是剪輯影片的排行榜,而是你是否能打斷它。

說得直白一點:Wan 2.7 回答的是「這個場景動起來時看起來像什麼?」Griffin 回答的是「既然這個人剛剛停頓了,這張臉和聲音在接下來兩百毫秒內應該做什麼?」

價格,在有價格的那一側

Wan 2.7 公佈的費率是依生成影片的每秒計算,而且整個套件中各方案的層級並不一致,而這正是大多數比較頁面會略過的細節。

• wan2.7-t2v 與 wan2.7-i2v — 僅按輸出時長計費。國際新加坡地區:720p 為 $0.10/秒,1080p 為 $0.15/秒,這正是排行榜上顯示的每分鐘 $9.00。北京與東京針對相同工作則列出每秒 $0.086 與 $0.143。

• wan2.7-r2v(參考轉影片)——依輸入影片長度計費,上限為五秒,再加上輸出。將五秒的參考影片餵入十五秒的生成內容,就會以二十秒計費。

wan2.7-videoedit — 僅依輸出計費,輸入素材免費。

有兩項生命週期事實應該與那些數字並列。阿里巴巴為自家的百鍊與 Qwen Cloud 平台推出了限時 30% 的首發折扣,活動期間到 2026 年 9 月 23 日,而這個期限現在已經過去了。此外,阿里雲 Model Studio 的退役通知(ID 118434)將於 2026 年 10 月 10 日讓數個較舊模型下線,包括 wan2.7-r2v 和 wan2.7-image。這是變體層級的下線,而非整個世代退役——wan2.7-t2v 與 wan2.7-i2v 仍列於清單中,並附有即時費率,頁面最近才在 9 月 11 日更新過——但如果你是因為 reference-to-video 才查看 2.7,那條路徑已經標上了期限。

相較於 Griffin 的比較中,只有一句話是誠實的:沒有價格可以拿來與 Wan 2.7 的價格並列,因為 Tavus 沒有公布任何價格。Griffin-Lite 並不在 Tavus 平台上,公告表示目前不會提供給客戶使用,而該公司自己的結語是,Griffin 會在它想出如何安全發布之後推出。沒有按秒計費的費率,沒有按請求計費的費率,沒有免費方案,沒有企業方案。任何為 Griffin 報價的人都是在憑空捏造。

品質分數:兩塊未達標準的板子

這兩個模型是以完全不同的評估工具來評分,這就是為什麼它們之間沒有 Elo 比較。

Wan 2.7 在 Artificial Analysis 的 video arena 上有兩個項目,而且它們並不在同一個位置——這就是只用一個數字來引用它時的陷阱。那裡的 Elo 是衍生自盲測的兩兩人類偏好投票,這是一套為短生成片段而打造的方法論;下方兩個讀數都來自 2026 年 10 月 2 日讀取的排行榜。

• Wan2.7-260612(六月版本)在文字轉影片(含音訊)方面——第 13 至 14 名,Elo 1,032(±10),在超過 4,645 票中,每分鐘 $9.00。

• Wan 2.7(四月版本)在圖像轉影片(含音訊)中——34 名中第 12 名,Elo 1,077,獲得 4,571 票,每分鐘 $9.00;這是一個投票數大致相同、卻將其排在顯著更高位置的排行榜。

• Wan 3.0,較新的同系列版本——在文字轉影片以 Elo 1,157 排名第 1,在圖像轉影片以 1,164 排名第 6,兩者皆為每分鐘 $12.00。在把 Wan 2.7 與任何東西相比之前,這是值得知道的數字:Alibaba 自家的下一代是榜首之作,而 2.7 只是中段班作品。

A screenshot of the top of Artificial Analysis's "AA-Video-T2V v2.0" leaderboard, text-to-video with audio, captured 2 October 2026: Wan 3.0 first at Elo 1,157 with 7,575 votes and $12.00/min; Utopai X (based on MiniMax H3) second at 1,150; Dreamina Seedance 2.5 third at 1,144; MiniMax H3 (768p) fourth at 1,139 and $4.80/min; MiniMax H3 Max fifth at 1,134; FLUX 3 sixth at 1,127; Gemini Omni Flash eighth at 1,117 and $9.12/min; Wan2.7-260612 thirteenth at 1,032 with 4,645 votes and $9.00/min; and the two Kling 3.0 1080p tiers sixteenth, at Elo 1,018 and Elo 1,000.

Griffin 建構於 NVIDIA 的 VideoFDB 之上,這是一項針對全雙工視聽對話的基準測試,由 NVIDIA 於 2026 年 9 月獨立建置並評分,採用語言模型評審,依循零到五分的評分標準。Griffin-Lite 在生成軌道上獲得 3.83 分,人類參考基準為 3.92,而次高的已發表系統為 2.80;在感知軌道上則獲得 3.73 分,人類參考基準為 4.20。Tavus 亦報告,該生成器在 H100 上相較於四個已發表的串流擴散基準,達到 0.43 秒的真實音訊轉視訊延遲。

這兩組數字都各自成立,而且都不能直接套用到另一方。競技場上的 Elo 是關於影片片段偏好的投票計數;VideoFDB 則是評審針對對話行為的評分規準分數。兩者之間沒有橋樑,而低樣本陷阱也會反向咬人:競技場在 Wan 2.7 上的 ±10 區間寬到,它相對於鄰近項目的排名並沒有被嚴謹地定出來;而 NVIDIA 與人類之間 0.09 分的生成差距,在五分制評分規準上小到,誠實的解讀是「接近人類參考」,而不是「達到人類水準」。感知能力的比較也並非對等比較——Griffin 被排在前面的一些系統,包括 OpenAI 的 gpt-realtime 和 MiniCPM-o 4.5,是在僅音訊的配置下評分,而 Griffin 還能感知影片。那 0.29 分領先中,有一部分衡量的其實是「有眼睛」。

每個人各自需要你提供什麼

這正是比較變得有用之處,因為輸入就是產品。

• 輸入 — Wan 2.7 接受文字、一張圖像、一段影片和音訊。Griffin 透過攝影機和麥克風接收真人,且完全不會應要求生成短片。

• 輸出 — Wan 2.7 會產生影片檔案,每次生成 2 到 15 秒,最高可達 1080p,並具備原生音訊。Griffin 則會產生持續進行的對話:以 320 毫秒為單位、25 fps 的 720p 影片,即時生成,並在解碼時同步播放。

• 什麼在引導它——Wan 2.7 是由提示詞,以及最多五張主體圖像與五段參考影片片段來引導,每次請求的參考素材上限為十個。Griffin 則是由人的舉動來引導:一次停頓、一個移開的視線、一個手勢、一次打斷。

• 時間範疇 — Wan 2.7 的工作單位是最多十五秒的片段,你再將其組裝起來。Griffin 的工作單位是一場對話,這就是為什麼架構必須解決漂移問題——三階段蒸餾成自迴歸生成器,並以其自身生成的歷史進行訓練,讓長時間的 rollout 保持穩定——而不是為了更長的單次生成而奮戰。

• 輸出容器 — Wan 2.7 交回的是你擁有、可以編輯、調色與散布的檔案。Griffin 交回的則是一段算圖完成的 session。沒有檔案可以編輯,因為像素是逐區塊依參考照片與模型自身的歷史生成的,而背景、陰影以及人物所坐的椅子都屬於生成內容的一部分。

一個值得指出的結構性差異:Wan 2.7 的成本隨輸出時長而增減,品質則隨你的提示詞有多具體而變化。Griffin 的成本未經衡量,品質則隨另一端那個人有多自然而變化。你可以靠寫出更好的簡報來改善前者,而後者只能靠與真人一起使用來改善。

A screenshot of the top of Artificial Analysis's "AA-Video-I2V v1.0" leaderboard, image-to-video with audio, captured 2 October 2026: MiniMax H3 Max first at Elo 1,195; MiniMax H3 second at 1,181; Gemini Omni Flash third at 1,178; Dreamina Seedance 2.0 720p fourth at 1,176; HiDream-O1-Video-1.0 fifth at 1,175; Wan 3.0 sixth at 1,164 with 9,302 votes and $12.00/min; Veo 3.1 eleventh at 1,082; and Wan 2.7 twelfth at Elo 1,077 with 4,571 votes and $9.00/min. A note above the table says "AA-Video-I2V v2.0 is coming soon".

參照與一致性,兩種設計碰撞之處

Wan 2.7 透過提供的參考來控制主體一致性:五張主體影像、五段參考片段,總共十個素材。這是一種攝影式做法——你讓它看主體長什麼樣子,它就會在整個生成過程中維持那個外觀。

Griffin 以相反的方式控制同一件事。它即時從單一參考圖像生成每一幀中的每個像素,而公告明確表示,它控制的是整個場景,而不是臉部:手臂與手指、椅子的移動、投下的陰影,以及後方的背景。那裡的一致性,是藉由讓環境成為生成目標,而非合成板來達成的。

這兩種方法都沒有絕對的優劣,而且失敗的方式不同。參考條件式生成會在長片段中逐漸偏離所提供的目標主體。帶有自迴歸歷史的逐區塊生成,若漂移處理不當,則會在長時間的生成過程中遊移走偏,而這正是第三個蒸餾階段旨在防止的失敗情況。當交付成果是特定人物在特定造型中的呈現時,Wan 2.7 是更安全的選擇。Griffin 並不是在爭取這類需求。

安全性、來源出處與發布態勢

Wan 2.7 並未搭載任何已公開的來源溯源系統,足以堪比能挺過壓縮的水印——該發布公告點名音訊品質與畫面文字準確度仍是有待改善的領域,這屬於保真度上的但書,而非安全性的顧慮。

Griffin 的安全敘事是反轉的:Tavus 表示把它維持在預覽階段的原因,正是那些讓它成為更好介面的特性,也讓它更擅長說服對方相信自己正在與真人對話,而數據也支持這項擔憂。在該公司自家的實測研究中,54 名參與者有 26 人相信自己的對話對象是真人,相較之下,先前的 Phoenix-4.5 / Raven-1 / Sparrow-2 堆疊上,41 人中只有 1 人如此。確實起疑的參與者,往往在前二十秒內就產生懷疑。Tavus 表示,發布前還需要進一步的對齊與揭露工作,公司正在打造揭露功能,並與多個組織合作進行安全評估。這是任何人針對這個模型所發表過最具實質內容的資訊,而這也是為什麼沒有產品可買。

對任何把這兩者當作工具來比較的人來說,實際後果很簡單:一個可以隨需生成,而且今天就能交付;另一個則是評估對象,其發布取決於廠商尚未解決的問題。

哪一個,做什麼用的?

• 如果交付成果是影片素材,就選擇 Wan 2.7。以指令為基礎對既有素材進行編輯,正是它表現格外出色、價格也格外低廉的應用場景,因為其編輯版本僅就輸出計費,並把輸入素材視為免費。其 reference-to-video 版本值得在 10 月 10 日退役之前先行評估,再決定是否採用。

• 本季度不要為了任何事選擇 Griffin,因為你辦不到。如果你需要知道一個人是否能分辨,或你的路線圖取決於互動層而非影片素材層,請申請存取權。

• 看的是落差,而不是任一模型。Griffin 的問世讓更值得玩味的比較落在未來:一個能生成整段對話的系統,對上一個能生成整個場景的套件。第一個兩者都做到的產品,才會是值得拿這篇來重新對照的那一個。

路由器適用與不適用的時機

這兩款模型都不在 OrcaRouter 的目錄中,而這一點值得在本節其他任何內容之前先說明。Wan 2.7 可透過阿里巴巴自家的平台——Alibaba Cloud 上的 Model Studio 與 Qwen Cloud——以及在其推出後整合它的第三方創意工具來取得;Tavus Griffin 則只能透過申請表單取得。若其中任一變得可供路由,它們將會以供應商定價顯示。

在影片管線中屬於路由問題的部分,是圍繞它的文字。鏡頭清單、提示詞擴寫、字幕生成、品質審查摘要,以及餵給參考轉影片流程的逐字稿或對話工作,全都是文字呼叫,而這些呼叫在 OrcaRouter 上與其他 200 多個模型一樣,執行於同一個 OpenAI 相容端點,並以供應商定價、加價 0%,因此供應商降價當天就會生效,而不必等到合約週期過後。把便宜模型用於批次處理、把前沿模型用於最終處理,在那裡只是設定變更,而不是多一段供應商關係——一旦生成層成為你能呼叫的東西,同樣的論證也適用於生成層。

值得觀察的重點:Wan 2.7 套件的參考與編輯變體,能否在 10 月 10 日 Model Studio 退役後原封不動地存續;以及 Griffin 的安全閘門是否會產出一份已發布、且附有端點的模型卡。這兩件事,正是會讓這項比較從一篇設計論述轉為採購決策的關鍵。

A two-column scoreboard titled "Tavus Griffin vs Alibaba Wan 2.7 — the scoreboard". Left column "Tavus Griffin": Makes: a live conversation; Price: none published; Output: 720p in 320 ms chunks; Input: a person on camera; Clip length: none - a session; Score: VideoFDB 3.83 of 5. Right column "Alibaba Wan 2.7": Makes: 2 to 15 second clips; Price: $9.00 per minute; Output: up to 1080p; Input: text, image, video; Clip length: 2 to 15 seconds; Score: arena Elo 1,032. Footer: "Wan rates per Alibaba Cloud; Elo per Artificial Analysis, 2 October 2026. Griffin figures Tavus-reported."