Thẻ hero cho "Tavus Griffin vs Alibaba Wan 2.7", với hai chip ghi "Tavus Griffin — chưa có giá công bố" và "Alibaba Wan 2.7 — 9,00 USD mỗi phút ở 1080p", phía trên sáu hàng: Tạo ra: một cuộc hội thoại trực tiếp; Ngược lại: một clip dài 2 đến 15 giây; Giá Griffin: chưa công bố; Giá Wan 2.7: 9,00 USD mỗi phút; Trạng thái Griffin: bản xem trước nghiên cứu; Trạng thái Wan 2.7: sẵn có chung. Chân trang: "Mức giá của Wan 2.7 là giá niêm yết của Alibaba Cloud; Griffin là bản xem trước nghiên cứu không có bảng giá."
Guides & Insights

Tavus Griffin vs Alibaba Wan 2.7: Mô hình hội thoại đối đầu với mô hình tạo sinh

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cách so sánh đầy cám dỗ giữa Tavus Griffin và Alibaba Wan 2.7 là theo từng giây video, và phép so sánh đó không thể thực hiện được. Wan 2.7 có bảng giá được công bố — 9,00 USD một phút ở độ phân giải 1080p trên các điểm cuối Singapore quốc tế của Alibaba Cloud, với một bậc giá rẻ hơn ở Bắc Kinh và Tokyo — còn Tavus Griffin thì hoàn toàn không có bảng giá, bởi vì Griffin-Lite ra mắt vào ngày 1 tháng 10 năm 2026 dưới dạng bản xem trước nghiên cứu dành cho những người thử nghiệm tin cậy được chọn lọc thông qua một biểu mẫu yêu cầu. Điều mà cả hai thực sự chia sẻ là một từ: video. Ngoài điều đó ra, chúng là câu trả lời cho những câu hỏi khác nhau. Một cái được hỏi điều gì nên xảy ra tiếp theo trong một cuộc trò chuyện; cái kia được hỏi một cảnh được mô tả trông như thế nào. Phép so sánh thú vị không nằm ở chất lượng, mà ở chỗ mỗi cái cần gì từ bạn trước khi nó tạo ra bất cứ thứ gì, và bạn nhận lại được gì.

Sự khác biệt nằm ở vòng lặp, không phải ở độ phân giải

Wan 2.7 tạo ra từng clip một từ một prompt. Bạn viết một mô tả, bạn nhận được một đoạn cảnh quay, bạn xem nó, rồi bạn viết một cái khác. Wan 2.7 là một bộ gồm bốn mô hình — text-to-video, image-to-video, reference-to-video và video-edit — và cách tương tác về cơ bản mang tính giao dịch: một đầu vào, một đầu ra đã được kết xuất, và một quyết định xem có giữ nó lại hay không. Không có gì của nó chạy trong khi bạn vẫn đang quyết định sẽ yêu cầu điều gì.

Griffin được xây dựng theo cách ngược lại. Đây là một hệ thống song công toàn phần: một engine Mô hình hóa Hội thoại Liên tục, thứ nạp âm thanh và video rồi đánh giá lại cuộc hội thoại theo từng khoảng dưới một giây, quyết định xem nên giữ im lặng, ra tín hiệu, đáp lời (backchannel) hay giành lượt nói, đồng thời phát ra các điều khiển biểu cảm để điều khiển song song một bộ sinh giọng nói dạng luồng và một bộ sinh video dạng luồng. Nó tạo ra 720p theo từng khối 320 ms từ một bức ảnh tham chiếu duy nhất, và tuyên bố đáng quan tâm là một quyết định được đưa ra giữa câu sẽ thể hiện trong giọng nói và trên khuôn mặt trong cùng một mini-turn. Chuẩn đánh giá cho việc này không phải là một bảng xếp hạng các clip. Mà là liệu bạn có thể ngắt lời nó hay không.

Nói một cách đơn giản: Wan 2.7 trả lời câu hỏi “cảnh này trông như thế nào khi chuyển động?” Griffin trả lời “khuôn mặt và giọng nói này nên làm gì trong hai trăm mili giây tiếp theo, với điều kiện là người đó vừa mới dừng lại.”

Giá, ở một bên khi có

Mức giá được công bố của Wan 2.7 tính theo mỗi giây video được tạo ra, và các gói dịch vụ không đồng nhất trong toàn bộ bộ sản phẩm — đây là chi tiết mà hầu hết các trang so sánh đều bỏ qua.

• wan2.7-t2v và wan2.7-i2v — chỉ tính phí theo thời lượng đầu ra. Khu vực quốc tế Singapore: 0,10 USD/giây ở 720p và 0,15 USD/giây ở 1080p, tức mức 9,00 USD/phút xuất hiện trên bảng xếp hạng. Bắc Kinh và Tokyo niêm yết 0,086 USD/giây và 0,143 USD/giây cho cùng công việc.

• wan2.7-r2v (reference-to-video) — tính phí theo thời lượng video đầu vào, tối đa năm giây, cộng với đầu ra. Đưa một tham chiếu năm giây vào một lần tạo mười lăm giây và bạn bị tính phí cho hai mươi giây.

• wan2.2-videoedit — chỉ tính phí đầu ra, còn video đầu vào miễn phí.

Hai dữ kiện về vòng đời cần được đặt ngay cạnh những con số đó. Alibaba đã áp dụng mức giảm giá ra mắt 30% có thời hạn trên các nền tảng Bailian và Qwen Cloud của riêng mình, kéo dài đến ngày 23 tháng 9 năm 2026, và thời hạn đó nay đã qua. Và thông báo ngừng hoạt động Model Studio của Alibaba Cloud (ID 118434) sẽ đưa một số mô hình cũ hơn ngừng hoạt động vào ngày 10 tháng 10 năm 2026, bao gồm wan2.7-r2v và wan2.7-image. Đó là ở cấp biến thể chứ không phải ngừng cả thế hệ — wan2.7-t2v và wan2.7-i2v vẫn được liệt kê với mức giá hiện hành và các trang được cập nhật gần đây nhất vào ngày 11 tháng 9 — nhưng nếu reference-to-video là lý do bạn đang xem 2.7, thì hướng đó đã có ngày định sẵn.

Phép so sánh với Griffin có một điểm trung thực: không có mức giá nào để đặt cạnh giá của Wan 2.7, bởi vì Tavus chưa công bố mức giá nào. Griffin-Lite không nằm trên nền tảng Tavus, thông báo nói rằng nó sẽ không khả dụng để khách hàng sử dụng vào thời điểm này, và câu kết của chính công ty là Griffin sẽ ra mắt khi họ đã tìm ra cách phát hành nó một cách an toàn. Không có mức giá theo giây, không có mức giá theo yêu cầu, không có gói miễn phí, không có gói doanh nghiệp. Bất kỳ ai đưa ra mức giá cho Griffin đều đang bịa ra con số đó.

Điểm chất lượng: hai bảng không đạt

Hai mô hình được chấm điểm bằng hai công cụ khác nhau, vì vậy không tồn tại sự so sánh nào giữa chúng.

Wan 2.7 có hai mục trên đấu trường video của Artificial Analysis, và chúng không nằm cùng một vị trí — đó chính là cái bẫy khi chỉ trích dẫn một con số cho nó. Điểm Elo ở đó được suy ra từ các phiếu bầu ưu tiên của con người theo cặp một cách mù, một phương pháp được xây dựng cho các clip ngắn do AI tạo ra, và cả hai kết quả đọc dưới đây đều đến từ các bảng được đọc vào ngày 2 tháng 10 năm 2026.

• Wan2.7-260612 (bản dựng tháng Sáu) ở hạng mục tạo video từ văn bản (có âm thanh) — thứ 13–14, Elo 1.032 (±10) qua 4.645 phiếu bầu, $9,00/phút.

• Wan 2.7 (bản dựng tháng 4) trong chuyển hình ảnh thành video (có âm thanh) — thứ 12 trong số 34, Elo 1.077 qua 4.571 phiếu bầu, 9,00 USD/phút, một bảng xếp hạng có số phiếu bầu gần tương đương nhưng xếp nó cao hơn đáng kể.

• Wan 3.0, người anh em mới hơn — đứng thứ 1 với Elo 1.157 ở tác vụ chuyển văn bản thành video và thứ 6 với 1.164 ở tác vụ chuyển hình ảnh thành video, cả hai đều ở mức $12.00/phút. Đó là con số đáng để biết trước khi bạn so sánh Wan 2.7 với bất cứ thứ gì: thế hệ kế tiếp của chính Alibaba đứng đầu bảng, còn 2.7 chỉ là một bản tầm trung.

A screenshot of the top of Artificial Analysis's "AA-Video-T2V v2.0" leaderboard, text-to-video with audio, captured 2 October 2026: Wan 3.0 first at Elo 1,157 with 7,575 votes and $12.00/min; Utopai X (based on MiniMax H3) second at 1,150; Dreamina Seedance 2.5 third at 1,144; MiniMax H3 (768p) fourth at 1,139 and $4.80/min; MiniMax H3 Max fifth at 1,134; FLUX 3 sixth at 1,127; Gemini Omni Flash eighth at 1,117 and $9.12/min; Wan2.7-260612 thirteenth at 1,032 with 4,645 votes and $9.00/min; and the two Kling 3.0 1080p tiers sixteenth, at Elo 1,018 and Elo 1,000.

Griffin nằm trên VideoFDB của NVIDIA, một bộ đánh giá cho hội thoại âm thanh-hình ảnh song công toàn phần mà NVIDIA đã xây dựng và chấm điểm độc lập vào tháng 9 năm 2026, sử dụng một giám khảo mô hình ngôn ngữ đối chiếu với thang điểm từ 0 đến 5. Griffin-Lite đạt 3,83 trên hạng mục tạo sinh so với mốc tham chiếu con người là 3,92 và 2,80 cho hệ thống đã công bố cao tiếp theo, cùng 3,73 trên hạng mục tri giác so với mốc tham chiếu con người là 4,20. Tavus cũng báo cáo độ trễ thực từ âm thanh đến video là 0,43 giây đối với bộ tạo sinh so với bốn đường cơ sở khuếch tán truyền trực tuyến đã công bố trên H100.

Cả hai bộ số đều hợp lệ và không bộ nào suy rộng được sang bộ kia. Elo trên arena là số phiếu bầu về sở thích clip; VideoFDB là điểm rubric của giám khảo về hành vi hội thoại. Không có cầu nối giữa chúng, và cạm bẫy mẫu thấp cũng chạy theo chiều ngược lại: dải ±10 của arena trên Wan 2.7 đủ rộng đến mức vị trí của nó so với các mô hình lân cận không được xác định chặt chẽ, còn khoảng cách tạo sinh 0,09 điểm của NVIDIA so với con người là đủ nhỏ trên thang rubric năm điểm đến mức “gần với tham chiếu con người” là cách đọc trung thực, chứ không phải “ngang tầm con người”. So sánh nhận thức cũng không phải là so sánh cùng điều kiện — một số hệ thống mà Griffin được xếp trên, bao gồm gpt-realtime của OpenAI và MiniCPM-o 4.5, được chấm điểm trong cấu hình chỉ âm thanh trong khi Griffin cũng nhận thức được video. Một phần trong mức dẫn trước 0,29 điểm đo lường việc có mắt.

Mỗi thứ cần gì ở bạn

Đây là lúc việc so sánh trở nên hữu ích, vì đầu vào chính là sản phẩm.

• Đầu vào — Wan 2.7 nhận văn bản, hình ảnh, video và âm thanh. Griffin nhận một người trực tiếp qua camera và micrô, và hoàn toàn không tạo clip theo yêu cầu.

• Đầu ra — Wan 2.7 tạo ra một tệp video, 2 đến 15 giây mỗi lần tạo, lên đến 1080p, với âm thanh gốc. Griffin tạo ra một cuộc trò chuyện liên tục: video 720p ở 25 fps theo từng khối 320 ms, được tạo theo thời gian thực và phát ngay khi được giải mã.

• Điều gì dẫn dắt nó — Wan 2.7 được dẫn dắt bởi prompt và tối đa năm ảnh chủ thể cùng năm clip tham chiếu, trong giới hạn mười tài nguyên tham chiếu cho mỗi yêu cầu. Griffin được dẫn dắt bởi những gì con người làm: một khoảng dừng, một cái liếc nhìn đi chỗ khác, một cử chỉ, một sự ngắt lời.

• Chân trời thời gian — đơn vị công việc của Wan 2.7 là một clip dài tối đa mười lăm giây, mà sau đó bạn ghép lại với nhau. Đơn vị công việc của Griffin là một cuộc hội thoại, đó là lý do kiến trúc phải giải quyết vấn đề drift — quá trình chưng cất ba giai đoạn thành một bộ sinh tự hồi quy, được huấn luyện trên chính lịch sử do nó sinh ra để những lần rollout dài vẫn ổn định — thay vì cố gắng giành lấy một lần sinh dài hơn.

• Bộ chứa đầu ra — Wan 2.7 trả về một tệp mà bạn sở hữu và có thể chỉnh sửa, chỉnh màu và phân phối. Griffin trả về một phiên đã kết xuất. Không có tệp nào để chỉnh sửa, vì các pixel được tạo theo từng khối từ một ảnh tham chiếu và lịch sử của chính mô hình, còn nền, bóng đổ và chiếc ghế mà người đó ngồi đều là một phần của quá trình tạo.

Một khác biệt mang tính cấu trúc đáng để gọi tên: chi phí của Wan 2.7 tỉ lệ thuận với thời lượng đầu ra và chất lượng của nó tỉ lệ thuận với mức độ cụ thể trong prompt của bạn. Chi phí của Griffin chưa được đo lường và chất lượng của nó tỉ lệ thuận với mức độ tự nhiên của người ở đầu bên kia. Bạn có thể cải thiện cái này bằng cách viết brief tốt hơn và cái kia chỉ bằng cách sử dụng nó với những người thật.

A screenshot of the top of Artificial Analysis's "AA-Video-I2V v1.0" leaderboard, image-to-video with audio, captured 2 October 2026: MiniMax H3 Max first at Elo 1,195; MiniMax H3 second at 1,181; Gemini Omni Flash third at 1,178; Dreamina Seedance 2.0 720p fourth at 1,176; HiDream-O1-Video-1.0 fifth at 1,175; Wan 3.0 sixth at 1,164 with 9,302 votes and $12.00/min; Veo 3.1 eleventh at 1,082; and Wan 2.7 twelfth at Elo 1,077 with 4,571 votes and $9.00/min. A note above the table says "AA-Video-I2V v2.0 is coming soon".

Tham chiếu và tính nhất quán, nơi hai thiết kế xung đột

Wan 2.7 kiểm soát tính nhất quán của chủ thể thông qua các tham chiếu được cung cấp: năm ảnh chủ thể, năm clip tham chiếu, tổng cộng mười tài nguyên. Đây là một cách tiếp cận mang tính nhiếp ảnh — bạn cho nó thấy chủ thể trông như thế nào và nó duy trì diện mạo đó xuyên suốt quá trình tạo.

Griffin kiểm soát cùng một thứ theo cách ngược lại. Nó tạo ra mọi pixel trong mọi khung hình từ một hình ảnh tham chiếu theo thời gian thực, và thông báo nói rõ rằng nó kiểm soát toàn bộ cảnh chứ không chỉ khuôn mặt: cánh tay và ngón tay, chuyển động của chiếc ghế, các bóng đổ và nền phía sau. Tính nhất quán ở đó đạt được bằng cách biến môi trường thành mục tiêu tạo sinh thay vì một tấm nền được tổng hợp.

Không cách nào thực sự tốt hơn cách nào, và chúng thất bại theo những kiểu khác nhau. Sinh có điều kiện tham chiếu thất bại bằng cách trôi dần khỏi chủ thể được cung cấp trong một clip dài. Sinh theo từng đoạn với lịch sử tự hồi quy thất bại bằng cách lang thang trong một phiên dài nếu việc xử lý trôi sai, và đó chính xác là kiểu thất bại mà giai đoạn chưng cất thứ ba tồn tại để ngăn chặn. Wan 2.7 là lựa chọn an toàn hơn khi sản phẩm bàn giao là một người cụ thể với một ngoại hình cụ thể. Griffin không cạnh tranh cho đề bài đó.

An toàn, nguồn gốc và tư thế phát hành

Wan 2.7 không có hệ thống nguồn gốc được công bố nào có thể so sánh với hình mờ tồn tại qua nén — thông báo nêu chất lượng âm thanh và độ chính xác văn bản trên màn hình là những lĩnh vực vẫn cần cải thiện, đây là lưu ý về độ trung thực chứ không phải về an toàn.

Câu chuyện an toàn của Griffin bị đảo ngược: lý do được Tavus đưa ra để giữ nó ở trạng thái xem trước là chính những thuộc tính khiến nó trở thành một giao diện tốt hơn cũng khiến nó giỏi hơn trong việc thuyết phục ai đó rằng họ đang nói chuyện với một con người, và các con số ủng hộ mối lo ngại này. Trong nghiên cứu trực tiếp của chính công ty, 26 trong số 54 người tham gia tin rằng người đối thoại của họ là người thật, so với 1 trong 41 người trên stack Phoenix-4.5 / Raven-1 / Sparrow-2 trước đó. Những người tham gia có nghi ngờ thì thường nghi ngờ trong vòng hai mươi giây đầu tiên. Tavus nói rằng cần thêm công việc căn chỉnh và tiết lộ trước khi phát hành, rằng công ty đang xây dựng các tính năng tiết lộ, và rằng công ty đang làm việc với các tổ chức về đánh giá an toàn. Đó là điều có tính thực chất nhất mà bất kỳ ai đã công bố về mô hình này, và cũng là lý do tại sao không có sản phẩm nào để mua.

Đối với bất kỳ ai đang so sánh hai thứ này như những công cụ, hệ quả thực tế rất đơn giản: một cái có thể được tạo ra theo yêu cầu và có thể xuất xưởng ngay hôm nay, còn cái kia là một mục tiêu đánh giá mà việc phát hành phụ thuộc vào một vấn đề mà nhà cung cấp chưa giải quyết.

Cái nào, để làm gì

• Hãy chọn Wan 2.7 nếu sản phẩm bàn giao là cảnh quay. Chỉnh sửa dựa trên hướng dẫn đối với tư liệu hiện có là khối lượng công việc mà nó đặc biệt mạnh và đặc biệt rẻ, vì biến thể chỉnh sửa chỉ tính phí đầu ra và coi đầu vào là miễn phí. Biến thể tham chiếu sang video của nó đáng để kiểm tra đối chiếu với thời điểm ngừng hỗ trợ ngày 10 tháng 10 trước khi bạn cam kết sử dụng nó.

• Không chọn Griffin cho bất cứ việc gì trong quý này, vì bạn không thể. Hãy yêu cầu quyền truy cập nếu bạn cần biết liệu một người có thể nhận ra hay không, hoặc nếu lộ trình của bạn phụ thuộc vào lớp tương tác thay vì lớp footage.

• Hãy nhìn vào khoảng cách, chứ không phải một trong hai mô hình. Sự xuất hiện của Griffin khiến cho phép so sánh đáng chú ý hơn trở thành một phép so sánh của tương lai: một hệ thống tạo ra toàn bộ cuộc trò chuyện đối chiếu với một bộ giải pháp tạo ra toàn bộ bối cảnh. Sản phẩm đầu tiên làm được cả hai sẽ là thứ đáng để đọc lại bài này mà đối chiếu.

Bộ định tuyến phù hợp ở đâu và không phù hợp ở đâu

Cả hai mô hình này đều không có trong danh mục của OrcaRouter, và điều đó đáng được nêu ra trước bất cứ điều gì khác trong phần này. Wan 2.7 có thể truy cập thông qua các nền tảng của chính Alibaba — Model Studio trên Alibaba Cloud và Qwen Cloud — cũng như thông qua các công cụ sáng tạo của bên thứ ba đã tích hợp nó sau khi ra mắt; Tavus Griffin chỉ có thể truy cập bằng biểu mẫu yêu cầu. Nếu một trong hai trở nên có thể định tuyến, chúng sẽ xuất hiện ở mức giá niêm yết của nhà cung cấp.

Phần của một pipeline video thực chất là bài toán định tuyến lại chính là phần văn bản bao quanh nó. Danh sách cảnh quay, mở rộng prompt, tạo chú thích, tóm tắt đánh giá chất lượng, cùng phần xử lý bản ghi hoặc hội thoại cung cấp dữ liệu cho một lượt reference-to-video đều là các lệnh gọi văn bản, và chúng chạy trên cùng một endpoint tương thích OpenAI tại OrcaRouter như 200+ mô hình khác ở mức giá niêm yết của nhà cung cấp với 0% phụ trội được cộng thêm, nên việc nhà cung cấp giảm giá có hiệu lực ngay trong cùng ngày thay vì phải chờ sau một chu kỳ hợp đồng. Việc tách một mô hình rẻ cho lượt xử lý hàng loạt và một mô hình tiên tiến cho lượt cuối cùng chỉ là một thay đổi cấu hình ở đó thay vì phải tạo thêm một mối quan hệ nhà cung cấp thứ hai — đây cũng chính là lập luận áp dụng cho lớp tạo sinh, một khi lớp tạo sinh là thứ bạn có thể gọi.

Điều cần theo dõi: liệu các biến thể tham chiếu và chỉnh sửa của bộ Wan 2.7 có tồn tại qua đợt ngừng hoạt động Model Studio ngày 10 tháng 10 mà không thay đổi hay không, và liệu cổng an toàn của Griffin có tạo ra một thẻ mô hình được công bố có kèm endpoint trên đó hay không. Hai sự kiện đó là những gì sẽ biến so sánh này từ một bài luận thiết kế thành một quyết định thu mua.

A two-column scoreboard titled "Tavus Griffin vs Alibaba Wan 2.7 — the scoreboard". Left column "Tavus Griffin": Makes: a live conversation; Price: none published; Output: 720p in 320 ms chunks; Input: a person on camera; Clip length: none - a session; Score: VideoFDB 3.83 of 5. Right column "Alibaba Wan 2.7": Makes: 2 to 15 second clips; Price: $9.00 per minute; Output: up to 1080p; Input: text, image, video; Clip length: 2 to 15 seconds; Score: arena Elo 1,032. Footer: "Wan rates per Alibaba Cloud; Elo per Artificial Analysis, 2 October 2026. Griffin figures Tavus-reported."