Thẻ tiêu đề hero cho 'Tavus Griffin vs Seedance 2.5' với phụ đề 'Một bên tạo ra ba mươi giây, một bên chờ bạn nói hết câu', phía trên bốn chip: Seedance 2.5 30 giây trong một lượt; Seedance 2.5 khoảng 0,51 USD cho mỗi 5 giây ở 480p; Griffin 0,43 giây từ âm thanh sang video; Griffin chưa thể bán cho khách hàng.
Guides & Insights

Tavus Griffin vs Seedance 2.5: Một bên tạo ra ba mươi giây, một bên đợi bạn nói xong câu.

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cách nhanh nhất để hiểu khoảng cách giữa Tavus Griffin và Seedance 2.5 là nhìn vào điều mà mỗi bên làm khi bạn ngừng nói. Seedance 2.5, được nhóm Seed của ByteDance phát hành ngày 31 tháng 7 năm 2026, vẫn tiếp tục: đưa cho nó một prompt và nó sẽ tạo ra tối đa ba mươi giây video chỉ trong một lượt, cùng âm thanh đi kèm, ở độ phân giải và tốc độ khung hình bạn đã chọn trước khi nhấn return. Tavus Griffin, được Tavus công bố vào tháng 10 năm 2026 dưới dạng bản xem trước nghiên cứu, dừng lại — rồi lại bắt đầu, vì nó đã lắng nghe suốt cả thời gian đó và có điều gì đó để đáp lại. Một mô hình là cỗ máy sản xuất vận hành không cần giám sát. Mô hình kia là một người tham gia chỉ hoạt động nếu bạn có mặt.

Ba mươi giây trong một lần quay

Điểm nhấn của Seedance 2.5 là thời lượng. Trong khi phiên bản tiền nhiệm chỉ đạt tối đa mười lăm giây, 2.5 tạo ra ba mươi giây trong một lần tạo — gấp đôi khung thời gian, tạo nên khác biệt giữa một cú máy và một cảnh. Ngoài ra, nó hỗ trợ gia hạn nhiều vòng, và ByteDance đã trình diễn một chế độ siêu dài trong bản beta, nơi mô hình được yêu cầu tiếp tục đầu ra của chính nó thay vì bắt đầu lại từ đầu.

Bề mặt đầu vào rộng ngay cả theo tiêu chuẩn năm 2026. Một yêu cầu duy nhất có thể mang tối đa khoảng ba mươi hình ảnh, mười clip video và mười clip âm thanh làm tham chiếu, với video và âm thanh tham chiếu mỗi loại kéo dài khoảng ba mươi giây. Đó là đủ tư liệu để chỉ định cùng lúc một nhân vật, một bối cảnh, một chuyển động và một nhạc nền. Mô hình còn đi kèm một bộ chế độ được đặt tên trông giống một bộ tổng hợp hơn là một ô nhập prompt: chế độ white-model và clay để dựng hình sơ bộ (previz), phông xanh, tham chiếu chuyển động và tham chiếu sáng tạo. Trên hết là điều khiển ở cấp dấu thời gian và chỉnh sửa ở cấp vùng, đó là lúc cửa sổ ba mươi giây không còn chỉ là một độ dài nữa mà bắt đầu trở thành một dòng thời gian.

Âm thanh và video được xuất ra trong cùng một lượt xử lý thay vì được ghép nối sau đó, xuyên suốt hơn mười ngôn ngữ hội thoại, và danh sách đối tác ra mắt — XCMG, XPeng, Lingchu Intelligence, Weifen Zhifei, Qiongche Intelligence — trông giống như một tệp khách hàng công nghiệp và ô tô hơn là của các công cụ sáng tạo. Cách ByteDance tự định vị là Seedance 2.5 dành cho những người cần một thước phim hoàn chỉnh, chứ không phải một tương tác.

Screenshot of Artificial Analysis's 'AA-Video-T2V v2.0' leaderboard filtered to models with audio, captured 2 October 2026: Wan 3.0 first at Elo 1,157, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144 with 7,526 votes and $34.12 per minute, MiniMax H3 (768p) fourth at 1,139 and MiniMax H3 Max fifth at 1,134, with samples, release month and per-minute API pricing columns.

Mô hình chỉ tồn tại trong lúc bạn đang trò chuyện

Griffin có hình dạng hệ thống đối lập, và Tavus đặc biệt rõ ràng về hình dạng đó. Nó gọi Griffin là Human Interaction Model đầu tiên: một hệ thống video-to-video theo dõi và lắng nghe người tham gia trong một cuộc trò chuyện và tạo ra phía bên kia của cuộc trò chuyện đó trong thời gian thực. Kiến trúc chia thành Continuous Conversational Modeling, quyết định nhân vật nên làm gì từng khoảnh khắc, và Audio-Visual Generation, truyền phát giọng nói và khuôn mặt tương ứng. Nó là song công hoàn toàn (full duplex), nên có thể bị ngắt lời, và nó không cần tín hiệu kết thúc lượt rõ ràng để phản hồi.

Mọi thứ về cách triển khai đều được tinh chỉnh cho một phần nhỏ của giây tiếp theo thay vì cảnh quay tiếp theo. Codec âm thanh Tavec chạy ở 48 kHz với 40 giá trị mỗi khung ở 100 khung hình/giây, không có codebook, bộ giải mã hoàn toàn nhân quả, và các gói nhỏ tới 10 mili giây. Video được phát trực tuyến ở 720p theo các đoạn 320 mili giây, một latent cho mỗi tám khung hình ở 25 fps, ba bước khuếch tán cho mỗi latent, với mức nén thời gian 8× trong VAE. Chưng cất ba giai đoạn — khớp phân phối, rồi tự hồi quy teacher-forcing, rồi self-forcing — chính là điều giúp ba bước khuếch tán khả thi trong thời gian thực. Độ trễ âm thanh sang video trung bình là 0,43 giây trên H100s, mà Tavus nói rằng chỉ bằng khoảng một nửa phương pháp nhanh thứ hai mà họ đo được. Nhân bản giọng nói cần mẫu dài khoảng mười giây.

Và rồi câu quyết định cách bạn lập kế hoạch xoay quanh nó: Tavus tuyên bố rằng Griffin-Lite, bản xem trước nghiên cứu, hiện có sẵn cho một nhóm người thử nghiệm sớm được chọn, rằng Griffin-Lite sẽ không khả dụng để khách hàng sử dụng vào thời điểm này, rằng một bản phát hành rộng rãi hơn của một mô hình mạnh hơn sẽ diễn ra sau đó, và rằng Griffin hiện chưa có trên nền tảng Tavus — nó sẽ xuất hiện khi công ty đã tìm ra cách phát hành nó một cách an toàn.

Những tuyên bố mà mỗi bên đưa ra, và giá trị thực của chúng

Bằng chứng của Seedance 2.5 chủ yếu xoay quanh năng lực: nó có thể tiếp nhận những gì, chạy được bao lâu, chi phí ra sao. Bằng chứng của Griffin chủ yếu xoay quanh hiệu quả. Trong một nghiên cứu phối hợp với Đại học Queen Mary London, Tavus báo cáo rằng 26 trong số 54 người tham gia — 48% — tin Griffin là người thật sau một cuộc gọi video kéo dài một phút, so với 1 trong 41 người (2,4%) trên bộ Phoenix-4.5, Sparrow-2 và Raven-1 trước đó, và những người hoài nghi thường bắt đầu nghi ngờ trong vòng hai mươi giây đầu tiên. Chuẩn đo lường VideoFDB của NVIDIA, được chấm điểm vào tháng 9 năm 2026, xếp Griffin đứng đầu ở hạng mục AI giao tiếp trực diện theo cách tính của Tavus: khả năng tạo 3,83 so với mức cơ sở mạnh nhất được báo cáo là 2,80 và 3,92 của con người; khả năng nhận thức 3,73 so với 3,44 và 4,20; cùng mức dẫn trước 37% so với hệ thống tốt thứ hai về khả năng phản ứng tức thời. Đều do nhà cung cấp tự báo cáo, trên một chuẩn đo lường do NVIDIA xây dựng — nhưng chính các điểm so sánh với con người mới là phần có sức nặng.

Không có bài kiểm tra độc lập nào có thể so sánh được cho câu hỏi "liệu khán giả có tin vào nó hay không" trên Seedance 2.5, bởi vì đó không phải là mục đích của nó. Hai mô hình đang trả lời những câu hỏi khác nhau và không bộ số liệu nào có thể áp dụng cho bộ còn lại.

Những gì bạn thực sự có thể mua

Seedance 2.5 là một sản phẩm có bảng giá. Trên nền tảng ModelArk của ByteDance, sản phẩm này có giá 10,70 USD cho mỗi triệu token khi không có đầu vào video và 6,40 USD cho mỗi triệu token khi có đầu vào video, tương đương khoảng 0,51 USD cho một clip 16:9 dài năm giây ở độ phân giải 480p và khoảng 1,16 USD cho cùng clip đó ở 720p. Quyền truy cập được thực hiện thông qua các ứng dụng tiêu dùng của ByteDance và qua API trên Volcano Engine Ark tại Trung Quốc và BytePlus ModelArk trên phạm vi quốc tế. Ít nhất một nhà phân phối tuyên bố sản phẩm không khả dụng tại Hoa Kỳ, và các nguồn tin không thống nhất về việc độ phân giải cao nhất là 720p hay 1080p — cả hai điều này đều đáng biết trước khi bạn ghi nó vào một bản đặc tả.

Griffin không có bảng giá, không có API công khai và không có ngày cụ thể. Đó chính là toàn bộ cơ sở để quyết định mua, và nó thu hẹp vấn đề hơn mức mà hầu hết các bài so sánh thừa nhận.

Board titled 'Seconds versus Sentences'. Seedance 2.5 card: what it reads a prompt plus up to 30 images, 10 video clips and 10 audio clips; what it returns up to 30 seconds of video in one pass; audio joint audio and video over 10 languages; latency batch generation, no real-time mode; price about $0.51 per five-second 480p clip on ModelArk; availability shipped 31 July 2026, live on ModelArk. Tavus Griffin card: what it reads the live participant, video and audio; what it returns the other side of the conversation in real time; audio streaming speech with a voice cloned from a ten-second sample; latency 0.43 s average audio to video on H100s; price none published; availability research preview, selected testers only.

Nơi một router khẳng định được vị trí của mình

Nếu bạn đang xây dựng bất cứ thứ gì cần cả hai — một agent vừa duy trì hội thoại vừa tạo ra thước phim hoàn chỉnh — thì bạn đang phải làm việc với hai nhà cung cấp, hai console, hai hệ thống thanh toán và hai quan niệm khác nhau về việc một yêu cầu là gì. Đó chính là mối nối mà OrcaRouter thực sự hữu ích chứ không chỉ để trang trí: một key duy nhất dùng được với hơn hai trăm model, với giá niêm yết của nhà cung cấp được chuyển thẳng qua ở mức0% markup, nhờ đó việc nhà cung cấp giảm giá sẽ đến được thẻ ngay trong ngày, failover tự động để một nhà cung cấp bị quá tải không trở thành sự cố của bạn, cùng một DSL định tuyến để ghim các tác vụ quan trọng vào một backend cụ thể trong khi các bản nháp đi đến nơi có dung lượng rẻ nhất. Model fusion cũng quan trọng ở các trường hợp biên — với một generator tính giá theo token hoặc theo giây, việc dùng một model văn bản rẻ để mài sắc prompt trước khi bạn chi cho phần tạo sinh đắt đỏ thường là dòng mang lại hiệu quả cao nhất trong pipeline.

Nói chính xác về hai mô hình trong tiêu đề: cả Seedance 2.5 lẫn Griffin đều không phải là một tuyến của OrcaRouter. Seedance được truy cập thông qua các nền tảng của chính ByteDance và các nhà phân phối bên thứ ba; còn Griffin thì hoàn toàn không thể truy cập được. Điều mà danh mục thực sự có ở mảng video là minimax/minimax-h3, trình tạo đa phương thức (omni-modal) của MiniMax, với mức giá 0,08 USD mỗi giây đầu ra ở 768P và 0,13 USD mỗi giây ở 2K, được bán theo cùng đơn vị tính theo giây như Seedance và hiện đã có sẵn.

Screenshot of the OrcaRouter model page for MiniMax-H3, showing the model id minimax/minimax-h3, the description 'omni-modal video generation model (the Hailuo 3 generation), released July 31, 2026', a price of $0.08 per second, p50 time to first token of 375 ms and p95 of 416 ms over seven days.

Câu hỏi thường gặp, trả lời ngắn gọn

Tôi có thể chạy Seedance 2.5 và Griffin trong cùng một sản phẩm không? Về mặt kiến trúc thì có, và đó là sự phân chia hiển nhiên: Seedance cho bất cứ thứ gì có thể được kết xuất trước, Griffin cho bề mặt trực tiếp. Về mặt thương mại thì không, vì Griffin vẫn chưa thể bán cho bạn.

Griffin có phải chỉ là một công cụ tạo video người nói? Không, và Tavus rất cẩn trọng về sự khác biệt này — một công cụ tạo video người nói nhận văn bản và trả về video, trong khi Griffin nhận video và âm thanh của người tham gia làm đầu vào và được chấm điểm dựa trên việc liệu nó có phản ứng ngay tại thời điểm đó hay không.

Seedance 2.5 có chạy theo thời gian thực không? Không. Đây là một trình tạo theo lô với giới hạn ba mươi giây và chế độ gia hạn nhiều vòng; độ trễ không phải là trục mà nó cạnh tranh.

Điểm mấu chốt

Seedance 2.5 là một engine sản xuất đã được phát hành: ba mươi giây trong một lần chạy, âm thanh đồng thời, tối đa ba mươi hình ảnh cùng mười tham chiếu video và âm thanh, điều khiển ở mức dấu thời gian và vùng, khoảng 0,51 USD cho một clip 480p dài năm giây và khoảng 1,16 USD ở 720p trên ModelArk, hiện đã có qua các nền tảng của chính ByteDance và, theo như bất kỳ ai đã xác nhận, chưa có ở Hoa Kỳ. Tavus Griffin không phải là một sản phẩm: nó là một Mô hình Tương tác Con người song công, với những thành tựu đã công bố là 48% người tham gia tin rằng nó là con người trong một cuộc gọi dài một phút và độ trễ trung bình từ âm thanh sang video là 0,43 giây trên H100, và nhà cung cấp của nó đã nói bằng văn bản rằng khách hàng chưa thể sử dụng nó. Nếu bạn cần cảnh quay ngay hôm nay, Seedance là câu trả lời và nó được niêm yết giá công khai. Nếu bạn cần một khuôn mặt phản ứng trong khi bạn nói, câu trả lời là chưa có ai bán một sản phẩm như vậy.