Một thẻ tiêu đề được tạo với dòng chữ 'Vidu Q4 Preview vs Seedance 2.5', phụ đề 'Mười lăm tham chiếu so với ba mươi, cộng thêm một đầu vào video' và hai thẻ, thẻ bên trái ghi 'Vidu Q4 Preview: 15 hình ảnh, 3 clip âm thanh, 16 giây, tối đa 4K' và thẻ bên phải ghi 'Seedance 2.5: 30 hình ảnh, 10 video, 10 clip âm thanh, 30 giây mỗi lần chạy'. Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

Vidu Q4 Preview so với Seedance 2.5: Tham chiếu không phải là khác biệt thực sự

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Các hạn mức tham chiếu được công bố trông như một thắng lợi rõ ràng cho Seedance 2.5: tối đa 30 hình ảnh, 10 video và 10 clip âm thanh so với Vidu Q4 Preview với 15 hình ảnh và 3 clip âm thanh. Đó là gấp đôi số hình ảnh và gấp ba lần âm thanh, và chỉ riêng điều đó thôi cũng đủ để giải quyết câu hỏi. Nhưng nó thì không, bởi vì con số quan trọng không phải là số lượng — mà là phương thức thứ hai. Seedance 2.5 chấp nhận video làm tham chiếu đầu vào. Vidu Q4 Preview chấp nhận hình ảnh và âm thanh, và không có cách nào được ghi nhận trong tài liệu để đưa một clip có sẵn vào.

Seedance 2.5 ra mắt ngày 31 tháng 7 năm 2026 với tư cách là sản phẩm dài kỳ của ByteDance, tạo ra một clip 30 giây chỉ trong một lần chạy với khả năng mở rộng nhiều lượt cho các chuỗi dài hơn. Vidu Q4 Preview ra mắt ngày 7 tháng 10 năm 2026 từ Shengshu Technology như một bản xem trước của sản phẩm chủ lực thế hệ tiếp theo, với hai chế độ — Image-to-Video và Reference-to-Video — và hai endpoint API được tài liệu hóa. Cả hai đều là những mô hình thiên về tham chiếu. Chúng được xây dựng để chứa đựng những thứ khác nhau.

Mỗi phương thức nhập liệu thực sự mở khóa được những gì

Một mô hình lấy hình ảnh làm tham chiếu có thể giữ nguyên dàn diễn viên và phong cách. Tài liệu của Vidu Q4 Preview mô tả việc kết hợp 1–15 hình ảnh cho nhân vật, bối cảnh và phong cách để các chủ thể giữ được sự nhất quán xuyên suốt một take nhiều cú máy, với tối đa 3 tham chiếu âm thanh mp3 dài 3–12 giây để nhân bản giọng nói và giữ cho cách thể hiện khớp nhau. Mười lăm vị trí phân bổ cho dàn diễn viên, trang phục, đạo cụ và ánh sáng trong một cảnh là một ngân sách hợp lý, và đó là lý do mô hình này đang đồng hạng ở vị trí dẫn đầu trên bảng xếp hạng ưu tiên image-to-video.

Một mô hình cũng nhận video làm tham chiếu có thể được hướng vào đoạn phim. Seedance 2.5 chấp nhận tối đa 10 đầu vào video cùng với 30 hình ảnh và 10 clip âm thanh, nghĩa là tập tham chiếu có thể bao gồm chuyển động, nhịp độ và hành vi camera được lấy từ một clip có sẵn thay vì được mô tả trong prompt. Đó là một năng lực khác, không phải một phiên bản lớn hơn của cùng năng lực đó, và chính nó đưa Seedance 2.5 lên bảng chỉnh sửa video tại Artificial Analysis — thứ hai, với 1.161 Elo qua 5.162 phiếu bầu tính đến ngày 8 tháng 10 năm 2026 — chỉnh sửa video từ một chỉ dẫn văn bản với âm thanh được giữ nguyên. Vidu Q4 Preview không có trên bảng đó, và lý do là danh sách endpoint của nó, không phải điểm số của nó.

Sự tương phản thực tế:

• Tham chiếu hình ảnh — Vidu Q4 Preview tối đa 15 so với Seedance 2.5 tối đa 30

• Tham chiếu video — Vidu Q4 Preview không có tài liệu nào so với Seedance 2.5 tối đa 10

• Tham chiếu âm thanh — Vidu Q4 Preview tối đa 3 clip mp3 dài 3–12 giây so với Seedance 2.5 tối đa 10

• Độ dài một lần chạy — Vidu Q4 Preview 3–16 giây trên Image-to-Video, 1–16 giây trên Reference-to-Video so với Seedance 2.5 30 giây trong một lần chạy, cùng khả năng gia hạn nhiều lượt vượt xa mức đó

• Chế độ — Vidu Q4 Preview Image-to-Video và Reference-to-Video so với Seedance 2.5 text-to-video, reference-to-video và video-in reference, cùng một lộ trình chỉnh sửa đang nằm trong kế hoạch

• Độ phân giải đầu ra — Vidu Q4 Preview từ 540p đến 4K dưới dạng các bậc tạo được định giá, 2K và 4K ở màu 10-bit so với Seedance 2.5 480p và 720p trên các máy chủ công bố thiết lập của nó, với các bậc cao hơn đạt độ phân giải phân phối thông qua upscale

Đặt chúng cạnh nhau thì các mô hình không còn cạnh tranh cho cùng một đề bài. Một take 4K dài mười sáu giây với mười lăm ảnh tham chiếu và một take 720p dài ba mươi giây với ba mươi ảnh tham chiếu cùng đầu vào video là câu trả lời cho hai câu hỏi sản xuất khác nhau.

Các đơn vị tính giá không chuyển đổi, và đó là toàn bộ vấn đề

Đây là chỗ mà hầu hết các so sánh giữa hai thứ này đều sai, và lỗi nằm ở đơn vị chứ không phải ở phép tính.

Seedance 2.5 không được nhà cung cấp bán theo giây. ByteDance tính phí mô hình theo token video trên bảng giá chính thức, được công bố qua Volcano Engine Ark tại Trung Quốc và BytePlus ModelArk trên thị trường quốc tế. Chi phí của một clip phụ thuộc vào độ phân giải, thời lượng và mức sử dụng token thực tế, vì vậy con số theo giây chỉ đúng với một độ phân giải và một thời lượng — và những lần tạo thất bại vẫn bị tính phí như những lần thành công. Các nhà cung cấp hosting bên thứ ba có cung cấp Seedance 2.5 sẽ cộng thêm biên lợi nhuận của riêng họ và công bố mức giá theo giây hoặc theo clip của riêng họ, đó là lý do vì sao hàng tá trang đưa ra hàng tá con số khác nhau và không có con số nào là của nhà cung cấp.

Vidu Q4 Preview được định giá theo cách ngược lại: mức tín dụng cố định mỗi giây chỉ thay đổi theo bậc độ phân giải bạn chọn, được Shengshu công bố công khai. Chín tín dụng mỗi giây ở 540p, 19 ở 720p, 24 ở 1080p, 38 ở 2K, 78 ở 4K, so với mức tín dụng nền tảng được nêu là $0,005, cùng với các ưu đãi gói trong thời gian giới hạn lên tới 30% hiện đang được áp dụng. Ở mức giá niêm yết, đường giá chạy từ khoảng $0,045 mỗi giây ở 540p đến khoảng $0,39 ở 4K. Con số $0,014 mỗi giây từ thông báo ra mắt là bậc 540p với mức giảm giá đã được áp dụng.

Nghĩa là hai bảng giá không thể được so sánh từng dòng một, và bất kỳ trang nào làm vậy đều đang so sánh danh sách công khai của nhà cung cấp với mức markup của bên vận hành. Điều có thể so sánh là những gì nhà cung cấp công bố về hình dạng của từng loại: chi phí của Vidu tăng theo độ phân giải và thời lượng, và có thể biết trước khi bạn nhấn tạo; còn của Seedance được tính theo token, do đó phụ thuộc vào cách mô hình chọn chi tiêu token cho prompt của bạn. Một cái thì dự đoán được, cái kia thì tính theo đồng hồ đo. Cả hai đều không sai, nhưng chúng phù hợp với những người mua khác nhau — và cái thứ hai là cái nguy hiểm hơn trong hai cái để lập ngân sách dựa vào, bởi vì sự biến động nằm ở phía nhà cung cấp trong ranh giới đó.

Trên bảng độc lập, các con số ghi nhận theo phút chỉ nên được đọc như một bậc độ lớn mà thôi. Artificial Analysis ghi nhận Vidu Q4 Preview ở mức 7,20 USD mỗi phút trên bảng image-to-video, và Dreamina Seedance 2.5 ở mức 34,12 USD mỗi phút trên text-to-video và 40,82 USD trên editing. Những cột đó là chi phí cho một phút đầu ra 1080p ở cài đặt mặc định của mỗi mô hình — và Seedance 2.5 mặc định dùng cấu hình dài hơn, nặng hơn mà bảng giá của nó áp giá, trong khi mặc định của Vidu Q4 Preview là một clip tạo một lần. Chúng đo các hành vi mặc định khác nhau, chứ không phải khoảng cách hiệu quả gấp bốn đến năm lần.

Mười sáu giây so với ba mươi là một sự khác biệt thực sự

Có một so sánh thực sự vẫn đứng vững trước vấn đề đơn vị, và đó là độ dài. Ba mươi giây trong một lần chạy gần gấp đôi mức trần mười sáu giây của Vidu Q4 Preview, và khả năng mở rộng nhiều lượt của Seedance 2.5 nghĩa là một chuỗi có thể được xây dựng vượt qua mốc đó. Đối với tác phẩm tự sự — một cảnh có cung truyện, một quảng cáo có phần dẫn dắt và phần trả kết — sự khác biệt giữa mười sáu và ba mươi giây là sự khác biệt giữa một cú máy và một cảnh.

Ở đầu phân giải cao, điều đó lại diễn ra theo hướng ngược lại. Vidu Q4 Preview tạo từ ba giây, và gói 540p của nó có giá chỉ khoảng một phần ba mức 720p của chính nó, khiến việc dựng bố cục trở nên rẻ trước khi chốt render ở độ phân giải đầy đủ. Không có gì trong cơ cấu giá đã công bố của Seedance 2.5 đảm nhận vai trò đó: gói host 480p của nó rẻ hơn 720p, nhưng cách tính phí của chính nhà cung cấp lại dựa trên token, nên một bài kiểm thử ngắn ở độ phân giải thấp không có mức giá công bố rõ ràng để dựa vào mà lập kế hoạch.

Cái nào, bằng bản tóm tắt

Hãy chọn Seedance 2.5 khi công việc liên quan đến cảnh quay bạn đã có sẵn. Nếu công việc là kéo dài, tái tạo phong cách hoặc cắt dựng lại một clip hiện có, hoặc nếu bộ tham chiếu cần truyền tải chuyển động thay vì chỉ ngoại hình, thì đầu vào video chính là năng lực quyết định và Vidu Q4 Preview không thể được dùng thay thế. Thêm khả năng chạy một mạch 30 giây, và trường hợp này trở nên rõ ràng đối với công việc kể chuyện và quảng cáo có mạch dài hơn.

Hãy chọn Vidu Q4 Preview khi công việc là một dàn cast cần giữ được sự nhất quán và thông số bàn giao vượt quá 720p. Khả năng tạo native 2K và 4K ở màu 10-bit là một hạng mà Seedance 2.5 không công bố ở cấp nhà cung cấp, và mức giá theo giây khiến một take 4K trở thành số lượng bạn thực sự có thể lên ngân sách, thay vì một ẩn số tính theo đồng hồ đo. Mười lăm ảnh tham chiếu và ba tham chiếu giọng nói là đủ cho một dàn cast cảnh đơn, và hạng blocking 540p giúp việc lặp lại trở nên rẻ.

Điều gì sẽ thay đổi cục diện này: một bản phát hành Vidu Q4 đầy đủ có bổ sung phương thức đầu vào video sẽ xóa bỏ khác biệt mang tính cấu trúc và biến hai mô hình này thành đối thủ trực tiếp, còn tài liệu của chính Shengshu nói rằng bản xem trước tồn tại chính xác để thu thập phản hồi định hình bản dựng cuối cùng. Ở phía ngược lại, nếu ByteDance công bố một bảng ví dụ về tỷ lệ token ở nhiều thiết lập hơn, sự bất đối xứng giữa tính đo đếm và tính có thể dự đoán sẽ dễ lập kế hoạch hơn nhiều. Cho đến khi một trong hai điều đó thành hiện thực, cách hiểu đúng về "30 tham chiếu so với 15" là một trong hai mô hình này nhận video đầu vào còn mô hình kia thì không.

Một khóa duy nhất cho các mô hình video mà bạn thực sự có thể gọi

OrcaRouter đưa các mô hình video và ngôn ngữ về sau một endpoint tương thích OpenAI duy nhất trên một khóa, với mức giá niêm yết của nhà cung cấp được chuyển nguyên vẹn, không cộng thêm phụ phí, nhờ đó khi nhà cung cấp thay đổi biểu giá thì thay đổi đó được áp dụng ngay trong ngày chứ không phải đợi đến kỳ gia hạn. Vidu Q4 Preview và Seedance 2.5 hiện chưa phải là các tuyến của OrcaRouter, và trang này không hề ngụ ý điều ngược lại. Những tuyến video mà chúng tôi thực sự phục vụ — Kling 3.0 cùng các biến thể Turbo và v2.6 của nó nằm trong số đó — nằm bên cạnh các mô hình ngôn ngữ trên cùng một endpoint và cùng một dạng yêu cầu, với khả năng chuyển đổi dự phòng tự động giữa các tuyến thay vì phải có hợp đồng riêng cho từng mô hình.

Đó là cấu trúc khiến một phép so sánh như thế này có thể hoàn tất: chạy các ứng viên trên đề bài của chính bạn, theo thiết lập của chính bạn, và để tỷ lệ chấp nhận quyết định thay vì hai bảng đơn giá ở các đơn vị khác nhau.

A generated two-column scoreboard titled 'Vidu Q4 Preview vs Seedance 2.5 - the scoreboard'. The left column reads: Image references up to 15; Video references none; Audio references up to 3; Single-run length up to 16 seconds; Max resolution 4K generation; Billing unit per second by tier. The right column reads: Image references up to 30; Video references up to 10; Audio references up to 10; Single-run length up to 30 seconds; Max resolution 720p on published hosts; Billing unit tokens, per vendor. A footer reads 'Vidu figures per vendor docs; Seedance figures vendor-reported, unreproduced.'A screenshot of the Vidu API documentation for Vidu Q4 Preview, showing the left navigation with the Vidu Q4 Preview entry selected and the 'Image to Video' page open, including the Create Task endpoint, the Authorization header and a cURL request example whose body sets model to viduq4-preview with a duration and resolution and the audio parameter set true.A screenshot of the Artificial Analysis AA-Video-T2V v2.0 text-to-video leaderboard, read 8 October 2026, showing Wan 3.0 first at 1,156 Elo, Dreamina Seedance 2.5 third at 1,143 over 8,264 samples with an API price of $34.12 per minute, MiniMax H3 (768p) fourth at 1,137 and MiniMax H3 Max fifth at 1,130, with Vidu Q4 Preview absent from the board entirely.