一張生成的標題卡寫著「Vidu Q4 Preview 對比 Seedance 2.5」,副標題為「十五個參考對上三十個,外加一個影片輸入」,並有兩張卡片,左邊寫著「Vidu Q4 Preview:15 張圖片、3 段音訊片段、16 秒,最高可達 4K」,右邊寫著「Seedance 2.5:30 張圖片、10 部影片、10 段音訊片段,每次執行 30 秒」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Vidu Q4 Preview 對比 Seedance 2.5:參考預算並非真正的差異

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

已公布的參考額度看似是Seedance 2.5的壓倒性勝利:最多 30 張圖片、10 段影片和 10 段音訊片段,對比Vidu Q4 Preview的 15 張圖片和 3 段音訊片段。圖片數量是兩倍,音訊數量是三倍,單就這一點就足以決定勝負。但事實並非如此,因為真正重要的數字不是數量——而是第二種模態。Seedance 2.5 接受影片作為輸入參考。Vidu Q4 Preview 接受圖片和音訊,且沒有文件記載的途徑能將既有片段納入。

Seedance 2.5 於 2026 年 7 月 31 日推出,是 ByteDance 的長篇生成力作,能在單次執行中生成 30 秒短片,並可透過多輪延伸來處理更長的序列。Vidu Q4 Preview 於 2026 年 10 月 7 日由生數科技推出,是其下一代旗艦模型的預覽版,具備兩種模式——圖像轉影片與參考轉影片——以及兩個有文件記載的 API 端點。兩者都是高度依賴參考的模型。它們是為了承載不同的內容而打造。

每種輸入模式實際上解鎖了什麼

以圖像作為參考的模型可以維持一個姿勢與一種造型。Vidu Q4 Preview 的文件說明描述了如何結合 1–15 張圖像,涵蓋角色、場景與風格,讓主體在多重鏡頭拍攝中保持一致,並可搭配最多 3 段 3–12 秒的 mp3 音訊參考來呈現一個聲音,同時讓演繹保持一致。單一場景的演員、服裝、道具與燈光共十五個欄位,是一套連貫的預算額度,而這正是該模型在圖像轉影片偏好榜上並列榜首的原因。

一個也能把影片當作參考的模型,可以直接對準現有影片素材。Seedance 2.5 最多可接受 10 個影片輸入,並可搭配 30 張圖像與 10 段音訊片段,這表示參考集可以納入取自既有片段的動態、節奏與攝影機行為,而不必在提示中加以描述。這是一種不同的能力,而不是同一種能力的放大版;正是這一點讓 Seedance 2.5 登上 Artificial Analysis 的影片編輯排行榜——截至 2026 年 10 月 8 日讀取時,以 5,162 票、1,161 Elo 位居第二——能依文字指令剪輯影片並保留音訊。Vidu Q4 Preview 不在那個排行榜上,原因在於其端點清單,而不是它的分數。

實際對比:

• 圖像參考 — Vidu Q4 Preview 最多 15 張,Seedance 2.5 最多 30 張

• 影片參考 — Vidu Q4 Preview 無任何記錄 vs Seedance 2.5 最多 10

• 音訊參考 — Vidu Q4 Preview 最多 3 段 3–12 秒的 mp3 片段,相較之下 Seedance 2.5 最多 10 段

• 單次生成長度 — Vidu Q4 Preview 在圖生影片模式下為 3–16 秒、在參考生影片模式下為 1–16 秒,而 Seedance 2.5 單次可生成 30 秒,並可透過多輪延長進一步延伸

• 模式 — Vidu Q4 Preview 的圖像轉影片與參考轉影片,對比 Seedance 2.5 的文字轉影片、參考轉影片與影片作為參考輸入,且編輯路線已在規劃中

• 輸出解析度 — Vidu Q4 Preview 提供 540p 到 4K,作為分級計價的生成層級;2K 與 4K 為 10 位元色彩,對比 Seedance 2.5 在公佈其設定的主機上為 480p 與 720p,而較高層級則透過升頻達到交付解析度

把這兩者並排比較,就會發現這些模型並不是在爭奪同一份需求簡報。一個是十五張參考圖的 4K 十六秒鏡次,另一個是三十張參考圖、720p、三十秒並帶有影片輸入的鏡次——它們回答的是兩個不同的製作問題。

定價單位不會換算,情況就是這樣。

這正是大多數對這兩者所作的比較出錯的地方,而問題出在單位,而不是算術。

Seedance 2.5 並非由其供應商按秒販售。ByteDance 在官方價目表上以影片 token 計量該模型,該價目表在中國透過 Volcano Engine Ark 公布,在國際上則透過 BytePlus ModelArk 公布。一段影片要花多少錢,取決於解析度、時長與實際 token 用量,因此每秒的數字只在單一解析度與單一時長下成立——而且失敗的生成與成功的生成計費相同。提供 Seedance 2.5 的第三方代管業者會在其上加收自己的利潤,並公布自家的按秒或按片段費率,這就是為什麼十幾個頁面會給出十幾種不同數字,而其中沒有一個是供應商的價格。

Vidu Q4 Preview 的定價方式則相反:固定每秒點數費率,僅依你所選擇的解析度等級而異,並由生數科技公開公布。540p 每秒 9 點、720p 為 19 點、1080p 為 24 點、2K 為 38 點、4K 為 78 點,對照平台公布的每點 $0.005 費率,目前還推出最高 30% 的限時套裝折扣。按牌價計算,費率曲線從 540p 每秒約 $0.045 一路到 4K 約 $0.39。發表公告中的每秒 $0.014 數字,是 540p 等級套用折扣後的價格。

這意味著這兩份費率表無法逐行比較,任何拿來逐行比較的頁面,都是在把供應商公開的價目表,拿去比託管方的加價。真正能比較的,是供應商就兩者各自的計費形態所公布的內容:Vidu 的成本隨解析度與時長而變,而且在按下生成之前就能得知;Seedance 則按 token 計量,因此取決於模型選擇如何在你的提示詞上使用 token。一個可預測,另一個按量計費。兩者都沒有錯,只是適合不同的買家——而若要據以編列預算,第二種是兩者中更危險的,因為變動是落在供應商那一側。

在獨立排行榜上,所記錄的每分鐘數字僅值得作為數量級參考。Artificial Analysis 在圖像轉影片排行榜上記錄 Vidu Q4 Preview 為每分鐘 $7.20,並在文字轉影片上記錄 Dreamina Seedance 2.5 為每分鐘 $34.12,在編輯上則為 $40.82。那些欄位代表每個模型在預設設定下輸出 1080p 一分鐘的成本——而 Seedance 2.5 預設採用其價目表據以定價的較長、較重配置,而 Vidu Q4 Preview 的預設則是單次生成的片段。它們衡量的是不同的預設行為,而非四到五倍的效率差距。

十六秒對上三十秒,這可是天壤之別

有一項比較確實不受單位問題影響,那就是長度。單次生成三十秒,幾乎是 Vidu Q4 Preview 十六秒上限的兩倍,而 Seedance 2.5 的多輪延伸意味著可以建構出超過這個長度的序列。對於敘事性作品——有起承轉合的一場戲、有鋪陳與回收的廣告——十六秒與三十秒之間的差別,就是一個鏡頭與一場戲之間的差別。

在低解析度這一端,情況正好相反。Vidu Q4 Preview 從三秒起就能生成,而其 540p 級距的定價大約只有自家 720p 費率的三分之一,這讓人在投入全解析度算圖之前,能以便宜的成本先確認構圖。已公布的 Seedance 2.5 費率結構中,沒有任何機制扮演這個角色:它的 480p 主級距確實比 720p 便宜,但廠商本身的計費是以權杖(token)為基礎,因此短時間的低解析度測試並沒有乾淨俐落的公開價格可供事先規劃。

哪一個,簡要說來

當工作涉及你手上已有的素材時,就採用 Seedance 2.5。如果工作是要延伸、重新調整風格或重新剪輯現有片段,或者參考素材集需要承載動態而不只是外觀,那麼影片輸入就是決定性的能力,而 Vidu Q4 Preview 無法替代。再加上三十秒的單次執行,對於這類工作與廣告工作而言,情況就簡單明瞭。

當工作是需要穩定撐住場面的角色陣容,而且交付規格超過 720p 時,就選用 Vidu Q4 Preview。原生 2K 與 4K 生成、10 位元色彩,是 Seedance 2.5 在供應商層級並未公布的規格層級,而按秒計價讓 4K 鏡次成為你真正能編列預算的數量,而不是按量計費的未知數。十五個影像參考與三個語音參考,對單一場景的角色陣容來說已經足夠,而 540p 的走位預覽層級則讓反覆迭代變得便宜。

什麼情況會改變這一點:若 Vidu Q4 正式版發布並加入影片輸入模態,就會消解這樣的結構性差異,讓這兩者成為直接競爭對手,而生數科技自家的資料也指出,預覽版的存在正是為了蒐集回饋,以形塑最終版本。另一方面,如果字節跳動公布涵蓋更多設定值的 token 費率範例表,這種「計量制對比可預測性」的不對稱就會變得容易規劃許多。在兩者之一實現之前,對「30 個參考對上 15 個」的正確解讀是:這兩款模型中,有一款能輸入影片,另一款則不能。

一把金鑰,搞定你真的能呼叫的影片模型

OrcaRouter 將影片與語言模型置於單一 OpenAI 相容端點之後,只需一組金鑰,並以供應商定價原樣傳遞、不額外加價,因此供應商的費率變動當天就會生效,而不是等到續約時才調整。Vidu Q4 Preview 與 Seedance 2.5 目前並非 OrcaRouter 的路由,本頁亦無此暗示。我們確實提供的影片路由——Kling 3.0,其中包括其 Turbo 與 v2.6 版本——與語言模型並列於同一個端點、相同的請求格式,路由之間具備自動容錯移轉,而非每個模型各自一份合約。

這就是讓這樣的比較得以完成的結構:用你自己的需求簡報來跑候選方案、用你自己的設定,並讓接受率來決定,而不是比較兩張單位不同的費率表。

A generated two-column scoreboard titled 'Vidu Q4 Preview vs Seedance 2.5 - the scoreboard'. The left column reads: Image references up to 15; Video references none; Audio references up to 3; Single-run length up to 16 seconds; Max resolution 4K generation; Billing unit per second by tier. The right column reads: Image references up to 30; Video references up to 10; Audio references up to 10; Single-run length up to 30 seconds; Max resolution 720p on published hosts; Billing unit tokens, per vendor. A footer reads 'Vidu figures per vendor docs; Seedance figures vendor-reported, unreproduced.'A screenshot of the Vidu API documentation for Vidu Q4 Preview, showing the left navigation with the Vidu Q4 Preview entry selected and the 'Image to Video' page open, including the Create Task endpoint, the Authorization header and a cURL request example whose body sets model to viduq4-preview with a duration and resolution and the audio parameter set true.A screenshot of the Artificial Analysis AA-Video-T2V v2.0 text-to-video leaderboard, read 8 October 2026, showing Wan 3.0 first at 1,156 Elo, Dreamina Seedance 2.5 third at 1,143 over 8,264 samples with an API price of $34.12 per minute, MiniMax H3 (768p) fourth at 1,137 and MiniMax H3 Max fifth at 1,130, with Vidu Q4 Preview absent from the board entirely.