一張為 Vidu Q4 Preview 生成的標題卡,副標題為「首日於圖像轉影片排行榜上排名第三」,卡片上寫著「AA-Video-I2V v1.0:第 3 名,Elo 1,179」與「Vidu Q3 Pro:第 19 名,Elo 1,056」,並有一排規格方塊寫著「最長片段:16 秒」、「最高解析度:4K」、「參考圖片:最多 15 張」與「文字轉影片:未提供」。OrcaRouter 標誌位於右下角留有邊距的條狀區。
Guides & Insights

Vidu Q4 Preview 在圖生影排行榜上初登場便奪下第三名——卻在另一個排行榜上不見蹤影

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Vidu Q4 Preview以 1,179 的 Elo 分數登上 Artificial Analysis AA-Video-I2V v1.0 排行榜第三名,而它所取代、原本是 Vidu 排名最佳作品的Vidu Q3 Pro,則以 1,056 分位居第十九。這是在單一版本發佈中推進 123 分,而在這個排行榜上,信賴區間大約有 20 分寬,且這樣的表现是在每分鐘生成影片 7.20 美元、而非舊款模型 9.60 美元的價格下達成。生數科技(Shengshu Technology)於 2026 年 10 月 7 日推出 Vidu Q4 Preview,作為其下一代旗艦模型的首個公開預覽版本,明確早於完整的 Q4 模型,並邀請創作者在最終版本仍在形塑之際,將其用於實際專案中。

首次登場的數字是頭條。缺席才是更有趣的事實,而這也是本文之所以是一篇報導、而非一張圖表的原因。

10月7日實際上出貨了什麼

Vidu Q4 Preview 是一款具備原生音訊的影片生成模型,透過 Vidu 自家的網頁產品與 API 平台銷售。生數的發表資料描述了三個工作領域:角色表演(臉部表情、情緒、身體動作與聲音彼此協調,而非分層疊加)、快速動作中的鏡頭與剪接連貫性,以及視覺特效——爆炸、粒子、煙火——這些效果位於場景之內,而非浮貼於其上。

供應商所述的規格:

• 最高解析度 — 4K,其中 2K 與 4K 具備 10 位元色彩深度;完整階梯為 540p、720p、1080p、2K、4K

• 最大片段長度 — 16 秒,分配不均:Image-to-Video 為 3 至 16 秒,Reference-to-Video 為 1 至 16 秒

參考素材額度 — 最多 15 張參考圖像(角色、服裝、道具、產品、環境,可放在同一個設定中),以及最多 3 段參考音訊片段

• 上市優惠價 — 每秒 $0.014 起,此為供應商提供的數字,且明確屬於促銷性質

該廠商還提出了一項很難要求它兌現的比較性主張:在可比的輸出規格與計費條件下,Vidu Q4 Preview 能「以相同預算帶來最高五倍的輸出量」。這是效率主張,而非品質主張;而正因為「可比的輸出規格與計費條件」這幾個字在該句中承擔了全部的關鍵作用,在有人成功重現之前,值得把它當作行銷話術來看待。Shengshu 自己隨文發布的但書則是:最終定價、支援的解析度、功能可用性與使用條款可能因方案與地區而異。

A generated single-column scoreboard titled 'Vidu Q4 Preview — the scoreboard' with six rows reading 'AA I2V rank: 3rd, Elo 1,179', 'Max resolution: 4K at 10-bit', 'Max clip: 16 seconds', 'Reference images: up to 15', 'Reference audio: up to 3' and 'Measured rate: $7.20 per minute', with a footer reading 'Elo, rank and rate per Artificial Analysis, 8 October 2026; resolution and clip length are vendor-stated.' The OrcaRouter logo sits in the bottom-right padded strip.

這兩個董事會對這個模型的用途意見分歧

Artificial Analysis 設有各自獨立的影片排行榜,採用各自獨立的 Elo 量表與各自獨立的投票池,而它們之間的差異正是這裡的關鍵所在。

在 AA-Video-I2V v1.0 —— 圖像轉影片、依據保留音訊的成對人類偏好投票排名 —— 中,Vidu Q4 Preview 以 1,179 ±10、5,543 個樣本排名第三,日期為 2026 年 10 月,定價為每分鐘 $7.20。只有兩個模型排在它之上:MiniMax H3 Max 為 1,195 ±9、5,894 個樣本($4.80/分鐘,2026 年 8 月),以及 MiniMax H3 為 1,181 ±8、7,284 個樣本($7.80/分鐘,2026 年 7 月)。Gem​ini Omni Flash 以 1,178 ±7、12,327 個樣本排名第四。該榜單自身的公告指出,過去 30 天內新增了兩個模型:Vidu Q4 Preview 與 HiDream-O1-Video-1.0,後者以 1,175 ±10 排名第六。

在 AA-Video-T2V v2.0 —— 文字轉影片,一個基於不同使用案例分類法建立的不同排行榜 —— 上,Vidu Q4 Preview 完全沒有出現。那裡最強的 Vidu 項目是 Vidu Q3 Pro,在 4,088 個樣本中獲得 941 ±10,排名第二十五。Wan 3.0 以 1,156 ±9 領先該排行榜。

把這兩句話放在一起讀,這次發布的輪廓就清晰了。這是一個以圖像與參考為核心的模型。Vidu 自家的產品頁面為它列出的恰好只有兩種模式——圖生影片與參考生影片——沒有文生影片的分頁,API 文件也與此相符。一場在廠商行銷上看起來像全面旗艦的發布,在獨立看板上卻是針對性的。

關於排名本身,還有一點但書。I2V 排行榜的十點區間從第三名到第六名大幅重疊——1,179、1,178、1,176、1,175——所以「第三名」只是雜訊範圍內的一個位置,並非與第四名有明確區隔。真正不在雜訊範圍內的,是它與被它取代的模型之間的差距。Vidu Q3 Pro 與 Vidu Q4 Preview 之間的 123 Elo,比該排行榜前六名的整體差距還大。

The Artificial Analysis image-to-video board on 8 October 2026, with Vidu Q4 Preview third at Elo 1,179 and Vidu Q3 Pro nineteenth at 1,056.

你實際上撥打的是什麼,以及它要花多少錢

這個 API 樸實無華且具體。Image-to-Video 會 POST 至 /ent/v2/img2video,模型名稱為 viduq4-preview,接收單一起始影格圖片(png、jpeg、jpg 或 webp,最大 50MB)、最多 20,000 個字元的提示詞、3 到 16 秒的持續時間(預設為 5 秒),以及 540p 到 4K 的解析度(預設為 720p)。Reference-to-Video 會 POST 至 /ent/v2/reference2video,接收一至十五張圖片,加上零至三個 mp3 音訊參考(每個長度為三至十二秒),並提供 1:1、9:16、16:9、3:4 與 4:3 的長寬比,預設為 16:9。

值得留意的參數是 audio,其預設值為 true。Vidu Q4 Preview 預設會隨畫面一併生成聲音——包含對話與音效——你得刻意將它關閉。回傳的創作網址僅維持 24 小時有效,如果你是以批次方式生成、之後才進行算圖,這個時效短得足以造成影響。

論價格,誠實的算術是:被提出的那兩個數字——「每秒 $0.014」與 Artificial Analysis 記錄的每分鐘 $7.20——並不是同一種產品。每秒 $0.014 等於每分鐘 $0.84,大約是該榜單數字的九分之一;這正是最低解析度的促銷底價,與生產級解析度下實測費率並列時的樣子。任何你根據發表數字編列的預算,都應該依你自己的解析度與時長重新推算,而不是根據宣傳標題數字。

Vidu's own API documentation for the Image-to-Video and Reference-to-Video endpoints behind Vidu Q4 Preview.

預覽 SKU 的實際問題

以廠商自己的說法,Vidu Q4 Preview 尚未完成。它搶在 Q4 之前推出,是為了讓效能、創作掌控與日常製作需求方面的意見回饋,能為最終正式版提供參考。定價屬於促銷性質。功能可用性會因方案與地區而異。API 文件甚至還帶著一個拼錯的別名——viduq4-previerw與正確的viduq4-preview並列出現在模型參數說明中——這雖是件小事,卻真實道出了這個版本在開發流程中所處的位置。

那不是反對使用它的論據。那是在反對在沒有計畫的情況下,把它放到關鍵路徑上——沒有計畫應對促銷價格結束和預覽版組建結束時會發生什麼;而對以這種方式發布的模型來說,這是幾週、而非幾季的問題。

如果你想在不必把正式生產流程押上去的情況下試用它,OrcaRouter 正是為這種情況打造:一個與 OpenAI 相容的端點,涵蓋超過 200 個模型,跨供應商自動容錯移轉,並將供應商的定價原樣傳遞,不額外加價。對於預覽版來說,容錯移轉這部分比平常更為重要,因為當預覽路由無法使用時,正是它讓你能用同一把金鑰,把請求導向穩定的模型。直說路由這件事:Vidu Q4 Preview 目前不是 OrcaRouter 的路由。我們確實有提供的影片模型——包括 MiniMax H3,也就是在這份榜單上排名第一的模型——可以和文字模型一樣在同一個端點上呼叫,而影片按秒計費的費率只是一項帳單明細,不是另立的合約。

看什麼

有三件事會推動這個故事發展。

首先,是文生影片的排行榜。Artificial Analysis 表示 AA-Video-I2V v2.0 即將推出,會與 T2V v2.0 的分類體系對齊,並全面涵蓋 1080p 影片。如果 Vidu Q4 Preview 是圖像與參考模型,它也不會出現在那裡——而如果它真的出現,那就代表 Shengshu 已經推出比預覽所暗示更廣泛的模型。

第二,完整的 Q4 正式版。從預覽版到正式版的階段,通常是促銷定價結束之時,也是功能組合要嘛維持、要嘛悄然縮減之處。15 張影像與 3 段音訊的參考額度,是規格中最有可能保留下來的部分,因為整個上市計畫所賴以建立的差異化優勢正是它。

第三,樣本數。5,543 票是真實的測量,但還很初期;隨著投票看板逐漸填滿,信賴區間會收窄,排名也會往任一方向變動。任何人若把「第三」當成已成定局的事實來引用,都應該說出自己讀到它的日期。

值得深究的問題比行銷說法所暗示的更狹窄。Vidu Q4 Preview 可衡量地是 Vidu 迄今打造的最佳圖像轉影片模型,領先幅度比排行榜本身前六名之間的差距還大,而且每分鐘費率比前代更低。這究竟會成為持久的地位,還是預覽版帶來的短暫提升,目前任何數字都無法回答。