一張生成的標題卡,寫著「Vidu Q4 Preview vs MiniMax H3」,副標題為「Elo 相差十六,相差三個榜位」,並有三個數據磚,分別寫著「1,195 MiniMax H3 Max」、「1,181 MiniMax H3」和「1,179 Vidu Q4 Preview」,每個都標註為「圖像轉影片 Elo」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Vidu Q4 Preview 對決 MiniMax H3:榜首並列,而只有一款登上三大榜單

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Artificial Analysis 的圖生影片排行榜(於 2026 年 10 月 8 日讀取)將MiniMax H3 Max以 1,195 的 Elo 列為第一,MiniMax H3以 1,181 位居第二,Vidu Q4 Preview則以 1,179 排名第三。第一名與第三名之間相差十六分,信賴區間約為 ±10 與 ±11,分別基於 5,894、7,284 與 5,543 票。這不過是一場披著頒獎台外衣的統計平手,任何以此排行榜作為開場就宣布贏家的頁面,都只是在解讀雜訊。

所以有趣的問題並不是這兩款模型中哪一款更好。而是當你走出那個兩者都出現的榜單之後,這個比較會變成什麼樣子——因為 MiniMax H3 於 2026 年 7 月 31 日發布,是一款全模態模型,能將文字、圖像、影片與音訊參考讀取為單一上下文;而 Vidu Q4 Preview 則於 2026 年 10 月 7 日推出,具有兩種輸入模式與兩個 API 端點。其中一款在三個地方受到衡量。另一款則只在一個地方受到衡量。

三方平手代表什麼、又不代表什麼

MiniMax 的兩個項目與 Vidu 的版本都落在彼此的區間之內,因此誠實的說法是:在目前的樣本規模下,前三名的圖像轉影片模型就人類偏好而言無從區分。有兩個細節讓這個平手結果,對所有人來說都不如聽起來那麼風光。

首先是時間。MiniMax H3 的投票來自 2026 年 7 月,H3 Max 的來自 8 月;Vidu Q4 Preview 的則來自 10 月。規模更大、時間更早的投票池,是對照不同的競爭場域與不同的對手組合來衡量的,這有利也有弊:衡量得更充分,但針對的是一個略有不同的問題。在這裡,無論往哪個方向出現 16 個百分點的差距,都不構成證據。

第二個是價格欄。Artificial Analysis 在這份榜單上記錄 MiniMax H3 為每分鐘 $7.80、H3 Max 為每分鐘 $4.80。Vidu Q4 Preview 則記錄為 $7.20。把這些當成排名來看,H3 Max 似乎是三者中最划算的選擇——但底層的供應商費率是在解釋這個標籤,而不是與之矛盾。我們在自己的模型卡上把 MiniMax-H3 列為 768P 下每秒 $0.08、2K 下每秒 $0.13,也就是每分鐘 $4.80 與 $7.80。榜單上這兩個 MiniMax 數字,是同一款模型在兩個解析度層級的定價,而非一個高階版本和一個平價版本。偏好榜單上的每分鐘欄位,用來判斷數量級很有用,但用來判斷更細微的差異就很危險。

MiniMax H3 會出現,而 Vidu Q4 Preview 不會出現的地方

這是對決中在平局後仍保留的部分,而這是結構上的差異,而非品質上的差異。

MiniMax H3 (768p) 在文字轉影片排行榜上以 1,137 Elo(8,315 票)排名第四,H3 Max 則以 1,130 Elo(5,719 票)排名第五。在影片編輯排行榜上,它同樣以 1,119 Elo(7,023 票)排名第四;該排行榜依據模型能否依照文字指令編輯影片並保留音訊來排名。Vidu Q4 Preview 則未出現在這兩個排行榜上。

這種缺席並非量測上的落差——而是這個產品的本質。Vidu Q4 Preview 的 API 記載了兩個端點,/ent/v2/img2video 與 /ent/v2/reference2video,而產品頁面列出兩種模式:圖生影片與參考生影片。文件裡沒有文字生影片的路徑。也沒有影片編輯的路徑,這意味著該模型無法取用既有的片段並在其中改動任何東西。MiniMax H3 兩者都能做到,而它全方位的模態框架——在單一脈絡中納入文字、圖像、影片與音訊參考——正是它之所以辦得到的原因。

值得對音訊這部分精確說明,因為兩個模型都支援原生音訊,但兩者並不是同一回事。Vidu Q4 Preview 會同時生成音訊與影片,其圖生影片端點中有個 audio 參數,能輸出含有對話與音效的影片,並且最多接受三段參考音訊片段,以維持角色聲音的一致性。MiniMax H3 則輸出原生立體聲音訊,並可將音訊與圖像、影片並列作為輸入模態。參考語音的應用情境是 Vidu 的獨特強項;萬物皆可參考的應用情境則是 MiniMax 的強項。

每秒的運算,逐層來看

兩個模型都按生成輸出的秒數計費,這使得這成為罕見的比較,可以直接把價目表相互對照,無須任何換算。

• 540p — 僅限 Vidu Q4 Preview:每秒 9 點,以平台公布的每點 $0.005 標準點數費率計算,約為 $0.045

• 720P / 768P — Vidu Q4 Preview 每秒 19 點數,約 $0.095,相較於 MiniMax-H3 每秒 $0.08

• 1080p — Vidu Q4 Preview 每秒 24 點,約 $0.12;相較之下 MiniMax-H3 未公布 1080p 層級

• 2K — Vidu Q4 Preview 每秒 38 點數,約 $0.19,相較之下 MiniMax-H3 為每秒 $0.13

• 4K — 僅限 Vidu Q4 Preview:每秒 78 點數,約 $0.39

由此得出的模式並不是「其中一個比較便宜」。Vidu Q4 Preview 的價格下限確實更低——它的 540p 層級是專門用於 blocking 的層級,定價正好反映其用途:在付費進行全解析度算圖之前先驗證構圖,而 MiniMax 的價目表中沒有任何方案扮演這個角色。在 2K 這個兩款模型共有的最高層級上,MiniMax H3 便宜約三分之一。而 Vidu 的 4K 層級是本次比較中唯一的 4K 生成層級,價格也反映了這一點。

Vidu 發表時所附帶的每秒 $0.014 這個上市數字,是 540p 等級在折扣點數費率下的價格,並非一般費率。Shengshu 的平台目前正對點數包推出最高 30% 的限時套裝折扣,這會讓每個等級一起調降,而不是改變曲線的形狀。請以定價表費率曲線作為比較基準,並把折扣視為暫時性的折抵。

在我們這邊:我們提供 MiniMax-H3 的路由。它已在公開模型 API 上線,位於 minimax/minimax-h3,依生成輸出每秒計費,採供應商牌價原價轉嫁、不額外加收任何費用,並可透過與我們所服務的每一個文字模型相同的 OpenAI 相容端點呼叫。Vidu Q4 Preview 並非 OrcaRouter 的路由,本頁也沒有聲稱相反——我們實際提供的影片模型,與語言模型共用同一把金鑰和同一種請求格式,正是這樣的安排讓比較多個模型變得便宜。原價轉嫁定價的一個實際結果是:當供應商調整每秒費率時,該變動當天就會反映在路由上,而不是等到合約續約時才顯現。

「全模態」在實際請求中能帶來什麼

MiniMax H3 的統一上下文很容易被讀成一份功能清單,卻忽略了它其實是一項工程差異。一個能接受影片作為輸入參考的模型,可以被指向某個現有鏡頭,並要求它延續、擴展或重新風格化;而沒有影片輸入的模型則辦不到。這就是 H3 之所以會出現在剪輯台上的機制,也是為什麼該模型 4–15 秒的輸出範圍,並不像這個數字所暗示的那麼受限——多輪延伸才是用它建構更長序列的常規做法。

Vidu Q4 Preview 的 16 秒上限同樣是針對單次生成而言,而其「參考到影片」(Reference-to-Video)模式正是為了在這個時間窗內進行多鏡頭敘事而打造,文件中描述了智慧運鏡切換,以及跨多個機位的一致性。它沒有的,是一條能接受你已經拍好的片段並加以修改的途徑。如果你的工作流程是從既有影片素材出發,而不是從一張靜態影像或一組參考素材開始,那麼這兩個模型中就有一個根本無法為你所用,而再高的 Elo 分數也彌補不了這一點。

哪一個,依工作

當輸入不是圖像或參考集時,就選 MiniMax H3。文字轉影片、影片轉影片編輯、音訊輸入、超過十五秒的多輪延伸,或是模型必須涵蓋相當於三種不同板卡使用情境的流程——那都是 H3 的守備範圍,而它是兩者中唯一具備其中任何一項的。在雙方共有的最高階級別中,它的 2K 費率也是兩者裡較便宜的。

當工作重點是角色與聲音的一致性時,或當你需要 4K 生成層級時,或當你想先用便宜的 540p 走位版本反覆調整鏡頭、再正式投入時,就選 Vidu Q4 Preview。十五個圖像參考與三個音訊參考,是比 MiniMax 文件所載明更大的公開參考額度,而在這項比較中,沒有其他模型能原生生成 4K。較窄的模式組合,就是換取這一點的代價。

會改變這一切的是:若 Vidu Q4 完整版發布,新增文字轉影片端點,就會把這兩個模型放上同一張排行榜,讓這變成一場正面對決。AA-Video-I2V v2.0 宣布將全面支援 1080p,並採用修訂後的能力分類法,它會取代榜首的票數,而不是重新排序——而這將釐清目前的三方並列究竟是真正的並列,還是量測上的極限。在那之前,要記住的數字是十六,並在旁邊註明排行榜名稱與日期。

從頒獎台本身唯一值得記取的一點是:第一名只比第三名高出十六 Elo,而區間又那麼寬,這不是排名。這是三個連人類投票者都無法區分的模型,而它們之間的抉擇必須來自本頁面上其他所有內容。

A generated two-column scoreboard titled 'Vidu Q4 Preview vs MiniMax H3 - the scoreboard'. The left column reads: Image-to-video Elo 1,179 (3rd); Text-to-video not present; Video editing not present; Max resolution 4K generation tier; Clip length 1-16 seconds; Price at 2K about 0.19 USD per second. The right column reads: Image-to-video Elo 1,181 (2nd); Text-to-video 4th, 1,137; Video editing 4th, 1,119; Max resolution 2K; Clip length 4-15 seconds; Price at 2K 0.13 USD per second. A footer reads 'All Elo and rank figures per Artificial Analysis, 8 Oct 2026; prices per vendor rate cards.'A screenshot of the Vidu API documentation for Vidu Q4 Preview, showing the left navigation with the Vidu Q4 Preview entry selected and the 'Image to Video' page open, including the Create Task endpoint, the Authorization header and a cURL request example whose body sets model to viduq4-preview with a duration and resolution and the audio parameter set true.A screenshot of the OrcaRouter model page for minimax/minimax-h3, showing MiniMax-H3 described as MiniMax's omni-modal video generation model and the Hailuo 3 generation, released July 31, 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio, billed per second of generated output at $0.08/s at 768P and $0.13/s at 2K, with an OpenAI-compatible code sample and a per-second price of $0.0800.