
Vidu Q4 Preview 對決 MiniMax H3:榜首並列,而只有一款登上三大榜單
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Artificial Analysis 的圖生影片排行榜(於 2026 年 10 月 8 日讀取)將MiniMax H3 Max以 1,195 的 Elo 列為第一,MiniMax H3以 1,181 位居第二,Vidu Q4 Preview則以 1,179 排名第三。第一名與第三名之間相差十六分,信賴區間約為 ±10 與 ±11,分別基於 5,894、7,284 與 5,543 票。這不過是一場披著頒獎台外衣的統計平手,任何以此排行榜作為開場就宣布贏家的頁面,都只是在解讀雜訊。
所以有趣的問題並不是這兩款模型中哪一款更好。而是當你走出那個兩者都出現的榜單之後,這個比較會變成什麼樣子——因為 MiniMax H3 於 2026 年 7 月 31 日發布,是一款全模態模型,能將文字、圖像、影片與音訊參考讀取為單一上下文;而 Vidu Q4 Preview 則於 2026 年 10 月 7 日推出,具有兩種輸入模式與兩個 API 端點。其中一款在三個地方受到衡量。另一款則只在一個地方受到衡量。
三方平手代表什麼、又不代表什麼
MiniMax 的兩個項目與 Vidu 的版本都落在彼此的區間之內,因此誠實的說法是:在目前的樣本規模下,前三名的圖像轉影片模型就人類偏好而言無從區分。有兩個細節讓這個平手結果,對所有人來說都不如聽起來那麼風光。
首先是時間。MiniMax H3 的投票來自 2026 年 7 月,H3 Max 的來自 8 月;Vidu Q4 Preview 的則來自 10 月。規模更大、時間更早的投票池,是對照不同的競爭場域與不同的對手組合來衡量的,這有利也有弊:衡量得更充分,但針對的是一個略有不同的問題。在這裡,無論往哪個方向出現 16 個百分點的差距,都不構成證據。
第二個是價格欄。Artificial Analysis 在這份榜單上記錄 MiniMax H3 為每分鐘 $7.80、H3 Max 為每分鐘 $4.80。Vidu Q4 Preview 則記錄為 $7.20。把這些當成排名來看,H3 Max 似乎是三者中最划算的選擇——但底層的供應商費率是在解釋這個標籤,而不是與之矛盾。我們在自己的模型卡上把 MiniMax-H3 列為 768P 下每秒 $0.08、2K 下每秒 $0.13,也就是每分鐘 $4.80 與 $7.80。榜單上這兩個 MiniMax 數字,是同一款模型在兩個解析度層級的定價,而非一個高階版本和一個平價版本。偏好榜單上的每分鐘欄位,用來判斷數量級很有用,但用來判斷更細微的差異就很危險。
MiniMax H3 會出現,而 Vidu Q4 Preview 不會出現的地方
這是對決中在平局後仍保留的部分,而這是結構上的差異,而非品質上的差異。
MiniMax H3 (768p) 在文字轉影片排行榜上以 1,137 Elo(8,315 票)排名第四,H3 Max 則以 1,130 Elo(5,719 票)排名第五。在影片編輯排行榜上,它同樣以 1,119 Elo(7,023 票)排名第四;該排行榜依據模型能否依照文字指令編輯影片並保留音訊來排名。Vidu Q4 Preview 則未出現在這兩個排行榜上。
這種缺席並非量測上的落差——而是這個產品的本質。Vidu Q4 Preview 的 API 記載了兩個端點,/ent/v2/img2video 與 /ent/v2/reference2video,而產品頁面列出兩種模式:圖生影片與參考生影片。文件裡沒有文字生影片的路徑。也沒有影片編輯的路徑,這意味著該模型無法取用既有的片段並在其中改動任何東西。MiniMax H3 兩者都能做到,而它全方位的模態框架——在單一脈絡中納入文字、圖像、影片與音訊參考——正是它之所以辦得到的原因。
值得對音訊這部分精確說明,因為兩個模型都支援原生音訊,但兩者並不是同一回事。Vidu Q4 Preview 會同時生成音訊與影片,其圖生影片端點中有個 audio 參數,能輸出含有對話與音效的影片,並且最多接受三段參考音訊片段,以維持角色聲音的一致性。MiniMax H3 則輸出原生立體聲音訊,並可將音訊與圖像、影片並列作為輸入模態。參考語音的應用情境是 Vidu 的獨特強項;萬物皆可參考的應用情境則是 MiniMax 的強項。
每秒的運算,逐層來看
兩個模型都按生成輸出的秒數計費,這使得這成為罕見的比較,可以直接把價目表相互對照,無須任何換算。
• 540p — 僅限 Vidu Q4 Preview:每秒 9 點,以平台公布的每點 $0.005 標準點數費率計算,約為 $0.045
• 720P / 768P — Vidu Q4 Preview 每秒 19 點數,約 $0.095,相較於 MiniMax-H3 每秒 $0.08
• 1080p — Vidu Q4 Preview 每秒 24 點,約 $0.12;相較之下 MiniMax-H3 未公布 1080p 層級
• 2K — Vidu Q4 Preview 每秒 38 點數,約 $0.19,相較之下 MiniMax-H3 為每秒 $0.13
• 4K — 僅限 Vidu Q4 Preview:每秒 78 點數,約 $0.39
由此得出的模式並不是「其中一個比較便宜」。Vidu Q4 Preview 的價格下限確實更低——它的 540p 層級是專門用於 blocking 的層級,定價正好反映其用途:在付費進行全解析度算圖之前先驗證構圖,而 MiniMax 的價目表中沒有任何方案扮演這個角色。在 2K 這個兩款模型共有的最高層級上,MiniMax H3 便宜約三分之一。而 Vidu 的 4K 層級是本次比較中唯一的 4K 生成層級,價格也反映了這一點。
Vidu 發表時所附帶的每秒 $0.014 這個上市數字,是 540p 等級在折扣點數費率下的價格,並非一般費率。Shengshu 的平台目前正對點數包推出最高 30% 的限時套裝折扣,這會讓每個等級一起調降,而不是改變曲線的形狀。請以定價表費率曲線作為比較基準,並把折扣視為暫時性的折抵。
在我們這邊:我們提供 MiniMax-H3 的路由。它已在公開模型 API 上線,位於 minimax/minimax-h3,依生成輸出每秒計費,採供應商牌價原價轉嫁、不額外加收任何費用,並可透過與我們所服務的每一個文字模型相同的 OpenAI 相容端點呼叫。Vidu Q4 Preview 並非 OrcaRouter 的路由,本頁也沒有聲稱相反——我們實際提供的影片模型,與語言模型共用同一把金鑰和同一種請求格式,正是這樣的安排讓比較多個模型變得便宜。原價轉嫁定價的一個實際結果是:當供應商調整每秒費率時,該變動當天就會反映在路由上,而不是等到合約續約時才顯現。
「全模態」在實際請求中能帶來什麼
MiniMax H3 的統一上下文很容易被讀成一份功能清單,卻忽略了它其實是一項工程差異。一個能接受影片作為輸入參考的模型,可以被指向某個現有鏡頭,並要求它延續、擴展或重新風格化;而沒有影片輸入的模型則辦不到。這就是 H3 之所以會出現在剪輯台上的機制,也是為什麼該模型 4–15 秒的輸出範圍,並不像這個數字所暗示的那麼受限——多輪延伸才是用它建構更長序列的常規做法。
Vidu Q4 Preview 的 16 秒上限同樣是針對單次生成而言,而其「參考到影片」(Reference-to-Video)模式正是為了在這個時間窗內進行多鏡頭敘事而打造,文件中描述了智慧運鏡切換,以及跨多個機位的一致性。它沒有的,是一條能接受你已經拍好的片段並加以修改的途徑。如果你的工作流程是從既有影片素材出發,而不是從一張靜態影像或一組參考素材開始,那麼這兩個模型中就有一個根本無法為你所用,而再高的 Elo 分數也彌補不了這一點。
哪一個,依工作
當輸入不是圖像或參考集時,就選 MiniMax H3。文字轉影片、影片轉影片編輯、音訊輸入、超過十五秒的多輪延伸,或是模型必須涵蓋相當於三種不同板卡使用情境的流程——那都是 H3 的守備範圍,而它是兩者中唯一具備其中任何一項的。在雙方共有的最高階級別中,它的 2K 費率也是兩者裡較便宜的。
當工作重點是角色與聲音的一致性時,或當你需要 4K 生成層級時,或當你想先用便宜的 540p 走位版本反覆調整鏡頭、再正式投入時,就選 Vidu Q4 Preview。十五個圖像參考與三個音訊參考,是比 MiniMax 文件所載明更大的公開參考額度,而在這項比較中,沒有其他模型能原生生成 4K。較窄的模式組合,就是換取這一點的代價。
會改變這一切的是:若 Vidu Q4 完整版發布,新增文字轉影片端點,就會把這兩個模型放上同一張排行榜,讓這變成一場正面對決。AA-Video-I2V v2.0 宣布將全面支援 1080p,並採用修訂後的能力分類法,它會取代榜首的票數,而不是重新排序——而這將釐清目前的三方並列究竟是真正的並列,還是量測上的極限。在那之前,要記住的數字是十六,並在旁邊註明排行榜名稱與日期。
從頒獎台本身唯一值得記取的一點是:第一名只比第三名高出十六 Elo,而區間又那麼寬,這不是排名。這是三個連人類投票者都無法區分的模型,而它們之間的抉擇必須來自本頁面上其他所有內容。



