一張生成的標題卡上寫著「Kandinsky 6.0 Video vs Grok Imagine Video」,副標題為「排行榜翻盤了」,位於標示「影片生成」、「同步音訊」和「開放權重部署」的圖示列上方。OrcaRouter 標誌位於右下角。
Guides & Insights

Kandinsky 6.0 Video 對決 Grok Imagine Video:排行榜翻盤了

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026 年 1 月,Grok Imagine Video推出時,在兩種模式下都登上 Artificial Analysis 影片競技場的榜首。如今同一份榜單上,其現行版本在文字轉影片項目中排名第十一或十二。這不是醜聞,也不是失敗——這是一個快速變動的類別在九個月內會出現的狀況,也是此刻將 xAI 的生成模型與 Kandinsky 6.0 Video相比較的誠實理由。兩者之中,一個是針對你能多快再產出一段短片而最佳化的服務;另一個則是 MIT 授權的檢查點,Pro 尺寸有 29B 參數、Lite 為 3B,由 Sber 的 Kandinsky Lab 於 2026 年 10 月第一週發布,能生成五秒影片並搭配同步的 44 kHz 音訊與脣形同步。有趣的問題不是哪一個在榜單上領先——而是兩者結構上接下來各自能做什麼。

在它下面的那塊板子

Grok Imagine Video 是 xAI 的生成模型,於 2026 年 1 月 29 日首次發布,並自 6 月 16 日起穩定於 1.5 版。在 Artificial Analysis 的文字轉影片排行榜上,其 1.5 版本以 Elo 1,045(±9)位居第 11–12 名,累積 4,056 票,標價為每分鐘 $15.00。原始版本未列於該排行榜上。

圖像轉影片是這個系列更擅長的部分,也是兩款版本出現分歧、值得仔細解讀的地方:

• grok-imagine-video-1.5 — 第7至第9名,Elo 1,098(±8),5,267 票,每分鐘 $8.40。

• grok-imagine-video(一月版本)—— 第12至17名,Elo 1,072(±7),14,371 票,每分鐘 4.20 美元。

• 為了說明規模,那個 I2V 排行榜的榜首——MiniMax H3 Max——在 5,894 票中拿下 Elo 1,195(±9),而 Wan 3.0 則以 1,164 位居第六。

以下有兩種解讀,而兩者皆成立。xAI 較新的版本在圖像轉影片方面確實比自家前代高出 26 Elo,而它每分鐘的代價也是前代的兩倍。至於發布首週的那個故事——一個一推出就登上頂峰的模型——並未維持住:賽局已經改變,競技場在十多個更新的系統之間累積了數萬票,而九個月的競爭之後,一個快速、通用的生成器就落在中段位置。

Kandinsky 6.0 Video 在任何排行榜上都沒有 Elo 評分。它的證據是一次 VABench 測試,以及一場由實驗室執行的人工評估,兩者都由 Sber 發表,且都沒有在 Sber 之外被重現。把一個未經審核的開源模型與一個已獲評分的商業模型並列,正是最需要謹慎看待的比較:已評分模型的位置是真實且不光彩的,而未評分模型的位置則無人知曉。「未知」並不等於「更好」。

兩種快,而只有其中一種是以秒來衡量的

Grok Imagine Video 的設計目標是每位創作者的產出效率。它深度整合進 X,會直接回傳一段附帶聲音的完成短片,而它的功能組合讀起來就像人們在動態消息中實際會做的事情清單:多種長寬比、鏡頭運動、物件新增、移除與替換、風格轉移、以多張影像作為參考條件來生成以維持角色一致性、原生音訊含對白、音效與音樂。短片長度最高可達十五秒,解析度最高為 1080p。整個產品在設計上,就是讓你再試一次只需花幾分鐘和幾美分。

Kandinsky 6.0 Video 的快,是另一種意義上的快——不是以每次嘗試計算,而是以每單位持有計算。它沒有任何一個環節是瞬間完成的。該儲存庫自己針對非蒸餾模型所列的執行時間(在暖機之後,且不計權重載入與 MP4 編碼),五秒的 Pro Full HD 片段在 H100 上約需 402 秒,在 RTX 5090 上為 854 秒,在 RTX 4090 上為 1,247 秒,在 RTX 5060 Ti 上則為 3,530 秒。Lite Full HD 在 H100 上是 284 秒。讓這一切還算能忍受的工具,是蒸餾檢查點;論文測得它與完整模型表現相當——在多數準則上更受偏好或打成平手,平均偏好度為 51% 對 49%,且沒有任何個別差異達到顯著。換取慢速渲染所得到的,是一個放在你自己磁碟上的模型,完全沒有按片段計費的計量錶在跑。

這就是這場對決真正的樣貌。Grok Imagine Video 優化的是第十次嘗試的成本。Kandinsky 6.0 Video 優化的是第一萬次嘗試的成本,並為第一次嘗試向你收取硬體與耐心的代價。

兩者都會生成音訊——但它們不是同一個主張。

這就是那個偷懶的比較會說「平手」,卻說錯了的軸線。

Grok Imagine Video 會產生原生音訊,包含對話、音效和音樂,而這只是眾多功能中的一項。它是一款恰好包含音效的通用型生成器。

Kandinsky 6.0 Video 以聲音為核心打造。其架構是雙串流 CrossDiT,將一個從 Kandinsky 5.0 Video 初始化的視訊串流,與一個在大型音訊語料庫上從頭訓練的音訊串流配對,兩者以雙向交叉注意力連結並聯合訓練。輸出為 44 kHz,並具備明確的唇形同步;論文中的強化學習階段據報導可將生成語音的詞錯誤率降低 47%——以 Whisper-large-v3 測量,而它是 RL 獎勵模型之一;這個細節很重要,因為論文另外還報告了一個不可比擬的 WER,與 VABench 並列,使用的是 Qwen3-ASR-1.7B。語音才是這個模型進行後訓練所針對的對象。

相較之下,Sber 自家的研究坦率點出它在哪些方面居於劣勢。在該實驗室的並列評比中,MiniMax H3 與 Dreamina Seedance 2.0 在視覺標準上以顯著幅度更受偏好,而該模型被描述為具競爭力,而非領先。值得認真看待的主張則更為狹隘、也更有用:在與 Kling 2.6 和 Veo 3.1 Fast 的對比中,結果是在各項標準上互有勝負,而 Kandinsky 6.0 Video 在語音品質與影音同步方面仍具競爭力,其中很大一部分的比較結果是不分軒輊。

十五秒對上五秒,以及達到各自目標所需付出的代價

• 最長片段 — Grok Imagine Video:最長 15 秒。Kandinsky 6.0 Video:固定 5 秒,24 fps 下共 121 幀,發行版本中沒有延伸模式。

• 解析度 — Grok Imagine Video:最高可達 1080p。Kandinsky 6.0 Video:透過專用的超解析度模型,將五秒短片放大 x2、x4 或 x2.25 倍,支援 SD、HD 和 Full HD。

• 參考輸入 — Grok Imagine Video:以多張影像進行參考條件式生成,確保角色一致性,並支援物件新增/移除/替換。Kandinsky 6.0 Video:單張影像,套用為遮罩尾幀。

• 定價 — Grok Imagine Video:每輸出秒數計費,從價格區間的低點到 1080p 的每秒 $0.30,並依每張輸入圖片另行收費;免費使用權限則需具備 X 訂閱方案。Kandinsky 6.0 Video:無——沒有服務、沒有費率,只有你提供的 GPU 時間。

• 權重 — Grok Imagine Video:無。Kandinsky 6.0 Video:MIT,Pro 與 Lite,並整合 diffusers。

較新 Grok 版本的溢價,才是那個該圈起來的數字。從 1 月版本升級到 1.5,在圖像轉影片排行榜上每分鐘成本要付出兩倍,換來 26 Elo。這是貨真價實的進步、貨真價實的代價,而這正是目前每一家影片廠商都在要求買家做出的同一筆交易。

路由器適用與不適用的時機

OrcaRouter 並不提供 Grok Imagine Video 或 Kandinsky 6.0 Video,本文也沒有任何地方如此宣稱:Kandinsky 讓你自己下載與執行,Grok Imagine Video 則是透過 xAI 自家的介面取用。以這兩個模型之一打造的流程,真正需要路由器提供的是渲染前後圍繞著的文字——分鏡清單、把一個構想轉換成這些模型訓練時所依據的長句或短句提示的提示擴展、字幕生成與轉錄工作,以及決定要保留哪一次生成的審閱摘要。這些全都透過單一 OpenAI 相容端點、橫跨 200 多款文字模型執行以供應商定價、0% 加成,因此廠商一降價,同一把金鑰當天就能生效,並具備自動容錯移轉,讓渲染佇列中途失敗的呼叫改道重送,而不是卡住整批作業。即便影片模型本身無法路由,圍繞影片模型的調度仍是一道路由問題,而這正是這兩者目前的情況。

哪一個,為了什麼?

當工作講求的是量,就該動用 Grok Imagine Video:社群短片、快速迭代、一個得重生六次才對的鏡頭,以及一個無法延長的截止期限。它每次嘗試的價格就是它的產品,而它如今位居中游而非頂端,正是這個變動如此之快的類別所需付出的正常代價。

當工作是流程化的,就選擇 Kandinsky 6.0 Video:可批次處理的固定五秒單位、以忠實還原所提供靜態影像為重的圖像轉影片流程、你打算讓人聽得清楚的語音,以及你寧可不租用的交付成果。為渲染編列預算,在消費級設備上要有它會很慢的心理準備,並且在這篇文章中出現的每一項品質數據,在實驗室以外的人評分之前,都應視為 Sber 自家的說法。

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Grok Imagine Video — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'T2V Elo: not scored', 'I2V Elo: not scored', 'Audio: 44 kHz, always on', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Grok Imagine Video column reads 'Max clip: up to 15s', 'T2V Elo: 1,045, 11th', 'I2V Elo: 1,098, 7th', 'Audio: native, optional', 'Weights: none', 'Price: $4.20 to $15.00/min'. A footer reads 'Grok figures per Artificial Analysis; Kandinsky unscored. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-I2V V1.0 leaderboard, ranking image-to-video models by Elo from pairwise human preference votes with audio. MiniMax H3 Max is first at 1,195 over 5,894 samples at $4.80 per minute (Aug 2026); MiniMax H3 is second at 1,181 over 7,284 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,178 over 12,327 samples at $6.00 per minute (May 2026); Wan 3.0 is sixth at 1,164 over 9,302 samples at $12.00 per minute (Aug 2026); grok-imagine-video-1.5 is eighth at 1,098 over 5,267 samples at $8.40 per minute (May 2026); Wan 2.7 is twelfth at 1,077 over 4,571 samples at $9.00 per minute (Apr 2026); grok-imagine-video is thirteenth at 1,072 over 14,371 samples at $4.20 per minute (Jan 2026). The board carries a note that AA-Video-I2V v2.0 is coming soon.

這組配對值得關注的地方,在於哪一方能承受一個糟糕的季度。如果 Grok Imagine Video 在競技場中進一步下滑,答案就是一個更好的模型和一個新的價格——這個類別就是這樣運作的,而 xAI 已經證明它會推出一個。如果 Kandinsky 6.0 Video 在被評分後結果只是中游,該檢查點依然存在、依然能運行,也依然能微調;授權條款不會因為那個數字而改變。這些是不同種類的持久性,而只有其中一種是由 Elo 衡量的。

A screenshot of OrcaRouter's own model page for kling/kling-v3-omni, titled 'kling/kling-v3-omni' with a FLAGSHIP badge and credited to Kling, showing the route endpoint /v1/video/generations and a per-request price of $0.08, with a description reading that Kling 3.0 Omni is a unified text-to-video and image-to-video API with multi-shot, subject control and video-reference, 3-15 second clips and up to native 4K.