一張生成的標題卡,寫著「Kandinsky 6.0 Video vs Google Veo 3.1」,副標題為「三種層級對上兩種尺寸」。OrcaRouter 標誌位於右下角。
Guides & Insights

Kandinsky 6.0 Video 對抗 Google Veo 3.1:三種層級對上兩種規模

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

打開 Sber 針對Kandinsky 6.0 Video的技術報告,並找到正面對決章節,你會注意到比較頁面漏掉的一件事:對手不是 Veo 3.1,而是 Veo 3.1 Fast。Sber 將其人工評估對準 Veo 三個層級中的中階,而這個單一選擇,比報告中任何品質主張都更能說明這場對決。Veo 3.1 自 2025 年 11 月 17 日起已在三個服務層級中正式提供;Kandinsky 6.0 Video 於 2026 年 10 月第一週推出,提供兩種可下載尺寸:Pro 為 29B、Lite 為 3B,採 MIT 授權。其中一個是你按秒購買的服務,另一個是你自行執行的檢查點——而決策真正所在,是層級問題,而非品質問題。

Veo 3.1 是三個產品共用同一個名稱

Google 的模型已全面推出 Standard、Fast 與 Lite 三種版本,三者皆產生相同的格式系列:720p、1080p 與原生 4K(24 fps),原生時長為 4、6 或 8 秒,據稱 1080p 可輸出更長片段,並可進一步以場景延伸串接,最多可使用三張參考圖像以維持角色與場景一致性,另有種子與負面提示控制。輸出帶有 SynthID 與 C2PA 來源出處中繼資料。

區分這些等級的是價格與速度,而獨立排行榜對這個差距說了些令人不安的話。在 Artificial Analysis 的文字轉影片排行榜上,這三者彼此差距在 14 Elo 以內——Veo 3.1 為 962(±10),獲得 2,998 票;Veo 3.1 Fast 為 961(±10),獲得 4,325 票;Veo 3.1 Lite 為 948(±10),獲得 2,903 票——而它們列出的費率為每分鐘 24.00、7.20 與 4.80 美元。把這些放在一起看,這個競技場是在告訴你,它無法可靠地依偏好區分這些等級。這不代表這些等級完全相同;而是代表買家真正的問題是:哪個等級能達到他們的門檻,因為偏好排行榜不會替他們回答這個問題。

Kandinsky 6.0 Video 對變化採取相反的做法。有兩種尺寸——29B 的 Pro 與 3B 的 Lite——共用同一種架構與同一種固定輸出格式:5 秒、24 fps 的 121 幀、具備唇形同步的同步 44 kHz 音訊,可從文字或參考影像生成,並由獨立的超解析度模型將結果提升至 Full HD。沒有 Fast 變體,也沒有延伸模式。你選擇一種尺寸和一張 GPU。

實驗室自己的評估實際上聲稱什麼

這是這兩個系統之間唯一存在的直接對比資料,而且斜線兩邊都是由廠商自行報告的——Sber 執行了它,Sber 發表了它,而 Sber 以外的任何人都未曾重現過。準確陳述此事,比以有利方式陳述更重要。

在文字轉音訊視訊模式中,報告顯示 Kandinsky 6.0 Video Pro 在偽影與鏡頭運動方面以具統計顯著性的差距更受偏好,並在由平手主導的領域中於動作真實感略佔上風。Veo 3.1 Fast 在視覺提示遵循、語音品質、影音同步、整體音訊品質、聲音提示遵循與使用者任務解決方面領先,除語音外均達到顯著性。整體視覺品質近乎持平,Veo 略佔優勢。

在圖像轉影片方面,情況在視覺層面出現了逆轉。Kandinsky 6.0 Video Pro 在整體視覺品質、參考圖像對齊、瑕疵與鏡頭運動方面更受青睞,且皆具顯著差異。Veo 3.1 Fast 仍在視覺提示遵循、影音同步、整體音訊品質、聲音提示遵循與使用者任務解決方面領先,同樣具顯著差異。動作真實感與語音品質則幾乎不相上下。

接下來有兩件事。圖像轉影片的結果才是真正的發現:在一項由該實驗室自己進行的研究中,一個開放模型在參考圖像對應度與整體視覺品質上,竟被偏好勝過 Google 同等級的模型,這是個值得仔細權衡的實質主張。而音訊結果則是 Veo 無論採用何種模式都維持領先之處——這就帶我們來到那個沒人提及的警訊。

決定該評估是否公平的音訊旗標

Veo 3.1 能與畫面同步生成原生 48 kHz 立體聲——對白、環境音、擬音。這是該模型最強大的功能之一。不過在 API 上,音訊參數預設為關閉,而無聲生成的定價低於含音訊生成:在 Google 公布的 Standard 級別中,無聲每秒約 $0.20,開啟音訊則約每秒 $0.40。

Kandinsky 6.0 Video 沒有這類切換開關。音訊是輸出的一部分,而合併至 vLLM-Omni 的 serving pipeline 預設會輸出 44.1 kHz AAC。因此,這兩個模型面對的預設並不相同:一個以音訊為優先,另一個則以無聲為優先,聲音只是額外的升級選項。

這種不對稱在比較時會帶來特定代價。任何把靜音的 Veo 3.1 和音訊始終隨附的競爭對手放在一起正面對決,然後在重視音訊的評分板上為兩者評分的做法,都會因為預設設定這個偶然因素,讓 Veo 處於劣勢。當你讀到上方 Sber 的數據——或其他任何人的數據——第一個該問的問題是,Veo 那一邊有沒有開啟音訊。第二個是價格差了多少,因為在 Standard 級別,開啟聲音會讓價格翻倍。

五秒對上八秒,以及 1080p 對上原生 4K

格式落差正是兩個模型設計綱要顯露之處。

• 片段長度 — Kandinsky 6.0 Video:固定 5 秒,24 fps 下共 121 個影格,無法延長。Veo 3.1:原生支援 4、6 或 8 秒,1080p 下可更長,若要再延長則以場景延伸串接。

• 解析度 — Kandinsky 6.0 Video:透過超解析度處理提供 SD、HD 與 Full HD(1920×1080)。Veo 3.1:720p、1080p 與原生 4K。

• 來源資訊 — Kandinsky 6.0 Video:發布內容中未提及。Veo 3.1:輸出帶有 SynthID 與 C2PA 中繼資料。

• 參考輸入 — Kandinsky 6.0 Video:一張影像,以遮罩尾幀的形式套用。Veo 3.1:最多三張參考影像,外加種子與負向提示詞。

• 格式 — Kandinsky 6.0 Video:44.1 kHz AAC,隨影像提供,永遠開啟。Veo 3.1:48 kHz 立體聲,可選,有兩種計價方式。

來源標示這條線,才是會帶來採購後果的那一條。如果你的交付成果必須可追溯——品牌專案、廣播內容,或任何法務團隊會檢視的東西——Veo 3.1 會附上中繼資料,註明影片素材是生成的,而 Kandinsky 6.0 Video 不會。這不是品質差異,也沒有任何基準測試會顯示出這點,但這正是那種單憑一項要求就能決定供應商的條件,而缺少這項功能的開放模型,對需要它的團隊來說並不是能直接替換的選項。

4K 這條界線的重要性也是如此,原因也相同。Kandinsky 6.0 Video 的 Full HD 是真材實料——有專用的 SR 模型,而該儲存庫的 SR 套件能處理五秒短片的 x2、x4 與 x2.25 放大——但它的上限,正是 Veo 3.1 原生路徑在高階端起步之處。就大螢幕作業而言,這個上限沒有妥協空間。

短片在每一邊的成本

Veo 3.1 是按秒計費的。在 Standard 級別下,一段五秒、1080p、含音訊的片段大約是 $2.00,而同樣片段若無聲則約為 $1.00;Fast 和 Lite 則低於此價位,而且由於它們在競技場上的分數落在 Standard 的信賴區間內,從證據來看,很難反對選擇較便宜的級別。

Kandinsky 6.0 Video 不寄發票,它耗的是 GPU 時間。該儲存庫針對非蒸餾模型提供的數據,是在暖機後測量、且排除權重載入與 MP4 編碼,結果顯示一段五秒的 Pro Full HD 片段在 H100 上約需 402 秒,在 RTX 5090 上為 854 秒,在 RTX 4090 上為 1,247 秒,在 RTX 5060 Ti 上則為 3,530 秒。Lite Full HD 在 H100 上為 284 秒。Pro SD 執行時的峰值配置達到 72.8 GiB,因此任何低於此的配置都需要區塊卸載(block offloading)——而 16 GB 預設會將文字編碼器量化為 NF4,這是該論文所確認、會改變片段本身而非僅引入捨入層級雜訊的唯一一項預設變更。

那兩種成本結構無法相提並論。一種是你按成品每秒預估的帳單;另一種是你買下的機器、以分鐘計的算圖,以及微調的選項——而 Veo 3.1 在任何方案層級都不提供這項功能。

分層問題屬於路由問題

OrcaRouter 既不提供 Google Veo 3.1,也不提供 Kandinsky 6.0 Video,這裡也沒有任何這樣的暗示——Veo 3.1 是透過 Google 自家的介面取得,而 Kandinsky 則要由你自己下載。不過,Veo 這個決策的結構值得點明,因為那正是我們的路由層在文字端存在要解決的問題:三個層級各自的獨立評分難以區分,價格卻相差五倍,這正是「先路由到便宜的那個,只有在未達門檻時才升級」勝過「全面標準化採用旗艦款」的情況。OrcaRouter 的自適應路由與路由 DSL 將其表達為一項設定好的政策,涵蓋單一 OpenAI 相容端點上的 200 多個文字模型,以供應商定價、0% 加價,並在路由中斷時自動容錯移轉。把同樣的直覺套用到影片支出上——預設採用 Fast,重要鏡頭則用 Standard——是你在今天完全不需要路由器就能做出的採購決策。

哪一個,給誰?

如果交付成果需要認真看待音訊、需要 4K 或長度超過五秒的片段,或下游有人要求溯源中繼資料,就選擇 Veo 3.1。請刻意挑選方案層級,而不是直接預設為 Standard,並為音訊旗標編列預算,而不是等到收到發票才發現。

如果你想要權重、如果五秒符合你的工作單位,而且任務是對照所提供的靜態影像來衡量圖生影片的保真度,那就選擇 Kandinsky 6.0 Video——這是該實驗室自家研究讓它以顯著差距領先某個 Veo 層級的唯一面向。開始使用前請了解:音訊永遠開啟、來源出處付之闕如,而品質宣稱完全取決於其作者自己撰寫的一份報告。

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Google Veo 3.1 — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'Resolution: Full HD plus SR', 'Audio: 44.1 kHz, always on', 'Provenance: none stated', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Google Veo 3.1 column reads 'Max clip: 4, 6 or 8s', 'Resolution: up to native 4K', 'Audio: 48 kHz, optional', 'Provenance: SynthID and C2PA', 'Weights: none', 'Price: $4.80 to $24.00/min'. A footer reads 'Veo rates and Elo per Artificial Analysis; Kandinsky vendor-reported. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-T2V V2.0 leaderboard, ranking text-to-video models by Elo from human preference votes. Wan 3.0 is first at 1,156 over 8,300 samples and $12.00 per minute (Aug 2026); MiniMax H3 (768p) is fourth at 1,137 over 8,315 samples at $4.80 per minute (Jul 2026); grok-imagine-video-1.5 is eleventh at 1,045 over 4,056 samples at $15.00 per minute (May 2026); Wan2.7-260612 is thirteenth at 1,030 over 5,571 samples at $9.00 per minute (Jun 2026); Veo 3.1 is eighteenth at 962 over 2,998 samples at $24.00 per minute, Veo 3.1 Fast nineteenth at 961 over 4,325 samples at $7.20 per minute, and Veo 3.1 Lite twenty-first at 948 over 2,903 samples at $4.80 per minute.

值得緊握的非對稱性在於:Veo 3.1 已投入生產十一個月,因此累積了本月才發布的開源模型所無法擁有的東西:一組已被其使用者公開、經過測繪的失效模式,以及一條財務團隊能夠建模的價格曲線。相較之下,Kandinsky 的 MIT 授權意味著你磁碟上的模型不依賴任何人的路線圖。這兩者哪個更有價值,並不是一個基準測試問題。

A screenshot of OrcaRouter's own model page for kling/kling-3-turbo, titled 'Kling 3.0 Turbo', credited to Kling and dated 2026-06-17, showing the route endpoint /v1/video/generations and a price of $0.11 per request, with a description explaining that Kling 3.0 Turbo is Kuaishou's speed-optimized model in the Kling 3.0 generation with native audio bundled in, handling text-to-video and image-to-video, and multi-shot storyboarding of up to six shots in a single generation.