一篇比較 Kandinsky 6.0 Video 與其具名對手的文章標題卡,副標為「論文中的版本不是你買到的版本」,並附上三個取自該文章自身證據的輔助標籤。
Engineering & Research

Kandinsky 6.0 Video 對比 Seedance 2.5:論文裡的版本,不是你買到的版本

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

這場對決中最常被引用的那句話,是與錯誤的模型所作的比較。Kandinsky 6.0 Video 技術報告於 2026 年 10 月 6 日隨著權重以 MIT 授權釋出而發布,其基準測試的比較對象是Dreamina Seedance 2.0——前一代。Seedance 2.5,是 ByteDance 目前的影片與音訊模型,自 2026 年 7 月 31 日起持續推出,也是目前販售中的版本。因此,當報告結論指出 Seedance「在視覺標準上更受偏好,且在整體視覺品質、偽影、動作真實感與視覺提示遵循方面具有統計顯著差距」時,它描述的是你今日無法取得授權的版本,並由撰寫Kandinsky 6.0 Video 的實驗室所評估。那句話的兩半都很重要,而兩者都不是忽略這項比較的理由——版本落差設定了它能告訴你多少的下限,而論述框架則告訴你該在什麼事情上信任誰。

兩個 Seedance 版本之間有什麼改變?

2.0 到 2.5 的躍進並非重繪,這正是為什麼這次替換並非表面功夫。Seedance 2.5 單次生成可達三十秒——是報告中模型上限的六倍,也是 Kandinsky 6.0 Video 固定五秒的六倍。它新增了時間戳層級的指定功能與區域層級的生成後編輯,意味著變更可以套用於片段中的某個時間範圍或畫面的某個部分,而不必重新生成整個作品。它能在單一請求中讀取文字,以及約三十張圖像、十段影片和十段音訊作為參考素材,對比 Kandinsky 6.0 Video 僅支援單一遮罩尾幀。而且它會產生含對話的同步音訊,這正是這兩者之所以會被放在同一篇文章裡的唯一原因。

那些每一項都是該報告評估並未測試的能力。因此,視覺標準結果告訴你,Kandinsky 6.0 Video 在整體視覺品質、瑕疵、動作真實感與提示遵循方面落後於 Seedance 的上一代。它並未告訴你目前組建版本會有什麼表現,而誠實的假設是,較新的一代不會在其自家發行說明所強調的軸向上變得更差。

報告自身的評估確立了什麼、未確立什麼

該方法揭露得足夠詳盡,可供衡量。由兩個模型依相同提示生成的並排配對,兩個片段皆經匿名化,每個任務的左右位置隨機化,任務順序隨機打亂,視覺問題先停用音訊,音訊問題再啟用音訊,提供對稱的平手選項,以及當準則無法判斷時明確的 N/A 選項,跨標註者以多數投票彙總,且每個受評估準則約有 200 次或更多成對比較。

在那個方法上,Seedance 2.0 的結果呈現出一種分歧,凡是讀過同一份報告中 Kling 比較的人,都會覺得似曾相識。視覺標準由 Seedance 勝出,領先幅度達到顯著水準。音訊領域則接近得多:影音同步幾乎不相上下,而語音品質則偏向 Kandinsky 6.0 Video Pro。這兩項陳述之間,正擺著整個決策的關鍵,因為這意味著最新的開放式影音檢查點在影片片段的外觀上明顯落後,卻在其中語音的聽感上明顯領先。

該結果的限制是常見的那幾種,且沒有一項對它構成致命影響。它是由 Kandinsky 的作者們以他們自行選擇的提示詞,並由他們招募的標註員所執行。沒有任何公開盲測競技場對 Kandinsky 6.0 Video 進行評分,因此沒有外部測試檢驗陌生人的提示詞是否能重現這項差異。報告也揭露了它衡量時所對照的上限:最長五秒的片段、以 SD 解析度進行基礎生成並透過超解析度階段達到 Full HD,以及與最強專有系統在視覺品質和整體音訊品質上仍存在的差距。

三個任何基準測試都無法捕捉的結構性缺口

時長是最先出現、也最直白的差異。Kandinsky 6.0 Video 以 121 幀訓練與評估,推論時同樣是 121 幀,在 24 fps 下即為 5 秒,且推出時沒有延長模式——一支三十秒的作品就是六次生成、五次接合,以及由你自行承擔的連貫性風險。Seedance 2.5 則能一次產出三十秒。對於單一段對話交流、產品導覽,或任何接縫會露餡的內容而言,這不是跑分上的差異;而是這項工作究竟是一次渲染,還是一道組裝步驟的差別。

第二種是參考條件化,而其中的不對稱極為明顯。Kandinsky 6.0 Video 只取一張參考圖像,並將其套用為遮罩尾幀——一個用來內插趨近的關鍵影格。Seedance 2.5 則取用一組約三十張圖像、十段視訊片段與十段音訊片段的工作集,作為單一上下文。序列中的角色一致性、從情緒板進行風格轉移、從既有片段帶入的表演:這些都是參考數量所能實現,而單幀模式不予嘗試的工作負載。

第三項是可編輯性,而它改變的是整體工作流程,而非單一鏡頭。區域層級與時間戳層級的編輯,意味著一段有瑕疵的三秒畫面能在原地修復。Kandinsky 6.0 Video 沒有編輯介面——有瑕疵的五秒只能重新生成,而若它原本與另外四段拼接在一起,接合處也得一併重新考量。習慣區域層級編輯的人,應該把這項差異計入模型選擇的考量之中。

• 時長 — Kandinsky 6.0 Video:固定 5 秒,24 fps 下共 121 幀,不支援延長模式。Seedance 2.5:單次生成最長可達 30 秒。

• 參考調節 — Kandinsky 6.0 Video:一張圖片,以遮罩尾幀的形式套用。Seedance 2.5:每次請求約三十張圖片、十段影片和十段音訊片段。

• 編輯 — Kandinsky 6.0 Video:無;重新生成並重新拼接。Seedance 2.5:時間戳層級定位與區域層級生成後編輯。

• 解析度 — Kandinsky 6.0 Video:SD 為 512×768,Full HD 1920×1080 透過內建的超解析度階段。Seedance 2.5:依模式而定,每段剪輯的價格由您選擇的解析度決定。

• 音訊 — Kandinsky 6.0 Video:44 kHz,具備唇形同步,與畫面共同生成。Seedance 2.5:同步音訊,包含對話,與影片一同生成。

• 權重 — Kandinsky 6.0 Video:MIT,Lite 3B 與 Pro 29B,附程式碼與 diffusers 整合。Seedance 2.5:無。

兩個無法互相轉換的計量器

Seedance 2.5 以 token 計費,一支 480p 的五秒短片約為 $0.51,720p 則約為 $1.16。之所以用這種方式陳述,而非以每秒費率表示,是因為 token 數量會隨影片長度而增加,因此一段三十秒的生成並非固定費率乘以三十秒——在相同設定下,它是五秒版本 token 數量的六倍,而編輯操作則依其觸及的部分計價。習慣反覆重新生成的流程,將會發現計費方式會反映這個習慣。

Kandinsky 6.0 Video 沒有計費錶,因為根本沒有東西可買。它的成本是一台機器加上一個時鐘,而報告提供了那個時鐘:在 H100 上處理一段 Pro Full HD 五秒片段約需 402 秒的運算時間,在 RTX 5090 上為 854 秒,在 RTX 4090 上為 1,247 秒,峰值配置低於 72.8 GiB 時需要區塊卸載,另外還有一個 16 GB VRAM 預設,會把文字編碼器量化為 NF4——報告指出,這是唯一一項會改變片段本身的預設變更。蒸餾檢查點經測量與完整模型表現相當,平均偏好為 51% 對 49%,且沒有任何準則達到統計顯著性,正是它讓這些數字得以可行。

• 每五秒成本 — Kandinsky 6.0 Video:無定價;依顯卡不同,單張 GPU 需六到二十一分鐘。Seedance 2.5:以代幣計,480p 約 $0.51,720p 約 $1.16。

那兩行數字之間沒有任何可通約之處,而一般試圖把它們化約成單一數字的做法——把 GPU 每小時費率除以五秒短片——默默假設了滿載使用、零閒置時間,以及你已經擁有一張顯示卡。更有用的比較是質性上的:Seedance 2.5 的成本會隨你生成多少而增減,並在你停止時消失;Kandinsky 6.0 Video 的成本則不論你是否生成都會產生。

Two-column scoreboard comparing Kandinsky 6.0 Video and Seedance 2.5 across six shared dimensions, with the vendor-vs-third-party sourcing line printed along the bottom.

每個各自可到達的位置

這兩個模型都不在 OrcaRouter 上,也沒有提出任何這類主張。Seedance 2.5 是透過廠商自家平台與多個第三方服務來取用;Kandinsky 6.0 Video 則是在 MIT 授權下載、並在自家硬體上執行的檢查點。任何告訴你兩者在多模型平台上都只需一次 API 呼叫即可取用的頁面,描述的其實是不同的模型。

在 Kandinsky 或 Seedance 的流程中,路由層之所以仍值得一提,是因為這類系統按呼叫次數來看大多是文字,按成本來看則大多是影片。提示詞擴充會把一則鏡頭備註轉成 T2AV 模型所期望的長篇結構化描述。對話會在脣形同步階段嘗試之前先擬好草稿,並在該階段把它搞得一團糟時改寫。同一個節拍的六個候選生成結果會經過審閱、從中選出一個——這是針對影片成品所做的文字判斷,也是正確做出昂貴決策最划算的方式。在橫跨 200 多個模型、以供應商標價原價轉嫁、0% 加價的單一 OpenAI 相容端點上,這些呼叫的成本就是供應商收取的費用,不會更多,即使是在供應商調整價格的隔天也一樣。當便宜審閱者與嚴謹審閱者在同一個呼叫位置應該是不同模型時,路由 DSL 便有其價值;而自動容錯移轉之所以有價值,是因為當六個片段中的第四個正在算圖時,一份描述若中途失敗,應該重新路由,而不是讓工作階段就此結束。

什麼會改變這場對決?

版本落差就是整件事的核心,也是解決它的最短路徑。讓 Seedance 2.5 對上 Kandinsky 6.0 Video 跑一輪,就能確認報告中相對於 2.0 所記錄的視覺標準劣勢,究竟是擴大了、縮小了,還是逆轉了——報告無法回答這點,其作者也無從回答。就目前而言,站得住腳的立場比任何一方的行銷所願意的都要狹窄:根據該模型自家實驗室所公布的證據,Seedance 在影片畫面上領先,而 Kandinsky 6.0 Video 則在片中語音聽起來如何方面領先;而這項說法所依據的 Seedance 版本,比你會買到的版本落後一個世代。

依此選擇。若作品篇幅長、引用密集或由剪輯驅動,在品質還沒上場之前,結構上的落差就已決定結果。若作品是五秒的人物講話鏡頭,對白第一次就得聽起來正確,那麼 Kandinsky 6.0 Video 可衡量的優勢正好落在這項標準上——而 MIT 授權意味著答案不取決於任何人的發展藍圖。該留意的不是排行榜。而是重跑一場那份報告始終無法進行的比較。

Screenshot of the arXiv abstract page for paper 2610.05608, "Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation", showing the 4 October 2026 submission date and the abstract, including the listed limitations that the models generate clips of up to 5 seconds and that base generation runs at SD resolution with Full HD obtained through super-resolution.Screenshot of the Hugging Face model card for kandinskylab/Kandinsky-6.0-Lite-5s-Diffusers, showing the MIT licence and the family description - Kandinsky 6.0 Video Lite at 3B parameters and Pro at 29B, generating 5-second clips with synchronized 44 kHz audio in T2AV and I2AV modes.

以最便宜的方式正確進行昂貴的呼叫:一套會依階段替換審查者的路由 DSL,並具備自動容錯移轉,讓一個失效的字幕不會拖垮整段影片。