一張生成的標題卡,上面寫著「Kandinsky 6.0 Video vs Alibaba Wan 2.7」,副標題為「開放權重對上四模型套件」。OrcaRouter 標誌位於右下角。
Guides & Insights

Kandinsky 6.0 Video 對決 Alibaba Wan 2.7:開放權重迎戰四模型套件

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Kandinsky 6.0 Video給你一個可下載的 29B 參數檢查點,換來一段五秒的短片。Wan 2.7則給你四種針對特定任務的變體、最長十五秒的短片,以及一張按秒計費的帳單。這兩句話就是比較本身,而之所以值得寫下來,是因為大多數捉對廝殺的頁面都拿視覺品質來比,但在這一點上,兩者都沒有能一槌定音的獨立評分——卻跳過了它們真正分道揚鑣的那條軸線,也就是各自期待你帶上什麼。

Sber 的 Kandinsky Lab 於 2026 年 10 月第一週以 MIT 授權開源了 Kandinsky 6.0 Video,提供兩種尺寸——Pro 為 29B、Lite 為 3B——並附上程式碼、檢查點與 diffusers 整合。Alibaba 的 Wan 2.7 於 2026 年 4 月 3 日以套件形式推出:文字轉影片、圖像轉影片、參考轉影片與影片編輯,按生成影片的秒數計費。其中一個是你自行執行的模型;另一個是你購買的服務。有趣的問題不是哪個更好,而是哪個才是適合這項工作的形態。

唯一能直接比較的面向

這兩款模型都能生成帶有聲音的影片,而不是先產生影片、之後再配樂。這比聽起來還罕見,而這正是這兩者總被相提並論的原因——業界大多數仍只產出無聲的 MP4,並把音訊留到另一個階段處理。

Kandinsky 6.0 Video 透過雙串流 CrossDiT 做到這一點:視訊串流從 Kandinsky 5.0 Video 檢查點初始化,音訊串流則在大型音訊語料庫上從頭訓練,並以雙向交叉注意力將兩者連接,在持續預訓練階段後進行聯合訓練。輸出為具唇形同步的 44 kHz 音訊,可從文字提示(T2AV)或參考圖像(I2AV)生成。

Wan 2.7 也能生成原生音訊,只是並未以同樣詳盡的方式公開其機制。它自家的文件把音訊品質與畫面文字準確度列為仍有待改善的兩個領域——這是個值得銘記的保真度但書,因為這話是廠商自己說的,而不是評論者的臆測。

相似之處到此為止。這條線以下的一切都是分歧,而非排名。

五秒對十五秒,以及這對鏡頭清單造成的影響

Kandinsky 6.0 Video 是以 121 幀、24 fps 訓練——五秒——且發行版不含延伸模式。論文、合併進 vLLM-O 的發行配方,以及該儲存庫的效能,全都圍繞著那個單一片段長度。一支三十秒的影片是六次生成與五次拼接,而接縫得由你來藏。

Wan 2.7 能在單次生成中涵蓋 2 到 15 秒,並依每次請求決定。對於人物對嘴特寫片段、產品插入鏡頭或單一運鏡來說,那樣的差異不是便利與否的問題——而是取決於一次算圖,還是多一道組裝步驟的差別。對於任何以逐鏡方式建構的內容而言,5 秒是正常的工作單位,而這個落差大致就消失了。

• 最大片段 — Kandinsky 6.0 Video:5 秒,固定,24 fps 下共 121 幀。Wan 2.7:2–15 秒,依需求設定。

• 解析度 — Kandinsky 6.0 Video:透過獨立的超解析度模型支援 SD、HD 與 Full HD(1920×1080)。Wan 2.7:最高可達 1080p。

• 參考條件 — Kandinsky 6.0 Video:一張影像,用作遮罩尾幀。Wan 2.7:最多五張主體影像與五段參考片段,每次請求十個素材。

• 任務 — Kandinsky 6.0 Video:T2AV 與 I2AV。Wan 2.7:文字轉影片、圖像轉影片、參考轉影片與影片編輯,各自為獨立變體並分別計費。

• 權重 — Kandinsky 6.0 Video:MIT,可下載,Pro 與 Lite。Wan 2.7:否。

四項任務對兩種模式

任務數量是 Wan 2.7 在比較表中最常被低估的部分,因為那不是一項品質宣稱——而是一項範圍宣稱。對現有素材進行基於指令的編輯,也就是你描述一項變更,取回的仍是同一鏡頭、但已套用該變更,這是一種 Kandinsky 6.0 Video 完全不嘗試的工作負載。參考轉影片,也就是由提供的表演驅動生成主體,同樣不在其兩種模式的範圍內。

其計費方式反映了使用範圍。Wan 2.7 的文字轉影片與圖片轉影片變體僅按輸出時長計費——在國際新加坡端點上,720p 為 $0.10/秒,1080p 為 $0.15/秒,而北京與東京針對相同工作列出 $0.086/秒 與 $0.143/秒。參考轉影片變體也會對輸入影片計費,上限為五秒,因此一段五秒的參考素材驅動十五秒的生成,會被計費二十秒的工作量。影片編輯變體僅對輸出計費,並將輸入素材視為免費——這是整個系列中最優惠的單一費率,也是為什麼編輯是 2.7 真正便宜的地方。

有兩項生命週期相關的事實,必須與這些數字並列來看。阿里雲為自家的 Bailian 與 Qwen Cloud 平台附加了限時 30% 的上市優惠,而該優惠已於 2026 年 9 月 23 日到期。另外,阿里雲 Model Studio 的退役通知(ID 118434)將於 2026 年 10 月 10 日讓數個較舊的模型下線,而 wan2.7-r2v 與 wan2.7-image 就在該名單上。這是模型變體層級的調整,而非整個世代下線——wan2.7-t2v 與 wan2.7-i2v 仍以現行費率列出——但如果你關注 2.7 的原因正是參考圖生影片(reference-to-video),那這條路徑只剩四天。

獨立董事會顯示什麼、不顯示什麼

這正是大多數針對這兩個模型的比較悄悄作弊的地方,因此值得精確釐清實際存在的是什麼。

Wan 2.7 在三個獨立的 Artificial Analysis 影片排行榜上各有獨立評分,而這些分數彼此並不一致,因為它們衡量的項目不同:

• 文字轉影片 — Wan2.7-260612(六月版本)在 5,571 票中拿下 Elo 1,030(±9),排名第 13–14 名,價格為每分鐘 $9.00。

• 圖像轉影片 — Wan 2.7(4 月版本)在 4,571 票中,以 Elo 1,077(±8)排名第 12,價格為每分鐘 $9.00。

• 影片剪輯 — Wan 2.7 在 17,988 票中取得 Elo 1,077(±5),排名第 5,價格為每分鐘 $16.90。

把這三項放在一起解讀,有用的結論並不是「Wan 2.7 在影片項目排第十二名」。而是:在各自專屬的評測榜上,這個模型在編輯方面明顯比生成更強,而為它引用單一數字,無論往哪個方向解讀都是錯誤的。

Kandinsky 6.0 Video 在它們任何一個上都沒有分數。其已發表的證據來自廠商一方,值得確切說明那是什麼:一次 VABench 測試,其中該實驗室報告 Pro 在受評估的三個系統中於語音品質、音訊美學、文字-視訊與音訊-視訊對齊、唇形同步準確度、去同步與視覺真實感方面領先——另外兩個系統是其自家的 Lite 模型與 LTX 2.5——以及一項由實驗室進行的並排人工評估,每項準則約有 200 次或更多成對比較,其中 Pro 與 Kling 2.6 和 Veo 3.1 Fast 相比具有競爭力,在視覺準則上落後 MiniMax H3 和 Dreamina Seedance 2.0,並在語音品質與音訊-視訊同步上保持競爭力。這些都未在 Sber 之外被重現,且它們都不是盲測公開排行榜上的 Elo。正確的解讀是「有潛力且未經審核」,而不是「媲美 Veo」。

每一項的成本,以各方使用的說法來說明。

這兩種定價模式無法被簡化成單一數字,而假裝它們可以,正是團隊做出錯誤決策的原因。

Wan 2.7 是按秒計費。一段十五秒的 1080p 短片約為 2.25 美元。三十秒的作品則是兩次生成加上一次剪輯——4.50 美元的原始生成費用,再加上你的組裝時間;若是由剪輯變體來完成工作,費用會更低,因為它不會對輸入計費。

Kandinsky 6.0 Video 完全沒有費率,因為沒有可購買的服務。它有的是由你提供的 GPU 小時成本。該儲存庫自身的數字定下了下限:一段 Pro Full HD 五秒片段在暖機後於 H100 上約需 402 秒工作時間,在 RTX 5090 上為 854 秒,在 RTX 4090 上為 1,247 秒。蒸餾檢查點——論文中測得與完整模型表現相當,平均偏好為 51% 對 49%,且沒有任何準則達到顯著性——才是你實際上會部署的版本。任何低於 72.8 GiB 峰值配置的情況都需要區塊卸載,而 16 GB 預設集會將文字編碼器量化為 NF4,論文證實這是唯一會改變影片片段本身的預設集變更。

說白了:Wan 2.7 的成本,是發票上一筆你可以預測的費用。Kandinsky 6.0 Video 的成本,則是一台你擁有的機器、每五秒就要花上數分鐘的渲染,以及可微調的選項——而不是義務。

路由器在其中的位置

OrcaRouter 不提供 Kandinsky 6.0 Video 或 Alibaba Wan 2.7,且此處並未做出任何此類聲明。Kandinsky 可供您自行下載與執行;Wan 2.7 則透過阿里巴巴自家的平台存取。無論基於哪個模型建置的管線,需要路由器提供的是環繞渲染的文本層:將鏡頭描述轉換為這些模型所訓練的長或短說明的提示擴展、為圖生影片階段提供輸入的說明與對白處理,以及決定多個生成結果中哪個值得保留的檢視摘要。這些是一般的文字呼叫,它們在一個與 OpenAI 相容的端點上運行,橫跨 200 多個模型,並搭配 以 0% 加價直接傳遞的供應商定價,因此供應商降價當天就能生效,而不必等到合約週期之後。自動容錯移轉在這裡比在聊天工作負載中更有價值,因為在問答環節第四分鐘失敗的說明文字呼叫應該重新路由,而不是失去渲染結果。

決定,每項一行

如果交付成品是含聲音的完成片段,而你又不想擁有 GPU,那麼在兩者之中,Wan 2.7 是唯一能提供這一點的;就現有證據來看,它的剪輯功能也是這個系列中最強的。在投入 reference-to-video 之前,先確認 10 月 10 日的停止支援資訊。

如果交付成果是一條你能掌控的管線,如果五秒為單位的片段符合你的鏡頭清單,而且你想微調或離線執行,那麼 Kandinsky 6.0 Video 是兩者中唯一允許你這麼做的一個——代價是它在消費級硬體上渲染緩慢,而且其品質宣稱仍完全出自該實驗室自己之口。那一邊值得關注的事件很簡單:一場 Elo。

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Alibaba Wan 2.7 — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'Resolution: Full HD plus SR', 'Tasks: text and image to AV', 'Reference input: one image', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Alibaba Wan 2.7 column reads 'Max clip: 2 to 15s', 'Resolution: up to 1080p', 'Tasks: four variants', 'Reference input: ten assets', 'Weights: none', 'Price: $0.10 to $0.15/s'. A footer reads 'Kandinsky figures vendor-reported; Wan pricing per Alibaba. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-Editing V1.0 leaderboard, ranking video-editing models by Elo from pairwise human preference votes with audio kept. Wan 3.0 is first at 1,156 over 5,255 samples at $12.00 per minute (Aug 2026); MiniMax H3 is second at 1,132 over 12,043 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,125 over 14,815 samples at $6.00 per minute (May 2026); HappyHorse-1.0 is fourth at 1,089 over 21,673 samples at $27.04 per minute (Apr 2026); Wan 2.7 is fifth at 1,077 over 17,988 samples at $16.90 per minute (Apr 2026); Dreamina Seedance 2.0 720p is sixth at 1,034 over 21,507 samples at $5.57 per minute (Mar 2026); Aleph 2.0 is seventh at 1,012 over 19,183 samples at $16.80 per minute (May 2026); Kling 3.0 Omni 1080p (Pro) is eighth at 1,000 over 17,447 samples at $10.91 per minute (Feb 2026); SkyReels V4 is ninth at 953 over 14,441 samples at $37.50 per minute (Mar 2026).

有一個不對稱值得在收尾前點名,因為它會比這兩個模型都更長壽。Wan 2.7 的天花板在合約與技術上都由阿里巴巴決定——當該套件的各變體被淘汰或重新定價時,你的管線會承接這個決定。Kandinsky 6.0 Video 的天花板則是你自己的硬體,而 MIT 授權意味著一個分支可以比實驗室的路線圖活得更久。曾被模型從目錄中消失所傷的團隊,往往在一年後會比在選擇當天更看重這個差異。

A screenshot of OrcaRouter's own model page for minimax/minimax-h3, titled 'MiniMax-H3' and credited to MiniMax, showing the route endpoint /v1/video/generations, a price of $0.08 per second at 768P and $0.13 at 2K, and a description explaining that MiniMax-H3 is MiniMax's omni-modal video generation model (the Hailuo 3 generation), released July 31 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio.