
Utopai X 在文字轉影片領域初登場即登上第 2 名:深入一間電影工作室對 MiniMax H3 的後訓練
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 121 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1124 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Utopai X 是一個上週還不存在的影片模型,既不是由前沿實驗室從零訓練而成,也不是透過 API 販售——而它目前在文字轉影片領域排名世界第二。這個模型來自 Utopai Studios,一家總部位於山景城的 AI 原生影視工作室,它是對 MiniMax H3 進行後訓練的成果,後者是 MiniMax 的全模態影片模型。在附帶音訊的 Artificial Analysis 文字轉影片排行榜上(該榜單現已被 Artificial Analysis 標示為 AA-Video-T2V v2.0,2026 年 9 月 29 日結果),Utopai X 以 Elo 1,150 的成績,僅落後於 Alibasba 的 Wan 3.0 的 1,157,並領先字節跳動的 Dreamina Seedance 2.5 的 1,143,以及它所調校自的 MiniMax H3 (768p) 基礎模型的 1,138。它於 2026-09-30 問世,正好是排行榜更新的同一天,而且它只在一個地方提供:在 PAI,Utopai 自家的製作平台之中。它沒有公開 API,而 Artificial Analysis 為該列自設的定價欄位寫著「No API available」。
那個組合——世界第二、單一發行管道、沒有通常意義上的每秒價目表——就是整件事的全貌。一家製作電影的片廠拿了別人的基礎模型,以自身的製作判斷加以調校,然後插隊。這究竟是能長久持續的成果,還是全新競技場的一張快照,才是值得追問的問題,而答案取決於解讀排行榜,而不是新聞稿。
看板實際顯示的內容
Artificial Analysis 使用源自盲測成對人類偏好投票的 Elo 來為影片模型排名。投票者會看到由同一提示生成的兩段短片,並在不曉得各段影片出自哪個模型的情況下,選出自己偏好的那一段。排行榜會隨著票數累積而變動,且每一列都帶有信賴區間,說明該名次被允許變動的幅度。擷取於 2026-10-01,含音訊的文字轉影片排行榜顯示:

• 第 1 名 Wan 3.0 — Elo 1,157(±10),6,391 個樣本,於 2026 年 8 月發布,每分鐘 $12.00。
• #2 Utopai X(基於 MiniMax H3) — Elo 1,150(±11),5,455 個樣本,於 2026 年 9 月發布,無可用 API。
• #3 Dreamina Seedance 2.5 — Elo 1,143(±10),6,375 個樣本,2026 年 7 月發布,每分鐘 $34.12。
• #4 MiniMax H3(768p) — Elo 1,138(±10),6,343 個樣本,2026 年 7 月發布,每分鐘 $4.80。
• #5 FLUX 3 — Elo 1,129(±10),5,628 個樣本,2026 年 7 月發布,每分鐘 $17.40。
有兩個細節比排序更重要。首先,第一名與第二名之間的差距是七個 Elo 分,而且兩個區間明確重疊——Artificial Analysis 將 Utopai X 的範圍列為 1,139 至 1,161,其中包含 Wan 3.0 的點估計值 1,157。該榜單將 Utopai X 的名次標示為一個範圍,第 1–3 名,而非固定名次。其次,Utopai X 與其後訓練所依據的模型之間的差距是十二分,且有同樣的重疊問題,因此「後訓練模型勝過其母模型」在方向上屬實,但在統計上偏弱。Utopai 自家的說明文章在這一點上比大多數發布文章更謹慎:它表示 Elo 結果「提供了一項獨立評估,說明人們如何回應其生成的影片素材」,這是對人類偏好競技場衡量什麼的合理解讀,而不是對電影製作的主張。
相較之下,由廠商自行報告的層面則信心滿滿。Utopai 描述了在反射與焦散——光線反射或折射時所形成的集中圖案——以及單一影片片段內空間一致性方面的優勢;這兩者都是開發目標,而非基準測試結果。這些是廠商的說法,並非 Artificial Analysis 的測量結果。
一個工作室,而非實驗室
Utopai Studios 開發、投資並製作自家的電影與電視項目,且它是在這項業務內部建構其模型,而非在其旁另建。其所闡明的機制是回饋:製作過程會產出劇本、經核准的角色與場景設計、鏡頭規劃以及一次次拍攝的鏡次,而該工作室的導演、攝影師與美術人員不僅記錄哪些鏡次被保留,也記錄其他鏡次為何被否決。這些紀錄成為訓練與評估訊號。研究團隊也運行一套內部 Elo 系統,將人類偏好評估與視覺語言模型的自動投票相結合,並由美術人員參與人類評判的一方。
這是一項看似合理的優勢,但從外部無法驗證。後訓練可以讓一個通用影片模型朝電影與廣告使用者的偏好靠攏,而不必替換基礎模型——這一點與排行榜一致。至於相較 MiniMax H3 的十二點差距,有多少來自訓練資料、偏好最佳化、提示處理、推論設定或服務時期的變更,發布資料並未說明。Utopai 尚未公布任何後訓練資料披露、最佳化方法、運算預算與安全評估。獨立研究人員無法重現這項提升,也沒有技術報告可供爭辯。
分發層正是讓這套「工作室論點」落實為具體做法的地方。PAI——Production Assistive Intelligence——是 Utopai 隨著該模型一同推出的平台,它承載了專案脈絡:把劇本拆解為場次與鏡頭、涵蓋角色、場景與物件的製作素材庫、版本紀錄、為企業團隊提供的共享審批功能,以及可匯出至 Premiere Pro 或 DaVinci Resolve 的時間軸。其賣點在於:生成一段片段是便宜的部分,讓某個鏡頭與整部片的其餘部分保持一致才是昂貴的部分。用該公司自己的說法,Utopai X 會「在電影製作人選用時」於該工作空間內生成素材——這個模型只是 PAI 中可用的眾多圖像、影片與音訊模型之一,而非唯一的選擇。
Utopai X 的費用為何,以及如何解讀

PAI 是以點數計價的訂閱制產品,而非按秒計費的 API。官方公佈的方案為:每月 15 美元可獲得 1,000 點數、每月 49 美元可獲得 3,500 點數、每月 129 美元可獲得 10,000 點數,以及每月 379 美元可獲得 35,000 點數;年繳約可享 8% 到 10% 折扣,另有每 1,000 點數 15 美元的加值方案。Utopai X 在 PAI 的點數表中有專屬的一列:1080p 影片每秒 93 點數。平台的其他影片模型則較低——標準方案在 1080p 下每秒 50 點數,專業方案則為 76 點數。
把它換算成每分鐘的數字,是任何人都做得到的算術,卻幾乎不該有人把它當成價格來引用。以每秒 93 點計算,Utopai X 輸出每分鐘要花 5,580 點。入門的 $15 方案每月可買到 1,000 點,也就是大約 10.8 秒的素材——前提是每一點都花在這個模型上。若把入門的點數費率線性放大,隱含成本大約是每分鐘生成的影片 $80 以上。這個數字只有在附上但書時才值得一提:它假設點數與美元之間是嚴格的線性換算,它忽略了點數在 PAI 中所有模型之間是共用池,而且會過期或根本沒用完,它忽略了年繳折扣與加值包,而且它對解析度或長度限制隻字未提——Utopai 並未針對 Utopai X 另行說明這些限制。這只是有用的數量級參考,不是價目表。
相較之下,在同一個 Artificial Analysis 榜單上,MiniMax H3(768p)標價為每分鐘 4.80 美元,Wan 3.0 為 12.00 美元,而 Dreamina Seedance 2.5 則標價 34.12 美元。這些是來自各家供應商自家 API 的自動定價資料饋送,並非由訂閱方案推算出的估計值,因此這種比較充其量只能看出方向——但方向很清楚:在入門方案層級,以點數計價的工作室平台內的生成,並不是在與按秒計價的 API 定價競爭。買方真正付費購買的,是模型周遭的工作空間,而不是模型每多一秒的邊際成本。
非公開的部分
有三個落差值得點名,因為每一個都阻礙著不同的決策。
• 沒有 API,也沒有整合途徑。 Utopai X 目前沒有直接整合途徑。想在管線中呼叫它的產品團隊無法做到。Artificial Analysis 將其列為「無可用 API」,而發布資料也未說明有任何開發者存取方式。
• 無獨立規格說明。MiniMax H3 可生成 4 至 15 秒的片段,最高達 2K 畫質,並具備原生立體聲。Utopai 並未公布 Utopai X 本身的最大時長或解析度,這表示點數表中 1080p 的數字是唯一可取得的解析度說明,而片段長度則不得而知。
• 沒有超出競技場範圍的評估。 Elo 結果是對短片段人類偏好的獨立測量。它並非衡量素材是否符合預定鏡頭、能否剪入剪輯,或能否經得起修改的標準。Utopai 自家的貼文直接承認這點——「評估也會在片段生成後持續進行」——這對產品發布而言是異常誠實的表述,同時也是對這項排名能走多遠的警告。
在工作室這一側,還有更多歷史值得一提。Utopai 於 2026 年 6 月 2 日推出 PAI 2.0,並在當時表示,該平台在四月首次亮相後不到兩個月,年度經常性收入就已達到 1,100 萬美元,動能來自銷售給製作公司的商業授權。該公司表示,已排定三部院線電影與兩部影集於 2027 年推出,並正將 PAI 與 Utopai X 應用於自家製作,包括The Most Serious Fart,這部由 Mike Bender 編劇並執導的動畫長片。這些是該工作室的數字與該工作室的檔期,而它們正是一個沒有 API 的後訓練模型之所以值得一寫的原因:這個模型正被用來製作該公司打算發行的電影,而這比排行榜是更嚴苛的考驗。
在基礎模型仍是實用選擇的情況下

對這週真的需要生成影片的人來說,這個系列中可路由存取的那一半,就是基礎模型。MiniMax H3已在 OrcaRouter 上以供應商的牌價提供——768p 每秒 $0.08,也就是每分鐘 $4.80,與 Artificial Analysis 列出的數字相同——零加成,因此任何廠商降價都會在同一天反映,而非等到重新定價週期之後,並且自動容錯移轉可跨供應商運作,讓單一端點中斷不會導致你的管線停擺。它接受文字、圖像、影片和音訊參考作為單一統一的上下文,並以 768P 或 2K 傳回 4 到 15 秒的片段,附帶原生立體聲音訊,按生成輸出的秒數計費。
Utopai X 並未提供路由,本文任何內容都不應被解讀為聲稱它已提供路由。基礎模型能帶給你的,是一種測試 H3 系列美學與動態特性的方式——這正是 Utopai 起步時所依據的同一套基礎,無論它之後施加了什麼後訓練——只要一組 API 金鑰,就能與超過 200 個其他模型並列使用,無需 PAI 訂閱。倘若 Utopai X 日後上架到可路由的供應商,它會在同一天以定價現身,並以供應商的費率原樣轉嫁,而非加價。在那之前,誠實的區分是:Utopai X 給 PAI 內部的工作室,MiniMax H3 給所有正在拼湊工作流程的人。
是什麼決定這究竟是初登場,還是一個時刻?
接下來一季有三件事值得觀察。第一,榜首的七分差距能否在再累積數千票後依然存在——目前區間互相重疊,而當新一批比較結果進來就會重新洗牌的排行榜,根本還沒塵埃落定。第二,Utopai 究竟會不會開放任何開發者存取;一個全球排名第二、卻只有 PAI 訂閱者能呼叫的模型,是產品決策,而且可以逆轉。第三,競爭是否會往另一個方向發展。Wan 3.0 已經能生成長達 30 秒、具備原生音訊的 1080p 內容,並接受文字、圖像、影片、音訊、文件和網頁作為參考,且在使用案例細分中於光影、材質和鏡頭控制方面領先排行榜。相較基礎模型有十二分的後訓練增益,這很耐人尋味;但要對抗一個輸入範圍更廣的基礎模型並保住第二名,則是另一回事。
這裡真正新的並不是 Elo,而是這項主張的形態:一間具備製作流程的工作室主張,擁有影片素材背後的那些決策——哪個鏡次、哪個參考、哪個修訂版——比擁有預訓練運行更有價值。這個論點可以檢驗,而 2027 年片單的票房就是其中一項檢驗。
