
Claude Opus 5.5 一次搞定音樂錄影帶:「規劃影片」究竟產出什麼
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 496 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 183 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
2026 年 9 月 23 日,一則發佈到 X 的訊號寫道:「Claude's Plan,一部由 opus 5.5 一發完成的影片」,並附上對 @jeffgwoah 的致意。那是示範宣稱,不是發佈宣稱——而且它正好落在通常真正關鍵那件事的錯誤一側。Claude Opus 5.5並不是要靠外洩消息才能嗅出的未發佈模型。Anthropic 已於 2026 年 9 月 22 日推出它,每百萬輸入 token 收費 4 美元、每百萬輸出 token 收費 20 美元。它才問世一天,已正式開放使用,而且早已列在價目表上。所以,有趣的問題不是 Opus 5.5 是否存在,而是這些「一發完成一部影片」的貼文實際上展示了什麼——因為這個說法的涵義比聽起來還要狹窄,而這個差別決定了你能不能拿其中任何一點來用。
以下是短版說明,而這正是大多數轉貼文所省略的部分:在經得起檢視的示範中,Claude Opus 5.5 並不生成像素,而是撰寫能繪出像素的程式碼。輸出是一支程式,而不是影片檔案。
目前流傳的兩段示範實際上做了什麼
這類主張背後有兩項公開的產出物,而兩者都可查核,因為兩者都公開了原始碼。
第一個是為一首名為「I'm Upping My P(doom)」的歌曲所製作的 156.6 秒音樂錄影帶,那是一個名為 PDoomVideo 的 repo,於 2026 年 9 月 22 日發布在 GitHub 上——也就是 Opus 5.5 上線的同一天。它的 README 指出,這部影片「花了兩次生成,兩次都在 Claude Code 中完成」,第一次歸功於 Claude Opus 5.5(Medium),第二次則歸功於以預設投入程度運行的 Claude Opus 5.5。它還指出「這個 repository 裡的一切都是由模型生成的」,而且「沒有指定任何場景構想」——唯一給出的指示,是使用某個特定的角色設計,並讓每句歌詞都有有趣的視覺效果與轉場。
第二個是 2026 年 9 月 23 日發布的三款遊戲示範儲存庫,與其說是展示,不如說更接近一場對照實驗:三款可遊玩的 3D 瀏覽器遊戲,各自只給一句提示詞,在一次工作階段中生成,而該儲存庫稱其程式碼經過零人工編輯,接著便部署上線。這些遊戲是單一檔案 HTML,沒有外部資源——模型、材質、動畫與音效全都由程式碼程序化生成。三者之中有一個要求模型先查閱某遊戲地圖的官方配置,並根據該研究重建其幾何結構,然後才開始撰寫任何內容。
這兩個 repo 都不是廠商發布品。兩者都是第三方產物,屬於自我陳述,而尤其是「零人工編輯」這個說法,是關於 git 歷史的一項主張,並非外部第三方已稽核過的事。請將流程說明視為作者的陳述,並將產物本身視為證據。
分鏡腳本才是真正的產出
決定「one-shotted」是否為公允描述的細節,是第一個 repo 中一個名為 STORYBOARD.md 的檔案。它不是人類的鏡頭清單。它是模型在第一次生成階段之後為自己寫的文件,而且它確確實實很具體:一條規則:每個鏡頭都要「在畫面上發生某件事」,一項指示:不要讓文字出現在畫面中,一組具名、設計固定的角色陣容,一套調色盤,從暖奶油色穿過太空紫到警示紅再返回,一條規則:角色表情要漸變,而非瞬間切換,以及一項要求:每一次剪接都必須由動作所驅動——咬一口轉黑、墜落、穿過眼睛的變焦。
那份文件就是訊號文字所指的計畫。模型產出了一份導演簡報,然後針對它平行執行子代理,每個章節一個,各自撰寫一個 JavaScript 檔案,描繪自己在時間軸上的區段。
渲染管線很普通,值得平實說明,因為這正是「AI 製作了一支影片」這種說法崩解的地方:影格是在一個網頁中用 p5.js 和水彩筆刷函式庫繪製出來的,一支 Node 指令碼在無頭 Chrome 中驅動那個網頁並對每個影格截圖,再由 ffmpeg 將影格與音軌合併。以每秒 24 個影格、全長 156.6 秒計算,這大約是 3,760 個逐一渲染的影格。
所以,準確的句子不是「Claude Opus 5.5 生成了一段影片。」而是「Claude Opus 5.5 撰寫、然後執導了一個能渲染出影片的程式。」這個區別並非吹毛求疵——這正是這項技術之所以對任何不是在製作音樂錄影帶的人有用的全部原因。
為什麼「兩個世代」這條線比「one-shot」那條線更重要
同一份 README 削弱了自身的標題。這支影片歷經兩次生成,而非一次。第一輪產生了一個結果,作者隨後又把它推得更遠;分鏡腳本與動畫指南——這些讓第二輪得以連貫的文件——是在那第一輪之後才寫的,而不是之前。
這就是每一個嚴肅的長遠程生成任務的真實樣貌,而這值得一說,因為一次性的框架設下了產出物無法達到的期望。提示詞是一則訊息。工作不是一次就能完成。模型所做的,是將一個大型、多檔案、多小時的建置維持得夠好,讓第二遍成為修訂而非重新開始——這是一項真實且遠不如「一個提示,一部影片」那麼炫目的能力。
有一個獨立數字比那些示範更能說明這一點。Artificial Analysis 在其 Intelligence Index 上測得 Claude Opus 5.5 在最大努力程度下為 58 分——這是它歷來記錄到的最高分,領先接下來幾個模型好幾分——並報告該模型在每個 Index 任務中消耗約 119,000 個輸出 token,相較之下 Claude Opus 5 約為 73,000 個,Claude Fable 5.1 約為 78,000 個。它使用了約 1.6 倍的輸出 token,卻在每項任務上達到大致相同的成本(約 $5.98 對上約 $5.86),儘管每 token 價格低了 20%。長時程生成就是那樣的 token 特徵從外部看起來的樣子:模型把預算花在自己身上。


成品不再可用的地方
這類工作的失效模式相當一致,而兩個 repo 從不同方向都指向同一個。
• 輸出是一個程式,不是檔案。 如果你需要一個能交給別人的 MP4,你仍然需要 Node、瀏覽器和 ffmpeg。模型產出的是渲染器,不是渲染結果。那是你必須永遠自行負責的建置相依性。
• 它的規模取決於影格數,而非提示詞。 3,760 個影格在作者自己的硬體上跑了一整夜的腳本化處理。Opus 5.5 沒有任何特性會改變繪製第 2,000 個影格的成本。
• 確定性是必要條件,不是可有可無的點綴。影格會平行且不依序渲染,因此每個影格都必須是其時間戳記的純函式——不能有延續的狀態,也不能有未設定種子的隨機性。尚未將這一點內化的模型,產出的影片會閃爍。兩個 repo 都處理了這件事;但提示詞中沒有任何內容強制要求它。
• 一次完成並不代表未經審查。最清楚的證據是第二個 repo 的遊戲相關工作:模型在建構之前必須先研究現有地圖的佈局,這代表模型判定自己的第一個答案原本會是錯的。
• 沒有人為失敗定價。這兩個 repo 都沒有說明它試了幾次、燒掉多少 token,或是第二代的產出中有多少比例是在修補第一代。那才是團隊在正式投入前真正需要的數字。
這對你來說改變了什麼,以及沒有改變什麼
如果你原本期待的是影片生成模型,Claude Opus 5.5 並不是,再多的示範影片也無法讓它變成那樣的模型。Anthropic 的發布資料中不含任何影片生成能力;該模型公布的評估項目是代理式編碼、電腦操作與知識工作。這些示範所展示的,是帶有創意簡報的長時程程式碼生成——同樣的能力也出現在 Anthropic 自家發布文章中引述的 680,000 行遷移,以及 C-to-Rust 移植上,只是這次指向的是你能實際觀看的東西。
如果那正是你想要的能力,實際的問題就不再是「該用哪個模型」,而是「我要怎麼跑這種東西,又不把正式環境的路徑押在它上面」。長跨度生成既昂貴,失敗模式又是無聲的——你會得到一個看似合理的程式,渲染了四分鐘之後才壞掉。合理的測試方式,是把這項工作導向你手上已經有的端點,而不是另外簽一份新合約:Opus 5.5 在 OrcaRouter 上以 Anthropic 的定價提供、0% 加成,和同一家族的其他模型並列,所以一趟徹夜的生成執行可以用同一把金鑰、同一套容錯移轉規則,就像你呼叫的其他所有東西一樣。如果這趟執行在第 3,000 個影格掛掉,那是路由問題,而不是得重新架構。

在你據此規劃之前,有兩件事值得留意。Anthropic 表示 Sonnet 5.5 和 Haiku 5.5 會「在接下來幾週內」推出,這將改變長時間算圖的盤算——一個更便宜、又能撐起多檔案建置的模型,會讓夜間批次執行變成例行公事,而非值得大書特書。而分鏡模式本身是可攜的:那份文件裡沒有任何內容是 Opus 5.5 專屬的,也沒有任何東西能阻止較小的模型寫出更糟的一份。
目前為止,對「Claude's Plan a video by opus 5.5 one shotted」最誠實的解讀,比它聽起來更狹隘,也比它看起來更有用。這個模型寫了一份鏡頭清單,向自己的子代理做簡報,然後寫了渲染器——而像這樣的計畫竟能經得起 3,760 個影格的考驗,這件事才是值得檢驗的主張,而不是那支影片。
