
Claude Opus 5.5 多模態:它能從程式碼渲染影片,卻無法觀看影片
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 1009 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 195 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
向 Claude Opus 5.5要一段影片,你最後可能真的會得到一段——那是一支由 HTML、CSS 或 canvas 呼叫組成的程式,會逐格繪出每個畫面,再由你親自執行。交給它一段影片,問它裡頭發生了什麼事,你則什麼都得不到,因為它沒有影片輸入。這種不對稱就是這款模型模態表面的全部,而我們榜上十一個 Anthropic 模型無一例外,所以值得直截了當地說:Claude Opus 5.5能讀文字、圖像與檔案,能寫文字,然後就沒了。它周遭的榜單可就遠沒這麼一致了。MiniMax H3直接生成影片,OrcaDub 1.0吃進一段影片、吐回一段配音版,而Qwen3.8-Max願意以每百萬輸入符元兩美元的價格看一段短片——是Claude Opus 5.5同樣百萬符元收費的一半,還外加一項它沒有的能力。
這是 OrcaRouter 於 2026-09-29 所記錄的模態列讀數,涵蓋型錄中全部 204 個模型。下方數字是型錄宣告,並非我們的基準測試——模態欄位是模型卡所載的內容,而模型卡會變動。
目錄實際記錄的內容
在 204 個模型中,有 182 個宣告了輸入介面。其餘 22 個則留空,這反映的是紀錄本身,而非模型本身——其中包含八個 Kling 影片模型、四個 OrcaRouter 元模型,以及散落其中的一些免費方案與預覽端點。

在這 182 個之中:
• 131 張已讀取的圖片
• 77 個能讀取檔案——而這 77 個每一個也都能讀取圖片,因此在這個榜單上,檔案輸入是圖片輸入的強化,絕不是獨立的第六種模態
• 49 已讀影片
• 19 聽取音訊
• 50 只取文字,其餘一概不要
Claude Opus 5.5屬於影像與檔案這條線,而不是影片那條線。我們自家的模型頁面用一句話就說明了,就在「上下文、模態與思考」這個標題之下:多模態輸入——文字、影像與檔案——輸出為文字,具備 1M token 的上下文視窗,以及最高 128K 的輸出 token。這就是完整的輸入介面。沒有第五個項目藏在子選單裡。
五十比大多數人預期的還要大。在所有至少聲明了任何資訊的模型中,超過四分之一只接受文字,這表示一套基於「可以附上截圖並讓它被理解」這項假設所打造的流程,會在這個看板上對四分之一的情況失效。
為什麼「帶有程式碼的影片」不是一種影片模態
那些廣為流傳的示範是真實的,效果也是:Claude Opus 5.5異常擅長撰寫能繪製動態的程式——一個自成一體的渲染器,執行時會產生影格。那是一種真實且有用的能力。但它並不是一種輸出模態。型錄上為這個模型記錄的輸出恰好只有一項,那就是文字。影片是在下游製造出來的,由模型所撰寫的程式碼,在你的機器上、用你的渲染器產生。
實際後果是一體兩面的,而後半部正是人們常忽略的那一半。
在輸出階段,算繪步驟由你負責。以程式碼為基礎的影片可以檢查、可以差異比對、可以用不同解析度重新執行,而且便宜得像文字回應一樣——只要幾美元的詞元,而不是按秒計費的計價表。你也得為每一次失敗負責:缺少字型、影格預算沒抓好、算繪器與交給它的程式碼不一致。
在輸入這一端,你沒有東西可以交給它。如果你的原始素材是螢幕錄影、產品短片、兩小時的線上研討會,或競爭對手的發表影片,Claude Opus 5.5根本沒辦法觀看。你只能傳送逐字稿、以靜態影格呈現的簡報,或是別人寫好的描述。這才是真正決定架構的關鍵限制,而它在展示影片裡完全看不出來。
兩大陣營:60 個模型接收文件,29 個接收影片片段
將 182 個模型依其確切輸入集分組,排行榜就會分成幾乎不重疊的兩組。
A 陣營——文件與圖像,不含影片:60 個模型。 輸入價格中位數 每百萬個 token 2.00 美元。這正是 Claude Opus 5.5 的落點,與全數十一個 Anthropic 模型、五列 Grok 中的三列,以及 OpenAI 產品目錄中的推理端並列——每一個 GPT-4.1 與 GPT-6 列,以及在 GPT-4o 與 GPT-5 系列中除了語音、codex、search 與 chat-latest 變體之外的所有項目。A 陣營也佔據了價格表的天花板:openai/gpt-5.5-pro 與 openai/gpt-5.4-pro,每百萬輸入 token 要價 30 美元。那是整張榜單上最高的輸入價格,而且它們與兩列 OpenAI GPT-4 及兩個文字轉語音端點共用這個價格,而這些全都無法讀取文件。這八者中沒有任何一個能看影片。
B 陣營——文字、圖像與影片,不支援檔案:29 個模型。 輸入價格中位數 每百萬個 token $0.25。這二十九個模型中有二十二個帶有 Qwen 前綴;其餘是 MiniMax M3、GLM-5.3-Flash、Kimi K2.6、Kimi K2.7-Code、Gemma 4 26B,以及兩個經 Obsidian 調校的 Qwen 版本。它的上限是 Qwen3.8-Max,每百萬個 token 為 $2.00——也就是說,這個陣營中最昂貴的影片讀取模型,價格恰好是 Claude Opus 5.5 的一半。
兩個陣營之間的中位數差距為 8×。成員組成的差距更是懸殊。在 182 個宣告輸入介面的機型中,有 60 個接受文件但不接受影片,32 個接受影片但不接受文件,73 個兩者皆不接受,只有 17 個兩者皆接受。重疊程度之小,使這兩個群組讀起來幾乎是互不相干的產品,而居於中間的那 17 個幾乎全是 Google 的高階層級——17 個中有 15 個——再加上 Meta 的兩個 Muse Spark 版本。

這種形態有個合理的解釋。文件理解與影片理解是不同的工程問題,具有不同的成本曲線;而大多先解決影片理解的供應商,正是以億計地販售便宜 token 的那些廠商。先解決文件理解的供應商,則是以溢價販售推理能力。目前還沒有人被迫以相同價格同時做到這兩者,因此市場已分裂成兩種產品,並據此定價。
那十九個帶走一切的人
有十九款模型可接受全部四種輸入類型——文字、圖像、影片與音訊。其中十六款是 Google,兩款是 Meta,一款是 MiniMax。Google 在這個陣營中的自家價格範圍,從 每百萬 $0.10 的 gemini-2.5-flash-lite 到 $4.00 的 gemini-pro-latest,因此「能讀取所有內容」不是一個價格層級;而是 Google 在每個價位都做出的決定。Meta 的貢獻是兩款 Muse Spark 版本——Muse Spark 1.1 與 Muse Spark 1.2,在目錄中完全相同,輸入每百萬 $1.25、輸出 $4.25,並具備 1M token 的上下文。
這就是印證文章關鍵論點的陣營:具影片感知能力的管線並不需要旗艦模型。它需要的是從一份十九個項目的清單中挑選,其中十個每百萬輸入 token 的成本不到一美元。
這個看板上的五個模型輸出的不是文字
讀懂影片與製作影片是兩回事,而後者更為罕見。在 204 個模型中,有 139 個宣告了輸出形式;其中五個所稱的並非文字。
其中三個是圖像生成器:Nano Banana(Gemini 2.5 Flash Image),每百萬個詞元輸入 $0.30、輸出 $30.00,Nano Banana Pro(Gemini 3 Pro Image Preview),每次請求 $0.24,以及 Nano Banana 2(Gemini 3.1 Flash Image Preview),每次請求 $0.151。有兩個會輸出影片:MiniMax H3,依生成的輸出秒數計費——768P 每秒 $0.08,2K 每秒 $0.13,可製作四到十五秒的片段,並具備原生立體聲音訊——以及 OrcaDub 1.0,依來源影片每分鐘 $0.60 計費,涵蓋 28 種語言,並為每位講者複製獨立的聲音。
這裡有兩種理解框架需要避免。首先,其餘 65 列讓輸出欄位留空;留空意味著該目錄並未記錄輸出介面,而這並不是某個模型只輸出文字的證據。其次,讀取影片與生成影片是兩條各自獨立的軸線,在這張表上幾乎沒有重疊——OrcaDub 1.0接收影片並回傳影片,這使它成為這裡唯一可能同時位於管線兩端的模型,而MiniMax H3則接受四種輸入類型,以產生單一且非文字的輸出類型。
將什麼路由到哪裡
四條規則從普查中得出,而且應用起來成本很低。
• 如果你的輸入是影片片段,請不要一開始就動用前沿旗艦模型。 那個不需要文件就能讀取影片的陣營有 29 個模型,其中 22 個是 Qwen,而它的中位數是每百萬四分之一。改為把影格和逐字稿送給旗艦模型,讓它來進行推理。
• 如果你的輸入是 PDF、合約或長篇文件,那影片陣營就是錯的陣營。只有 17 個模型同時宣告支援檔案與影片輸入,而每個宣告支援檔案輸入的模型也都宣告支援圖片輸入,因此兩者總是相伴出現。Claude Opus 5.5以每百萬 $4.00 的價格,換得文件處理介面外加 100 萬 token 的視窗,這就是你正在做的取捨。
• 如果你需要輸出媒體,你是在五個模型中做選擇,而不是從整個陣容中挑選。其中三個生成靜態圖像,兩個生成影片,而這兩個是按秒和按分鐘計費,而非按詞元計費——所以用輸入價格推算出的成本估算,必然會是錯的。
• 如果你需要輸出影片,而你的素材是腳本,那麼程式碼生成依然是這塊板子上最便宜的路徑。 Claude Opus 5.5以文字的價格撰寫渲染器;MiniMax H3則以每秒八美分的價格將它渲染出來。把兩者串接起來,成本低於任何一種替代方案,還能讓你得到一個可以編輯的檔案。
常見問題
Claude Opus 5.5 可以觀看影片嗎?
不行。它宣告的輸入模態是文字、圖像和檔案。影片不在其中,音訊也不在。螢幕錄影或產品短片必須先經過轉換——取樣影格、逐字稿,或兩者——才能送出。
Claude Opus 5.5 會直接生成影片嗎?
不是作為一種模態。它回傳的是文字,而那段文字往往是個自成一體的程式,執行後便會渲染出動態畫面。渲染由你負責;模型從不輸出任何像素。若你想要這張看板上能自行回傳影片的模型,MiniMax H3 與 OrcaDub 1.0 就是那兩款。
「multimodal」是價格層級嗎?
不是,而排行榜從兩個方向說明了原因。Google 以每百萬輸入 token 0.10 美元到 4.00 美元的價格,提供完整的四模態輸入;openai/gpt-5.5-pro而排行榜上並列最高的輸入價格——每百萬 30 美元——能讀取文件與圖像,卻不支援影片。你付費買的是推理等級,而不是模態數量。
為什麼能讀取圖像的模型那麼多,能讀取文件的模型卻那麼少?
由於檔案與圖片在這份榜單上總是相伴出現:全部 77 個能讀取檔案的模型也都能讀取圖片,因此檔案輸入是圖片輸入的延伸,而非一項獨立能力。要記住的數字是:在 182 個宣告輸入介面的模型中,有 60 個接受文件與圖片,完全不接受影片——佔了榜單的三分之一,也正是旗艦層級所在的位置。
我該如何為影片管線定價?
要看模型是以什麼單位計費。影片讀取工具和任何聊天模型一樣,都是按 token 計價;這個看板上的影片生成器則按輸出秒數計價(MiniMax H3:768P 為 $0.08,2K 為 $0.13),或按來源素材的分鐘數計價(OrcaDub 1.0:$0.60)。把這兩種單位混進同一份估算,是影片預算算錯最常見的原因。
值得記住的一句話
的有趣之處Claude Opus 5.5,並不在於它是多模態的。排行榜上大多數模型都是。而是在於它的模態分界線落在一個不尋常的位置——文件與靜態影像輸入、文字輸出,兩個方向都沒有影片——然而讓它聲名大噪的示範卻是影片。這兩件事並不衝突,而把它們解讀成衝突,正是讓那段程式碼生成影片的故事變得令人費解的原因。模型撰寫渲染器;渲染器製作出影片。模型能拿到的,是一份腳本、一份文件和一張截圖。

以上所有內容都是 2026-09-29 的 OrcaRouter 型錄快照,以及其中所載的模態宣告。供應商規格會變動,而在你依據某個數字進行建置之前,模型卡的模態清單是最先該重新確認的事項。如果這裡的某項說法對某個決策有影響,請開啟模型頁面——欄位就在頁面上。
