
Claude Opus 5.5 多模态:它能用代码渲染视频,却看不了视频
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 1009 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 195 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
向 Claude Opus 5.5要一段视频,你确实可能得到一段——一个由 HTML、CSS 或 canvas 调用组成的程序,逐帧绘制出画面,再由你来运行它。可要是你递给它一段视频,问里面发生了什么,你会一无所获,因为它根本没有视频输入。这种不对称就是该模型模态能力的全部,而且在我们榜单上全部十一个 Anthropic 模型上都一模一样,所以值得直截了当地说明:Claude Opus 5.5能读文本、图像和文件,能写文本,仅此而已。而它周围的榜单则远没有这么整齐。MiniMax H3直接生成视频,OrcaDub 1.0接收一段视频,返回一段配音版,Qwen3.8-Max则愿意以每百万输入 token 两美元的价格观看一段视频——这是 Claude Opus 5.5同样百万 token 收费的一半,而且还具备它并不拥有的能力。
这是对 OrcaRouter 于 2026-09-29 所记录的模态字段的解读,涵盖目录中全部 204 个模型。以下数字是目录声明值,而非我们的基准测试结果——模态字段就是模型卡上写的内容,而模型卡是会变的。
目录实际记录的内容
在这 204 个模型中,182 个声明了输入接口。其余 22 个则留空,这是对记录本身的说明,而非对模型的说明——其中包括八个 Kling 视频模型、四个 OrcaRouter 元模型,以及零散分布的若干免费套餐与预览版端点。

在这182个中:
• 已读 131 张图片
• 77 个能读取文件——而这 77 个中的每一个也都能读取图像,所以文件输入在这方面是对图像输入的增强,绝不是单独的第六种模态
• 49 个已读视频
• 19 收听音频
• 50 只取文本,不要其他内容
Claude Opus 5.5属于图像与文件这一路,而不属于视频这一路。我们自己的模型页面在"上下文、模态与思考"这一标题下用一句话就说明了:多模态输入——文本、图像和文件——输出为文本,100 万 token 的上下文窗口,最多 128K 的输出 token。这就是全部的输入面。不存在藏在子菜单里的第五个条目。
五十比大多数人预想的要大。超过四分之一至少声明了某些信息的模型只接受文本,这意味着,一条建立在“附上一张截图就能被理解”这一假设之上的流水线,会在这个榜单四分之一的模型上失灵。
为什么“带代码的视频”不是一种视频模态
那些广为流传的演示是真实的,效果也是真实的:Claude Opus 5.5异常擅长编写绘制运动的程序——一个自包含的渲染器,运行它就能生成帧。这是一项真实的能力,而且很有用。但它并不是一种输出模态。目录中记录的该模型的输出只有一项,那就是文本。视频是在下游制造出来的,靠模型编写的代码,在你的机器上,用你的渲染器完成。
实际后果是把双刃剑,而人们往往忽略的正是后一半。
在输出这一端,渲染步骤归你负责。基于代码的视频可检查、可 diff、能在不同分辨率下重新运行,而且便宜得就像一条文本回复——花几美元的 token,而不是按秒计费的计价器。每一次失败也都归你负责:缺失的字体、糟糕的帧预算、以及拿到代码后却与它意见相左的渲染器。
在输入端,没有任何东西可以交给它。如果你的源素材是屏幕录制、产品片段、两小时网络研讨会,或竞争对手的发布影片,Claude Opus 5.5也看不了它。你可以发送文字记录、以静态帧呈现的幻灯片,或别人写好的描述。这才是真正决定架构的约束,而在演示短片里,它是看不见的。
两大阵营:60 个模型接受文档,29 个接受视频片段
将 182 个模型按各自确切的输入集合分组,榜单便会分成两个几乎不重叠的组。
A 阵营——文档和图像,不含视频:60 个模型。 输入价格中位数 每百万 token 2.00 美元。这正是Claude Opus 5.5 所处的位置,与全部十一个 Anthropic 模型、五条 Grok 行中的三条,以及 OpenAI 产品目录中的推理端并列——每一个 GPT-4.1 和 GPT-6 行,以及在 GPT-4o 和 GPT-5 系列中,除 voice、codex、search 和 chat-latest 变体之外的所有项。A 阵营还占据了价格表的上限:openai/gpt-5.5-pro 和 openai/gpt-5.4-pro,价格为每百万输入 token 30 美元。这是整个榜单上最高的输入价格,它们与两条 OpenAI GPT-4 行以及两个文本转语音端点共享这一价格,而这些没有一个会读取文档。这八个里没有一个能观看视频。
阵营 B — 文本、图像和视频,不含文件:29 个模型。输入价格中位数 每百万 token 0.25 美元。这 29 个模型中有 22 个带有 Qwen 前缀,其余的是 MiniMax M3、GLM-5.3-Flash、Kimi K2.6、Kimi K2.7-Code、Gemma 4 26B,以及两个经 Obsidian 调优的 Qwen 构建版本。其上限是 Qwen3.8-Max,每百万 2.00 美元——也就是说,该阵营中最贵的视频读取模型,价格恰好是 Claude Opus 5.5 的一半。
两大阵营之间的中位数差距为8×。成员构成的差距还要更悬殊。在 182 个声明了输入面的模型中,60 个接受文档而不接受视频,32 个接受视频而不接受文档,73 个两者都不接受,仅有 17 个两者都接受。重叠部分小到足以让这两组看上去几乎是互不相干的产品,而居于中间的 17 个几乎全部来自谷歌的高端梯队——十七个里有十五个——再加上 Meta 的两个 Muse Spark 版本。

这种格局有一个说得通的理由。文档理解和视频理解是不同的工程问题,有着不同的成本曲线,而最先解决视频问题的供应商,大多是那些按亿出售廉价 token 的厂商。最先解决文档问题的供应商,则是以溢价出售推理能力的厂商。还没有人被迫以同样的价格同时做好这两件事,因此市场已经分裂成两种产品,并据此为它们定价。
夺走一切的十九个
十九款模型支持全部四种输入类型——文本、图像、视频和音频。其中十六款来自 Google,两款来自 Meta,一款来自 MiniMax。Google 自身在这一阵营中的价格范围从 每百万 $0.10 的 gemini-2.5-flash-lite 到 $4.00 的 gemini-pro-latest,因此,“什么都能读”并不是一个价格层级;它是 Google 在每个价位上做出的决定。Meta 的贡献是两款 Muse Spark 构建版本——Muse Spark 1.1 和 Muse Spark 1.2,两者在目录中完全相同,输入每百万 $1.25、输出 $4.25,上下文为 100 万 token。
这就是那个点明文章核心论点的阵营:具备视频感知能力的流水线并不需要旗舰模型。它需要从一份列有十九项的清单中挑选,其中十项每百万输入 token 的成本不到一美元。
这个板块上的五个模型输出的是文本之外的东西
读取视频与制作视频是两种不同的本领,而后者更为罕见。在 204 个模型中,有 139 个声明了输出面;其中五个声明的并非文本。
其中三款是图像生成器:Nano Banana(Gemini 2.5 Flash Image),输入每百万 token 收费 $0.30、输出收费 $30.00,Nano Banana Pro(Gemini 3 Pro Image Preview)每次请求 $0.24,以及 Nano Banana 2(Gemini 3.1 Flash Image Preview)每次请求 $0.151。另有两款可生成视频:MiniMax H3按生成输出的秒数计费——768P 下每秒 $0.08,2K 下每秒 $0.13,可生成四到十五秒的片段,并带有原生立体声音频——以及OrcaDub 1.0,按源视频每分钟 $0.60 计费,覆盖 28 种语言,并能为每位说话人克隆独立的声音。
这里有两种解读方式需要避免。第一,其余 65 行的输出字段是空白的;空白意味着目录并未记录输出模态,而不能作为模型只输出文本的证据。第二,读视频和生成视频是两条彼此独立的轴,在这张图表上几乎没有重叠——OrcaDub 1.0接收视频、输出视频,这使它成为此处唯一一个有可能同时位于流水线两端的模型,而MiniMax H3接收四种输入类型,却只产生一种并非文本的输出类型。
路由什么到哪里
四条规则源自这次普查,且应用起来成本低廉。
• 如果你的输入是一段视频片段,不要一上来就动用前沿旗舰模型。无需文档就能读取视频的那一阵营有 29 个模型,其中 22 个是 Qwen,中位价格为每百万 0.25 美元。改为把画面帧和转录文本发给旗舰模型,让它来做推理。
• 如果你的输入是 PDF、合同或长篇文档,那么视频阵营就是错误的选择。只有 17 个模型同时声明支持文件和视频输入,而每个声明支持文件输入的模型也都声明支持图像输入,因此这两者总是相伴而行。Claude Opus 5.5以每百万 4.00 美元的价格,换来的是文档处理能力外加 1M token 的上下文窗口,这正是你所做的取舍。
如果你需要输出媒体内容,你面对的是五个模型,而不是整个榜单三个生成静态图像,两个生成视频,而它们按秒和按分钟计费,而不是按 token——所以,一个依据输入价格拼出来的账单,从构造上就注定是错的。
• 如果你需要视频输出,而源素材是脚本,那么在这块板子上,代码生成仍然是最便宜的途径。 Claude Opus 5.5以文本的价格编写渲染器;MiniMax H3以每秒八美分的价格进行渲染。将两者串联的成本低于任一替代方案,还能留下一个你可以编辑的文件。
常见问题
Claude Opus 5.5 能观看视频吗?
不。它声明的输入模态是文本、图像和文件。视频不在其中,音频也不在。屏幕录制或产品短片必须先经过转换——抽取帧、生成文字转录,或两者兼有——之后才能发送。
Claude Opus 5.5 能直接生成视频吗?
并非作为一种模态。它返回文本,而该文本往往是一个自包含的程序,运行它时便会渲染出动态画面。渲染由你完成;模型从不输出任何像素。如果你想要这个榜单上能自行返回视频的模型,MiniMax H3 和 OrcaDub 1.0就是这两个。
“多模态”是一个价格档位吗?
不,而这份榜单从两个方向说明了原因。Google 以每百万输入 token 0.10 至 4.00 美元的价格提供完整的四模态输入能力,而榜单上并列最高的输入价格——openai/gpt-5.5-pro每百万 30 美元——可读取文档和图像,但不支持视频。你付费买的是推理层级,而不是模态数量。
为什么能读图像的模型那么多,能读文档的却那么少?
因为在本榜单上,文件和图像总是相伴出现:全部 77 个可读取文件的模型也都能读取图像,所以文件输入是图像输入的延伸,而非一项独立能力。值得记住的数字是:在 182 个声明了输入面的模型中,有 60 个接受文档和图像、完全不接受视频——占全榜单的三分之一,也正是旗舰档位所在之处。
我应该如何为视频流水线定价?
取决于模型的计费单位。视频读取模型按 token 计费,和任何聊天模型一样。本榜单上的视频生成模型按输出时长每秒计费(MiniMax H3:768P 下 $0.08,2K 下 $0.13),或按源视频每分钟计费(OrcaDub 1.0:$0.60)。把这两种单位混进同一个估算里,是视频预算算错最常见的原因。
值得记住的一句话
关于Claude Opus 5.5,有趣之处并不在于它是多模态的。榜单上大多数都是。有趣之处在于,它的模态分界线落在了一个不寻常的位置——输入文档和静态图像,输出文本,任何方向都没有视频——而让它声名鹊起的演示却是视频。这两个事实并不冲突,而把它们解读为冲突,才会让代码生成视频的故事令人费解。模型编写渲染器;渲染器制作影片。能交给模型的是脚本、一份文档和一张截图。

以上所有内容均为 2026-09-29 的 OrcaRouter 目录快照及其中的模态声明。厂商规格会变动,模型卡上的模态列表是你在依据某个数字开展工作之前最应先复核的内容。如果这里的某项说法对你的决策有影响,请打开该模型页面——相关字段就在上面。
