标题卡写着“Claude Opus 5.5:一次点击实际渲染出什么”,副标题为“宣传视频并非生成所得。它背后的流水线可以安装。”,页脚写着“价格以 Anthropic 为准;指数数据以 Artificial Analysis 为准。”
Engineering & Research

Claude Opus 5.5撰写了一部产品发布视频:“一键”实际渲染出什么

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

X 上 2026 年 9 月 24 日的一篇帖子称,Claude Opus 5.5 为一款名为 CodePilot 的产品制作了一支宣传片,一键生成,而且成品碾压 GPT-6 Astra——也就是厂商 9 月 4 日发布的那个模型。帖子出自归藏(op7418),一位产品设计师,他的技能仓库已悄然成为自成一体的分发渠道;而比这支片子更重要的细节,是结尾的那句话:这套工作流正被并入一个名为 guizang-product-video-skill 的公开仓库,任何人都能把它安装进 Claude Code 或 Codex。所以真正有用的问题不是这支宣传片好不好看——演示的观感只是单一来源的说法,无论真假都无法证伪——而是那个仓库实际交付了什么、运行成本是多少,以及它的许可证允许你拿它生成的视频做什么。

简短回答,而这也正是那些转发帖略去的部分。Claude Opus 5.5 并不生成视频。它会写一个程序来渲染视频,然后由 ffmpeg 对你机器生成的帧进行编码。那条流水线中有价值的产物不是 MP4 文件,而是围绕它的一整套提示并验证的工作流,而这恰恰就是如今可安装的东西。

演示不再是演示了,而这才是真正的新闻。

Claude Opus 5.5于2026年9月22日发布,定价为每百万输入token 4美元、每百万输出token 20美元,配备100万token的上下文窗口,输出上限最高可达128K token。它问世仅三天便已正式可用,因此这不是一篇爆料文章:该模型真实存在、已有定价且可路由调用,没有什么发布信息可供猜测。信号中真正的新意在于其包装方式。

这个演示背后的仓库有一个可核实的形态。它于 2026 年 9 月 18 日公开,最近一次提交落地于 9 月 22 日——正是 Claude Opus 5.5 发布的那一天——截至本文撰写时,它在 AGPL-3.0 许可下拥有 261 个星标和 23 个复刻,并另有一条商业许可路径。这些日期才是关键。一篇一次性的演示文章只配让人耸耸肩;而一个把该技术固化为六个编号步骤、八份参考文档和五个脚本的仓库,却是读者今天下午就能装起来的东西。传播比产物本身更重要,因为产物本来就会好看,而工作流才是你真正能借走的东西。

作者本人的表述对这套东西的来历并不讳言。README 里说,这项技能是他在制作 CodePilot 影片的过程中打磨出来的流程,特意写下来,是为了能复用到其他产品上。介绍影片同样没有随安装包一起分发——上传视频的链接本该出现的地方,README 只留了一句占位注释,而从影片中截取的静帧则躺在仓库的 readme 资源目录里。这是件小事,却也颇能说明问题:真正交付出去的是方法,而不是影像素材。

这项技能实际产出的内容,逐步说明

这个工作流分为六个阶段,而它们的形态就揭示了这是什么样的工具:

• 范围优先——产品、版本范围、受众、平台、宽高比、语言和风格在开始任何制作之前就已确认,并且所选范围会写入计划文件,这样交付的影片就不会悄悄声称覆盖整个产品。

• 先有真实内容 —— 智能体会读取代码仓库和发布说明,核实哪些功能是真正已交付而非只是对外宣称的,并在进行任何样式处理之前先接好一个真实的产品组件。

• 第三,故事板和文案——值得讲述的变化被转化为镜头列表,字幕以简洁句子写成,关键帧在动画开始前渲染以供审核。

• 第四项:动效 —— 一条可任意定位的主时间轴驱动组件状态、入场、转场与细节镜头。

• 声音第五——配乐是针对这部特定影片用代码合成的,音效与画面动作对齐,音乐在重要提示音下被压低。

• 最后是验证——检查构图、字体、图像、标志、音频同步和最终文件,项目还会区分哪些是机器已验证的,哪些仍需人工用眼和耳来确认。

仓库所提供的内容异常明确,而明确的版本比摘要更有用。其 references/ 目录包含八份文档——上手引导、仓库与风格、组件流水线、故事与文案、音频来源、音频与 QA、入门指南和案例研究——其 scripts/ 目录包含五份:环境检查、项目初始化、音效合成、音频混音以及一个针对完成影片运行的交付检查。入门项目是一个运行中的示例,tests/ 则同时包含脚本回归测试和组件集成测试。依赖列表同样具体:Node 22 或更新版本、Python 3.9 或更新版本、FFmpeg 和 ffprobe、用于浏览器渲染流水线的 Playwright Chromium,以及你自己的产品仓库及其依赖项。该列表中没有任何一项是视频服务,而这正是整个设计所依赖的设计选择。

Single-column scoreboard card titled "Claude Opus 5.5 - the scoreboard" listing Released: 22 September 2026; Price in / out: $4.00 / $20.00; Cached input: $0.20; Context: 1,000,000; AA Index, max effort: 58, rank 1 of 210; Output tokens per index task: 260M, rank 95 of 210; footer "Index figures per Artificial Analysis; price and context per Anthropic."

“一键”是作者自己的说法,而他自己写的常见问题解答(FAQ)却与之相矛盾

信号说的是“一键生成”——one-click generated。仓库的 FAQ 直接回答了与之最接近的问题,而答案是:不能。当被问到是否只要给一个仓库地址就能得到一部成片时,README 自己的回答是:有时仍需要下载仓库、补全依赖并确认 demo 状态;这是一个让 AI 逐步完成工作的过程,而不是无视你项目环境的一键转换器。比起那篇谈论他工具的文章,作者对自己工具的表述反而更精确。

工作流本身还有第二道刹车。第一阶段需要做出一个决定,而智能体被明确禁止代表用户做这个决定:影片涵盖哪个版本范围,以及覆盖哪些平台界面。README 的论证值得引用其要旨——仓库历史能告诉你存在哪些版本,却不能告诉你想要宣传的是哪些版本——并且未完成的平台界面必须在交付时声明,这样观众才不会以为影片覆盖了整个产品。这是一个治理步骤,而不是渲染步骤,而且它最清楚地证明,“一键”描述的是作者自己对该工具的顺手程度,而不是工具实际的输入面。

流水线还预设了一种形态,也有一种形态它并不预设。README 直截了当地说明了其默认起点:45 到 60 秒、横屏、中文。时长和宽高比可以调整,但竖版剪辑不是裁剪——取景和文字排版必须重新布局,因为构图一旦失去两侧便无法成立。本文第一段引用了演示自身的说法,因此值得直说:促成它的那部影片是一部中文横屏宣传片;如果你的发布是英文或竖版,请为重新布局留出预算,而不是想当然地认为该技能的第一版产出就是你的交付物。

“一键”这个说法站得住脚的范围更窄,但依然真实:对他已经做好的那个演示而言,影片确实是由单条指令生成的,因为范围、产品和视觉语言早已确定。这才是诚实的解读。提示词只有一条消息;但前期准备不是。

一次渲染的成本,以及为什么“碾压Astra”是错误的衡量维度

帖子中的对比对象是 GPT-6 Astra,于 2026 年 9 月 4 日发布,在输入不超过 272K token 时定价为每百万 token 10 美元和 50 美元,长上下文请求重新定价为 20 美元和 75 美元,快速模式为 20 美元和 100 美元。在两个模型均有测量的唯一一个独立指数上,两者十分接近,排名取决于你更看重什么。

• 智能指数 — Claude Opus 5.5 在最大努力档位下得分 58,在 2026-09-25 查阅的 Artificial Analysis 页面上于 210 个模型中排名第一;相比之下,GPT-6 Astra 在其最高设置下得分为 53,于 210 个模型中排名第六。

• 每项 Index 任务的成本 — GPT-6 Astra 更便宜,为 3.26 美元,而 Claude Opus 5.5 为 5.98 美元。在这一维度上,差距的方向恰好相反。

• 每项 Index 任务的输出 token 数——Claude Opus 5.5 花费 2.6 亿,冗长程度在 210 个中排名第 95;GPT-6 Astra 花费 6000 万,排名第 36。质量上的优势在一定程度上是靠 token 换来的。

那些数据来自 Artificial Analysis,是每个模型标注为“最大努力”(maximum effort)的配置,而非厂商自己的评测。放在一起看,它们传达的信息比一个排名更有用:在公布的指数上,Claude Opus 5.5 是更强的模型,而 GPT-6 Astra 运行一项任务的成本要低得多。声称一方“碾压”另一方,不过是关于某个演示在某一时间点输出的说法,而没有任何指数能在任一方向上支持这个词。

还有第三条成本线,两个索引都没有捕捉到,而正是它决定了值不值得安装一条促销流水线。帧渲染并不是一次模型调用。一段 3,760 帧、每秒 24 帧的渲染,要通过无头 Chromium 在你的硬件上运行,其成本是墙钟时间和电力,而不是 token。API 账单覆盖的是规划、文案、组件接线以及渲染器的源代码。正是这种拆分,才让这项技术总体上负担得起,也正是它让该 Skill 的依赖列表比它的提示词更长。

Artificial Analysis model page for Claude Opus 5.5 in its Adaptive Reasoning, Max Effort, Default Fallback configuration, showing Intelligence rank 1 of 210, Speed 93 of 210, Cost 93 of 210, Verbosity 95 of 210, In $4.00 / Out $20.00, cost per Intelligence Index task $5.98, 260M output tokens per Index task, and 210 models in this class.

许可证是没人会读的那部分,但它却是最具可操作性的章节。

这正是该仓库格外谨慎之处,也是计划将其用于商业用途的读者需要放慢脚步之处。有三种彼此独立的制度适用,而且它们不会合并为一种。

• 主许可证是 AGPL-3.0。工作流、文档、脚本、入门项目和原始音频资源均受其覆盖。复制或分发它们需要保留版权、许可证和声明,而 AGPL-3.0 的网络交互条款意味着,通过网络向用户提供的修改版本必须向这些用户提供相应的源代码。

• 默认视觉样式并不采用 AGPL 许可。从 CodePilot 改编并作为回退样式随附发布的组件和样式,仍受 Business Source License 1.1 及其附加使用授权(Additional Use Grant)与变更日期(Change Date)约束。README 中明确写道,本目录并未重新以 MIT 许可授权,并且任何将其组合在内的项目都不能被描述为仅采用 AGPL 许可,也不能被描述为可不受限制地用于商业用途。

• 生成的视频并不自动适用 AGPL。README 指出,输出内容不会仅仅因为由本工具生成就成为 AGPL 作品——但该输出中任何受保护的组件、素材或代码仍遵循其各自原有的条款。对营销团队而言,这一区分就是整件事的关键:工具的许可与成片的许可,是两个截然不同的问题。

音乐是来源最清晰、许可最明确的部分。随附的乐谱在 {{1}}Python{{/1}} 中由波形、噪声、包络和音符序列合成,时长固定为 48 秒、速度 120 BPM,不使用任何外部采样,也不调用生成式模型;其源码作为改编参考而非固定配乐存放在代码库中,而新影片的默认做法是为该片的故事板用代码编写配乐。这十一个音效由代码库中的一个脚本生成,格式为 48 kHz、单声道、16 位 PCM,每个文件的时长和 SHA-256 哈希值都发布在音频清单中。两组内容均为代码库作者的原创作,因此它们与工作流、文档、脚本和起始项目一样,均受 AGPL-3.0 保护。

差距在于原片使用的内容,而仓库对此处理得当。案例研究坦承,CodePilot 宣传片中的点击、弹出、打字和通知音效是来自某音效网站的素材库录音,单个片段的作者信息和详情页均未保留,并且不会为它们杜撰来源。因此这些录音被排除在安装包之外,并由程序化音效集替换。实际后果是,开箱即得的音频刻意保持朴素,而来源参考会告诉你先搜索素材库,仅对无法填补的类别才回退到内置文件——并提醒你,内置的来源说明并不涵盖你下载来替换它们的任何内容。

靠我们自己的两条腿来运营

对比中的两个模型都在 OrcaRouter 上,所以如果问题是要把流水线指向哪一个,试用并不需要两个账户或重写代码。Claude Opus 5.5 在 OrcaRouter 上按 Anthropic 公布的列表价原样透传,零加价——与 Anthropic 列出的相同 $4/$20 和 $0.20 缓存读取——而 GPT-6 Astra 也以相同条款提供,所以“碾压它”的论点可以在你自己产品的素材上解决,而不是在别人的演示上。一个密钥即可覆盖一个 API 接入 200+ 模型,而自动故障转移意味着一个结果糟糕的实验只会让你重试,而不是付出生产路径的代价。如果你想要这些模型本身,两者都在同一计费下的同一目录中。

OrcaRouter model page for anthropic/claude-opus-5.5 showing input text, image and file modality, vision, tools, JSON and reasoning support, public benchmarks by Anthropic dated 2026-09-22, pricing of $4.00 per 1M input tokens, $20.00 per 1M output tokens and $0.200 per 1M cache reads, and a performance panel with 7.39s p50 time to first token, 131 tokens per second and a 10.3% error rate.

需要关注什么,以及现在要决定什么

有两件事尚未解决,值得关注,而不应想当然。第一是这套工作流能否推广到 React 之外。README 坦言,组件集成的难度因框架而异,React 有可用的示例,而需要服务器、原生运行时或重度上下文的组件可能需要一个适配层。Vue 或 Svelte 团队应当预期要自己编写这一层,而不是直接继承现成的。

第二点是关于可移植到更弱模型的承诺。文章声称,该技能的模式也能让能力较弱的模型产出不错的结果,而这恰恰是公共代码仓库最终能够验证的那类说法:如果质量来自方法本身,那么在更便宜的模型上结果也应站得住脚;如果质量来自模型本身,那么就不会。目前还没有人公布过这种对比,包括作者本人。

今天你能决定的范围更窄,也更有用。如果你有一个由真实组件构成的产品,并且有一次值得对外公布的发布,那么这项技术值得你花上一个下午,而你应该抱持的诚实预期是这样的:模型写渲染器,你的机器绘制帧,ffmpeg 生成文件,而你继承的许可取决于你的影片实际触及三种规则中的哪一种。带着这样的预期,这个代码仓库不会让你失望。带着“一键搞定”的预期,你头一个小时都会花在决定这部影片讲什么上——而这恰恰是工具理应拒绝替你决定的部分。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新