一张生成的主视觉标题卡,上面写着“一份简报,两个模型,一段旁白视频”,分为两栏。左栏标题为 Claude Opus 5.5,内容为:撰写脚本;于2026年9月22日发布;每百万 token 输入 4.00 美元、输出 20.00 美元。右栏标题为 Gemini 3.8 Flash TTS,内容为:将其朗读出来;2026年9月22日正式可用;每百万音频 token 9.00 美元。页脚一行写着:一段 5 分 51 秒的渲染约为 8,775 个音频 token,旁白费用约为 8 美分。
Guides & Insights

Claude Opus 5.5 与 Gemini 3.8 Flash TTS 生成了一条带旁白的新闻视频:简报、两张费率卡,以及语音的成本

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

两个模型、两家厂商、一条成品视频,外加一段短到可以直接粘贴进聊天框的提示词。2026年10月2日,中文AI作者宝玉(X/@dotey)发布了同一份八卦合集的两种渲染版本——一版英文、一版中文——并表示两者都是由Claude Opus 5.5端到端制作的:它自己找素材、自己写旁白,配音则由Gemini 3.8 Flash TTS提供,用的是作者自备的API密钥。这两个模型都不新:Anthropic于2026年9月22日发布了Claude Opus 5.5,Google的发布说明也把Gemini 3.8文本转语音模型的日期定在同一天。真正只有几天历史的,是这套打包方式——制片人简报本身,以及9月30日至10月3日之间创建的一批仓库,它们把那份简报变成可安装的Claude Code技能。本文讲的是工作流,而不是某场发布。

简报实际规定的内容

这个模板只有一句话,里面有三个空位。它从中文原文译成英文后,是这样的:给我做一个关于{topic}的八卦视频(补充材料:{链接/截图,可选};脱敏版本:去掉{人名},可选)。这个格式中所有有意思的地方,都藏在这三个空位里,因为一份如此简短的委托,只有在接收方无需被交代就能做到三件事时,才是可交办的:自己找到素材、自行判断故事是什么,并交回一个成品,而不是一份计划。

主题是一段自由文本字符串,所以模型做的是编辑取舍——什么算作故事、要纳入哪些节拍、它们按什么顺序排列。这与摘要生成是两回事,而且这是整条流水线中人类最难以控制的部分。补充材料就是那个逃生出口:粘贴一个链接或截图,模型就基于固定来源来工作,而不是去搜索,这决定了你得到的是可复现的渲染,还是每次运行都不同的一条视频。第三个槽位,去敏,是值得细想的那个,我们稍后会回到它。

把这份简报当作规格说明来读,它就会告诉你它对测试框架作了哪些假设。它假设模型能够触及外部世界——发现这一步是被委托出去的,而非被描述出来的——而模型能触及什么,取决于操作者挂载了哪些工具,而非 Claude Opus 5.5 本身。它假设存在图像或渲染技术栈,因为交付的成品是视频,而 Claude Opus 5.5 并不输出视频。它还假设有一个声音。

分工才是关键。

那个最后的假设是这套工作流的结构性事实。我们自己关于 anthropic/claude-opus-5.5 的目录条目把它的输入模态列为文本、图像和文件,输出模态列为文本——只有一种输出模态。该模型无法合成语音,也无法在音轨生成后听到它。因此,用这种方式制作的每一支旁白视频都至少依赖两个模型,也就意味着两张价目表、两家供应商和两套凭证,而第二套必须由人来提供。Opus 5.5 能写脚本、能接通渲染;它没法注册一个 Google 账号,也没法申请一个密钥。10 月 2 日那篇帖子的作者正是这么说的:那个 Gemini 密钥是他的。

这个约束还有第二个容易被忽视、直到上线才会暴露的问题。由于 Claude Opus 5.5 不接受音频输入,写旁白的模型无法检查旁白本身。名字读错、重音怪异、合成器把一句话念得平平无奇——这些都不会传回给撰写它的模型。对语音的质量把控,每一次都是靠人去听输出结果,而正是这一步,使得无论稿子写得多好,这条流水线都无法做到完全无人值守。当模型自己的输出是一段程序时,审查方式是做差异比对;而当输出是语音时,审查方式是去听。

A screenshot of Google's Gemini API documentation for the Gemini 3.8 Flash TTS model, captured in English on 3 October 2026, showing the model identifier gemini-3.8-flash-tts, the studio-grade voice fidelity and long-form multi-turn stability description, voice design and voice replication support, and a supported-languages count of over 130 languages.

语音的成本——而这并不是昂贵的部分

Google 的定价页面公布了让这笔算术变得清晰的换算关系:音频 token 对应每秒输出 25 个 token。10 月 2 日帖子中的两段渲染时长分别为 351 秒和 332 秒,读取自推文自身的媒体元数据——大约是 5 分 51 秒和 5 分 32 秒。按每秒 25 个 token 计算,这分别是 8,775 和 8,300 个音频 token;而按当前 Flash TTS 音频价格每百万 token 9.00 美元计算,也就是每个视频约 8 美分的旁白,两个语言版本合计约 15 美分。

把它放在同一项工作的推理侧旁边来看。Claude Opus 5.5 的标价是每百万输入 token 4 美元、每百万输出 20 美元,其中思考 token 按输出计费,缓存读取为每百万 0.20 美元。一段六分钟视频的旁白,相对于模型为判断故事是什么、阅读来源并写出配音所读的脚本而消耗的 token 来说,不过是个舍入误差。实际的结论并不是“TTS 很便宜”——而是在这条流水线里,语音是唯一一项你不必去优化的支出,精力应该放在真正花掉美元的那一部分上。

费率卡上的两个细节会改变这一计算,因此现在就要针对它们制定计划:

• 促销窗口即将关闭——Flash TTS 标准价为每百万输入文本 token 0.50 美元,每百万输出音频 token 9.00 美元,优惠持续至 2026 年 12 月 31 日,之后分别为 1.00 美元和 18.00 美元。同一视频的旁白在 1 月份的费用约为 16 美分,正好翻倍。

• 还有一个更便宜的档位,代价也实实在在——Gemini 3.8 Flash-Lite TTS 按同样的计费周期分别收取 $0.50 和 $6.00,之后涨至 $1.00 和 $12.00,覆盖 101 种语言;而 Flash TTS 覆盖 130 种。对于英语单人解说的讲解视频,Lite 的音频费率只有三分之二,语言上限也无关紧要;但对于 10 月 2 日那篇帖子里的双语渲染,它显然并非无关紧要——这正是档位划分要你做出的抉择。

Google 的批处理和 Flex 层级价格为输入 $0.25、输出 $4.50,而 Priority 层级为 $0.90 和 $16.20——如果你的渲染任务是排队执行而不是交互式执行,这就值得了解,因为八卦综述这类内容并不需要实时得到答案。

A two-column rate-card panel titled The voice versus the reasoner. The left column, Gemini 3.8 Flash TTS, reads: text input 0.50 dollars per million through 31 December 2026 then 1.00; audio output 9.00 dollars per million through 31 December 2026 then 18.00; metering 25 audio tokens per second of speech; six-minute narration about 8 cents today, about 16 cents from 1 January 2027. The right column, Claude Opus 5.5, reads: input 4.00 dollars per million; output 20.00 dollars per million with thinking billed as output; cache reads 0.20 dollars per million; output modality text only, so it cannot hear the track it commissioned. A footer line reads: Google and Anthropic published rates, read 3 October 2026, vendor-reported.

这周,简报变成了一项技能

一条推文里的提示词只是一种演示;而一个代码仓库是你真正可以安装的东西。围绕这一形式出现的那些仓库,才是真正属于过去七天里的部分;它们值得被逐个阅读,而不是当作一个集合来看,因为每一个都对“流水线中有多少环节应当固化在代码里”押下了不同的赌注。

• hoangduong92/idea-to-film-skill —— 创建于 2026 年 9 月 30 日,采用 MIT 许可证,是与 10 月 2 日那篇帖子最为匹配的项目:一个 Claude Code 技能,可将一个想法变成带旁白的短片 MP4,配有代码绘制的动画、音乐、音效、Gemini TTS 语音和字幕。语音的名称在描述中明确写出,这正是发布它的诚实做法:第二个供应商是公开声明的依赖项,而非隐藏的依赖项。

samstroschein/opus-video-generator 创建于 10 月 2 日,采用 MIT 许可证,在凭据问题上也最有主见:它让你在自己的环境里生成视频,直接运行 npx。这是对上述关键问题的另一种回答——让人类已有的授权继续留在流程中,而不是为智能体新铸一个 API 密钥。

• makevoid/motion-graphics-music-video-skill-noimage — 创建于10月2日,采用MIT许可,而且它的那种自律值得效仿:它在自己的描述中声明,不使用任何图像模型,也不使用任何视频模型,仅凭一段音乐音轨和一条提示词生成动态图形。当唯一的生成步骤是代码时,输出便是可复现的,成品中每一项素材的许可也都由你自己来斟酌判断。

• RohanRatwani/explainer-video-opus-5.5——创建于10月2日,采用 MIT 许可,面向的是 16:9 与 Shorts 形式的解说视频,而非八卦盘点,并且它明确点出了时序问题:每个动画都按旁白来计时。这一先后顺序很关键,因为它意味着音频先渲染完成,画面随后才被放置。

• zhuyansen/awesome-opus-5.5-video — 创建于9月27日,未声明许可证,以67颗星成为该组中关注度遥遥领先的项目,其余项目的星数则停留在个位数或为零。它是一个索引而非工具,提供中英双语,其存在为这种关注形态提供了有用的信号:人们首先想要的是一份他人声称已做出成果的目录,而工具则随之而来。

这些都不是稳定的依赖项。它们才诞生几天,都是单一作者的作品,而它们的许可条款,是唯一挡在你和一段你无法使用的素材之间的东西。但方向才是重点:推文里的提示词是原型,而仓库里的技能,才是团队真正会采用的东西。

两个语言版本,同一个故事

10月2日的那篇帖子是刻意做成双语的——同一主题的英文版本和中文版本。对一份演示来说,这很不寻常,也暴露出这种格式的一个真实特点:八卦并不靠翻译传播。在一个市场里撑起一则故事的节拍(谁对谁说了什么、发布了哪项否认、时间线长什么样),并不是在另一个市场里撑起它的节拍,所以第二个版本是带着不同编辑判断的改写,而不是一道翻译工序。真正能迁移过去的是骨架:同样的故事结构、同样的渲染栈、同样的口吻。

成本上的代价很小,而且方向是对的。按照上面的算术,增加第二种语言只会带来大约八美分的额外音频开销,而这篇报道模型已经研究过一次了。当一条流水线中昂贵的部分是推理、廉价的部分是输出时,用另一种语言生成第二个版本几乎不花什么成本——这就为把本地化视为工作流的一等产出、而不是一个单独的项目提供了理由。

去标识化是一种编辑,而不是删除。

简报中的第三个空位是应当让你慢下来的那个。去敏——de-sensitise,即移除具名个人的去标识化版本——被作为一个可选参数提供,仿佛删除一个名字是你打开的一个筛选器。事实并非如此。一篇关于可识别事件的八卦综述,即便去掉了名字,通常仍然是在讲那个人:读者会从语境中补出名字,而从标题到缩略图的一切都可能带有识别信息。剥离那个字符串改变的是视频声称自己在讲什么,而不改变它在讲谁;如果你剥离名字的理由是法律或声誉方面的,那么那个字符串并不是正在造成风险暴露的部分。

对于任何要交付这种格式的人来说,有两点随之而来。第一,来源标注的责任并不会因为主播是合成的就从你身上转移走:一篇从他人报道中读取内容的生成式综述,继承了说明这些报道来源的义务,而10月2日那篇帖子里的简报根本没有为来源标注留出位置——这是运营者必须手动填补的缺口。第二,这件成品确实是合成的,除非你告诉听众,否则他们并不会知道。一个标注不过是一行文字,却是演示与让观众对自己所看内容产生误解的内容之间的分界线。如果你希望这些参数承担那份分量,就把披露写进简报,并把它当作不可省略的一项,就像声音的供应商应当被点名,而不是被隐藏。

The OrcaRouter model page for anthropic/claude-opus-5.5, captured in English on 3 October 2026, showing a 1,000,000-token context window, 128,000-token maximum output, text, image and file input with text output, a release date of 22 September 2026, capability chips for vision, tools, JSON and reasoning, and pricing of 4.00 dollars per million input tokens and 20.00 dollars per million output tokens.

在一个键上运行它,以及它尚未覆盖的那个键

如果你正在构建这条流水线,集成成本并不在于模型调用——而在于第二个凭证。Claude Opus 5.5 如今即可作为 anthropic/claude-opus-5.5 进行路由,按 Anthropic 自身的标价每百万 token 4 美元和 20 美元计费,以 0% 加价原样透传,因此供应商的价格变动当天就会传导到你的账单上,而不必等到下一次合同评审。将其与你技术栈中的其他部分一起通过同一个 OpenAI 兼容端点进行路由,正是省去第二个 SDK 的关键,而自动故障转移则让你能在内部渲染中试用更新或尚未充分验证的模型,而不必让生产路径受其牵累。

诚实的边界在于语音。Google 的 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 端点目前不在我们的目录中——公开模型 API 对 google/gemini-3.8-flash-tts 返回 not-found——因此 10 月 2 日那篇帖子中的工作流确实需要作者自己的 Google 密钥,这是一个实实在在的限制,而不是我们可以随手指出的临时问题。我们确实提供的 TTS 端点是较旧的 google/gemini-3.1-flash-tts-preview,输入文本 token 每百万 $1.00,输出音频 token 每百万 $20.00:可用于同样的流水线形态,按较旧一代定价,而且并不是这个工作流所基于的模型。请知情地选择你的路径——一把密钥给推理模型、第二把给语音,或者一把密钥加较旧的 TTS。

看什么

让这种格式变得无聊——褒义上的无聊——的关键,是生成模型上具备音频模态。在 Claude Opus 5.5——或者取代它的任何东西——能够听到自己委托生成的曲目并据此调整之前,人声始终是一个需要人工审核的环节,而这些流水线在设计上就处在人在环中,而不是靠政策规定。未来两周,请关注技能仓库,而不是那些演示:能活下来的,将是那些声明自家供应商、附带许可证、并让你用同一份简报重跑就能得到同一段视频的仓库。10 月 2 日那篇帖子里的提示词,日后看来会像是最简单的部分,因为它本来就是。

对于已经拥有自己的素材和脚本的流水线,请自行计算你的数字,而不是从 X 借用:按每秒 25 个 token 计算,每分钟成品旁白是 1,500 个音频 token,按当前 Flash TTS 费率约为 1.35 美分——在把制作档期交给合成主播之前,你可以对照费率卡核实这个数字。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新