一張生成的英雄標題卡,寫著「一份簡報,兩個模型,一支旁白影片」,分成兩欄。左欄標題為 Claude Opus 5.5,內容寫著:撰寫腳本;2026 年 9 月 22 日發布;每百萬個 token 輸入 4.00 美元、輸出 20.00 美元。右欄標題為 Gemini 3.8 Flash TTS,內容寫著:朗讀腳本;2026 年 9 月 22 日正式開放使用;每百萬個音訊 token 9.00 美元。頁腳寫著:一段 5 分 51 秒的渲染約為 8,775 個音訊 token,大約是 8 美分的旁白費用。
Guides & Insights

Claude Opus 5.5 與 Gemini 3.8 Flash TTS 製作了一支旁白新聞影片:簡報、兩份價目表,以及語音要價多少

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩個模型、兩家廠商、一支完成的影片,還有一段短到可以直接貼進聊天框的提示詞。2026 年 10 月 2 日,中文 AI 作家寶玉(X/@dotey)發布了同一則八卦彙整的兩支成品——一支英文、一支中文——並表示兩者都是由 Claude Opus 5.5從頭到尾製作完成,它自己找素材、自己寫旁白,聲音則由 Gemini 3.8 Flash TTS提供,用的是作者自己提供的 API 金鑰。這兩個模型都不新:Anthropic 於 2026 年 9 月 22 日推出 Claude Opus 5.5,而 Google 的發行說明也把 Gemini 3.8 文字轉語音模型標在同樣這一天。真正只有幾天歷史的是它的包裝——也就是那份製作人簡報本身,以及 9 月 30 日至 10 月 3 日之間建立的一連串儲存庫,它們把那份簡報變成一個可以安裝的 Claude Code 技能。這是一篇談工作流程的文章,而不是談某次發布。

簡報實際上具體規定了什麼

這個模板是一句帶有三個插槽的句子。將它從原始中文翻譯成英文後,讀起來是:幫我做一支關於 {topic} 的八卦影片(補充資料:{links/screenshots, optional};去識別化版本:移除 {person's name},選填)。這個格式所有有趣的地方都藏在三個插槽裡,因為這麼簡短的簡報之所以能被交辦,前提是接收者不必被交代就能做三件事:自己找到素材來源、判斷故事是什麼,以及交回完成的成品,而不是一份計畫。

主題是一個自由文字字串,所以模型是在做編輯取捨——什麼算得上是這則故事、要納入哪些段落、它們以什麼順序排列。這與摘要截然不同,而且是整條流程中操作者最難掌控的部分。選用的補充素材則是逃生出口:貼上連結或截圖,模型就會依據固定來源作業,而不是去搜尋,這正是可重現的算圖與每次執行都產出不同影片之間的差別。第三個欄位「去敏」值得細細斟酌,我們之後會再回到這一點。

把這份簡報當成規格來讀,它就會告訴你它對測試框架做了哪些假設。它假設模型能觸及外部世界——探索步驟是委派出去的,而非被描述出來的——而模型能觸及什麼,取決於操作者掛載了哪些工具,而非 Claude Opus 5.5 本身。它假設有一套影像或渲染堆疊,因為交付的產出物是影片,而 Claude Opus 5.5 不會輸出影片。它還假設有一個聲音。

勞動分工就是整個故事。

最後那個假設是這套工作流程的結構性事實。我們自己目錄中 anthropic/claude-opus-5.5 的條目,將其輸入模態列為文字、圖像與檔案,輸出模態則列為文字——只有一種輸出模態。這個模型無法合成語音,也無法在音軌產生之後聽見它。因此,以這種方式製作的每一支旁白影片,至少都有兩個模型相依項目,各自有兩份價目表、兩家供應商與兩組憑證,而第二組必須由人提供。Opus 5.5 能撰寫腳本、串接算圖流程;它無法開設 Google 帳號或配置金鑰。10 月 2 日那篇貼文的作者正是這麼說的:Gemini 金鑰是他提供的。

這道限制還有第二道刃口,直到你真正出貨前都很容易忽略。由於 Claude Opus 5.5 不接受音訊輸入,撰寫旁白的那個模型無法檢查旁白。唸錯的名字、奇怪的輕重音、合成器唸得平淡無味的一句話——這些都傳不到撰寫它的模型那裡。語音的品質控管,每一次都得靠人耳聆聽輸出,而無論腳本多好,正是這一步讓它無法成為完全無人值守的流程。當模型自己的輸出是一支程式時,審查是「聽」,而不是「比對差異」。

A screenshot of Google's Gemini API documentation for the Gemini 3.8 Flash TTS model, captured in English on 3 October 2026, showing the model identifier gemini-3.8-flash-tts, the studio-grade voice fidelity and long-form multi-turn stability description, voice design and voice replication support, and a supported-languages count of over 130 languages.

語音的成本——而它並不是昂貴的部分

Google 的定價頁面公布了讓這套算術變得簡潔的換算關係:音訊 token 對應每秒輸出 25 個 token。10 月 2 日貼文中的兩次渲染分別執行 351 秒與 332 秒——這是從該推文自身的媒體中繼資料讀取而來——大約是 5 分 51 秒與 5 分 32 秒。以每秒 25 個 token 計算,分別是 8,775 與 8,300 個音訊 token;而依照目前 Flash TTS 音訊價格每百萬個 token 9.00 美元,這相當於每支影片約 8 美分的旁白,兩個語言版本合計則約 15 美分。

把這點和同一項工作的推理端放在一起看。Claude Opus 5.5 的牌價是每百萬個輸入 token 4 美元、每百萬個輸出 token 20 美元,思考 token 以輸出計費,快取讀取則是每百萬個 0.20 美元。一支六分鐘影片的旁白,對比模型花在判斷故事是什麼、閱讀來源、寫出配音所唸腳本的 token,不過是四捨五入的誤差。實際結論並不是「TTS 很便宜」——而是在這條流程裡,聲音是你唯一不必最佳化的支出項目,力氣應該花在真正吃掉成本的那一部分。

兩項費率表細節將會改變這項計算,因此請現在就針對它們預先規劃:

• 促銷期結束——Flash TTS 標準版在 2026 年 12 月 31 日前,每百萬輸入文字 token 為 0.50 美元,每百萬輸出音訊 token 為 9.00 美元,之後則為 1.00 美元與 18.00 美元。同一部影片的旁白在一月將花費約 16 美分,正好是兩倍。

• 有一個更便宜的層級,但伴隨實質取捨——Gemini 3.8 Flash-Lite TTS 在相同計費時程下收費 $0.50 與 $6.00,之後調升至 $1.00 與 $12.00,涵蓋 101 種語言,而 Flash TTS 則涵蓋 130 種。對於英語單人旁白的解說內容,Lite 的音訊費率是三分之二,語言上限無關緊要;但對於 10 月 2 日貼文中的雙語渲染,這點並非顯而易見地無關緊要,而這正是分層方案要你做出的決定。

Google 的 Batch 與 Flex 級別是輸入每百萬 token $0.25、輸出 $4.50,而 Priority 則是 $0.90 與 $16.20——如果你的算圖是排隊處理而非即時互動,這點值得留意,因為八卦總整理這種東西,根本不需要即時拿到答案。

A two-column rate-card panel titled The voice versus the reasoner. The left column, Gemini 3.8 Flash TTS, reads: text input 0.50 dollars per million through 31 December 2026 then 1.00; audio output 9.00 dollars per million through 31 December 2026 then 18.00; metering 25 audio tokens per second of speech; six-minute narration about 8 cents today, about 16 cents from 1 January 2027. The right column, Claude Opus 5.5, reads: input 4.00 dollars per million; output 20.00 dollars per million with thinking billed as output; cache reads 0.20 dollars per million; output modality text only, so it cannot hear the track it commissioned. A footer line reads: Google and Anthropic published rates, read 3 October 2026, vendor-reported.

這週,簡報變成了一項技能

推文裡的提示詞是一種示範;儲存庫則是你真的可以安裝的東西。圍繞這個格式出現的那些儲存庫,才是真正落在過去七天內的部分,值得分開來讀,而不是把它們當成一組來讀,因為每一個都對管線有多少部分該固定在程式碼裡,下了不同的賭注。

• hoangduong92/idea-to-film-skill——建立於 2026 年 9 月 30 日,採用 MIT 授權,是與 10 月 2 日那則貼文最相符的專案:一個 Claude Code 技能,能把一個構想變成附旁白的短片 MP4,包含以程式碼繪製的動畫、音樂、音效、Gemini TTS 語音與字幕。語音在說明中具名揭露,這正是發布這類專案最誠實的做法:第二家供應商是公開宣告的相依項目,而非隱藏起來的。

• samuelstroschein/opus-video-generator——於10月2日建立,採MIT授權,而且在憑證方面立場最為鮮明:它透過npx執行,讓你在自己的Claude訂閱上於瀏覽器中製作發布影片。這對上述關鍵問題給出了不同的答案——讓人類既有的權益持續參與其中,而不是為代理程式鑄造新的API金鑰。

• makevoid/motion-graphics-music-video-skill-noimage — 於 10 月 2 日建立,採 MIT 授權,而它有一項值得效法的自律:它在自身的說明中表明不使用任何圖像模型、也不使用任何影片模型,而是從一條音樂軌與一段提示詞產出動態圖像。當唯一的生成步驟就是程式碼時,輸出便可重現,而且成品中每一項素材的授權都任由你自行推敲。

• RohanRatwani/explainer-video-opus-5.5 — 建立於 10 月 2 日,採用 MIT 授權,鎖定的是 16:9 與 Shorts 的講解影片,而非八卦彙整,並且明確點出時間軸問題:每個動畫都依照旁白計時。這個排序很重要,因為這代表音訊會先渲染完成,之後才放置視覺元素。

• zhuyansen/awesome-opus-5.5-video —— 於 9 月 27 日建立,未宣告授權條款,且以 67 顆星成為這批專案中最受矚目的一個,其餘的則只有個位數甚至掛零。它是索引而非工具,提供英文與中文版本,而它的存在本身就是個有用的訊號,反映出這股關注的樣貌:人們最先想要的是一份他人宣稱已做出成果的目錄,工具則隨之而來。

這些都不是穩定的相依項目。它們才問世幾天、只有單一作者,而它們的授權條款是唯一擋在你和一段你無法使用的影片素材之間的障礙。但方向才是重點:推文裡的提示詞是原型,而儲存庫裡的技能才是團隊真正會採用的東西。

兩種語言版本,同一個故事

10月2日的貼文刻意做成雙語——同一主題的英文版本與中文版本。對一個示範來說,這很不尋常,也揭露了這種格式某個真實的一面:八卦不是靠翻譯來傳播的。在某個市場能讓一則八卦撐起來的關鍵元素(誰對誰說了什麼、發布了哪種否認、時間線長什麼樣子),未必是另一個市場能讓它撐起來的關鍵元素,所以第二個版本是帶著不同編輯判斷的改寫,而不是一次翻譯。真正能轉移過去的是骨架:同樣的故事結構、同樣的渲染堆疊、同樣的聲音。

成本上的結果影響不大,但方向是對的。根據上述的計算,新增第二種語言大約只多花八美分的音訊成本,而這則報導模型已經研究過一次。當流程中昂貴的部分是推理,而便宜的部分是輸出時,用另一種語言產出第二個版本幾乎不花成本——這正是主張應將在地化視為工作流程的一級輸出,而非獨立專案的理由。

去識別化是編輯,而非刪除

簡報中的第三個欄位,是最應該讓你慢下來的那一個。去敏——de-sensitise,也就是移除具名人物後去識別化的版本——被列為可選參數,彷彿刪掉一個名字只是你打開的一個篩選器。並不是。一則關於可辨識事件的八卦彙整,即便移除了名字,通常仍然是在講那個人:讀者會從脈絡中自行補上名字,而從標題到縮圖的一切都可能帶著足以辨識身分的資訊。抽掉那個字串,會改變影片宣稱自己在講什麼,卻不會改變它在講誰;而如果你移除名字的理由是法律或名譽方面的,那麼那個字串並不是造成曝險的部分。

對任何推出這種格式的人來說,有兩件事隨之而來。第一,註明來源的責任不會因為主播是合成的就從你身上轉移:一份取材自他人報導的生成式彙整,同樣承接說明這些報導來源的義務,而10月2日貼文中的簡報根本沒有來源欄位——這是操作者必須手動補上的缺口。第二,成品確實是合成的,而除非你告訴聽眾,否則他們不會知道。標註只是一行文字,卻決定了它是示範,還是會讓觀眾誤解自己正在觀看什麼的內容。如果你希望參數承擔這份責任,就把揭露聲明放進簡報,並把它當成不可省略的項目,就像語音的供應商應該被具名,而不是被隱藏。

The OrcaRouter model page for anthropic/claude-opus-5.5, captured in English on 3 October 2026, showing a 1,000,000-token context window, 128,000-token maximum output, text, image and file input with text output, a release date of 22 September 2026, capability chips for vision, tools, JSON and reasoning, and pricing of 4.00 dollars per million input tokens and 20.00 dollars per million output tokens.

在單一金鑰上執行它,以及它尚未涵蓋的那一個金鑰

如果你正在打造這條管線,整合成本並不在於模型呼叫,而是在於第二組憑證。Claude Opus 5.5 現在就能以anthropic/claude-opus-5.5 進行路由,採用 Anthropic 自家的定價,每百萬個 token 為 $4 與 $20,並以 0% 加價原價轉手,因此供應商的價格一有變動,當天就會反映到你的帳單上,而不是等到下一次合約檢視。將它與你其餘的技術堆疊一起透過單一 OpenAI 相容端點進行路由,正是省下第二套 SDK 的關鍵,而自動容錯移轉則讓你可以在內部渲染上試用較新或尚未經過充分驗證的模型,而不必把正式環境路徑押在它後面。

誠實的界線在於語音。Google 的 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 端點目前不在我們的目錄中——公開模型 API 對 google/gemini-3.8-flash-tts 回傳 not-found——因此 10 月 2 日文章中的工作流程確實需要作者自己的 Google 金鑰,而這是真實的限制,不是我們能隨手帶過的暫時性問題。我們確實有提供的 TTS 端點,是較舊的 google/gemini-3.1-flash-tts-preview,輸入每百萬文字 token 收費 $1.00,輸出每百萬音訊 token 收費 $20.00:可用於相同形狀的管線,價格反映較舊世代,且不是這套工作流程所依據的模型。請在知情的情況下選擇你的路徑——一把金鑰給推理器、第二把給語音,或一把金鑰搭配較舊的 TTS。

看什麼

會讓這種格式變得無聊——而且是好的那種無聊——的關鍵,在於產出模型上要有音訊模態。在 Claude Opus 5.5——或任何取代它的東西——能夠聽見自己委製的曲目並加以調整之前,人聲仍是一個需要人工審核的步驟,而這些流程管線也仍是靠架構本身、而非靠政策,才維持人在迴路之中。接下來兩週,請盯著技能儲存庫,而不是那些示範:能存活下來的,會是那些公開聲明其供應商、附上授權條款,並且讓你以同一份簡報重跑、得到同一支影片的儲存庫。10 月 2 日那篇文章裡的提示詞,屆時看起來會像是簡單的部分,因為它本來就是。

對於已經擁有自身素材與腳本的流程,請自行試算你自己的數字,而不是從 X 借用一個:以每秒 25 個 token 計算,每分鐘完成的旁白是 1,500 個音訊 token,以今日 Flash TTS 費率約為 1.35 美分——在你把製作檔期投入合成主持人之前,這個數字可以對照價目表查核。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新