生成されたヒーロータイトルカードには「1つのブリーフ、2つのモデル、1本のナレーション付き動画」と表示され、2つの列に分かれている。左の列は Claude Opus 5.5 という見出しで、次のように書かれている:脚本を書く、2026年9月22日リリース、100万トークンあたり入力4.00ドル、出力20.00ドル。右の列は Gemini 3.8 Flash TTS という見出しで、次のように書かれている:読み上げる、2026年9月22日一般提供開始、100万音声トークンあたり9.00ドル。フッター行には、5分51秒のレンダリングは約8,775音声トークン、ナレーションでおよそ8セント、と書かれている。
Guides & Insights

{{1}}Claude Opus 5.5{{/1}}と{{2}}Gemini 3.8 Flash TTS{{/2}}がナレーション付きニュース動画を制作:その概要、2つの料金表、そして音声にかかるコスト

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2つのモデル、2つのベンダー、1本の完成した動画、そしてチャットボックスに貼り付けられるほど短いプロンプト。2026年10月2日、中国語のAIライター宝玉(X/@dotey)は、同じゴシップまとめの2つのレンダリング — 1つは英語、1つは中国語 — を公開し、どちらも端から端までClaude Opus 5.5が自ら素材を見つけてナレーションを書き、声はGemini 3.8 Flash TTSが著者の提供したAPIキーを使って生成した、と述べた。どちらのモデルも新しいものではない。Anthropicは2026年9月22日にClaude Opus 5.5をリリースし、GoogleのリリースノートはGemini 3.8のテキスト読み上げモデルを同じ日付としている。ほんの数日前のものなのは、そのパッケージングだ — プロデューサーブリーフそのものと、9月30日から10月3日の間に作成された、そのブリーフをインストール可能なClaude Codeスキルに変える一連のリポジトリ。これはローンチについての記事ではなく、ワークフローについての記事だ。

ブリーフが実際に明記していること

このテンプレートは、3つのスロットを備えた1つの文です。元の中国語から英語に訳すと、こうなります:{topic}についてのゴシップ動画を作って(補足資料:{リンク/スクリーンショット、任意}、匿名化版:{人名}を削除、任意)。この形式の面白さはすべて、この3つのスロットに隠れています。これほど短いブリーフは、受け取った側が言われなくても次の3つをこなせるときに初めて、委任できるものになるからです。すなわち、自分で素材を探し出すこと、何がストーリーなのかを決めること、そして計画ではなく完成した成果物を返すことです。

トピックは自由記述の文字列なので、何がストーリーとして成立するか、どの要素を含めるか、どの順番で並べるかといった編集上の選別はモデルが行っている。これは要約とは別の作業であり、パイプラインの中でオペレーターが最も制御しにくい部分だ。任意の補足資料は逃げ道になる。リンクやスクリーンショットを貼り付ければ、モデルは検索する代わりに固定されたソースから作業する。これが、再現可能なレンダリングと、実行するたびに違う動画ができることの違いだ。三つ目のスロットである匿名化は、じっくり考える価値のあるもので、後ほど戻ってくる。

ブリーフを仕様書として読むと、ハーネスについて何を前提としているかがわかる。それは、モデルが外界に到達できることを前提としている——発見のステップは記述されるのではなく委任される——そして、モデルが到達できるものは、Claude Opus 5.5 自体の性質ではなく、オペレーターがマウントするツールの性質である。それは画像またはレンダリングスタックを前提としている。なぜなら、納品される成果物は動画であり、Claude Opus 5.5 は動画を出力しないからである。そして、声を前提としている。

分業こそが物語だ

その最後の前提は、このワークフローの構造上の事実である。私たち自身のカタログにある anthropic/claude-opus-5.5 の項目では、入力モダリティはテキスト、画像、ファイル、出力モダリティはテキストと記載されている — 出力は1モダリティのみだ。このモデルは音声を合成できず、一度生成されたトラックを聴くこともできない。したがって、この方法で作られるナレーション付き動画はすべて、少なくとも2つのモデル依存を抱えることになり、2つの料金表、2つのベンダー、2つの認証情報が必要で、しかも2つ目は人間が用意しなければならない。Opus 5.5 はスクリプトを書き、レンダリングを接続することはできるが、Google アカウントを開設したり、キーを発行したりすることはできない。10月2日の投稿の著者もまさにそう述べている。Gemini のキーは彼自身のものだったのだ。

この制約には、出荷するまで見落としがちなもう一つの側面がある。Claude Opus 5.5 は音声を入力として受け取らないため、ナレーションを書いたモデルはそのナレーションを確認できない。名前の発音ミス、不自然な強調、音声合成エンジンが平坦に読み上げてしまう文——そうしたものはどれも、それを書いたモデルには届かない。音声の品質管理は、毎回、人間が出力を聴くことになる。そして、スクリプトがどれほど優れていても、これが完全な無人パイプラインになるのを防いでいるのは、まさにこのステップだ。モデル自身の出力がプログラムである場合、レビューは diff ではなく、聴くことになる。

A screenshot of Google's Gemini API documentation for the Gemini 3.8 Flash TTS model, captured in English on 3 October 2026, showing the model identifier gemini-3.8-flash-tts, the studio-grade voice fidelity and long-form multi-turn stability description, voice design and voice replication support, and a supported-languages count of over 130 languages.

声のほうは——しかも、そこが高くつく部分ではない

Googleの価格ページは、この計算を明快にする換算を公開している。音声トークンは出力1秒あたり25トークンに相当する。10月2日の投稿にある2つのレンダリングは、ツイート自体のメディアメタデータから読み取ると351秒と332秒、およそ5分51秒と5分32秒だ。1秒あたり25トークンなら、これらは8,775音声トークンと8,300音声トークンになり、現在のFlash TTSの音声料金である100万トークンあたり9.00ドルでは、動画1本あたりナレーション約8セント、両言語版を合わせておよそ15セントになる。

それを、同じ作業の推論側と並べて見てみましょう。Claude Opus 5.5 のリスト料金は、入力100万トークンあたり4ドル、出力100万トークンあたり20ドルで、思考トークンは出力として課金され、キャッシュ読み取りは100万トークンあたり0.20ドルです。6分の動画のナレーションは、モデルが物語とは何かを決め、資料を読み、音声が読むスクリプトを書くために費やすトークンに比べれば、誤差のようなものです。実用的な結論は「TTSは安い」ではありません。このパイプラインでは、音声こそ最適化しなくてよい唯一の費目であり、労力はコストがかかる部分に注ぐべきだということです。

料金表の2つの詳細がその計算を変えるため、今からそれらを踏まえて計画してください:

• プロモーション期間は終了します — Flash TTS standard は、入力テキストトークン100万個あたり0.50ドル、出力音声トークン100万個あたり9.00ドル(2026年12月31日まで)、その後は1.00ドルと18.00ドルです。同じ動画のナレーションは1月には約16セントかかり、ちょうど2倍になります。

• 本当のトレードオフを伴う、より安価なティアがあります — Gemini 3.8 Flash-Lite TTS は同じ料金体系で $0.50 と $6.00 を請求し、$1.00 と $12.00 に上がり、Flash TTS の 130 言語に対して 101 言語をカバーします。英語の単一ナレーターによる解説では、Lite は音声料金が 3 分の 2 で、言語の上限は無関係です。10 月 2 日の投稿にあるバイリンガルレンダリングでは、明らかに無関係とは言えません。それが、このティア分割があなたに求めている判断です。

Google の Batch および Flex ティアは入力 $0.25、出力 $4.50、Priority は $0.90 と $16.20 です — レンダリングがインタラクティブではなくキューに入るなら知っておく価値があります。ゴシップのまとめ記事にリアルタイムの回答など必要ないのですから。

A two-column rate-card panel titled The voice versus the reasoner. The left column, Gemini 3.8 Flash TTS, reads: text input 0.50 dollars per million through 31 December 2026 then 1.00; audio output 9.00 dollars per million through 31 December 2026 then 18.00; metering 25 audio tokens per second of speech; six-minute narration about 8 cents today, about 16 cents from 1 January 2027. The right column, Claude Opus 5.5, reads: input 4.00 dollars per million; output 20.00 dollars per million with thinking billed as output; cache reads 0.20 dollars per million; output modality text only, so it cannot hear the track it commissioned. A footer line reads: Google and Anthropic published rates, read 3 October 2026, vendor-reported.

今週、ブリーフはスキルになった

ツイートの中のプロンプトはデモンストレーションであり、リポジトリはインストールできる代物だ。このフォーマットの周辺に現れたリポジトリ群こそが、本当にこの直近7日間に属する部分であり、それらは一まとまりとしてではなく個別に読む価値がある。というのも、それぞれがパイプラインのどの部分をコードに固定すべきかについて、異なる賭けをしているからだ。

• hoangduong92/idea-to-film-skill — 2026年9月30日作成、MITライセンス、そして10月2日の投稿に最も近い一致:アイデアから、コードで描かれたアニメーション、音楽、効果音、Gemini TTSの音声、字幕を備えたナレーション付き短編映画のMP4を生成するClaude Codeスキル。音声は説明文に明記されており、これが誠実な出し方だ。2番目のベンダーは宣言された依存関係であり、隠された依存関係ではない。

• samuelstroschein/opus-video-generator — 10月2日作成、MITライセンス、そして認証情報について最もこだわりの強いツールです。npx経由で実行され、自分のClaudeサブスクリプションを使ってブラウザ上でローンチ動画を作成します。これは前述の鍵となる問題に対する別の答えです — エージェント用に新しいAPIキーを発行するのではなく、人間がすでに持っている権利をループの中に残しておくのです。

• makevoid/motion-graphics-music-video-skill-noimage — 10月2日作成、MITライセンス、そして真似する価値のある規律を備えたもの:それ自身の説明で、画像モデルも動画モデルも使わず、音楽トラックとプロンプトからモーショングラフィックスを生成すると明言している。唯一の生成ステップがコードであるとき、出力は再現可能で、完成作品内のすべてのアセットのライセンスは自分で判断できる。

• RohanRatwani/explainer-video-opus-5.5 — 10月2日に作成、MITライセンス。ゴシップのまとめではなく、16:9とShortsの解説動画を対象としており、タイミングの問題を明示している。すべてのアニメーションはナレーションに合わせてタイミングが取られている。この順序が重要である。なぜなら、ビジュアルが配置される前に音声がレンダリングされることを意味するからだ。

• zhuyansen/awesome-opus-5.5-video — 9月27日に作成され、ライセンスは宣言されておらず、67スターで群を抜いて最も目立っており、他のものは1桁かゼロである。それはツールというよりインデックスであり、英語と中国語で書かれており、その存在は関心の形についての有用なシグナルである:人々が最初に求めるのは、他人が作ったと主張するもののカタログであり、ツールは後からついてくる。

これらはいずれも安定した依存関係ではない。数日前に登場したばかりで、作者は一人しかおらず、ライセンス条件だけが、あなたが使えない映像素材との間に立ちはだかっている。しかし重要なのは方向性だ。ツイートのプロンプトはプロトタイプであり、リポジトリにあるスキルこそ、チームが実際に採用するものだ。

二つの言語版、一つの物語

10月2日の投稿は意図的にバイリンガルだ——同じトピックの英語版と中国語版。これはデモとしては異例であり、このフォーマットについてのある現実を浮き彫りにする。つまり、ゴシップは翻訳によって伝わるものではないということだ。ある市場でストーリーを成立させる要素(誰が誰に何を言ったか、どの否定がなされたか、タイムラインがどう見えるか)は、別の市場でそれを成立させる要素ではない。だから第二版は、翻訳作業ではなく、異なる編集判断による書き直しなのだ。引き継がれるのは骨格だ。同じストーリー構造、同じレンダリングスタック、同じ声。

コスト面の帰結は、望ましい方向に小さく収まる。上記の計算に従えば、2つ目の言語を追加するコストは、モデルがすでに一度調査した記事に対して約8セント分の追加音声で済む。パイプラインの高コストな部分が推論で、安価な部分が出力であるなら、別の言語で2つ目のバージョンを作ることはほとんど無料に等しい——これは、ローカライズを独立したプロジェクトとしてではなく、ワークフローの第一級の出力として扱うべきだという主張につながる。

非識別化は編集であり、削除ではない

ブリーフの3番目のスロットこそ、手を止めて考えるべきものだ。「去敏」——脱感作、つまり実名の人物を削除した非識別化版——は、名前を削除するのがオンにできるフィルターであるかのように、任意パラメータとして提示されている。そうではない。特定可能な出来事についてのゴシップまとめは、名前を取り除いても、たいていは依然としてその人物についてのものだ。読者は文脈から名前を補うし、見出しからサムネイルに至るまで、あらゆるものが識別情報を運びうる。文字列を削除すると、その動画が何についてのものだと語っているかは変わるが、誰についてのものかは変わらない。そして、名前を削除する理由が法的または評判上のものであるなら、その文字列は、露出を生み出していた部分ではない。

このフォーマットを世に出す人には、次の2つのことが付きまとう。第一に、プレゼンターが合成だからといって、出典を明示する義務があなたから移るわけではない。他者の報道を情報源として生成されたまとめは、その報道がどこから来たのかを明示する義務を引き継ぐ。そして10月2日の投稿にあるブリーフには、出典を入れる欄がまったく含まれていない——それは運用者が手作業で埋めなければならない穴だ。第二に、その成果物は正当に合成物であり、あなたがそう伝えない限り、リスナーにはそのことが知らされない。ラベルは1行のテキストにすぎないが、それがデモと、視聴者に自分が見ているものについて誤解させるコンテンツとの違いを生む。パラメータにその重みを担わせたいなら、開示情報をブリーフに入れ、任意ではないものとして扱うことだ。音声のベンダーを隠すのではなく明記すべきであるのと同じように。

The OrcaRouter model page for anthropic/claude-opus-5.5, captured in English on 3 October 2026, showing a 1,000,000-token context window, 128,000-token maximum output, text, image and file input with text output, a release date of 22 September 2026, capability chips for vision, tools, JSON and reasoning, and pricing of 4.00 dollars per million input tokens and 20.00 dollars per million output tokens.

1つのキーで実行していて、それがまだカバーしていない唯一のキー

このパイプラインを構築しているなら、統合コストはモデル呼び出しではなく、2つ目の認証情報だ。Claude Opus 5.5 は今日 anthropic/claude-opus-5.5 として Anthropic 自身の定価、100万トークンあたり$4と$20で、0%のマークアップでパススルーされる。だからベンダーの価格変更は、次回の契約レビュー時ではなくその日のうちに請求へ反映される。これを残りのスタックと一緒に単一の OpenAI 互換エンドポイント経由でルーティングすることが2つ目の SDK を取り除き、自動フェイルオーバーがあれば、プロダクションの経路をその後ろに置くことなく、内部レンダーでより新しく、あるいは実績の少ないモデルを試せる。

正直な線引きは声の部分にあります。GoogleのGemini 3.8 Flash TTSおよびFlash-Lite TTSエンドポイントは現在当社のカタログにはなく、公開モデルAPIは google/gemini-3.8-flash-tts に対してnot-foundを返すため、10月2日の投稿のワークフローは本当に著者自身のGoogleキーを必要とします。そしてそれは、我々が手を振って済ませられる一時的なものではなく、実際の制約です。当社が実際に提供しているTTSエンドポイントは、旧世代の google/gemini-3.1-flash-tts-preview です。入力テキストトークン100万あたり$1.00、出力音声トークン100万あたり$20.00で、同じパイプライン構成で使え、旧世代向けの価格設定であり、このワークフローが基盤としたモデルではありません。承知の上で道を選んでください — 推論用に1つのキー、音声用にもう1つ、または1つのキーと旧TTSです。

何を見るべきか

このフォーマットを(良い意味で)退屈にするものは、生成側モデルに音声モダリティが備わることだ。Claude Opus 5.5 — あるいはそれを置き換えるもの — が、自ら発注したトラックを聴いて調整できるようになるまでは、ボイスは手動レビューの工程にとどまり、これらのパイプラインは方針によってではなく、構造上 human-in-the-loop のままになる。次の2週間はデモではなくスキルリポジトリを注視せよ。生き残るのは、ベンダーを明示し、ライセンスを備え、同じブリーフを再実行すれば同じ動画が得られるものだ。10月2日の投稿のプロンプトは、楽な部分に見えるだろう。実際そうだったのだから。

自前の素材と台本をすでに持っているパイプラインなら、Xから数字を借りてくるのではなく、自分で算出してみましょう。毎秒25トークンなら、完成したナレーション1分あたり1,500オーディオトークン、今日のFlash TTSの料金では約1.35セントになります。これは、合成ホストに制作枠を割り当てる前に、料金表と突き合わせて確認できる数字です。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新