
Gemini 3.8 TTS vs Sesame Preview:一方はダウンロード、もう一方はアプリ
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
の比較を検索するとGemini 3.8 Flash TTSとSesame Preview、両者を同じカテゴリーの2つの製品として扱う記事が山ほど見つかるでしょう。しかし両者はそうではなく、その違いは些細な技術論ではありません。Gemini 3.8 Flash TTS は API エンドポイントです。モデル識別子があり、公開された料金表があり、Artificial Analysis Provider Voice Arena で1,999サンプルにわたり Elo 1,260、ランク2というリーダーボード上の順位があり、リクエスト形式も文書化されています。一方 Sesame Preview は、名前付きのエージェント、マルチターン会話、30分の通話上限を備えた無料の一般消費者向け音声アシスタントアプリです。API もモデル ID も課金プランもなく、あのボード上のスコアもありません。
実際にその上に構築できるSesameの成果物は、また別物です:CSM-1B。これはHugging Face上のApache 2.0チェックポイントで、LlamaバックボーンとMimi音声デコーダーを使ってテキストからオーディオコードを生成します。アプリの声がどれほど人間らしいかを語るときに人々が話題にしている声ではありません。つまり、この比較は答えの出せる問いに帰着します:音声モデルを借りたいのか、それともダウンロードしたいのか?

Sesame と呼ばれるものが 2 つあり、そのうちビルドできるのは 1 つだけです。
混乱の大半は命名に起因するので、先に進む前にそれを切り分けよう。
• Sesame Preview — アプリ本体。無料で利用可能。エージェントの名前は Maya、Miles、Simone、Charlie。ターンをまたいで保持されるコンテキストを伴うマルチターン会話、ケイパビリティとしてのウェブ検索とリマインダー、英語のみ対応、通話は 30 分が上限。開発者向けのサーフェスは一切ない。認証する対象も、計測するものも、呼び出すエンドポイントもない。
• CSM-1B — チェックポイント。Hugging Face 上で sesame/csm-1b として Apache 2.0 ライセンスの下で公開されており、Llama バックボーンと、Mimi オーディオコードを生成する小型デコーダーを備えています。約20億パラメータ、英語、F32 ウェイトで、Hugging Face Transformers を通じて動作します。モデルカードには、1B 版が2025年3月に提供開始され、ネイティブの Transformers サポートが2025年5月に登場したことが記録されています。
その2つは同じ会社と同じ研究の系譜を共有しているが、関係はおおよそそこまでだ。アプリは製品であり、チェックポイントはそれに先立つ研究から生まれた成果物にすぎない。アプリの会話記憶を称賛するレビュアーが描写しているのは、音声モデルの周囲に検索と状態管理を備えたシステムであり、ダウンロードできる2Bチェックポイントの特性ではない。
チェックポイントには実際に何が入っているのか
CSM-1Bは、実行を計画している人にとって重要なアーキテクチャ上の意味でのテキスト読み上げモデルです。テキストとオーディオコンテキストを入力として受け取り、RVQオーディオコードを出力し、デコーダがそれを波形に変換します。モデルカードからの実用的な事実:
• ライセンス — Apache 2.0。これがこのページで最も重要な一行である。研究専用の重みライセンスとは異なり、Apache 2.0 は別途契約を交わすことなく商用利用を認めている。そのため CSM-1B は、真に実用的なオープン音声チェックポイントの数少ない一つとなっている。
• サイズ — F32で約2Bパラメータ。並行処理には本格的なハードウェアが必要になるほど大きく、開発用には単一のアクセラレータで実行できるほど小さい。
• 言語 — カードのとおり英語。多言語モデルではありません。
traction — 執筆時点で過去1か月間に141,461ダウンロード、リポジトリでの「いいね」はおよそ245,000件。これは、オープンな音声モデルの基準から見れば広く使われているチェックポイントであり、この成果物がアプリの報道とは無関係に実際のユーザーベースを持っていることを示す最も有力な根拠である。

カードが与えてくれないのは、何かと比較できる品質の主張だ。アリーナの行も、第三者によって再現されたベンダーのベンチマークも、チェックポイントの出力がアプリの出力とどう関係するかについて公表された評価もない。ダウンロードできるモデルがアプリと同じように聞こえると言う人は、名前からそう推測しているにすぎない。
なぜ直接比較が存在しないのか、そしてなぜそれが研究上のギャップではないのか
リーダーボード上に Gemini 3.8 TTS 対 Sesame Preview の比較は存在しません。なぜなら、存在し得ないからです。アリーナは、ホストされたエンドポイントで生成されたクリップをリスナーに比較させることでモデルをランク付けします。この組み合わせの一方にはエンドポイントがないため、エントリーできません。
そこは正確に言っておく価値がある。というのも、「直接比較は存在しない」は、あたかもデータが欠落しているかのように書かれることがよくあるからだ。欠落しているのではない。未定義なのだ。比較されている二つのものは、測定可能な共通の面を共有していない:
• Gemini 3.8 Flash TTS は、ネイティブのホスト型音声によって評価されます。Sesame Preview には、その意味で評価対象となるネイティブ音声はありません — あるのはエージェントです。
• Gemini 3.8 Flash TTSはトークン単位の料金表を公開している。Sesame Previewは無料で、何も公開していない。請求するものなど何もないからだ。
• Gemini 3.8 Flash TTS はスクリプトを受け取り、音声を返します。Sesame Preview は会話を受け取り、アプリがその上に重ねる検索やメモリがどうであれ、会話を返します。
正当な比較に最も近いのは Gemini 3.8 Flash TTS と CSM-1B の間の比較だが、それすら対等ではない。一方には独立した Elo とベンダーの料金表があり、もう一方にはどちらもない。比較できるのはコミットメントの形——従量制 API とダウンロード可能なチェックポイント——であり、その比較にリーダーボードは必要ない。
これで数字が書かれている唯一の面
この組み合わせにおいて定量的なものはすべてGoogle側にあり、それ自体がまさに要点である。
Artificial Analysis Provider Voice Arena(2026年9月24日取得)では、Gemini 3.8 Flash TTSはランク2、Elo 1,260、1,999サンプル、8つのアリーナ音声を対象とし、2026年9月23日にリリースされました。その姉妹モデルGemini 3.8 Flash-Lite TTSはランク6、1,235です。GoogleはFlash TTSを、入力テキスト100万トークンあたり$0.50、出力音声100万トークンあたり$9.00で2026年12月31日まで請求し、その後は$18.00、Flash-Lite TTSは$0.50と$6.00、その後は$12.00です。Artificial Analysisはこれらを100万文字あたり$16.50と$11.00に正規化しており、別の単位で請求するモデルと同じボードで比較できるようにしています。その正規化はボード側の計算であり、Googleの見積もりではありません。
それに対して、CSM-1Bには価格がない。使用量メーターがないからだ。あるのはダウンロード数、ライセンス、パラメータ数だ。あなたの意思決定の枠組みがEloを必要とするなら、この比較はSesame側のEloを提供しない。そして正直な結論は、どちらか一方が未実証だというより、二つの選択肢が異なる基準で評価されているということだ。

もしあなたが求めていたのがアプリの体験だったのなら
この比較を検索している人の多くは、そもそもモデルを選ぼうとしているわけではありません。彼らはSesameアプリを使い、その会話の感触が気に入り、それを自社製品に取り入れたいと考えています。それは別の問題であり、ダウンロードでは解決しません。
アプリが今のような感触を与える理由は、主に音声モデルによるものではない。ターンをまたいだ持続的なコンテキスト、会話の途中でウェブ検索するかどうかの判断、エージェントが話し始めるタイミング——これらはオーケストレーションであり、どれも2Bチェックポイントの中にはない。CSM-1Bをダウンロードすれば声は手に入る。その上にアプリの振る舞いを築くのはあなたのエンジニアリングであり、30分の通話上限とAPIの不在は、完成版を借りることもできないことを意味している。
求めていたのが呼び出せる音声モデルなら、正直な答えは、Gemini 3.8 Flash TTS が、文書化されたインターフェース、公表された価格、独立したスコア、そして1回のリクエストでの2話者対話を備えた選択肢だということです。求めていたのが手元に置ける重みなら、Apache 2.0 の CSM-1B が、この2つのうち実際に保持できるものであり――その引き換えとして、ハードウェア、サービングスタック、そしてあらゆる品質保証を自分で用意することになります。
OrcaRouterはどちらもホストしていません。GoogleのモデルはGoogle自身のAPIと9月23日の発表で示された各サーフェスを通じて呼び出されるものであり、CSM-1Bは自分で実行するチェックポイントです。OrcaRouterが担うのは、その選択のさらに上の層です。200以上のモデルを単一のキーの背後に、プロバイダーの定価でマークアップなしに提供するため、ベンダーの料金変更は当日に反映され、自動フェイルオーバーによって実験的なルートが本番の依存先になることはなく、単一の声だけでは仕事が完結しないときにモデルを1回の呼び出しに組み合わせるルーティングDSLも利用できます。
この比較をひとことで言えば、実際には比較になっていない。片方には料金表とEloがあり、もう片方にはライセンスとダウンロード数がある。自分が実際に埋められる欄を持つほうを選べばいい。
