
GPT-Live-1 vs Sesame Preview:この比較で最高の音声は、購入できないものだ
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング

両方を使ったことがある人に聞けば、その評価に僅差はない。Sesame Preview は、ほとんどの人が話した中で最も説得力のある音声アシスタントだ。そして、その上に構築することはできない存在でもある。GPT-Live-1 と Sesame Preview は常に比較される — どちらも会話型で、どちらも割り込みに対応し、どちらも電話の自動応答ツリーではなく人間のように聞こえる — しかし、提供のされ方は正反対だ。GPT-Live-1 は分単位で借りるホスト型モデルで、2026年9月10日から一般に呼び出し可能だ。Sesame Preview は API が一切ない無料の消費者向けアプリで、人々が感銘を受けるあの声は、一度もリリースされたことのない本番モデルで動いている。
それぞれが実際に何なのか
• GPT-Live-1 — OpenAIの全二重音声モデル。ChatGPTでは2026年7月8日から、APIでは9月10日から、音声1分あたり0.05ドル。APIの音声は12種類、クローニングなし、画像・動画入力なし、セッションごとに文字起こしと応答テキストが返される。
• Sesame Preview — Sesameのコンシューマー向け音声アシスタント。2026年5月からiOSで無料、2026年8月初旬からAndroidでも広く利用可能、さらに音声ファーストのWebプレビューも提供。4つのエージェント — Maya、Miles、Simone、Charlie — は英語のみで、通話上限は30分、ログアウト時は5分に短縮されます。
• CSM-1B — Sesameのオープンな部分:2026年4月23日にApache 2.0の下でリリースされた1Bの会話音声モデルで、Llamaアーキテクチャのバックボーンに別個のデコーダーとKyutaiのMimiコーデックを組み合わせて構築され、約4Kトークンのコンテキストから24 kHzモノラル英語音声を生成する。
上の3行が、この決定の構図のすべてだ。片方の企業はモデルを分単位で売っている。もう一方はアプリを無料で配り、アプリに入っているのとは違う、より小さなモデルをオープンソース化している。
デモとダウンロードの間のギャップ
Sesameはこの点について異例なほど率直であり、このペアを評価する誰にとっても、これが唯一最も重要な事実だ。Previewアプリ内の声——あのバイラルクリップや「業界最高クラスのボイスモード」レビューを生み出した声——は、より大規模なクローズドのプロダクションモデルである。CSM-1Bは同じラボによる1Bパラメータのオープンチェックポイントであり、両方を動かしたことのある人々の評価によれば、明らかに弱い声だ。Previewでのセッションには上限があり、英語に限定され、タスク実行もない。エージェントは話すが、予約や購入、書類提出は行わない。
そうなると開発者に残るのは、現実的だがより限定的な提供内容だ:ライセンス料無料のセルフホスト可能な会話音声チェックポイントであり、サードパーティの推論プロバイダー1社が100万文字あたり7ドル——合成音声1時間あたりおよそ0.35ドル——でホストするか、自身のハードウェア上なら無料で使える。Preview音声とCSM-1Bのいずれについても、独立したベンチマークを公表した者は誰もいない。したがって、どちらの方向であれ品質に関する主張は聴感上の印象であり、測定値ではない。Sesameはまた、公開価格、エンタープライズ向けティア、収益化計画のいずれも公表していない;同社が公言している方向性は、研究パートナーシップと計画中のハードウェア製品である。

0.05ドルで1分間に買えるもの、無料では買えないもの
GPT-Live-1 の開発者向けの売り込みは、音がより良いということではない。なぜなら、誰にも測定できないクローズドモデルを相手に、その論法では勝ち目がないからだ。そうではなく、それは呼び出し可能で、価格が付いているということだ。具体的には、メーターが回っている分に得られるものは:
• 自分で制御できるセッション — 1つのモデル ID、1つの Live Sessions エンドポイント、WebRTC 上で動作する公開済みの統合サンプル、そして指示・ボイス・委任ブロックを設定したセッション。
• 文書化された振る舞いとしての割り込み処理 — Full Duplex Bench v1.5 におけるインタラクティビティは 80.1% で、GPT-Realtime-2.1 の 45.4% に対して優位に立ち、ターン交代遅延は 0.798 秒、ツール呼び出し成功率は 87%。これら3つはすべて OpenAI 自身の数値であり、リリースとともに公開されたもので、執筆時点では誰も再現していない。
• あなたが選ぶ推論バックエンド — 音声レイヤーは、セッション構成で指定された別のモデルへ非同期の境界を越えて重い処理を渡し、そのモデルは会話が続いている間も動作し続けます。OpenAI のドキュメント例では、そのバックエンドは GPT-5.6 Terra です。7月の消費者向けローンチ時点では GPT-5.5 でした。
・文字起こし、応答テキスト、電話型の課金体系 — 連続して開いた回線1時間につき$3.00、秒単位で課金され、セッション初期化の15秒は加算されるのではなく割引として計上されます。
Sesameはより良い会話を提供し、そうしたものは一切ない。もしあなたがプロダクトを作っているなら、「より良い会話、APIなし、価格なし、ベンチマークなし、英語のみ、30分上限」は比較ではない——それはウェイトリストだ。
GPT-Live-1には今、消費者向けローンチ時には存在しなかった数字があり、それは上記のすべてに対する正直な対抗軸だ。Artificial AnalysisのSpeech to Speech Indexでは、GPT-Live-1は69.8%で、11モデル中7位。GPT-Realtime-2.1の73.9%に後れを取り、Grok Voice Think Fast 2.0の79.0%にも後れを取っている。つまり、購入できるモデルは、この独立系ボードでも最良のものではない。このボードが点数化できないのは、Sesameが実際に勝っている点だ。そのインデックスにある11モデルのいずれも、話していてどう感じるかでは評価されておらず、Sesame Previewの音声にはどこにも行がない。

どちらの会社のものでもないスタックの部分
ここが両方の選択肢が収束する点であり、判断が二項対立的でなくなる場所です。Sesame PreviewもGPT-Live-1も、完全なエージェントではありません。Sesameのエージェントはタスクを実行しません。GPT-Live-1は、推論、検索、またはツールを必要とするものはすべて、明示的にバックエンドモデルに委任します。どちらの設計でも、興味深い作業は音声の背後、プレーンテキストのモデル呼び出しの中で行われ、その層は音声層とは違って移植可能です — 音声モデル用のプロンプトを1つも録音し直すことなく、バックエンドを移せます。
そのバックエンドこそ、OrcaRouterが役立つ場所でもあります。そして、私たちが何を扱い、何を扱わないのかについては正確を期しておく価値があります。私たちはGPT-Live-1をルーティングしません。Live SessionsエンドポイントはOpenAIのものであり、そこにある音声レイヤーには手が届かないからです。Sesameの本番モデルもルーティングしません。理由はもっと単純で、これまで一度もAPIとして提供されたことがないからです。私たちがルーティングするのは、両製品が処理を委ねるレイヤーです。11社の上流プロバイダーによる約190のモデルがプロバイダー表示価格のまま、マークアップなしの1つのキーの背後で動作しており、プロバイダーをまたぐ自動フェイルオーバーと、複数のモデルを1回の呼び出しに組み合わせられるルーティングDSLを備えています。実績のない音声フロントエンドの上に構築するチームにとって、それこそが重要なヘッジです。音声レイヤーは、推論レイヤーを道連れにすることなく差し替えたり見捨てたりでき、3月に賭けたモデルも、1行を編集するだけで6月には置き換えられます。
何を見るべきか
この比較を変える要素が3つあり、そのいずれもまだ誰の手にも渡っていない。Sesame APIは——有料のものであっても——このカテゴリーで最強の音声を即座に構築可能な選択肢に変え、GPT-Live-1の$0.05と並ぶ実際の価格を示すことになる。Previewボイスの公開ベンチマークは、聴取した印象を数値に変えるだろう。そして独立した評価は、デモでしか勝負してこなかった音声には厳しい傾向がある。OpenAIのインタラクティブ性とレイテンシーの数値に対する最初の外部再現が、全二重が本当の能力差なのか、それとも巧みに選ばれた評価なのかを決着させるだろう。
それまでは、正直な線引きはこうだ。自分のための声を選ぶなら、Sesame Preview を使え——無料で、より優れていて、それを好むのに何のコストもかからない。出荷し、販売し、サポートしなければならない製品のための声を選ぶなら、GPT-Live-1 がこの2つのうち実際に購入できる唯一のものであり、より良い響きのほうではないという事実こそが、参入の代償だ。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
