「Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B」のタイトルカード:大きなタイトル、サブタイトル「ライセンスできない声、そして出荷できない声」、2つのフラットアイコンカード — 「Sesame Preview」には電話と人物のラインアイコンと「無料アプリ・APIなし・レビュアー推奨」のバッジ、「NVIDIA NemotronLabs VoiceChat 11B」にはダウンロードとサーバーのラインアイコンと「オープンウェイト・研究専用・セルフホスト」のバッジ。フッター:「出荷できない最高の2つの声 — 音声AI、2026年8月。」OrcaRouterロゴは右下に合成。
Guides & Insights

Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B:ライセンスできない音声、そして出荷できない音声

著者

Jim Song

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年で最も話題になった2つの音声モデルには、ローンチ時の報道では誰も触れない共通点がある:どちらも製品に組み込むことはできない。Sesame Previewは、その会話音声がTestingCatalogに「市場で入手可能な最高の音声モードの1つ」と言わしめた無料のコンシューマー向けアシスタントだが、その背後にあるプロダクションモデルにはAPIもモデルIDも購入可能なライセンスもなく、同社は単にそれをリリースしていないのだ。NVIDIA NemotronLabs VoiceChat 11Bは鏡像のような存在だ:重み付けは公開され、全二重設計は真に初の試みであり、ライセンスは研究目的のみとされているため、合法的に出荷できる者はいない。ひとつは聞くことはできても借りることのできない声。もうひとつは手にすることはできても売ることのできない声。これは2つの鍵のかかったドアの比較であり、有益な問いは、あなたがどの鍵の前に立っているかということだ。

異なる錠前で施錠された二つのドア

まず、それぞれの「かたち」から見ていきましょう。名前だけでは、この2つの製品がどれほど異なるのかが見えてこないからです。Sesame Previewはアプリであり、APIではありません。それぞれ異なる個性を持つ4つのエージェントを搭載しています — Maya(温かく創造的)、Miles(くつろいだ雰囲気で切れ者)、Simone(好奇心旺盛で知性的)、Charlie(機知に富み温かい)— それぞれが独自の声と独自のメモリを持ち、サインイン中はWebとモバイル間で同期されます。Web検索、深掘り調査、メモやリマインダーの記録を行い、通話ごとに要約を送信します。プレビュー版は無料で有料プランはなく、英語のみ対応、サインイン時は1回の通話あたり最長30分(それ以外は5分)に制限されています。また、意図的にタスクを実行しません。ブレインストーミングや調査は行いますが、フライトの予約はしてくれません。製品内にAPIキーはどこにも存在せず、プロダクションボイスはアプリの機能であって、エンドポイントではありません。

Screenshot of Sesame's official Mobile Preview page (sesame.com/mobile-preview), showing 'Personal agents for curious people' and 'Preview available now on iOS and Android' with App Store and Google Play links. Captured August 6, 2026.

NVIDIA NemotronLabs VoiceChat 11Bは、その正反対の形状を持つ。つまり製品ではなくチェックポイントである。このモデルは2026年8月3日に何の発表もなくHugging Faceに登場した。ローンチ投稿も、テクニカルレポートも、ツイートもない。モデルカード自体が発表なのである。これは11Bパラメータの全二重音声モデルであり(私たちはsafetensorsヘッダーを解析し、1,626個のテンソルにわたって110億9,500万パラメータを数えた)、単一のスタックとして構築されている。すなわち、右コンテキストがゼロで80msフレームの16kHzオーディオを処理するFast Conformerエンコーダ、推論を担うNemotron Nano 9B v2バックボーン、22.05kHzオーディオを書き出すNVIDIA TTSデコーダ、ユーザーの発話を書き起こすRNN-Tデコーダ、そして音声応答を汚染することなくツール呼び出しスクリプトを出力する独立した出力チャネルから構成される。このモデルは同時に聞き取りと発話が可能で、言葉の途中でも割り込まれることができる。NVIDIAはこれを、ツール呼び出しに対応した初のオープンな全二重モデルとして売り出している。その主張が現実と向き合っても成り立つかどうかは、以下の専用セクションで取り上げる。

両者が分岐する基準 —「最高の会話」の候補が2つ、壊れた証拠基準が2つ

両モデルは、その評判のすべてを同じものに賭けている。会話の質——ターンテイキング、割り込み、自然なタイミング、実際のやりとりの感触——だ。だからこそ、この2つが同じ見出しに並ぶのである。また、比較が奇妙になるのもこの点だ。どちらの候補も適切に評価できないからである。

Sesame Previewには、どこにも数値がありません。プロダクションモデルは未公開かつ未掲載です。モデルIDもなく、Artificial Analysisの音声対音声リーダーボードへの掲載もなく、レイテンシ目標も、いかなるベンチマークもありません。TestingCatalogの「市場で入手可能な最高の音声モードの1つ」というのは、レビュアーの総意であり、測定値ではありません。また、それを何かとブラインドA/B比較する方法もありません。誰もが独立して実行できる唯一のSesameモデルは、オープンウェイトのCSM-1Bベースであり、それはアプリの音声ではなく、テキスト読み上げチェックポイントです。

NVIDIA NemotronLabs VoiceChat 11Bには逆の問題がある。数字はあるものの、その数字は互いに一致しない2つのエビデンス基準に分かれているのだ。NVIDIAは、スムーズなターンの取得に448ミリ秒、割り込み時の譲歩に480ミリ秒、ユーザー割り込み時のテイクオーバー率は完璧な1.0と報告しているが、いずれもNVIDIA自社のFull-Duplex-Bench 1.0で測定されたベンダー計測値であり、独立に再現されたものはない。このファミリーの独立測定値は、別の名前とパラメータ数で記録されている。すなわち「Nemotron 3 VoiceChat (V1)」12Bというラベルであり、NVIDIAはこれをHugging Face上の11Bチェックポイントと一度も整合させていない。そしてその結果は理解力の面で芳しくない。Artificial AnalysisによるBig Bench Audioで29.2%、NVIDIA自身のカードでは37.0%である。VoiceBenchでは、このファミリーは58.10を獲得し、公開されているフルデュプレックスの中では最高の結果だ。つまり、同じモデルが、同時に、公開フルデュプレックスチェックポイントの中ではリーダーでありながら、ホスト型リアルタイムのリーダーたちには、聞いた内容の理解においておよそ3対1の差をつけられているのである。

A two-column comparison scoreboard for Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B. Sesame Preview: 'free app, 4 voice agents', 'Independent score: none — app unreleased', 'How you buy it: no API — app only', 'Callable voice: CSM-1B, $7/M chars', 'Memory: per-agent, syncs across devices', 'Latency: no published target'. NVIDIA NemotronLabs VoiceChat 11B: 'open full-duplex checkpoint', 'Independent score: VoiceBench 58.10 (V1/12B)', 'How you buy it: not buyable — research-only', 'Callable voice: none — 80 GB self-host', 'Memory: ~2 min audio context max', 'Latency: 448 ms turn-taking (NVIDIA)'. Footer: 'Nemotron figures per NVIDIA / Artificial Analysis (V1 12B lineage); Sesame app voice unmeasured; prices per vendor/OpenRouter.' OrcaRouter logo composited bottom-right.

では、食い違いはどちらが優れているかということではない。2026年の最高の会話を競う2人の候補が、正反対で、しかも同様に不完全な証拠に基づいて評価されているということだ。レビュー担当者が最も人間らしいと感じる音声には測定値がまったくなく、実際にリーダーボードに載っている音声は、その弱点が公開されている方の音声である。評判と数字を比較することはできない。そして、ここには数字が1つしかない——しかも、それは好意的な数字ではない。

アクセス — アプリストアからのダウンロード、または80 GBのビルド

どちらかを試したいなら、スタートラインは、どんなスペックよりも重要な点で異なる。

Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.

NVIDIA NemotronLabs VoiceChat 11Bは、単にダウンロードして実行できるものでもありません。立ち上げる必要のあるビルドです。Hugging Faceは、このモデルが「いかなる推論プロバイダーでもデプロイされていない」と述べており、NVIDIAもホストしていません。また、リポジトリ内のconfig.jsonはNeMoのトレーニング設定のため、AutoModelに渡せるTransformersチェックポイントはありません。サポートされている方法は、Python 3.12、PyTorch 2.10、Transformers 4.56に固定されたconda環境で、causal-conv1dとmamba-ssmをソースからコンパイルし、vLLMを実行する80GB GPU(A100、H100、H200、B200、RTX 6000)上で実行するか、NVIDIAのNGC NIMコンテナを使うことです。後者は、そのハードウェア上であれば/v1/realtimeでOpenAI Realtime互換のWebSocketを公開します。ダウンロード数がアクセスの実態を物語っています。モデル公開から最初の1か月のダウンロードは約80件だったのに対し、いいねは107件でした。人々はブックマークしたものの、実際に実行した人はほぼいません。実行しようとする研究者に一つ率直な注意を述べると、このチェックポイントが基盤とする推論バックボーン、Nemotron Nano 9B v2は、現在呼び出し可能なホスト型モデルですが、その周りにある全二重モデルはそうではありません。そのギャップこそが重要なのです。

The Hugging Face model card for nvidia/NVIDIA-NemotronLabs-VoiceChat-11B, showing the OpenMDW 1.1 research-only license, 'This model isn't deployed by any Inference Provider', natural turn-taking / barge-in / tool calling, ~450 ms response, 11B params, and 80 downloads in the last month with 107 likes. Captured August 6, 2026.

価格 — 無料アプリ、フリーウェイト、そして80GBの請求書

両方のモデルは「無料」だが、その言葉はどちらの場合でも同じ程度に誤解を招く働きをする。

Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.

正直な基準は、これらのいずれかが購入可能になるその日に適用される。つまり、どのホステッド音声モデルを選んでも、支払うべきはプロバイダーの定価であり、その上にルーティングのマークアップは一切載せない。それがパススルーであり、ベンダーの値下げが契約サイクルを待たずに同じ日に請求書に反映されることを意味する。この記事で取り上げているモデルはどちらもOrcaRouterを通じて呼び出すことはできない。Sesameの本番音声にはAPIがまったくなく、NVIDIA NemotronLabs VoiceChat 11Bはどんな手段でも呼び出せない。この基準は、実際に購入できる音声のためのものであり、$7/100万文字のT​TSベースや、将来登場するSesame品質のAPIを正直に価格設定することを容易にするまさにその基準である。

Memory — 覚えているアプリ vs 忘れてしまうモデル

ここでの差は峡谷のように大きく、それがこの2つが代替品ではない最も具体的な理由である。Sesame Previewは記憶を保持するアプリだ。各エージェントはエージェントごとの記憶を持ち、サインイン中はWebとモバイル間で同期される。通話は最長30分まで可能で、シークレットモードは新しい記憶を作成せずに過去の記憶を読み取る。対照的に、オープンのCSM-1Bは4Kのコンテキストウィンドウ(およそ3〜4分分のテキスト)しかなく、そもそもあなたの声を聞く耳もない。

NVIDIA NemotronLabs VoiceChat 11Bは、音声コンテキストを最大約2分しか保持しません — トレーニングデータローダーは発話を142.39秒に制限しており、モデルカードは2分を超える会話は保持されない可能性があると警告しています。4分前に合意した内容を覚えておく必要があるサポート電話にとって、その上限はそれだけで失格です。さらに、リリースされたチェックポイントにはクローニング機能がなく、固定された単一の音声(Aria)しかないため、アーキテクチャについてオープンなモデルは、顧客を覚えておくことも、自分の声を変えることもできないモデルでもあります。

それぞれが本当に苦手なこと

冷静だ。なぜなら、強みだけに留まる比較はマーケティングにすぎないからだ:

Sesame Preview:APIなし — この音声を製品に組み込むことはできず、本番モデルは未リリースで未評価です。英語のみ対応、タスク実行不可、通話上限30分、独立したベンチマークは一切存在しません。唯一のオープンモデルであるCSM-1Bは、4Kのコンテキストウィンドウを持ち、ツール呼び出しもリスニング機能もなく、アプリの音声ではありません。

NVIDIA NemotronLabs VoiceChat 11B:研究専用ライセンス(OpenMDW v1.1)です。ダウンロード、研究、ファインチューニングは可能ですが、製品として出荷することはできません。また、それを基に開発した人も同様です。ホスト型エンドポイントはないため、「試す」には80 GBのGPUとソースからのビルドが必要です。英語のみ対応、メモリ上限は約2分、固定された1つの音声。NVIDIAは、知識と指示追従において、このモデルが自身のバックボーンよりも低い性能を示す可能性があると述べており、多段階の推論と算数が特に弱いと指摘されています。文の途中で遮ったり、数ターン後に回復不能な意味不明な発話や独り言に劣化したり、文字起こしで単語を落としたりする可能性があります。また、騒がしい部屋や反響のある部屋には明示的に不向きです。ツール呼び出しはASCIIのみのプロンプトと応答でのみ機能し、セッションあたり最大5つのツールまでです。引数の正確さ(44.2%)と初回成功率(33%)は、ツールの引数を正確に埋めるよりも、正しいツールを選ぶ方が信頼できることを意味しています。

誰がどれを選ぶべきか

どちらも呼び出し可能ではないため、正直な答えは、あなたが何をしようとしているのかから始まります。

2026年最高評価の音声を体験: Sesame Preview、無料、今日から——アプリとして。レビュアーが挙げる4つのエージェント、割り込み処理、ドライブモードの使いやすさ——それは消費者向け製品であり、その価値はまさに測定できないものです。

全二重音声モデリングの研究:NVIDIA NemotronLabs VoiceChat 11B は、そのカテゴリの中でより興味深いダウンロードです — 動作するツール呼び出しチャネルを備えた11Bオープンチェックポイントで、約55万時間のブレンドされたトレーニング音声と、これまでで最高のオープンな全二重VoiceBench結果を持ち、しかもウェイトのコストはゼロドルです。研究専用ライセンスは、その作業に対する制約にはなりません。

Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.

今四半期中に音声製品を出荷する:そのどちらでもありません。必要なのは、商用ライセンスを備えたホステッド型リアルタイム音声間(speech-to-speech)モデルです。まだ本番パスとして確約していないモデルを採用する安全な方法は、実績のあるモデルの隣に自動フェイルオーバー付きでルーティングし、未検証の音声がライブ通話を停止させることがないようにすることです。200以上のホステッドモデルをプロバイダー定価で、マークアップなしで単一のAPIから利用できることこそが、新しく利用可能になった音声を試すことを、書き換えではなく設定変更にするのです。

このパターンは繰り返し発生するため、名前を付ける価値がある。これらのモデルはどちらも、あと一つの出来事で呼び出し可能になる。SesameはモデルIDやAPIを出荷した日、NVIDIA NemotronLabs VoiceChat 11BはNVIDIAが商用ライセンスを公開するか誰かがホストした日だ。それが起きたとき、正しい対応は現在の音声スタックを引き裂くことではない。新しい音声を古いものの隣に追加し、フェイルオーバーでルーティングすることである。これは、新しい未検証のモデルに対して行うのとまったく同じだ。これらは2026年で最も優れた未出荷の音声2つであり、3つ目を出荷するためのインフラはすでに存在する。

この比較を変えるものは何でしょうか?

この記事を書き換える出来事は4つある。Sesameの本番用音声のAPIまたはモデルID——それが実現した瞬間、Sesameはアプリではなくなり、ホステッド音声API市場が待ち望んでいた参入者となる。NVIDIA NemotronLabs VoiceChat 11Bの商用ライセンスまたはホステッドエンドポイント——これは研究の成果物を一夜にして本物の製品オプションに変えるだろう。Sesameの音声に対する独立したスコア——Artificial Analysisの音声対音声ボードに掲載されれば、「最高の音声」という主張に検証の基準が与えられる。そして、NVIDIAが11Bチェックポイントと、リーダーボードが測定する12B「Nemotron 3 VoiceChat (V1)」エントリとの整合性を説明するテクニカルレポート——これはこのファミリーの数値を信頼するための前提条件である。そのいずれも実現しない限り、正確な要約はシンプルだ:2026年の最も興味深い2つの会話音声は、どちらもロックされている——ひとつは販売しない企業によって、もうひとつは提供されないライセンスによって。

よくある質問

自分のアプリ内でどちらかのモデルの音声を使用できますか?

No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.

実際には、その2つのうちどちらの方がより人間らしく聞こえますか?

不明。それぞれ異なる根拠に基づく。Sesame Previewには独立したスコアが一切ない。TestingCatalogの「市場で最高の音声モードの1つ」という評価は、レビュアーたちの総意であって、測定値ではない。NVIDIA NemotronLabs VoiceChat 11Bの会話タイミング(ターンテイキング448ms、バージイン応答480ms)はNVIDIAが報告したものであり、再現確認はされていない。また、その独立したBig Bench Audioの数値(Artificial Analysisによる29.2%、「Nemotron 3 VoiceChat (V1)」に記載)は理解度を測るものであり、音声の心地よさを測るものではない。一方は耳で確かめられる評判であり、他方は別の問いに答える数値である。

NVIDIA NemotronLabs VoiceChat 11Bは本当に無料なのですか?

ウェイトは無料だが、モデルは安くない。実行するには80GBのGPU(オンデマンドで1時間あたり約2〜3ドル、常時起動しておくと月額1,500〜2,200ドル)とソースからのビルドが必要であり、さらにOpenMDW v1.1ライセンスは研究目的のみに使用を制限している。つまり、その出費をしたとしても、法的に顧客の前に置くことはできない。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube