
NVIDIA NemotronLabs VoiceChat 11B:NVIDIAが発表せずに出荷した全二重音声モデル
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianNEWQwen3.8 27B2026-08-1552知能68コーディング
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokNEWSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
同じHugging Faceリポジトリの中に2枚のモデルカードがあり、両者は互いに食い違っている。ページ上に表示される方のカードは、このモデルをNVIDIA NemotronLabs VoiceChat 11Bと呼び、リリース日を2026年8月3日とし、パラメータ数を11Bと記載している。もう1枚は、overview.mdという名前のファイルで、Filesタブを開かない限り誰も目にしない。こちらは同じモデルを12Bと呼び、リリース日を7月16日とし、公開カードにはないベンチマークセクションを含み、未だにTODOという単語が、結果の説明があるべき場所に残っている。どちらのカードにも、NVIDIAからのローンチポスト、プレスノート、テクニカルレポート、ツイートのいずれも付随していなかった。
とはいえ、そこにあるものはプレースホルダーではありません。これは、マイク音声を入力として受け取り、合成音声を出力する単一のスタックであり、音声認識から言語モデル、テキスト読み上げへという通常の中継を介さずに、聞き取りと発話を同時に行う44 GBのチェックポイントです。これはNemotron Nano 9B v2バックボーンを基盤としており、話し続けながら文の途中でツールを呼び出すことができ、NVIDIAは、それを実現できる最初のオープンな全二重モデルであると主張しています。
以下はすべて、そのリポジトリから直接読み取ったものです——2枚のカード、config.json、そして、11B対12Bの疑問を解決するために私たち自身で解析した、重みファイル内のテンソルインデックスです。NVIDIAがこのモデルについて公表するすべてのパフォーマンス数値は、NVIDIA独自のものであり、NVIDIAの測定によるものであり、再現されていません。この系統の独立した測定結果は、公にはちょうど1件だけ存在し、それはArtificial Analysisによるもので、異なる名前と異なるパラメータ数で登録されています——これが、このリリースで最も興味深い点であることが判明します。
リポジトリには実際に何が含まれているのか
このリポジトリは2026年7月29日に作成され、8月4日に最後に更新されました。17個のファイルが含まれています:競合する2つのモデルカード、ライセンス、config.json、44.4GBのmodel.safetensors、アーキテクチャ図、RNN-Tトークナイザディレクトリ、バイアス・安全性・プライバシー・説明可能性に関する4つの短いポリシーノート、および3つの.wavファイル(ターンテイキングデモ、バージインデモ、ツール呼び出しデモ)— カード上部にオーディオプレーヤーとして埋め込まれており、読む前にモデルを聴くことができます。
いくつかのものが欠けているが、それらはファイルリストよりも重要である。
• このモデルには論文が存在しない。 カードは5つを引用している:VoiceBench、Full-Duplex-Bench 1.0、Full-Duplex-Bench v3、SALM-Duplex、Audio Flamingo 3、さらにNVIDIA独自のPersonaPlexプレプリントである。そのどれもNemotronLabs VoiceChatのテクニカルレポートではない。アーキテクチャは約3段落と1つの図で説明されており、それが構築方法に関する公開情報のすべてである。
• それを呼び出す方法はありません。Hugging Face のページには、このモデルが「どの Inference Provider にもデプロイされていない」と明確に記載されています。NVIDIA を含め、どこからもホストされたエンドポイントは提供されていません。リポジトリにある唯一のオープンなコミュニティスレッドは、NVIDIA にhandler.py を追加してほしいと依頼しているユーザーによるものです。そうすればチェックポイントを Hugging Face Inference Endpoints にデプロイできます。— 簡単な方法で実行しようとした人が、その方法がないことに気づいたのです。
• pipeline_tagもlibrary_nameもありません。そのため、このページには推論ウィジェットもタスクラベルもなく、これはより深い問題の兆候です:config.jsonはTransformersのconfigではありません。これは32 KBのNeMoのトレーニング用configであり、AdamWブロック、学習率スケジュール、データローダーのバケットビン、検証分割が含まれています。AutoModel.from_pretrainedをこのconfigに対して使用することはできません。NVIDIAのSpeechリポジトリの特定のブランチ(nemotron-labs-voicechat)をクローンし、Python 3.12、PyTorch 2.10、Transformers 4.56に固定したconda環境を構築し、causal-conv1dとmamba-ssmをビルド分離なしでコンパイルして、そのスクリプトを実行する必要があります。
ダウンロードカウンターはそのすべてを反映している。モデル公開初月に80ダウンロードに対して107件の「いいね」が付いたのは、人々がブックマークしただけで実行しなかったリリースの特徴を示している。

パラメータを数えたところ、11Bが勝ちました。
safetensorsファイルには、すべてのテンソル、その形状、およびdtypeをリストしたJSONヘッダーが含まれているため、パラメータ数は意見の問題ではありません。ヘッダーを取得して合計しました: 1,626個のfloat32テンソルにわたる110億9,500万パラメータ、44.38GBを占有します。したがって、レンダリングされたカードは正しく、overview.mdは古いです。これは11Bモデルであり、12Bという数値は残り物です。
Hugging Faceのモデルツリーを見れば、12Bがどこから紛れ込んだのかがわかる。その系統をたどると、Nemotron Nano 12B v2 Base、次にNemotron Nano 12B v2、続いてNemotron Nano 9B v2、そして最後にこのモデルにたどり着く。NVIDIA自身のテキストバックボーンファミリーには12Bと9Bの両方が存在し、9Bは12Bを枝刈りして派生したもので、VoiceChatは9Bをベースに構築されている。この連鎖のより早い段階で作成されたカードであれば、当然ながら大きい方の数字が記載されていたはずだ。
ヘッダーもまた、アーキテクチャの2つの半分に沿ってきれいに分割されます。
• 理解側 — 10.098B. そのうち、7.714B は Nemotron Nano v2 トランスフォーマー・スタック、0.609B は音声エンコーダー、そして 131,072 × 4,480 の行列が3つあり、それぞれ 0.587B です。
• 音声側 — 0.997B.28層、幅1,152のテキスト読み上げバックボーン(0.595B)、0.159Bの混合ガウス出力ヘッド、およびエンコーダとデコーダがそれぞれ0.092Bのニューラルオーディオコーデック。
{{1}}dtypeからは、実際的な結果が2つ導き出される。{{/1}}1つ目は、44 GBのダウンロードは大きなモデルではなく、float32で提供されている普通のモデルだということだ。bfloat16にキャストすれば、重みはおよそ22 GBになる。2つ目は、NVIDIAが公表している80 GB GPUという下限は、モデルのサイズによるものではなく、その選択による結果だということだ。48 GBのカードを持っていて、自分でチェックポイントを変換する気がある人なら、明らかに締め出されているわけではない——{{2}}ただし、そのフットプリントでの実行が確認されたという報告は誰も発表していないので、それは計算上の話であり、約束ではないと考えてほしい。{{/2}}
どのようにして同時に聞き、話すのか
「フルデュプレックス」がこのリリースの要点であり、その購入方法は設定に示されている。3つの設計上の選択がその役割を果たしている。
• 音声エンコーダーは先読みできません。これは、24層・8ヘッドのConformerで、その注意コンテキストは[70, 0]、すなわち70フレームの左コンテキストとゼロフレームの右コンテキストです。従来の認識器は、現在の瞬間以降の音声を覗き見て、聞いたばかりの内容を曖昧さなく解釈します。しかし、このエンコーダーにはそれが許されていないため、精度は犠牲になりますが、その代わりにフレームが到着した瞬間に判断を出力できる能力を得ています。
• すべてが80 msに量子化されています。 設定におけるフレーム長は0.08秒で、NVIDIAがこの一連の研究について別の場所で説明している80 msのチャンクサイズと一致しています。モデルは80 msごとに、聞き続けるか話し始めるかを決定しています。そのテンポこそが、バージイン(割り込み)を「丁寧」ではなく「即時」に感じさせるのです。
• ツール呼び出しは、モデル自身の口から出てくる。あの、同一形状の語彙数131,072の3つの行列を思い出してほしい。1つは入力埋め込み、1つは通常の言語モデルヘッド——そして3つ目はfunction_headと名付けられている。カードの説明文にある「ツール呼び出しスクリプト用の独立した出力チャネル」は、文字通りの3つ目の出力射影であり、5億8700万パラメータの幅を持ち、音声生成と並行して動作する。これこそが、モデルが会話を止めることなくツール呼び出しを送出できる構造上の理由であり、プロンプト上の慣習ではなく、実際の設計上のコミットメントなのだ。
下流では、テキスト音声合成デコーダーが、31個の量子化器とダウンサンプリングレート7、7、9を持つ残差ベクトル量子化コーデックのコードを予測します——これは441倍の削減であり、オーディオトークンレートを22.05kHz出力で毎秒50フレームにします。入力は16kHzです。チェックポイントにはRNN-Tデコーダーとジョイントネットワークも含まれており、そのためモデルの宣言された出力には、ユーザーの書き起こしが自身のテキストおよび音声と並んで含まれます: その書き起こしは実際の認識ヘッドであり、副産物ではありません。デフォルトの音声はAriaと呼ばれ、3秒の参照クリップが話者を条件付けます。
コンフィグのもう1つの詳細は、明記された制限を裏付けるものであり、注目に値します。トレーニングデータローダーは発話を142.39秒に制限しています。モデルが2分を超える音声コンテキストを保持できないというカードの警告は、そのモデルを生成したデータパイプラインに表れています。
スコア、そして実際に誰が測定したのか
NVIDIAの主要な主張は、レイテンシとランキングです。Full-Duplex-Bench 1.0では、スムーズなターンテイキングに448ms、割り込み時に譲るのに480msかかると報告しており、スムーズなターンテイキングでのテイクオーバー率は0.82、ユーザー割り込み時は1.0、割り込み処理のGPT-4oジャッジスコアは4.33です。また、VoiceBenchのオープンなフルデュプレックスモデルの中で2位、Full-Duplex-Benchのオープンモデルの中で2位であると主張しています。これらはすべてNVIDIA自身による実行結果です。
それらを外の世界と並べてみると、二つのギャップが浮かび上がる。
• 音声推論について、ベンダーの数値は約8ポイント高くなっています。 未レンダリングの overview.md は Big Bench Audio で 37.0% を報告しています。Artificial Analysis がこの系統を独立に測定した値は 29.2%です。同じベンチマーク、同じファミリーでありながら、その差はモデルのランキング上の位置を変えるほど大きい。
• VoiceBenchでは、ベンダーの数値は控えめすぎる。カードはオープン全二重モデルの中で2位と主張しているが、公開VoiceBenchリーダーボードではこのモデルは58.10であり、これはトップ(オープン全二重バケット内)で、55.20のFreeze-Omniと29.51のMoshiを上回っている。NVIDIA自身のドラフトカードは55.1と報告しているが、これは現在リーダーボードに掲載されている数値を下回る。
もう一つ小さな奇妙な点もある。NVIDIAの独自比較表は、Artificial Analysisよりも競合他社に寛大な評価を与えている。ドラフトカードでは、Big Bench AudioにおいてFreeze-Omniが33.4%、PersonaPlex 7Bが19.1%となっている。一方、Artificial Analysisの測定では33.9%と12.6%である。どちらの方法でも順位は変わらないため安心できるが、ベンダーのテスト環境と独立したテスト環境では、第三者の製品であっても同じ数値が得られないということを思い起こさせる。

このチャートは、正直な見出しを避けられなくする。オープンな全二重モデルの中では、これは確実な前進だ。音声推論ではPersonaPlexの2倍以上を記録し、Moshiとは完全に別のカテゴリーになるほどだ。だが、購入できる製品と比べれば、遠く及ばない。Step-Audio R1.1が96%、Grok 4.5のVoice AgentとGemini 2.5 Flash (Thinking)が92%、Nova 2.0 Sonicが87%である。つまり、音声入力からの推論では、およそ3対1の差がある。
フルデュプレックスが現在どれほどのコストを伴うかを確認する最も明確な方法は、NVIDIA自身のカタログを見ることだ。VoiceBenchでは、フルデュプレックス対応ではないより大きなモデルであるNVIDIA Nemotron 3 Nano Omni 30B A3Bが89.39を記録しているのに対し、VoiceChatは58.10にとどまる。割り込み処理と500ミリ秒未満のターンテイキングの代償は、アシスタント品質にして約30ポイント分だ——少なくともこの世代においては。製品が単語の途中で遮られるようなモデルを必要としないのであれば、使うことのない機能に多大なコストを払っていることになる。
ツール呼び出しが目玉であり、同時に最も弱い部分でもある
「ツール呼び出しをサポートする最初のオープンなフルデュプレックスモデル」というのがこのリリースの根拠となる主張であり、その背後にある数字はばらつきがある。BFCL-v3の音声版では、NVIDIAは平均56.1%を報告している:単純58.5%、複数62.5%、並列42.5%、並列複数27.5%、無関係な呼び出しを正しく拒否した場合は89.6%である。Full-Duplex-Bench v3では、その差はさらに顕著である。
• ツール選択 — 82.5%。リストから正しい関数を選ぶことであり、NVIDIAはこれをフロンティアモデルと競争力があると公正に説明している。
• 引数の正確性 — 44.2%。 ユーザーの発言からその関数のパラメータを正しく埋めること。
• Pass@1 — 33%。最初の試行で呼び出し全体を正しく行うこと。
どのツールを使うべきかを、ツールの引数を埋められる精度よりも3分の2高い信頼性で判断できるモデルは、間違った都市の天気を自信満々に調べるようなモデルです。テキストエージェントであれば、検証レイヤーとリトライでそれを検出できるでしょう。しかし、ライブの音声通話では、リトライはユーザーに聞こえてしまいます。カードには、失敗したコールをモデルが一切リトライすべきではないと明記されており、APIに問題があることをユーザーに伝えるよう指示されています。
それを取り巻く運用上の制約は厳しく、NVIDIAはそれを誇張なしに列挙している。品質が低下する前に1セッションで使えるツールは最大5つまで、複数ツールの同時呼び出しは信頼できない、ツール実行中にユーザーが割り込む方法はない、そして雑談が混ざる会話では、本来呼び出すべきツールを呼ばずに自分の知識から回答してしまう傾向がある。ツールの応答が長いとエージェントは停止してしまうが、それを覆い隠すために存在するのが「保留メッセージ」機能だ。つまり、呼び出しが発火した瞬間にエージェントが話すフレーズをあらかじめ書いておくことで、沈黙の中に何かを入れておくのだ。
誰かの午後を無駄にする厄介な点:システムプロンプトとツールの応答に求められるのはASCIIのみである。emダッシュ、カーリクォート、度記号、絵文字は一切使えない。ツールの出力は、モデルに届く前に、話し言葉に適したプレーンなASCII文に変換しなければならない。つまり、JSON APIレスポンスは生のまま渡すことはできない。
実行にかかる費用、そしてあなたを止めるライセンス
ハードウェアから始めましょう。NVIDIAのブランチドキュメントでは、少なくとも80GBのメモリを搭載したGPUが要求されており、これはH100またはH200を指しています。テスト済みの構成はvLLMを備えたH100です。一般的なGPUクラウドでは、オンデマンドのH100キャパシティは1時間あたり約2〜3ドルかかります。そのため、継続的に稼働するインスタンスは、アプリケーションコードを書く前、それを維持する人を雇う前、または2番目の同時会話に対応する前に、月額約1,500〜2,200ドルになります。
では、比較です。Artificial Analysis は、ホステッド音声対音声(speech-to-speech)の価格を入力音声1時間あたりのコストに換算しています。現在の価格帯は、安価な方で約1時間あたり1.42ドルから、最も高価なプレミアム層で1時間あたり10.75ドルまであり、Grok Voice Think Fast 2.0 のような評判の高いミッドマーケットの選択肢は1時間あたり4.80ドル、つまり音声1分あたり0.08ドルです。

この2つの段落を合わせて読むと、セルフホスティングの優位性は見た目ほど強くない。専用H100が中価格帯のホステッドエンドポイントより安くなるのは、実際に使い続けた場合だけだ。そして、利用状況にほとんど関係なく、ホステッド市場の低価格帯よりも高額になる。その上、エンジニアリングやオンコール対応のコストも負担し、ホステッドオプションが87〜96%を達成する一方で、モデルのスコアは29.2%にとどまる。
そして壁がある。ライセンスはOpenMDW License Agreement v1.1であり、カードは独自のブロック引用の中で、このモデルは「研究目的のみに利用できる」と述べている。GitHubブランチのコードはApache-2.0だが、重みはそうではない。これをダウンロードし、研究し、ファインチューニングし、ベンチマークし、記事を書くことはできる。しかし、顧客の前に置くことはできない。したがって、上記の経済的議論はすべて、音声製品を出荷しようとする企業にとっては机上の空論である——問題は決してGPUの計算が機能するかどうかではなかった。
これこそが、私たちが当然のことを率直に言う理由でもあります。NemotronLabs VoiceChat 11B は OrcaRouter 経由では呼び出せません。そもそも、どの手段からも呼び出せないからです。1つのキーで実際に得られるのは、それ(NemotronLabs VoiceChat 11B)が評価されるべきベースラインです。ホスト型の音声・オーディオモデルは単一のAPIの背後にあり、マークアップは0%です。つまり、プロバイダーの定価をそのまま通すということです。ベンダーが音声レートを引き下げた場合、契約サイクル後ではなく、その日のうちに低い料金が適用されます。音声エージェントの価格を決めるなら、その1分あたりの数字が、80 GB GPUが打ち負かすべき数字です。そして、ラックを導入する前に、その数字を正確に把握しておく価値があります。
名前の問題:11B、12B、NemotronLabs、Nemotron 3
ここが初期の報道のほとんどが間違ってきた点であり、何が確定していて何が確定していないのかを慎重に見極める価値がある。
NVIDIA自身の4つの情報源は、この成果を3つの異なる呼称で説明している。Hugging Faceは、オープンウェイトと研究専用ライセンスの下で「NVIDIA NemotronLabs VoiceChat 11B」を公開している。NVIDIAの開発者ブログは2026年3月に、「Nemotron 3 VoiceChat」を早期アクセスの12Bパラメータの全二重モデルとして説明し、その目標としてsub-300 msのエンドツーエンド遅延(80 msチャンク時)を掲げ、早期アクセスプログラムではリファレンスコンテナ、ベンチマーク結果、ファインチューニングのパスを提供し、「エンタープライズ展開のためのオープンで検証可能なウェイト」を約束している。公開のVoiceBenchリーダーボードとArtificial Analysisはともに、このエントリを「Nemotron 3 VoiceChat (V1)」12Bとして登録している。
分かっていること:アーキテクチャの説明は構成要素ごとに一致している——Fast Conformerエンコーダー、Nemotron Nano v2 9Bバックボーン、NVIDIA TTSデコーダー、独立したツール呼び出しチャネル、80msフレーム、単一の統合スタック。Hugging Faceリポジトリの未レンダリングのカードは、他の場所と同じ12Bの数値を使用している。これは同じ系統の研究であり、第三者のエントリはほぼ間違いなくこのファミリーを測定している。
何が未確認なのかというと、今日ダウンロードできるチェックポイントが、Artificial AnalysisとVoiceBenchが評価したもの、あるいは早期アクセスプログラムが配布するものと、ビット単位で完全に一致するかどうか、ということだ。それを前提とすべきでないことを示す点が2つある。パラメータ数が異なる——申請上の12Bに対して、測定値は11.095Bだ。そしてレイテンシ目標も大きく異なる——ブログのエンタープライズ向け説明ではエンドツーエンドで300ms未満とされている一方、出荷されたカードはFull-Duplex-Benchで448msと480msを計測している。これらは同じモデルの異なる測定ポイントかもしれないし、別のモデルかもしれない。NVIDIAは何も述べていない。NVIDIAはこのリリースについて何も発表していないからだ。
実務上の要点は、このモデルの数値を引用するなら、それがどの公開面(サーフェス)から来た数値かを明示することだ。Artificial Analysis の29.2%を Hugging Face のモデルカードに由来するものとし、NVIDIA の37.0%を独立したテストに由来するものとする報道は、NVIDIA自身が異なるパラメータ数で別々の文書に分けている2つのものを混同している。
それが壊れるところ
ドラフトカードの制限事項セクションは異例なほど率直であり、GitHubブランチはさらに多くのことを付け加えている。収集済み:
• 英語のみで、リポジトリには多言語対応のロードマップはありません。
• 2分間の記憶。2分のオーディオウィンドウを超える会話は保持されない場合があります。これは、サポートコールや、4分前に合意した内容を覚えておく必要があるあらゆるものにとって、厳しい上限です。
• 自身のバックボーンよりも知能が低い。NVIDIAは、知識、指示追従および安全性の面でNemotron Nano 9B v2に及ばない可能性があると述べている。というのも、会話の自然さを重視してチューニングされたためだ。推論やアライメントを明示的に学習しておらず、多段階推論や算術が弱点とされている。
• 信頼できるバックチャネリングがない。人間がまだ聞いていることを示す「mm-hm」は、体系的に処理されていない。
• 話の途中で遮ってきます。ブランチノートには、既知の障害モードとして、文の途中の間でユーザーを遮ることや「暴走継続/独り言」が挙げられています — これは、右コンテキストがゼロのエンコーダーの直接的な代償です。
• 静かな部屋のみ。 騒がしい環境や残響の多い環境には明らかに不向きで、特に背景に話し声がある場所では適していません。これにより、ほとんどのコールセンターのフロアやほとんどの車内は対象外となります。
実際にこれをダウンロードすべき人は誰でしょう
二重音声モデリングに取り組む研究者は、ここから最も多くのものを得られ、移行すべきです。SALM-Duplex論文から再実装するよりも、実音声と合成音声を混ぜた約55万時間で学習された、動作するツール呼び出しチャネルを備えた11Bのオープンチェックポイントの方が、はるかに優れた出発点となります。研究ライセンスは、その作業に対する制約にはなりません。
音声エージェントを構築しているチームは、カードを読んでダウンロードを省略すべきだ。出荷できない44GBのfloat32チェックポイントから得られる教訓では、アーキテクチャは変わらない。そして、ベンチマークの正直な教訓は、エンドツーエンドの全二重通信が、ユーザーが最も気にする点—つまりアシスタントが自分を理解したかどうか—において、優れたホスト型モデルにまだ及ばないということだ。当面の賢明な選択は、ホスト型エンドポイントに対して構築し、乗り換えを安価に保つことだ。—自動フェイルオーバーを備えた200以上のモデルにまたがる単一のキーは、プロバイダーの障害が通話中に電話回線を切断しないことを意味し、そして後でオープンな全二重モデルに移行することが、書き直しではなく設定変更であることを意味する。
この点を特に重視する企業は、Hugging Face の重みに基づいて構築するのではなく、Nemotron 3 VoiceChat の早期アクセスに申請すべきです。そのプログラムには、デプロイ可能なライセンス、参照コンテナ、そして300ミリ秒未満という主張が含まれています。公開されているチェックポイントは、同じアイデアの研究プレビューであり、それを利用できるようにするための書類なしで公開されています。
このリポジトリが繰り返し受ける3つの質問
大幅にファインチューニングすれば商用利用できますか?いいえ。OpenMDW v1.1とモデルカードの「研究目的のみ」という記載は、ウェイトおよびそこから派生したものすべてに適用されます。GitHubブランチ上のApache-2.0ライセンスは推論コードを対象としており、チェックポイントには適用されません。ファインチューニングしてもライセンスは変わりません。商用利用の権利が必要であれば、NVIDIAが実際にそのために用意しているのはアーリーアクセスプログラムです。
これはリーダーボードに載っているモデルと同じものですか?同じファミリーであることはほぼ確実ですが、同一のアーティファクトであるかは未確認です。リーダーボードとArtificial Analysisのエントリは、12Bの「Nemotron 3 VoiceChat (V1)」として登録されていますが、ダウンロード可能なチェックポイントは11.095Bと測定されており、NVIDIAはこれらを整合させる情報を何も公開していません。リーダーボードの数値は、系統に関する利用可能な最良の独立した判断材料として使用し、Hugging Face上のファイルの検証済みの測定値としては扱わないでください。
80GBカードより小さいものでも動作しますか?おそらく、工夫次第で動作するでしょうが、それを証明した公開情報はまだありません。重みはfloat32なので、bfloat16に変換すれば、約44GBのパラメータを約22GBに削減でき、KVキャッシュ、コーデック、ストリーミングバッファを考慮する前の時点で、48GBカードには十分な余裕が生まれます。ただし、サポートされている経路は80GBのH100上のvLLMであり、デプロイメントコンテナもそれ用に構築されています。NVIDIAが報告しているテスト済み構成はその1つだけです。VRAMだけでなく、時間にも余裕を見てください。
何を見るべきか
このリリースの評価を変える要素は三つある。自己矛盾のないモデルカード、あるいはテクニカルレポートがあれば、11Bチェックポイントがリーダーボードが測定した成果物であるかどうかが分かるだろう。独立したレイテンシ再現—NVIDIAの外部の誰かが自社のハードウェアで448msのターンテイキングを確認すること—は、このリリースの最も魅力的な主張をマーケティングから事実へと変えるだろう。そして、商用ライセンス、または誰かが提供するホステッドエンドポイントがあれば、これは論文に近い珍品から、割り込み可能な音声エージェントのためにある程度の推論品質を喜んで犠牲にする多くのチームにとっての現実的な選択肢へと変わるだろう。
それらのいずれかが実現するまでは、正確な評価は狭いながらも真に注目に値するものだ。すなわち、NVIDIAは、これまでに測定された中で最強のオープンな全二重音声チェックポイントを公開し、そのカテゴリーでは初の実用ツール呼び出しチャネルをそれに搭載し、誰も出荷できない条件でライセンスし、そしてこうしたことがすべて起きたことをあえて言及しなかったのである。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
