Титульная карточка для «Sesame Preview против NVIDIA NemotronLabs VoiceChat 11B»: крупный заголовок, подзаголовок «Голос, который нельзя лицензировать, и голос, который нельзя выпустить», и две плоские карточки с иконками — «Sesame Preview» с линейной иконкой «телефон и человек» и значком «Бесплатное приложение · без API · выбор рецензентов», а также «NVIDIA NemotronLabs VoiceChat 11B» с линейной иконкой «загрузка и сервер» и значком «Открытые веса · только для исследований · самостоятельный хостинг». Нижний колонтитул: «Два лучших невыпускаемых голоса — голосовой ИИ, август 2026». Логотип OrcaRouter, размещённый в правом нижнем углу.
Guides & Insights

Sesame Preview против NVIDIA NemotronLabs VoiceChat 11B: голос, который нельзя лицензировать, и голос, который нельзя выпустить

Автор

Jim Song

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

У двух самых обсуждаемых голосовых моделей 2026 года есть одна общая черта, о которой не расскажет ни один материал о запуске: ни одну из них нельзя встроить в продукт. Sesame Preview — это бесплатный потребительский ассистент, чей разговорный голос заставил TestingCatalog назвать его «одним из лучших голосовых режимов, доступных на рынке», а лежащая в его основе производственная модель не имеет ни API, ни идентификатора модели, ни лицензии, которую можно купить, — компания просто не выпустила её. NVIDIA NemotronLabs VoiceChat 11B — зеркальное отражение: веса открыты, полнодуплексная архитектура — действительно первая в своём роде, а лицензия разрешает использование только в исследовательских целях, так что её тоже никто не может легально поставлять. Одна — это голос, который можно услышать, но нельзя арендовать. Другая — это голос, который можно держать в руках, но нельзя продавать. Это сравнение двух запертых дверей, и полезный вопрос — перед каким замком вы стоите.

Две запертые двери с разными замками.

Начнём с сути каждого продукта, потому что названия скрывают, насколько эти два продукта различаются. Sesame Preview — это приложение, а не API. В его составе четыре агента с ярко выраженными характерами: Майя (тёплая и творческая), Майлз (спокойный и проницательный), Симона (любознательная и интеллектуальная), Чарли (остроумный и душевный) — у каждого свой голос и своя память, которая синхронизируется между веб-версией и мобильным приложением, когда вы вошли в аккаунт. Оно ищет в интернете, проводит глубокие исследования, делает заметки и напоминания и отправляет сводку после каждого разговора. Предварительная версия бесплатна, без платного тарифа, только на английском языке, с лимитом 30 минут на один разговор при входе в аккаунт (пять минут — в противном случае), и она намеренно не выполняет задачи: может устроить мозговой штурм и провести исследование, но не забронирует вам авиабилет. В продукте нет ни одного API-ключа — продакшен-голос — это функция приложения, а не эндпоинт.

Screenshot of Sesame's official Mobile Preview page (sesame.com/mobile-preview), showing 'Personal agents for curious people' and 'Preview available now on iOS and Android' with App Store and Google Play links. Captured August 6, 2026.

NVIDIA NemotronLabs VoiceChat 11B — полная противоположность: это чекпоинт, а не продукт. Она появилась на Hugging Face 3 августа 2026 года без анонса — ни поста о запуске, ни технического отчёта, ни твита; карточка модели и есть анонс. Это полнодуплексная речевая модель на 11B параметров (мы разобрали заголовок safetensors и насчитали 11,095 миллиарда параметров в 1 626 тензорах), собранная в единый стек: энкодер Fast Conformer, обрабатывающий аудио 16 кГц кадрами по 80 мс с нулевым правым контекстом, магистраль Nemotron Nano 9B v2, отвечающая за рассуждение, декодер NVIDIA TTS, выдающий аудио 22,05 кГц, RNN-T декодер, транскрибирующий пользователя, и отдельный выходной канал, который генерирует скрипты вызова инструментов, не смешивая их с произносимым ответом. Она слушает и говорит одновременно, её можно прервать на полуслове, и NVIDIA называет её первой открытой полнодуплексной моделью с вызовом инструментов. Насколько это заявление соответствует реальности — тема отдельного раздела ниже.

Эталон, на котором они расходятся, — два кандидата на «лучший разговор», два сломанных стандарта доказательств.

Обе модели ставят на карту всю свою репутацию ради одного и того же: качества диалога — очерёдность реплик, перебивания, естественный темп, ощущение настоящего живого общения. Именно поэтому они и заслуживают общего заголовка. Но именно здесь сравнение становится странным, потому что ни одного из кандидатов нельзя оценить по достоинству.

У Sesame Preview нет ни одного числа. Продакшн-модель не выпущена и не внесена в списки — нет идентификатора модели, нет записи в лидерборде speech-to-speech от Artificial Analysis, нет целевой задержки, нет никаких бенчмарков. Фраза TestingCatalog «один из лучших голосовых режимов, доступных на рынке» — это мнение обозревателей, а не измерение, и нет способа провести слепое A/B-тестирование с чем-либо. Единственная модель Sesame, которую кто-либо может запустить самостоятельно, — это базовая CSM-1B с открытыми весами, и это чекпоинт text-to-speech, а не голос приложения.

У NVIDIA NemotronLabs VoiceChat 11B противоположная проблема: показатели у неё есть, но они распределены по двум стандартам доказательств, которые не согласуются между собой. NVIDIA сообщает о 448 мс на плавный захват хода, 480 мс на уступку при прерывании и идеальном показателе 1,0 по перехвату инициативы при прерывании пользователем — всё измерено вендором на собственном Full-Duplex-Bench 1.0 от NVIDIA и независимо не воспроизведено. Независимые измерения этого семейства зафиксированы под другим именем и с другим числом параметров — «Nemotron 3 VoiceChat (V1)» на 12B, — ярлык, который NVIDIA так и не соотнесла с чекпоинтом 11B на Hugging Face, — и они нелестны в части понимания: 29,2% на Big Bench Audio по данным Artificial Analysis против 37,0% на собственной карточке NVIDIA. На VoiceBench семейство набирает 58,10 — лучший открытый полнодуплексный результат в таблице лидеров. Таким образом, одна и та же модель одновременно является лидером среди открытых полнодуплексных чекпоинтов и отстаёт примерно в три раза от hosted-лидеров реального времени в понимании того, что слышит.

A two-column comparison scoreboard for Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B. Sesame Preview: 'free app, 4 voice agents', 'Independent score: none — app unreleased', 'How you buy it: no API — app only', 'Callable voice: CSM-1B, $7/M chars', 'Memory: per-agent, syncs across devices', 'Latency: no published target'. NVIDIA NemotronLabs VoiceChat 11B: 'open full-duplex checkpoint', 'Independent score: VoiceBench 58.10 (V1/12B)', 'How you buy it: not buyable — research-only', 'Callable voice: none — 80 GB self-host', 'Memory: ~2 min audio context max', 'Latency: 448 ms turn-taking (NVIDIA)'. Footer: 'Nemotron figures per NVIDIA / Artificial Analysis (V1 12B lineage); Sesame app voice unmeasured; prices per vendor/OpenRouter.' OrcaRouter logo composited bottom-right.

Расхождение, таким образом, не в том, что лучше. Оно в том, что двух кандидатов на лучший разговор 2026 года оценивают на основе противоположных и в равной степени неполных данных. Голос, который, по словам обозревателей, ощущается наиболее человечным, не имеет измерений вообще, а голос с реальными позициями в рейтинге — это тот, чьи слабости публичны. Нельзя сравнивать репутацию с числом, а здесь есть только одно число — и оно не из лестных.

Доступ — загрузка из магазина приложений или сборка на 80 ГБ

Если вы хотите попробовать любой из них, то стартовая линия отличается так, что это важнее любых характеристик.

Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.

NVIDIA NemotronLabs VoiceChat 11B — это тоже не просто файл, который можно скачать и запустить: это сборка, которую нужно разворачивать. Hugging Face утверждает, что модель «не развернута ни одним поставщиком инференса»; NVIDIA не размещала её у себя; а config.json в репозитории — это конфиг для обучения NeMo, так что чекпоинта Transformers, на который можно было бы нацелить AutoModel, там нет. Поддерживаемый путь — это conda-окружение с закреплёнными версиями Python 3.12, PyTorch 2.10 и Transformers 4.56, где causal-conv1d и mamba-ssm компилируются из исходников, на GPU с 80 ГБ памяти (A100, H100, H200, B200 или RTX 6000) под управлением vLLM — либо контейнер NVIDIA NGC NIM, который открывает WebSocket, совместимый с OpenAI Realtime, по адресу /v1/realtime, при условии, что вы уже на этом оборудовании. Счётчик загрузок рассказывает историю доступа: примерно 80 загрузок за первый месяц модели против 107 лайков. Люди добавляли её в закладки; почти никто её не запускал. Одно честное замечание для исследователя, который всё же это сделает: бэкбон рассуждений, на котором построен этот чекпоинт, — Nemotron Nano 9B v2 — сам по себе является размещённой моделью, к которой можно обратиться уже сегодня; а вот полнодуплексная модель вокруг него — нет, и весь смысл именно в этом разрыве.

The Hugging Face model card for nvidia/NVIDIA-NemotronLabs-VoiceChat-11B, showing the OpenMDW 1.1 research-only license, 'This model isn't deployed by any Inference Provider', natural turn-taking / barge-in / tool calling, ~450 ms response, 11B params, and 80 downloads in the last month with 107 likes. Captured August 6, 2026.

Цена — бесплатное приложение, бесплатные веса и счёт за 80 ГБ.

Обе модели «бесплатны», и в обоих случаях это слово в равной степени вводит в заблуждение.

Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.

Честный ориентир на тот день, когда любую из этих моделей можно будет купить: какую бы хостинговую голосовую модель вы ни выбрали, вы должны платить цену из прайс-листа провайдера, без наценки за маршрутизацию сверху — сквозной перенос, благодаря которому снижение цены вендором отражается в вашем счете в тот же день, а не после завершения контрактного цикла. Ни одну из моделей из этого материала нельзя вызвать через OrcaRouter: у продакшн-голоса Sesame вообще нет API, а NVIDIA NemotronLabs VoiceChat 11B нельзя вызвать ни через что. Ориентир относится к тому голосу, который вы действительно можете купить, и это ровно тот стандарт, который позволяет легко и честно устанавливать цену на базовую ставку T​TS в $7 за миллион символов или на будущий API уровня Sesame.

Memory — приложение, которое помнит, против модели, которая забывает

Здесь разрыв — это целый каньон, и это самая конкретная причина, по которой эти две вещи не взаимозаменяемы. Sesame Preview: приложение запоминает — каждый агент несёт индивидуальную память, которая синхронизируется между веб-версией и мобильным приложением, когда вы вошли в систему; звонки могут длиться до 30 минут; а режим инкогнито читает прошлые воспоминания, не создавая новых. Открытая модель CSM-1B, напротив, имеет контекстное окно на 4K — примерно три-четыре минуты текста — и у неё, в любом случае, нет ушей, чтобы вас услышать.

NVIDIA NemotronLabs VoiceChat 11B вмещает не более примерно двух минут аудиоконтекста — тренировочный даталоадер ограничивает реплики до 142,39 секунды, а в карточке модели предупреждается, что разговор за пределами двухминутного окна может не сохраняться. Для звонка в поддержку, которому необходимо помнить о договорённостях, достигнутых четыре минуты назад, этот предел сам по себе является дисквалифицирующим фактором. Добавьте единственный фиксированный голос (Aria) без возможности клонирования в выпущенном чекпоинте — и модель, открытая в отношении своей архитектуры, также оказывается моделью, которая не может запомнить клиента или изменить собственный голос.

В чём каждый из них действительно плох

Собранный, потому что сравнение, которое останавливается на сильных сторонах, — это маркетинг:

Sesame Preview: нет API — вы не можете встроить этот голос в продукт, а производственная модель не выпущена и не оценена. Только английский язык, без выполнения задач, лимит звонков 30 минут и никаких независимых бенчмарков. Единственная открытая модель, CSM-1B, имеет контекстное окно 4K, не поддерживает вызов инструментов, не имеет функции прослушивания и не является голосом приложения.

NVIDIA NemotronLabs VoiceChat 11B: лицензия только для исследований (OpenMDW v1.1) — вы можете скачать, изучить и дообучить её, но не можете выпускать её как продукт, и никто из тех, кто строит на её основе, тоже не может. Нет размещённого эндпоинта, поэтому «попробовать её» означает GPU на 80 ГБ и сборку из исходников. Только английский язык, потолок памяти около 2 минут, один фиксированный голос. NVIDIA заявляет, что она может уступать собственной базовой модели по знаниям и следованию инструкциям, а многошаговые рассуждения и арифметика отмечаются как слабые. Она может обрывать вас на полуслове, после нескольких ходов деградировать в необратимую бессмыслицу или разговор с самой собой, пропускать слова при расшифровке и явно не подходит для шумных или гулких помещений. Вызов инструментов работает только с подсказками и ответами, содержащими только ASCII, максимум пять инструментов за сессию, а точность аргументов (44,2%) и процент успеха с первой попытки (33%) означают, что она выбирает правильный инструмент надёжнее, чем заполняет его аргументы.

Кто должен выбирать

Поскольку ни один из них не является вызываемым, честный ответ начинается с того, что вы пытаетесь сделать.

Познакомьтесь с лучшим по отзывам голосом 2026 года: Sesame Preview, бесплатно, сегодня — в виде приложения. Четыре агента, обработка прерываний, удобство режима вождения, которое рецензенты постоянно отмечают: это потребительский продукт, и его ценность — именно то, что невозможно измерить.

Изучение полнодуплексного моделирования речи:NVIDIA NemotronLabs VoiceChat 11B — самый интересный файл для скачивания в своей категории: открытая контрольная точка 11B с работающим каналом вызова инструментов, примерно 550 000 часов смешанного обучающего аудио и лучший на данный момент открытый результат полнодуплексного VoiceBench — и всё это при нулевой стоимости весов. Лицензия только для исследований не является ограничением для этой работы.

Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.

Выпустите голосовой продукт в этом квартале: ни то, ни другое. Вам нужна размещённая модель преобразования речи в речь в реальном времени с коммерческой лицензией, и безопасный способ внедрить ту, на которую вы не ставили как на основной производственный путь, — это направлять к ней запросы наряду с проверенной моделью с автоматическим переключением при сбое, чтобы непроверенный голос никогда не срывал живой звонок. Один API для более чем 200 размещённых моделей по цене провайдера, без наценки, — вот что превращает опробование недавно появившегося голоса в изменение конфигурации, а не в переписывание кода.

Этот паттерн стоит назвать, потому что он будет повторяться. Обе эти модели отделяет одно событие от того, чтобы стать вызываемыми: Sesame — день, когда появится идентификатор модели или API; NVIDIA NemotronLabs VoiceChat 11B — день, когда NVIDIA опубликует коммерческую лицензию или кто-то разместит её у себя. Когда это произойдёт, правильным решением будет не вырывать текущий голосовой стек, а добавить новый голос рядом со старым и маршрутизировать с отказоустойчивостью — точно так же, как вы поступили бы с любой новой, непроверенной моделью. Это два лучших невыпущенных голоса 2026 года; инфраструктура для выпуска третьего уже существует.

Что бы изменило это сравнение?

Четыре события могли бы переписать этот материал. API или идентификатор модели для продакшн-голоса Sesame — как только это произойдёт, Sesame перестанет быть приложением и станет тем игроком, которого ждал рынок хостинговых голосовых API. Коммерческая лицензия или хостинговый эндпоинт для NVIDIA NemotronLabs VoiceChat 11B, которые в одночасье превратили бы исследовательский артефакт в реальный продукт. Независимая оценка голоса Sesame — появление в таблице speech-to-speech на Artificial Analysis позволило бы проверить заявление о «лучшем голосе». И технический отчёт NVIDIA, согласующий чекпоинт 11B с позициями 12B «Nemotron 3 VoiceChat (V1)» в лидербордах, — предпосылка для доверия любым показателям этого семейства. Пока ничего из этого не появилось, корректное резюме просто: оба самых интересных разговорных голоса 2026 года заблокированы — один компанией, которая не продаёт, другой лицензией, которая не выйдет.

Часто задаваемые вопросы

Могу ли я использовать голос любой из моделей в своём приложении?

No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.

Что из двух на самом деле звучит более по-человечески?

Неизвестно, по разным причинам для каждого. У Sesame Preview вообще нет независимой оценки — слова TestingCatalog о том, что это «один из лучших голосовых режимов на рынке», это консенсус обозревателей, а не измерение. Тайминг разговора NVIDIA NemotronLabs VoiceChat 11B (448 мс на смену реплик, 480 мс на уступку при прерывании) указан самой NVIDIA и не воспроизведён независимо, а его независимый показатель Big Bench Audio (29,2%, по данным Artificial Analysis, в категории «Nemotron 3 VoiceChat (V1)») измеряет понимание, а не приятность голоса. У одного — репутация, которую можно услышать; у другого — цифры, отвечающие на другой вопрос.

Действительно ли NVIDIA NemotronLabs VoiceChat 11B бесплатный?

Веса бесплатны; модель недёшева. Запуск требует GPU на 80 ГБ (примерно $2–3 в час по требованию, $1,500–2,200 в месяц, если держать его постоянно включённым) и сборки из исходников, а лицензия OpenMDW v1.1 ограничивает её только исследовательскими целями — так что даже после таких затрат вы не можете легально предоставить её клиентам.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube