
Sesame Preview против NVIDIA NemotronLabs VoiceChat 11B: голос, который нельзя лицензировать, и голос, который нельзя выпустить
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- qwenНОВИНКАQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3055Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
- z-aiZ.ai: GLM 5.22026-06-1653Интеллект69Кодинг60Математика
У двух самых обсуждаемых голосовых моделей 2026 года есть одна общая черта, о которой не расскажет ни один материал о запуске: ни одну из них нельзя встроить в продукт. Sesame Preview — это бесплатный потребительский ассистент, чей разговорный голос заставил TestingCatalog назвать его «одним из лучших голосовых режимов, доступных на рынке», а лежащая в его основе производственная модель не имеет ни API, ни идентификатора модели, ни лицензии, которую можно купить, — компания просто не выпустила её. NVIDIA NemotronLabs VoiceChat 11B — зеркальное отражение: веса открыты, полнодуплексная архитектура — действительно первая в своём роде, а лицензия разрешает использование только в исследовательских целях, так что её тоже никто не может легально поставлять. Одна — это голос, который можно услышать, но нельзя арендовать. Другая — это голос, который можно держать в руках, но нельзя продавать. Это сравнение двух запертых дверей, и полезный вопрос — перед каким замком вы стоите.
Две запертые двери с разными замками.
Начнём с сути каждого продукта, потому что названия скрывают, насколько эти два продукта различаются. Sesame Preview — это приложение, а не API. В его составе четыре агента с ярко выраженными характерами: Майя (тёплая и творческая), Майлз (спокойный и проницательный), Симона (любознательная и интеллектуальная), Чарли (остроумный и душевный) — у каждого свой голос и своя память, которая синхронизируется между веб-версией и мобильным приложением, когда вы вошли в аккаунт. Оно ищет в интернете, проводит глубокие исследования, делает заметки и напоминания и отправляет сводку после каждого разговора. Предварительная версия бесплатна, без платного тарифа, только на английском языке, с лимитом 30 минут на один разговор при входе в аккаунт (пять минут — в противном случае), и она намеренно не выполняет задачи: может устроить мозговой штурм и провести исследование, но не забронирует вам авиабилет. В продукте нет ни одного API-ключа — продакшен-голос — это функция приложения, а не эндпоинт.

NVIDIA NemotronLabs VoiceChat 11B — полная противоположность: это чекпоинт, а не продукт. Она появилась на Hugging Face 3 августа 2026 года без анонса — ни поста о запуске, ни технического отчёта, ни твита; карточка модели и есть анонс. Это полнодуплексная речевая модель на 11B параметров (мы разобрали заголовок safetensors и насчитали 11,095 миллиарда параметров в 1 626 тензорах), собранная в единый стек: энкодер Fast Conformer, обрабатывающий аудио 16 кГц кадрами по 80 мс с нулевым правым контекстом, магистраль Nemotron Nano 9B v2, отвечающая за рассуждение, декодер NVIDIA TTS, выдающий аудио 22,05 кГц, RNN-T декодер, транскрибирующий пользователя, и отдельный выходной канал, который генерирует скрипты вызова инструментов, не смешивая их с произносимым ответом. Она слушает и говорит одновременно, её можно прервать на полуслове, и NVIDIA называет её первой открытой полнодуплексной моделью с вызовом инструментов. Насколько это заявление соответствует реальности — тема отдельного раздела ниже.
Эталон, на котором они расходятся, — два кандидата на «лучший разговор», два сломанных стандарта доказательств.
Обе модели ставят на карту всю свою репутацию ради одного и того же: качества диалога — очерёдность реплик, перебивания, естественный темп, ощущение настоящего живого общения. Именно поэтому они и заслуживают общего заголовка. Но именно здесь сравнение становится странным, потому что ни одного из кандидатов нельзя оценить по достоинству.
У Sesame Preview нет ни одного числа. Продакшн-модель не выпущена и не внесена в списки — нет идентификатора модели, нет записи в лидерборде speech-to-speech от Artificial Analysis, нет целевой задержки, нет никаких бенчмарков. Фраза TestingCatalog «один из лучших голосовых режимов, доступных на рынке» — это мнение обозревателей, а не измерение, и нет способа провести слепое A/B-тестирование с чем-либо. Единственная модель Sesame, которую кто-либо может запустить самостоятельно, — это базовая CSM-1B с открытыми весами, и это чекпоинт text-to-speech, а не голос приложения.
У NVIDIA NemotronLabs VoiceChat 11B противоположная проблема: показатели у неё есть, но они распределены по двум стандартам доказательств, которые не согласуются между собой. NVIDIA сообщает о 448 мс на плавный захват хода, 480 мс на уступку при прерывании и идеальном показателе 1,0 по перехвату инициативы при прерывании пользователем — всё измерено вендором на собственном Full-Duplex-Bench 1.0 от NVIDIA и независимо не воспроизведено. Независимые измерения этого семейства зафиксированы под другим именем и с другим числом параметров — «Nemotron 3 VoiceChat (V1)» на 12B, — ярлык, который NVIDIA так и не соотнесла с чекпоинтом 11B на Hugging Face, — и они нелестны в части понимания: 29,2% на Big Bench Audio по данным Artificial Analysis против 37,0% на собственной карточке NVIDIA. На VoiceBench семейство набирает 58,10 — лучший открытый полнодуплексный результат в таблице лидеров. Таким образом, одна и та же модель одновременно является лидером среди открытых полнодуплексных чекпоинтов и отстаёт примерно в три раза от hosted-лидеров реального времени в понимании того, что слышит.

Расхождение, таким образом, не в том, что лучше. Оно в том, что двух кандидатов на лучший разговор 2026 года оценивают на основе противоположных и в равной степени неполных данных. Голос, который, по словам обозревателей, ощущается наиболее человечным, не имеет измерений вообще, а голос с реальными позициями в рейтинге — это тот, чьи слабости публичны. Нельзя сравнивать репутацию с числом, а здесь есть только одно число — и оно не из лестных.
Доступ — загрузка из магазина приложений или сборка на 80 ГБ
Если вы хотите попробовать любой из них, то стартовая линия отличается так, что это важнее любых характеристик.
Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.
NVIDIA NemotronLabs VoiceChat 11B — это тоже не просто файл, который можно скачать и запустить: это сборка, которую нужно разворачивать. Hugging Face утверждает, что модель «не развернута ни одним поставщиком инференса»; NVIDIA не размещала её у себя; а config.json в репозитории — это конфиг для обучения NeMo, так что чекпоинта Transformers, на который можно было бы нацелить AutoModel, там нет. Поддерживаемый путь — это conda-окружение с закреплёнными версиями Python 3.12, PyTorch 2.10 и Transformers 4.56, где causal-conv1d и mamba-ssm компилируются из исходников, на GPU с 80 ГБ памяти (A100, H100, H200, B200 или RTX 6000) под управлением vLLM — либо контейнер NVIDIA NGC NIM, который открывает WebSocket, совместимый с OpenAI Realtime, по адресу /v1/realtime, при условии, что вы уже на этом оборудовании. Счётчик загрузок рассказывает историю доступа: примерно 80 загрузок за первый месяц модели против 107 лайков. Люди добавляли её в закладки; почти никто её не запускал. Одно честное замечание для исследователя, который всё же это сделает: бэкбон рассуждений, на котором построен этот чекпоинт, — Nemotron Nano 9B v2 — сам по себе является размещённой моделью, к которой можно обратиться уже сегодня; а вот полнодуплексная модель вокруг него — нет, и весь смысл именно в этом разрыве.

Цена — бесплатное приложение, бесплатные веса и счёт за 80 ГБ.
Обе модели «бесплатны», и в обоих случаях это слово в равной степени вводит в заблуждение.
Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.
Честный ориентир на тот день, когда любую из этих моделей можно будет купить: какую бы хостинговую голосовую модель вы ни выбрали, вы должны платить цену из прайс-листа провайдера, без наценки за маршрутизацию сверху — сквозной перенос, благодаря которому снижение цены вендором отражается в вашем счете в тот же день, а не после завершения контрактного цикла. Ни одну из моделей из этого материала нельзя вызвать через OrcaRouter: у продакшн-голоса Sesame вообще нет API, а NVIDIA NemotronLabs VoiceChat 11B нельзя вызвать ни через что. Ориентир относится к тому голосу, который вы действительно можете купить, и это ровно тот стандарт, который позволяет легко и честно устанавливать цену на базовую ставку TTS в $7 за миллион символов или на будущий API уровня Sesame.
Memory — приложение, которое помнит, против модели, которая забывает
Здесь разрыв — это целый каньон, и это самая конкретная причина, по которой эти две вещи не взаимозаменяемы. Sesame Preview: приложение запоминает — каждый агент несёт индивидуальную память, которая синхронизируется между веб-версией и мобильным приложением, когда вы вошли в систему; звонки могут длиться до 30 минут; а режим инкогнито читает прошлые воспоминания, не создавая новых. Открытая модель CSM-1B, напротив, имеет контекстное окно на 4K — примерно три-четыре минуты текста — и у неё, в любом случае, нет ушей, чтобы вас услышать.
NVIDIA NemotronLabs VoiceChat 11B вмещает не более примерно двух минут аудиоконтекста — тренировочный даталоадер ограничивает реплики до 142,39 секунды, а в карточке модели предупреждается, что разговор за пределами двухминутного окна может не сохраняться. Для звонка в поддержку, которому необходимо помнить о договорённостях, достигнутых четыре минуты назад, этот предел сам по себе является дисквалифицирующим фактором. Добавьте единственный фиксированный голос (Aria) без возможности клонирования в выпущенном чекпоинте — и модель, открытая в отношении своей архитектуры, также оказывается моделью, которая не может запомнить клиента или изменить собственный голос.
В чём каждый из них действительно плох
Собранный, потому что сравнение, которое останавливается на сильных сторонах, — это маркетинг:
• Sesame Preview: нет API — вы не можете встроить этот голос в продукт, а производственная модель не выпущена и не оценена. Только английский язык, без выполнения задач, лимит звонков 30 минут и никаких независимых бенчмарков. Единственная открытая модель, CSM-1B, имеет контекстное окно 4K, не поддерживает вызов инструментов, не имеет функции прослушивания и не является голосом приложения.
• NVIDIA NemotronLabs VoiceChat 11B: лицензия только для исследований (OpenMDW v1.1) — вы можете скачать, изучить и дообучить её, но не можете выпускать её как продукт, и никто из тех, кто строит на её основе, тоже не может. Нет размещённого эндпоинта, поэтому «попробовать её» означает GPU на 80 ГБ и сборку из исходников. Только английский язык, потолок памяти около 2 минут, один фиксированный голос. NVIDIA заявляет, что она может уступать собственной базовой модели по знаниям и следованию инструкциям, а многошаговые рассуждения и арифметика отмечаются как слабые. Она может обрывать вас на полуслове, после нескольких ходов деградировать в необратимую бессмыслицу или разговор с самой собой, пропускать слова при расшифровке и явно не подходит для шумных или гулких помещений. Вызов инструментов работает только с подсказками и ответами, содержащими только ASCII, максимум пять инструментов за сессию, а точность аргументов (44,2%) и процент успеха с первой попытки (33%) означают, что она выбирает правильный инструмент надёжнее, чем заполняет его аргументы.
Кто должен выбирать
Поскольку ни один из них не является вызываемым, честный ответ начинается с того, что вы пытаетесь сделать.
• Познакомьтесь с лучшим по отзывам голосом 2026 года: Sesame Preview, бесплатно, сегодня — в виде приложения. Четыре агента, обработка прерываний, удобство режима вождения, которое рецензенты постоянно отмечают: это потребительский продукт, и его ценность — именно то, что невозможно измерить.
• Изучение полнодуплексного моделирования речи:NVIDIA NemotronLabs VoiceChat 11B — самый интересный файл для скачивания в своей категории: открытая контрольная точка 11B с работающим каналом вызова инструментов, примерно 550 000 часов смешанного обучающего аудио и лучший на данный момент открытый результат полнодуплексного VoiceBench — и всё это при нулевой стоимости весов. Лицензия только для исследований не является ограничением для этой работы.
• Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.
• Выпустите голосовой продукт в этом квартале: ни то, ни другое. Вам нужна размещённая модель преобразования речи в речь в реальном времени с коммерческой лицензией, и безопасный способ внедрить ту, на которую вы не ставили как на основной производственный путь, — это направлять к ней запросы наряду с проверенной моделью с автоматическим переключением при сбое, чтобы непроверенный голос никогда не срывал живой звонок. Один API для более чем 200 размещённых моделей по цене провайдера, без наценки, — вот что превращает опробование недавно появившегося голоса в изменение конфигурации, а не в переписывание кода.
Этот паттерн стоит назвать, потому что он будет повторяться. Обе эти модели отделяет одно событие от того, чтобы стать вызываемыми: Sesame — день, когда появится идентификатор модели или API; NVIDIA NemotronLabs VoiceChat 11B — день, когда NVIDIA опубликует коммерческую лицензию или кто-то разместит её у себя. Когда это произойдёт, правильным решением будет не вырывать текущий голосовой стек, а добавить новый голос рядом со старым и маршрутизировать с отказоустойчивостью — точно так же, как вы поступили бы с любой новой, непроверенной моделью. Это два лучших невыпущенных голоса 2026 года; инфраструктура для выпуска третьего уже существует.
Что бы изменило это сравнение?
Четыре события могли бы переписать этот материал. API или идентификатор модели для продакшн-голоса Sesame — как только это произойдёт, Sesame перестанет быть приложением и станет тем игроком, которого ждал рынок хостинговых голосовых API. Коммерческая лицензия или хостинговый эндпоинт для NVIDIA NemotronLabs VoiceChat 11B, которые в одночасье превратили бы исследовательский артефакт в реальный продукт. Независимая оценка голоса Sesame — появление в таблице speech-to-speech на Artificial Analysis позволило бы проверить заявление о «лучшем голосе». И технический отчёт NVIDIA, согласующий чекпоинт 11B с позициями 12B «Nemotron 3 VoiceChat (V1)» в лидербордах, — предпосылка для доверия любым показателям этого семейства. Пока ничего из этого не появилось, корректное резюме просто: оба самых интересных разговорных голоса 2026 года заблокированы — один компанией, которая не продаёт, другой лицензией, которая не выйдет.
Часто задаваемые вопросы
Могу ли я использовать голос любой из моделей в своём приложении?
No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.
Что из двух на самом деле звучит более по-человечески?
Неизвестно, по разным причинам для каждого. У Sesame Preview вообще нет независимой оценки — слова TestingCatalog о том, что это «один из лучших голосовых режимов на рынке», это консенсус обозревателей, а не измерение. Тайминг разговора NVIDIA NemotronLabs VoiceChat 11B (448 мс на смену реплик, 480 мс на уступку при прерывании) указан самой NVIDIA и не воспроизведён независимо, а его независимый показатель Big Bench Audio (29,2%, по данным Artificial Analysis, в категории «Nemotron 3 VoiceChat (V1)») измеряет понимание, а не приятность голоса. У одного — репутация, которую можно услышать; у другого — цифры, отвечающие на другой вопрос.
Действительно ли NVIDIA NemotronLabs VoiceChat 11B бесплатный?
Веса бесплатны; модель недёшева. Запуск требует GPU на 80 ГБ (примерно $2–3 в час по требованию, $1,500–2,200 в месяц, если держать его постоянно включённым) и сборки из исходников, а лицензия OpenMDW v1.1 ограничивает её только исследовательскими целями — так что даже после таких затрат вы не можете легально предоставить её клиентам.
