
Realtime-Venus против Sesame Preview: то, что можно получить, — не то, что хорошо
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus и Sesame Preview созданы лабораториями с совершенно разными представлениями о том, для чего нужна голосовая модель, и они попали в одну и ту же ловушку с противоположных сторон. Sesame Preview — это бесплатное потребительское приложение (на iOS с мая 2026 года, на Android с начала августа) с четырьмя разговорными агентами, поиском в интернете в реальном времени во время звонков и голосом, который обозреватели называли лучшим в своём классе. Опубликованные Sesame открытые веса — это другая, меньшая модель, которую сама компания не представляет как тот голос, что вы слышали в демо. Realtime-Venus — полнодуплексная система на 9B от Venus Team компании Ant Group и Университета Цинхуа — пошла другим путём: загружаемые артефакты — это настоящая система, а продукта как такового нет вообще. В обоих случаях разрыв между тем, что доступно, и тем, что впечатляет, — это самое полезное, что стоит понять, прежде чем планировать что-либо вокруг любого из них.
Что каждый из них на самом деле из себя представляет

Sesame Preview — это продукт. Sesame — лаборатория из Сан-Франциско, основанная в 2023 году Бренданом Ирибе, Анкитом Кумаром и Райаном Брауном при поддержке a16z, Sequoia, Spark и Matrix, а её потребительский голосовой ассистент включает четыре персоналии — Майю, Майлза, Симону и Чарли — у каждой свой темперамент и голос. Агент может искать в интернете прямо во время разговора, создавать заметки и напоминания и отправлять итоговую сводку после звонка. Память ведётся отдельно для каждого агента и синхронизируется между веб-версией и мобильным приложением, когда вы вошли в аккаунт; есть режим инкогнито, который читает прошлые воспоминания, но не записывает новые. Продукт бесплатный, без рекламы, и компания утверждает, что не продаёт данные.
Realtime-Venus — это исследовательский релиз. Два 9B-чекпоинта под лицензией Apache-2.0 на Hugging Face — Realtime-Venus-Omni для аудиовизуального взаимодействия и Realtime-Venus-Audio для голосового взаимодействия — а также технический отчёт, отправленный в arXiv 12 сентября 2026 года, страница проекта и сопутствующий репозиторий, содержащий компонент Realtime-Venus-Harness. Нет приложения, нет API, нет цены и нет анонса от вендора. Репозиторий не развёрнут ни одним провайдером инференса, и загрузки не отслеживаются.
Ловушка, в обоих направлениях
Версия Sesame — это классическая форма опенвошинга, и Sesame честнее в этом, чем большинство. CSM-чекпойнт, который лаборатория выпустила под лицензией Apache-2.0, — это базовая модель генерации речи: бэкбон Llama, подающий сигнал на декодер Mimi-codec, — и в документации прямо сказано, что это не голос приложения и не сквозная система преобразования речи в речь. Она не умеет генерировать текст и обучена в основном на англоязычных данных, а её возможности за пределами английского ограниченны. Работу Sesame Preview обеспечивает более крупная продакшен-модель, которая не была выпущена. Так что если вы отправились искать голос из демо, вы нашли его исследовательскую родословную, а не сам голос. Когда один из четырёх агентов отвечает на ваш звонок, вы слышите то, что нельзя скачать.
Версия Realtime-Venus — это зеркальное отражение, и, пожалуй, более странное. Всё опубликованное подлинно: настоящие веса, настоящий код, настоящий отчёт, разрешительная лицензия. Не хватает лишь способа использовать это, не владея GPU. Два чекпоинта 9B в BF16 — это примерно по восемнадцать гигабайт весов каждый до учёта памяти активаций, и оба рассчитаны на непрерывный односекундный потоковый цикл с живым аудио- и видеовходом. Это развёртывание серверного класса. Потребительское приложение, которое доставляет ту же возможность на телефон, делает то, чего этот релиз даже не пытается, и разрыв между скачиваемой и запускаемой моделью — именно там, где застрянет большинство тех, кто её хочет.
Измеримость — это более резкое различие
Ни одна из моделей не имеет независимой оценки качества голоса, но причины различаются.
• Sesame Preview — отсутствует в арене, нет опубликованной оценки голоса в продакшене. Репутация Sesame Preview держится на рецензентах и на эффекте оригинального демо на слушателей — а это своего рода реальное свидетельство, но совершенно не измеренное.
• CSM-1B — открытый чекпойнт представляет собой базовую генеративную модель; он не сравнивается с диалоговыми системами, поскольку таковой не является.
• Realtime-Venus — один самостоятельно заявленный голосовой показатель: оценка VoiceBench AlpacaEval 4,81, которую его отчёт описывает как соответствующую лучшему показателю среди сравниваемых. Ни одна третья сторона не проводила его оценку.
• То, чего не даёт ни один из них, — это число, полученное кем-то, кто не заинтересован в результате. Если качество голоса — ваш критерий покупки, то всё это сравнение невозможно оценить, и честный шаг — послушать оба и решить самому, а не полагаться на таблицу.
Поочерёдность, где обоим есть что доказать
Репутация Sesame была построена именно на этом. Демо, прославившее лабораторию, — это голос с дыханием, запинками и таймингом перебивания, достаточно убедительный, чтобы слушатели решили, будто на линии человек. Это утверждение о динамике разговора, и именно на этом продаётся продукт.
Realtime-Venus делает такое же заявление, подкрепив его цифрами. На Full-Duplex-Bench v1.5 его аудио-чекпоинт сообщает о реакции на 75% пользовательских прерываний, с показателями продолжения 97% при бэкчанелах, 88% при речи, обращённой к другим, и 86% при фоновой речи — утверждается, что он превосходит Gemini 3.1 Live и GPT-4o по всем трём метрикам продолжения. Эти цифры взяты из его собственного отчёта, и никто их не воспроизвёл.
Итак, сравнение — это демонстрация без числа против числа без демонстрации; это по-настоящему неловкое положение и честное описание того, как вся эта категория прямо сейчас рассказывает о себе. Единственное, что можно утверждать с уверенностью, — что ни одно из этих утверждений не прошло проверку независимой стороной, а 97-процентный показатель продолжения при использовании неофициальных каналов достаточно высок, чтобы заслуживать такой проверки, прежде чем его начнут цитировать как установленный факт.

Что вы действительно можете создать
Sesame Preview ничего не даёт разработчику. Нет API, нет идентификатора модели, нет тарифной сетки и нет никаких заявленных планов на появление чего-либо из этого. Звонки ограничены тридцатью минутами, если вы вошли в систему, и пятью — в противном случае, английский — единственный официально поддерживаемый язык, а агент будет исследовать и запоминать, но не выполнять задачи — он не забронирует рейс. Бесплатный тариф и есть продукт. Это вполне хорошее потребительское предложение и тупик для интеграции.
Realtime-Venus даёт разработчику всё, кроме места, где это можно запустить. Веса распространяются по разрешительной лицензии, код загружается стандартными вызовами Transformers, полнодуплексный потоковый режим включается одним переключением метода, а задокументированный цикл состоит из одной секунды потокового префилла, за которой следует потоковая генерация, и повторяется. Память для длинных видео включается параметром memory-minutes и описывается как не требующая обучения, что необычно для возможности, которая обычно требует дообучения. Две оговорки задокументированы, а не оставлены на самостоятельное обнаружение: ограничение на количество кадров, которое незаметно обрезает длинное видео, если не увеличить константу до импорта утилиты, и требование наличия шрифта CJK для нелатинских субтитров, отрисовываемых в дуплексное видео.
Но всё это не меняет того, что harness — компонент, который выполняет асинхронные делегирования, самую характерную часть архитектуры, — находится в отдельном репозитории GitHub, документирован куда хуже, чем модель, и именно по нему труднее всего судить о готовности к продакшену. В реальном развёртывании плечо делегирования — это обычный текстовый инференс за диалоговым интерфейсом. OrcaRouter не предоставляет ни Realtime-Venus, ни Sesame Preview; оба голосовых слоя находятся вне того, что мы обслуживаем, и мы говорим об этом прямо, а не намекаем на отношения хостинга, которых не существует. Почти 200 текстовых моделей за одним ключом по прайсовой цене провайдера без наценки — это та половина этой архитектуры, которую мы действительно покрываем, с автоматическим переключением при сбое, чтобы делегированная задача пережила отказ вышестоящего сервиса, DSL маршрутизации, объединяющим несколько моделей в один вызов, и слиянием моделей там, где суждения одной модели недостаточно. Это та часть решения, которую можно купить, а его интересная часть не продаётся.

Честная рекомендация
Если вы потребитель, который хочет самый лучший по звучанию разговорный голос, доступный сегодня, и вам не нужно его интегрировать, Sesame Preview бесплатен, доступен на обеих мобильных платформах, и его репутация вполне заслужена — обозреватели продолжают это повторять. Пользуйтесь и наслаждайтесь.
Если вы исследователь или инженерная команда с серьёзными ресурсами, которой нужен открытый аудиовизуальный стек полного дуплекса, который можно изучать и дообучать, Realtime-Venus — один из очень немногих реальных вариантов, и то, что его бенчмарки основаны на самоотчётах, не меняет того, что веса действительно открыты, а архитектура действительно задокументирована.
Если вы продуктовая команда, ищущая голосовой слой, чтобы выпустить его в этом квартале, ни один из этих вариантов не станет вашим ответом, а полезный вывод из их сопоставления — почему. Одна лаборатория создала нечто превосходное и оставила хорошую часть закрытой; другая опубликовала всё и оставила вам обеспечивать инфраструктуру. Категория доказала, что способна создать голос, который стоит слушать, но ещё не решила, должен ли этот голос быть доступен для покупки в какой-либо форме, кроме приложения.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
