Титульная карточка для «Realtime-Venus vs Sesame Preview» с подзаголовком «Две лаборатории, одна и та же ловушка, противоположные направления», с тремя карточками: «Sesame Preview: бесплатное приложение, четыре агента, нет API с мая 2026 года», «Realtime-Venus: веса Apache-2.0, нет продукта, нет анонса» и «Ни одна не публикует независимо проверенную оценку голоса», над нижней полосой с текстом «Возможности Sesame согласно её собственной документации по мобильному превью; данные Realtime-Venus из её технического отчёта, не воспроизведены». Логотип OrcaRouter скомпонован в правом нижнем углу.
Guides & Insights

Realtime-Venus против Sesame Preview: то, что можно получить, — не то, что хорошо

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Realtime-Venus и Sesame Preview созданы лабораториями с совершенно разными представлениями о том, для чего нужна голосовая модель, и они попали в одну и ту же ловушку с противоположных сторон. Sesame Preview — это бесплатное потребительское приложение (на iOS с мая 2026 года, на Android с начала августа) с четырьмя разговорными агентами, поиском в интернете в реальном времени во время звонков и голосом, который обозреватели называли лучшим в своём классе. Опубликованные Sesame открытые веса — это другая, меньшая модель, которую сама компания не представляет как тот голос, что вы слышали в демо. Realtime-Venus — полнодуплексная система на 9B от Venus Team компании Ant Group и Университета Цинхуа — пошла другим путём: загружаемые артефакты — это настоящая система, а продукта как такового нет вообще. В обоих случаях разрыв между тем, что доступно, и тем, что впечатляет, — это самое полезное, что стоит понять, прежде чем планировать что-либо вокруг любого из них.

Что каждый из них на самом деле из себя представляет

A screenshot of the Sesame mobile preview page, captured 18 September 2026, showing the header navigation with Blog, Team, Mobile Preview and Research Preview, the headline 'Personal agents for curious people', the line 'Preview available now on iOS and Android', and both the App Store and Google Play download badges.

Sesame Preview — это продукт. Sesame — лаборатория из Сан-Франциско, основанная в 2023 году Бренданом Ирибе, Анкитом Кумаром и Райаном Брауном при поддержке a16z, Sequoia, Spark и Matrix, а её потребительский голосовой ассистент включает четыре персоналии — Майю, Майлза, Симону и Чарли — у каждой свой темперамент и голос. Агент может искать в интернете прямо во время разговора, создавать заметки и напоминания и отправлять итоговую сводку после звонка. Память ведётся отдельно для каждого агента и синхронизируется между веб-версией и мобильным приложением, когда вы вошли в аккаунт; есть режим инкогнито, который читает прошлые воспоминания, но не записывает новые. Продукт бесплатный, без рекламы, и компания утверждает, что не продаёт данные.

Realtime-Venus — это исследовательский релиз. Два 9B-чекпоинта под лицензией Apache-2.0 на Hugging Face — Realtime-Venus-Omni для аудиовизуального взаимодействия и Realtime-Venus-Audio для голосового взаимодействия — а также технический отчёт, отправленный в arXiv 12 сентября 2026 года, страница проекта и сопутствующий репозиторий, содержащий компонент Realtime-Venus-Harness. Нет приложения, нет API, нет цены и нет анонса от вендора. Репозиторий не развёрнут ни одним провайдером инференса, и загрузки не отслеживаются.

Ловушка, в обоих направлениях

Версия Sesame — это классическая форма опенвошинга, и Sesame честнее в этом, чем большинство. CSM-чекпойнт, который лаборатория выпустила под лицензией Apache-2.0, — это базовая модель генерации речи: бэкбон Llama, подающий сигнал на декодер Mimi-codec, — и в документации прямо сказано, что это не голос приложения и не сквозная система преобразования речи в речь. Она не умеет генерировать текст и обучена в основном на англоязычных данных, а её возможности за пределами английского ограниченны. Работу Sesame Preview обеспечивает более крупная продакшен-модель, которая не была выпущена. Так что если вы отправились искать голос из демо, вы нашли его исследовательскую родословную, а не сам голос. Когда один из четырёх агентов отвечает на ваш звонок, вы слышите то, что нельзя скачать.

Версия Realtime-Venus — это зеркальное отражение, и, пожалуй, более странное. Всё опубликованное подлинно: настоящие веса, настоящий код, настоящий отчёт, разрешительная лицензия. Не хватает лишь способа использовать это, не владея GPU. Два чекпоинта 9B в BF16 — это примерно по восемнадцать гигабайт весов каждый до учёта памяти активаций, и оба рассчитаны на непрерывный односекундный потоковый цикл с живым аудио- и видеовходом. Это развёртывание серверного класса. Потребительское приложение, которое доставляет ту же возможность на телефон, делает то, чего этот релиз даже не пытается, и разрыв между скачиваемой и запускаемой моделью — именно там, где застрянет большинство тех, кто её хочет.

Измеримость — это более резкое различие

Ни одна из моделей не имеет независимой оценки качества голоса, но причины различаются.

• Sesame Preview — отсутствует в арене, нет опубликованной оценки голоса в продакшене. Репутация Sesame Preview держится на рецензентах и на эффекте оригинального демо на слушателей — а это своего рода реальное свидетельство, но совершенно не измеренное.

• CSM-1B — открытый чекпойнт представляет собой базовую генеративную модель; он не сравнивается с диалоговыми системами, поскольку таковой не является.

• Realtime-Venus — один самостоятельно заявленный голосовой показатель: оценка VoiceBench AlpacaEval 4,81, которую его отчёт описывает как соответствующую лучшему показателю среди сравниваемых. Ни одна третья сторона не проводила его оценку.

• То, чего не даёт ни один из них, — это число, полученное кем-то, кто не заинтересован в результате. Если качество голоса — ваш критерий покупки, то всё это сравнение невозможно оценить, и честный шаг — послушать оба и решить самому, а не полагаться на таблицу.

Поочерёдность, где обоим есть что доказать

Репутация Sesame была построена именно на этом. Демо, прославившее лабораторию, — это голос с дыханием, запинками и таймингом перебивания, достаточно убедительный, чтобы слушатели решили, будто на линии человек. Это утверждение о динамике разговора, и именно на этом продаётся продукт.

Realtime-Venus делает такое же заявление, подкрепив его цифрами. На Full-Duplex-Bench v1.5 его аудио-чекпоинт сообщает о реакции на 75% пользовательских прерываний, с показателями продолжения 97% при бэкчанелах, 88% при речи, обращённой к другим, и 86% при фоновой речи — утверждается, что он превосходит Gemini 3.1 Live и GPT-4o по всем трём метрикам продолжения. Эти цифры взяты из его собственного отчёта, и никто их не воспроизвёл.

Итак, сравнение — это демонстрация без числа против числа без демонстрации; это по-настоящему неловкое положение и честное описание того, как вся эта категория прямо сейчас рассказывает о себе. Единственное, что можно утверждать с уверенностью, — что ни одно из этих утверждений не прошло проверку независимой стороной, а 97-процентный показатель продолжения при использовании неофициальных каналов достаточно высок, чтобы заслуживать такой проверки, прежде чем его начнут цитировать как установленный факт.

A two-column comparison scoreboard titled 'Realtime-Venus vs Sesame Preview — the scoreboard'. The left column, labelled Realtime-Venus, reads 'What it is: research release, Apache-2.0 weights', 'Product: none', 'Agents or voices: one reference voice', 'Languages: English and Chinese', 'Independent voice score: none', 'Runs on: a GPU node you own'. The right column, labelled Sesame Preview, reads 'What it is: free consumer app, closed production voice', 'Product: iOS since May 2026, Android since early August', 'Agents or voices: Maya, Miles, Simone, Charlie', 'Languages: English only', 'Independent voice score: none', 'Runs on: your phone'. The footer reads 'Sesame capabilities per its own mobile preview documentation; Realtime-Venus figures from its technical report, unreproduced.'

Что вы действительно можете создать

Sesame Preview ничего не даёт разработчику. Нет API, нет идентификатора модели, нет тарифной сетки и нет никаких заявленных планов на появление чего-либо из этого. Звонки ограничены тридцатью минутами, если вы вошли в систему, и пятью — в противном случае, английский — единственный официально поддерживаемый язык, а агент будет исследовать и запоминать, но не выполнять задачи — он не забронирует рейс. Бесплатный тариф и есть продукт. Это вполне хорошее потребительское предложение и тупик для интеграции.

Realtime-Venus даёт разработчику всё, кроме места, где это можно запустить. Веса распространяются по разрешительной лицензии, код загружается стандартными вызовами Transformers, полнодуплексный потоковый режим включается одним переключением метода, а задокументированный цикл состоит из одной секунды потокового префилла, за которой следует потоковая генерация, и повторяется. Память для длинных видео включается параметром memory-minutes и описывается как не требующая обучения, что необычно для возможности, которая обычно требует дообучения. Две оговорки задокументированы, а не оставлены на самостоятельное обнаружение: ограничение на количество кадров, которое незаметно обрезает длинное видео, если не увеличить константу до импорта утилиты, и требование наличия шрифта CJK для нелатинских субтитров, отрисовываемых в дуплексное видео.

Но всё это не меняет того, что harness — компонент, который выполняет асинхронные делегирования, самую характерную часть архитектуры, — находится в отдельном репозитории GitHub, документирован куда хуже, чем модель, и именно по нему труднее всего судить о готовности к продакшену. В реальном развёртывании плечо делегирования — это обычный текстовый инференс за диалоговым интерфейсом. OrcaRouter не предоставляет ни Realtime-Venus, ни Sesame Preview; оба голосовых слоя находятся вне того, что мы обслуживаем, и мы говорим об этом прямо, а не намекаем на отношения хостинга, которых не существует. Почти 200 текстовых моделей за одним ключом по прайсовой цене провайдера без наценки — это та половина этой архитектуры, которую мы действительно покрываем, с автоматическим переключением при сбое, чтобы делегированная задача пережила отказ вышестоящего сервиса, DSL маршрутизации, объединяющим несколько моделей в один вызов, и слиянием моделей там, где суждения одной модели недостаточно. Это та часть решения, которую можно купить, а его интересная часть не продаётся.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge with the Any-to-Any, Transformers, Safetensors, audio, video, speech and streaming tags, and a side panel stating 'This model isn't deployed by any Inference Provider.'

Честная рекомендация

Если вы потребитель, который хочет самый лучший по звучанию разговорный голос, доступный сегодня, и вам не нужно его интегрировать, Sesame Preview бесплатен, доступен на обеих мобильных платформах, и его репутация вполне заслужена — обозреватели продолжают это повторять. Пользуйтесь и наслаждайтесь.

Если вы исследователь или инженерная команда с серьёзными ресурсами, которой нужен открытый аудиовизуальный стек полного дуплекса, который можно изучать и дообучать, Realtime-Venus — один из очень немногих реальных вариантов, и то, что его бенчмарки основаны на самоотчётах, не меняет того, что веса действительно открыты, а архитектура действительно задокументирована.

Если вы продуктовая команда, ищущая голосовой слой, чтобы выпустить его в этом квартале, ни один из этих вариантов не станет вашим ответом, а полезный вывод из их сопоставления — почему. Одна лаборатория создала нечто превосходное и оставила хорошую часть закрытой; другая опубликовала всё и оставила вам обеспечивать инфраструктуру. Категория доказала, что способна создать голос, который стоит слушать, но ещё не решила, должен ли этот голос быть доступен для покупки в какой-либо форме, кроме приложения.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно