
Realtime-Venus против SeedRealtime: два противоположных способа быть недоступным
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus и SeedRealtime — это две половины одной и той же истории 2026 года, и они проваливают противоположные тесты. SeedRealtime — это нативная аудиовизуальная полнодуплексная модель ByteDance, включённая в приложении Doubao 5 августа 2026 года бесплатно, охватывающая аудиторию, которую её создатель описывает как исчисляющуюся сотнями миллионов, — без API, без идентификатора модели, без цены и без целевого показателя задержки. Realtime-Venus — это пара 9B-чекпоинтов от Venus Team из Ant Group и Университета Цинхуа, опубликованных 12 сентября 2026 года под лицензией Apache-2.0 вместе с техническим отчётом и без анонса, лежащих в репозитории, который любой инженер может скачать, а реалистично развернуть почти никто не может. Один из них вы не можете вызвать. Другой вы можете скачать и затем обнаружить, что вам не на чем его вызывать. Оба действительно находятся на переднем крае одной и той же возможности, и ни у одного нет бенчмарка, который кто-либо, кроме их собственных авторов, воспроизвёл.
Два варианта «тебе этого не получить».
Стоит быть точным, потому что фраза «недоступно» скрывает реальную разницу.
SeedRealtime недоступен так, как бывает недоступен потребительский продукт: он существует, работает, у него есть пользователи, а дверь для разработчиков просто закрыта. Нет API, нет тарифной сетки, нет портала документации и нет объявленных сроков его появления. Путь ByteDance на рынок — это приложение, и приложения было достаточно. Как разработчик вы получаете демо, которое можно испытать, но нельзя интегрировать.
Realtime-Venus недоступна в том смысле, в каком недоступен исследовательский артефакт: веса открыты, лицензия разрешительная, код на месте, но никто её не запускает. Репозиторий не развёрнут ни одним провайдером инференса, а загрузки вообще не отслеживаются, так что публичного сигнала о её adoption нет ни в ту, ни в другую сторону. Она доступна в том смысле, который важен исследователю, и недоступна в том смысле, который важен продакт-менеджеру.
В совокупности они очерчивают вопрос, на котором сейчас застряла вся эта категория: модели, которые работают, находятся за потребительскими приложениями, а модели, которые можно запустить, нигде не используются в продакшене.
Оба находятся на том уровне, который действительно отличает 2026.
Полезный способ разобраться в сфере realtime — рассматривать её на трёх уровнях. Первый — полудуплексный голос с прикрученным зрением: ассистенты, работающие по очереди, которые могут видеть, но всё равно отвечают по очереди. Второй — полнодуплексное аудио: слушает и говорит одновременно, без камеры: собственный Seeduplex от ByteDance, GPT-Live от OpenAI, Grok Voice Think Fast 2.0 от xAI. Третий — аудиовизуальный полный дуплекс, где восприятие и выражение непрерывно охватывают видео и аудио.
SeedRealtime — первая модель третьего уровня, достигшая крупномасштабного коммерческого развертывания. Realtime-Venus — участник с открытыми весами на том же уровне: видео через энкодер SigLIP2, аудио через Whisper-Medium, базовая модель Qwen3-8B и односекундный цикл взаимодействия, который никогда не перестаёт воспринимать. В её карточке модели указано, что она адаптирована из MiniCPM-o 4.5 — омнимодальной модели OpenBMB, выпущенной ранее в 2026 году, — что относит вклад Ant Group к постобучению и среде выполнения, а не к базовой архитектуре.
Что их объединяет и что ставит их на ступень выше чисто аудиосистем, — так это то, что ни та, ни другая не останавливается, чтобы посмотреть. Непрерывное визуальное восприятие во время речи — это действительно иная способность, чем описание отдельного кадра, и обе модели были построены вокруг неё.
Чего стоят показатели каждого из них

Ни у одной из моделей нет стороннего бенчмарка. Однако доказательства не равноценны, и это различие имеет значение.
• SeedRealtime вообще не публикует никаких бенчмарков. ByteDance предлагает лишь утверждение, что проблемы с ритмом диалога — перебивание пользователя, запоздалые ответы, срабатывание на посторонний шум — сокращаются примерно вдвое по сравнению с каскадной системой, согласно сквозным оценкам людей. Исходные данные не опубликованы.
• Цифры предшественника имеют ту же форму. Seeduplex, аудиомодель, которую ByteDance выпустила в Doubao в апреле 2026 года, как сообщается, вдвое снизила частоту ложных ответов и ложных прерываний, сократила задержку конечной точки примерно на 250 миллисекунд, уменьшила количество преждевременных ответов на 40% и повысила удовлетворённость звонками на 8,34 балла в крупномасштабном A/B-тесте. Все данные предоставлены производителем.
• Realtime-Venus публикует таблицу. В её отчёте заявляются лучшие результаты по шести из восьми видеобенчмарков, включая StreamingBench 70.2, OVO-Bench 64.7 и Daily-Omni 81.3, а также лидерство по MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8 и Speech CMMLU 67.8 для аудиочекпоинта.
• Оба результата не воспроизведены. Опубликованная таблица, которую никто не проверял, и неопубликованный A/B-тест, который никто не может проверить, — это разные виды непроверенного. Ни то, ни другое не является доказательством, на котором можно основывать закупочное решение.
Единственное сравнение, которое имеет смысл делать внутри показателей Realtime-Venus, — это сравнение с её собственной базовой моделью. MiniCPM-o 4.5 показывает 80,2 на Daily-Omni; Realtime-Venus-Omni показывает 81,3. Прирост в один пункт относительно модели, из которой она была адаптирована, на бенчмарке, с которым эта модель уже справлялась, — правдоподобный результат для усилий по постобучению и работе в рантайме — и куда более скромное заявление, чем фраза «лучший в шести из восьми» звучит сама по себе.

Проблема смены реплик — именно в ней и живёт полнодуплексный режим.
Полный дуплекс — это не характеристика задержки. Это набор моделей поведения: понимать, когда пауза означает «я думаю», а не «я закончил», отличать разговор посторонних от речи человека, который обращается к вам, и молчать, когда собеседник поддакивает, вместо того чтобы воспринимать «мм-хм» как перебивание.
Подход SeedRealtime состоит в том, чтобы моделировать состояние диалога нативно и полностью отказаться от внешнего детектора голосовой активности, поэтому смена реплик становится выученным поведением внутри сети, а не порогом, применяемым к аудиопотоку. Тот же архитектурный принцип исповедует Realtime-Venus, и оба они противопоставлены каскадным системам, которым нужен отдельный компонент, чтобы решать, кто говорит.
Где доказательства расходятся, так это в том, что утверждение SeedRealtime касается развёртывания в масштабе — сотни миллионов пользователей, реальные комнаты, реальный шум, — тогда как утверждение Realtime-Venus касается бенчмарка. Результаты Full-Duplex-Bench v1.5 для Realtime-Venus-Audio — 75% реакции на перебивания, продолжение в 97% случаев при поддакиваниях, 88% при речи, адресованной другим, и 86% при фоновой речи, превосходя Gemini 3.1 Live и GPT-4o по продолжению, — это самые непосредственно релевантные цифры, опубликованные любой из этих моделей по данной проблеме. Кроме того, они полностью основаны на самоотчётах, а 97% продолжения при поддакиваниях — поразительный показатель, который заслуживает независимой проверки, прежде чем кто-либо станет приводить его как факт.
Где каждый оставляет по строителю
Практический разрыв — не в качестве, а в форме предложения.
• SeedRealtime — его можно бесплатно попробовать в Doubao, а интегрировать — никогда. Нет пути от «это впечатляет» до «это в моём продукте».
• Realtime-Venus — его можно скачать, дообучить, запускать в изолированной от сети среде и inspect every layer? Wait: "inspect every layer" — «проверять/изучать каждый слой». The cost — "Цена" — два чекпоинта 9B в BF16, примерно по восемнадцать гигабайт весов каждый, плюс непрерывный потоковый цикл с посекундной обработкой, а значит, GPU-узел, который тарифицируется независимо от того, обращается ли к нему кто-нибудь.
• Ни у того, ни у другого нет хостингового варианта. Ни то, ни другое нельзя попробовать, имея ключ и полдня.
Последний пункт — причина, по которой эти две модели полезнее в паре, чем в качестве противников. Вместе они демонстрируют, что обе половины задачи решены — возможность работает, и веса можно выпустить, — и при этом показывают, что никто ещё не соединил их вместе во что-то, что разработчик действительно мог бы вызвать.
Есть обходной путь, к которому прибегнут многие команды, и стоит четко понимать, что он покрывает, а что нет. Если вы не можете получить голосовой слой, вы всё ещё можете построить ту часть, которая думает. Realtime-Venus делегирует свою дорогостоящую работу — поиск, сложные рассуждения, вызовы бизнес-API — фоновому каркасу через маркеры асинхронного делегирования, и это делегированное звено — обычный текстовый инференс. OrcaRouter не предоставляет ни Realtime-Venus, ни SeedRealtime; оба дуплексных слоя находятся вне того, что мы предоставляем, и мы не хостим ни один из них. Почти 200 текстовых моделей через один ключ по прайс-листовой цене провайдера без наценки — это та половина архитектуры, которую мы как раз и покрываем, с автоматическим переключением при сбое, чтобы фоновая задача не завершилась сбоем из-за того, что у одного из апстримов выдался неудачный день, DSL маршрутизации для объединения нескольких моделей в один вызов, и слияние моделей, когда суждения одной модели недостаточно. Это не та часть этих систем, которая сложна. Это та часть, которую действительно можно купить.

Что бы изменило это сравнение?
Три события поставили бы точку в этом вопросе, и ни одно из них пока не произошло. Независимый бенчмарк Realtime-Venus — потому что таблица без второго читателя остаётся утверждением, а не результатом. API для SeedRealtime — потому что модель с самыми сильными доказательствами развёртывания сейчас та, которой никто не может воспользоваться. И опубликованный показатель задержки хотя бы от одной из них — время до первого аудио — это метрика, по которой покупают в этой категории, а на момент написания ни одна из моделей его не назвала.
До тех пор честная оценка такова: SeedRealtime — это доказательство того, что аудиовизуальный полный дуплекс работает в потребительском масштабе, а Realtime-Venus — доказательство того, что веса можно открыть, и ни один из этих фактов не приближает разработчика к выпуску продукта. Это не критика ни одной из лабораторий. Это описание категории, которая решила исследовательскую задачу и пока не решила задачу дистрибуции.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
