Титульная карточка для «Realtime-Venus vs SeedRealtime» с подзаголовком «Один работает для сотен миллионов людей. Другой пока не работает ни для кого», с тремя карточками: «SeedRealtime: доступен в Doubao с 5 августа 2026 года, без API, без цены», «Realtime-Venus: веса под Apache-2.0, без развёртывания» и «Оба: ноль независимо воспроизведённых бенчмарков», над нижней полосой с текстом «Оба набора цифр заявлены вендором; ни один из них не был независимо воспроизведён». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Realtime-Venus против SeedRealtime: два противоположных способа быть недоступным

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Realtime-Venus и SeedRealtime — это две половины одной и той же истории 2026 года, и они проваливают противоположные тесты. SeedRealtime — это нативная аудиовизуальная полнодуплексная модель ByteDance, включённая в приложении Doubao 5 августа 2026 года бесплатно, охватывающая аудиторию, которую её создатель описывает как исчисляющуюся сотнями миллионов, — без API, без идентификатора модели, без цены и без целевого показателя задержки. Realtime-Venus — это пара 9B-чекпоинтов от Venus Team из Ant Group и Университета Цинхуа, опубликованных 12 сентября 2026 года под лицензией Apache-2.0 вместе с техническим отчётом и без анонса, лежащих в репозитории, который любой инженер может скачать, а реалистично развернуть почти никто не может. Один из них вы не можете вызвать. Другой вы можете скачать и затем обнаружить, что вам не на чем его вызывать. Оба действительно находятся на переднем крае одной и той же возможности, и ни у одного нет бенчмарка, который кто-либо, кроме их собственных авторов, воспроизвёл.

Два варианта «тебе этого не получить».

Стоит быть точным, потому что фраза «недоступно» скрывает реальную разницу.

SeedRealtime недоступен так, как бывает недоступен потребительский продукт: он существует, работает, у него есть пользователи, а дверь для разработчиков просто закрыта. Нет API, нет тарифной сетки, нет портала документации и нет объявленных сроков его появления. Путь ByteDance на рынок — это приложение, и приложения было достаточно. Как разработчик вы получаете демо, которое можно испытать, но нельзя интегрировать.

Realtime-Venus недоступна в том смысле, в каком недоступен исследовательский артефакт: веса открыты, лицензия разрешительная, код на месте, но никто её не запускает. Репозиторий не развёрнут ни одним провайдером инференса, а загрузки вообще не отслеживаются, так что публичного сигнала о её adoption нет ни в ту, ни в другую сторону. Она доступна в том смысле, который важен исследователю, и недоступна в том смысле, который важен продакт-менеджеру.

В совокупности они очерчивают вопрос, на котором сейчас застряла вся эта категория: модели, которые работают, находятся за потребительскими приложениями, а модели, которые можно запустить, нигде не используются в продакшене.

Оба находятся на том уровне, который действительно отличает 2026.

Полезный способ разобраться в сфере realtime — рассматривать её на трёх уровнях. Первый — полудуплексный голос с прикрученным зрением: ассистенты, работающие по очереди, которые могут видеть, но всё равно отвечают по очереди. Второй — полнодуплексное аудио: слушает и говорит одновременно, без камеры: собственный Seeduplex от ByteDance, GPT-Live от OpenAI, Grok Voice Think Fast 2.0 от xAI. Третий — аудиовизуальный полный дуплекс, где восприятие и выражение непрерывно охватывают видео и аудио.

SeedRealtime — первая модель третьего уровня, достигшая крупномасштабного коммерческого развертывания. Realtime-Venus — участник с открытыми весами на том же уровне: видео через энкодер SigLIP2, аудио через Whisper-Medium, базовая модель Qwen3-8B и односекундный цикл взаимодействия, который никогда не перестаёт воспринимать. В её карточке модели указано, что она адаптирована из MiniCPM-o 4.5 — омнимодальной модели OpenBMB, выпущенной ранее в 2026 году, — что относит вклад Ant Group к постобучению и среде выполнения, а не к базовой архитектуре.

Что их объединяет и что ставит их на ступень выше чисто аудиосистем, — так это то, что ни та, ни другая не останавливается, чтобы посмотреть. Непрерывное визуальное восприятие во время речи — это действительно иная способность, чем описание отдельного кадра, и обе модели были построены вокруг неё.

Чего стоят показатели каждого из них

A screenshot of the ByteDance Seed page for SeedRealtime, captured 18 September 2026, showing the page language toggle set to EN, the heading 'SeedRealtime: An Audio-Visual Full-Duplex LLM' dated August 5, 2026, and the opening overview text stating that the model natively unifies audio, video and text in a single architecture and that end-to-end human evaluations show it halves conversational pacing issues compared with cascaded models.

Ни у одной из моделей нет стороннего бенчмарка. Однако доказательства не равноценны, и это различие имеет значение.

• SeedRealtime вообще не публикует никаких бенчмарков. ByteDance предлагает лишь утверждение, что проблемы с ритмом диалога — перебивание пользователя, запоздалые ответы, срабатывание на посторонний шум — сокращаются примерно вдвое по сравнению с каскадной системой, согласно сквозным оценкам людей. Исходные данные не опубликованы.

• Цифры предшественника имеют ту же форму. Seeduplex, аудиомодель, которую ByteDance выпустила в Doubao в апреле 2026 года, как сообщается, вдвое снизила частоту ложных ответов и ложных прерываний, сократила задержку конечной точки примерно на 250 миллисекунд, уменьшила количество преждевременных ответов на 40% и повысила удовлетворённость звонками на 8,34 балла в крупномасштабном A/B-тесте. Все данные предоставлены производителем.

• Realtime-Venus публикует таблицу. В её отчёте заявляются лучшие результаты по шести из восьми видеобенчмарков, включая StreamingBench 70.2, OVO-Bench 64.7 и Daily-Omni 81.3, а также лидерство по MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8 и Speech CMMLU 67.8 для аудиочекпоинта.

• Оба результата не воспроизведены. Опубликованная таблица, которую никто не проверял, и неопубликованный A/B-тест, который никто не может проверить, — это разные виды непроверенного. Ни то, ни другое не является доказательством, на котором можно основывать закупочное решение.

Единственное сравнение, которое имеет смысл делать внутри показателей Realtime-Venus, — это сравнение с её собственной базовой моделью. MiniCPM-o 4.5 показывает 80,2 на Daily-Omni; Realtime-Venus-Omni показывает 81,3. Прирост в один пункт относительно модели, из которой она была адаптирована, на бенчмарке, с которым эта модель уже справлялась, — правдоподобный результат для усилий по постобучению и работе в рантайме — и куда более скромное заявление, чем фраза «лучший в шести из восьми» звучит сама по себе.

A two-column comparison scoreboard titled 'Realtime-Venus vs SeedRealtime — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Availability: Apache-2.0 weights, no deployment', 'Where it runs: nowhere in production', 'Modality: audio, video and text', 'Benchmarks: self-reported table', 'Context: 40,960 tokens', 'Base model: adapted from MiniCPM-o 4.5'. The right column, labelled SeedRealtime, reads 'Availability: Doubao app only, no API', 'Where it runs: consumer scale since 5 August 2026', 'Modality: audio, video and text', 'Benchmarks: none published, vendor A/B claims', 'Context: not published', 'Base model: not disclosed'. The footer reads 'All figures vendor-reported; neither model has an independently reproduced benchmark.'

Проблема смены реплик — именно в ней и живёт полнодуплексный режим.

Полный дуплекс — это не характеристика задержки. Это набор моделей поведения: понимать, когда пауза означает «я думаю», а не «я закончил», отличать разговор посторонних от речи человека, который обращается к вам, и молчать, когда собеседник поддакивает, вместо того чтобы воспринимать «мм-хм» как перебивание.

Подход SeedRealtime состоит в том, чтобы моделировать состояние диалога нативно и полностью отказаться от внешнего детектора голосовой активности, поэтому смена реплик становится выученным поведением внутри сети, а не порогом, применяемым к аудиопотоку. Тот же архитектурный принцип исповедует Realtime-Venus, и оба они противопоставлены каскадным системам, которым нужен отдельный компонент, чтобы решать, кто говорит.

Где доказательства расходятся, так это в том, что утверждение SeedRealtime касается развёртывания в масштабе — сотни миллионов пользователей, реальные комнаты, реальный шум, — тогда как утверждение Realtime-Venus касается бенчмарка. Результаты Full-Duplex-Bench v1.5 для Realtime-Venus-Audio — 75% реакции на перебивания, продолжение в 97% случаев при поддакиваниях, 88% при речи, адресованной другим, и 86% при фоновой речи, превосходя Gemini 3.1 Live и GPT-4o по продолжению, — это самые непосредственно релевантные цифры, опубликованные любой из этих моделей по данной проблеме. Кроме того, они полностью основаны на самоотчётах, а 97% продолжения при поддакиваниях — поразительный показатель, который заслуживает независимой проверки, прежде чем кто-либо станет приводить его как факт.

Где каждый оставляет по строителю

Практический разрыв — не в качестве, а в форме предложения.

• SeedRealtime — его можно бесплатно попробовать в Doubao, а интегрировать — никогда. Нет пути от «это впечатляет» до «это в моём продукте».

• Realtime-Venus — его можно скачать, дообучить, запускать в изолированной от сети среде и inspect every layer? Wait: "inspect every layer" — «проверять/изучать каждый слой». The cost — "Цена" — два чекпоинта 9B в BF16, примерно по восемнадцать гигабайт весов каждый, плюс непрерывный потоковый цикл с посекундной обработкой, а значит, GPU-узел, который тарифицируется независимо от того, обращается ли к нему кто-нибудь.

• Ни у того, ни у другого нет хостингового варианта. Ни то, ни другое нельзя попробовать, имея ключ и полдня.

Последний пункт — причина, по которой эти две модели полезнее в паре, чем в качестве противников. Вместе они демонстрируют, что обе половины задачи решены — возможность работает, и веса можно выпустить, — и при этом показывают, что никто ещё не соединил их вместе во что-то, что разработчик действительно мог бы вызвать.

Есть обходной путь, к которому прибегнут многие команды, и стоит четко понимать, что он покрывает, а что нет. Если вы не можете получить голосовой слой, вы всё ещё можете построить ту часть, которая думает. Realtime-Venus делегирует свою дорогостоящую работу — поиск, сложные рассуждения, вызовы бизнес-API — фоновому каркасу через маркеры асинхронного делегирования, и это делегированное звено — обычный текстовый инференс. OrcaRouter не предоставляет ни Realtime-Venus, ни SeedRealtime; оба дуплексных слоя находятся вне того, что мы предоставляем, и мы не хостим ни один из них. Почти 200 текстовых моделей через один ключ по прайс-листовой цене провайдера без наценки — это та половина архитектуры, которую мы как раз и покрываем, с автоматическим переключением при сбое, чтобы фоновая задача не завершилась сбоем из-за того, что у одного из апстримов выдался неудачный день, DSL маршрутизации для объединения нескольких моделей в один вызов, и слияние моделей, когда суждения одной модели недостаточно. Это не та часть этих систем, которая сложна. Это та часть, которую действительно можно купить.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge, the arXiv 2609.13814 badge, the model card heading 'A full-duplex interaction system with asynchronous delegation', and a side panel stating 'This model isn't deployed by any Inference Provider.'

Что бы изменило это сравнение?

Три события поставили бы точку в этом вопросе, и ни одно из них пока не произошло. Независимый бенчмарк Realtime-Venus — потому что таблица без второго читателя остаётся утверждением, а не результатом. API для SeedRealtime — потому что модель с самыми сильными доказательствами развёртывания сейчас та, которой никто не может воспользоваться. И опубликованный показатель задержки хотя бы от одной из них — время до первого аудио — это метрика, по которой покупают в этой категории, а на момент написания ни одна из моделей его не назвала.

До тех пор честная оценка такова: SeedRealtime — это доказательство того, что аудиовизуальный полный дуплекс работает в потребительском масштабе, а Realtime-Venus — доказательство того, что веса можно открыть, и ни один из этих фактов не приближает разработчика к выпуску продукта. Это не критика ни одной из лабораторий. Это описание категории, которая решила исследовательскую задачу и пока не решила задачу дистрибуции.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно