Титульная карточка для 'Realtime-Venus' с подзаголовком 'Статья, два чекпоинта и никакого анонса', с тремя карточками: 'Realtime-Venus-Omni: 9B, аудиовизуальный, Apache-2.0', 'Realtime-Venus-Audio: 9B, речевое взаимодействие' и 'Всё ещё отсутствуют: API, цена, пост о запуске, независимый бенчмарк', над нижней полосой с текстом 'Все показатели бенчмарков взяты из технического отчёта; ни один не воспроизведён независимо.' Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Realtime-Venus: полнодуплексная 9B-модель Ant Group выпущена без анонса

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

12 сентября 2026 года на arXiv появился технический отчёт, описывающий Realtime-Venus — полнодуплексную систему взаимодействия, построенную на двух отдельно обученных 9B-моделях: Realtime-Venus-Omni для аудиовизуального взаимодействия и Realtime-Venus-Audio для речевого взаимодействия, — авторство которой приписывается команде Venus Team в Ant Group, работавшей совместно с Университетом Цинхуа. В течение нескольких дней репозиторий под лицензией Apache-2.0 по адресу inclusionAI/Realtime-Venus на Hugging Face содержал оба чекпоинта в виде доступных для скачивания BF16 safetensors, а также страницу проекта и сопутствующий репозиторий GitHub. А вот чего не появилось — это та часть, которую стоит отметить: ни анонсирующего поста, ни страницы продукта, ни API, ни прайс-листа, и ничего на собственных ресурсах Ant Group, что объявляло бы о существовании чего-либо из этого. Это релиз, в котором выпущено всё, кроме анонса, что делает отделение установленных фактов от утверждений всей задачей.

Что на самом деле находится на диске

Репозиторий не является заглушкой. В нём есть два каталога моделей, каждый с шардированными весами safetensors, конфигурацией и пользовательским кодом Hugging Face Transformers, который карточка предлагает загружать с помощью trust_remote_code=True. Есть файл requirements, папка assets с ресурсами token-to-waveform и эталонным голосом, а также лицензия Apache-2.0 в корне. Карточка описывает установку для Python 3.10 с CUDA и FFmpeg, а также зеркало ModelScope и путь загрузки с Hugging Face. Веса настоящие, код на месте, и ничто не мешает вам скачать его сегодня.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the header with the Any-to-Any, Transformers, ONNX, Safetensors, English, Chinese, multimodal, audio, video, speech, streaming, full-duplex, long-video and custom-code tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, the model card title reading 'A full-duplex interaction system with asynchronous delegation', rows for project page, ModelScope, arXiv, GitHub and licence, and a right-hand panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Два отсутствия столь же информативны, как и содержимое. Первое: репозиторий прямо заявляет, что он не развёрнут ни одним провайдером инференса — нет размещённой конечной точки, нет бессерверного варианта, нет сторонней платформы, которая бы его поддерживала. Второе: загрузки вообще не отслеживаются, а значит, нет публичного сигнала о том, сколько людей его скачали. На Hugging Face модель может выглядеть востребованной или проигнорированной; а эту по этому признаку не прочитать.

Две контрольные точки и то, что их разделяет

Оба — 9B, у обоих общая потоковая основа, и разница между ними в том, что они способны воспринимать.

• Realtime-Venus-Omni — аудиовизуальный чекпоинт. Визуальный энкодер SigLIP2 для потоковых кадров, аудиоэнкодер Whisper-Medium и языковой бэкбон Qwen3-8B. Принимает видео или изображения, аудио и текст; возвращает текст и, опционально, речевую волновую форму.

• Realtime-Venus-Audio — та же основа, но со зрением, отключённым на этапе загрузки. На входе — аудио и текст, на выходе — текст и речь. Он существует для случая, когда камера не нужна и вам нужны меньший объём занимаемой памяти и более простой путь.

• Общая спецификация — контекст из 40 960 токенов у обоих, веса BF16 у обоих, речь генерируется как дискретные токены S3, декодируемые потоковым декодером flow-matching, а не отдельной моделью синтеза речи, прикрученной в конце.

• Происхождение — в карточке модели указано, что чекпойнт Omni адаптирован из MiniCPM-o 4.5 — 9B омнимодальной модели, которую OpenBMB выпустила с открытым исходным кодом ранее в 2026 году. Это не сноска. Это означает, что вклад Ant Group — это пост-обучение, среда выполнения и архитектура делегирования, надстроенные поверх чужого потокового бэкбона, что является иным и более конкретным утверждением, чем «новая 9B омни-модель».

Единственная по-настоящему новая идея: делегирование как полноправное событие потока

В 2026 году каждая полнодуплексная система вынуждена решать одно и то же противоречие. Управление диалогом работает с гранулярностью от миллисекунд до одной секунды. Вызовы инструментов, поиск и сложные рассуждения занимают от секунд до десятков секунд. Модель, которая делает паузу, чтобы подумать, перестаёт быть полнодуплексной; модель, которая никогда не делает паузу, не может использовать инструмент.

Realtime-Venus отвечает с помощью двухконтурной среды выполнения. Цикл взаимодействия работает фиксированными секундными блоками, непрерывно принимая аудио- и видеопризнаки, обновляя состояние диалога и решая, слушать или говорить, одновременно передавая потоком текст и синхронизированную речь. Он не приостанавливается, когда выполняется фоновая работа. Второй контур — это планировщик, который в статье называется Realtime-Venus-Harness: когда фронтенд решает, что задача превышает его возможности выполнить её инлайн, он отправляет асинхронное делегирование через приватные маркеры, встроенные в его собственную скрытую последовательность, а Harness выполняет задачу в фоне и реинтегрирует результат в текущий диалог.

Деталь, из-за которой это не просто диаграмма, — то, что в статье называется causal task capture: делегированная задача выполняется на изолированном снимке состояния разговора, так что длительная фоновая задача не может быть повреждена из-за того, что разговор продолжает идти, пока она выполняется. Именно этот режим отказа заставляет большинство схем «делегируй и продолжай разговор» разваливаться на практике, и это самое интересное в отчёте.

Обвязка не в весах. Она находится в репозитории GitHub как отдельный компонент, а это значит, что часть, которая придаёт архитектуре её отличительную особенность, — это та часть, которую вам придётся собрать и которой придётся довериться самостоятельно.

Числа, и чьи именно они

Все приведённые ниже цифры взяты из технического отчёта и карточки модели. Ничто из этого не было воспроизведено кем-либо за пределами авторского коллектива, ни одна третья сторона не публиковала оценку, и нет записи в таблице лидеров, с которой можно было бы их сверить. Воспринимайте их как собственные измерения авторов.

• Видеобенчмарки, Realtime-Venus-Omni — лучший результат в шести из восьми бенчмарков, используемых в отчёте, включая StreamingBench 70,2, OVO-Bench 64,7 и Daily-Omni 81,3.

• Аудиобенчмарки для Realtime-Venus-Audio — MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8, Speech CMMLU 67,8, а также оценка VoiceBench AlpacaEval 4,81, которую в отчёте описывают как совпадающую с лучшим показателем среди сравниваемых.

• Full-Duplex-Bench v1.5 — реакция на 75% пользовательских перебиваний, с показателями продолжения 97% при поддакиваниях, 88% при речи, обращённой к другим, и 86% при фоновой речи. В отчёте утверждается, что это превосходит Gemini 3.1 Live и GPT-4o по всем трём метрикам продолжения.

На показателе Daily-Omni стоит задержаться отдельно. MiniCPM-o 4.5 — модель, на основе которой адаптирован этот чекпоинт, — показывает 80,2 на том же бенчмарке. Realtime-Venus-Omni показывает 81,3. Если оба числа подтвердятся, улучшение от масштабных усилий по постобучению и работе над рантаймом составляет примерно один пункт на бенчмарке, на котором базовая модель и так уже была сильна, — что является реалистичным результатом для такой работы и гораздо менее драматичной историей, чем заголовок «лучший в шести из восьми».

A generated scoreboard for 'Realtime-Venus — the scoreboard' showing a single centered card with six rows: Params 9B, Context 40,960 tokens, Licence Apache-2.0, Weight format BF16, Daily-Omni 81.3, Full-Duplex-Bench continuation 97 / 88 / 86, with the footer 'Vendor-reported from the technical report; no independent scores yet.'

Что не установлено

Список открытых вопросов длиннее списка решённых, и это честное состояние модели, которой шесть дней.

• Независимой оценки не существует. Ни размещения на арене, ни воспроизведения третьей стороной, ни одной внешней группы, опубликовавшей хоть какое-то число.

• Нет показателя задержки в миллисекундах. В отчёте описывается частота взаимодействия раз в секунду, а в карточке документируются потоковые вызовы с частотой раз в секунду, но опубликованного значения времени до первого звука нет, а ведь именно по этому показателю фактически и выбирают решения в этой категории.

• Ни API, ни цены, и никаких заявлений о том, что появится хотя бы одно из них. Доподлинно неизвестно, это продукт, который ждёт своего часа, или исследовательский артефакт, который так и останется доступным только для скачивания.

• Никаких заявленных намерений от вендора. Отсутствие анонса не является доказательством стратегии тихого запуска; это также согласуется с репозиторием, опубликованным для статьи, и ни с чем большим.

• Нет подтверждений из продакшена для харнесса. Это несущий компонент архитектуры и при этом наименее документированный.

Почему тихий маршрут продолжает повторяться

Это уже второй раз в этом году, когда работа Ant Group над моделями стала доступна публике через репозиторий, а не через запуск. UI-Venus-2-9B, GUI-агент лаборатории, появился на Hugging Face в конце августа 2026 года без статьи, без страницы проекта и без анонса — а позднее о нём вышел отчёт. Realtime-Venus появился в обратном порядке: сначала отчёт, рядом — репозиторий, а анонс всё ещё не объявлен.

Эта схема не уникальна для Ant Group. В особенности китайские лаборатории выпускают в мир исследовательские артефакты и потребительские решения, оставляя анонс для разработчиков на потом или вовсе пропуская его. Для всех, кто следит за этой областью, это неудобно, потому что привычный сигнал — пост о запуске, тарифная сетка, сайт с документацией — как раз и отсутствует. Теперь сам артефакт служит анонсом, и внимательное его прочтение — единственный способ узнать, что именно было выпущено.

Если бы вы хотели запустить это

Карта необычно практична для столь нового релиза. Загрузка стандартна: AutoModel.from_pretrained на локальном каталоге чекпоинта с доверенным удалённым кодом, вниманием SDPA и bfloat16. Полнодуплексный стриминг включается одним вызовом, который переводит модель в дуплексный режим, после чего документированный цикл — это одна секунда streaming_prefill, за которой следует streaming_generate, и так повторяется. Память для длинных видео включается параметром memory-minutes, установленным на сорок, и описывается как не требующая обучения, что примечательно для возможности, которая обычно требует тонкой настройки. Две оговорки задокументированы, а не обнаружены: ограничение количества кадров, которое незаметно обрезает длинные видео, если не увеличить константу перед импортом утилит, и требование шрифта CJK для нелатинских субтитров, отрисовываемых в дуплексном видео.

Чего карта не даёт, так это аппаратного минимума. 9B-модель в BF16 — это примерно восемнадцать гигабайт весов ещё до всякой памяти под активации, что делает дуплексный инференс в реальном времени возможным только на серьёзном GPU и выводит его за пределы досягаемости для развёртывания на ноутбуке, для которого семейство MiniCPM-o, от которого она происходит, частично и создавалось.

Здесь есть шов, который стоит назвать, потому что именно в нём и находится место для роутера. Realtime-Venus перекладывает свою тяжёлую работу — поиск, сложные рассуждения, вызовы бизнес-API — на фоновую модель. Это делегированное плечо — обычный текстовый вывод, и именно оно решает, будет ли ваш разговорный интерфейс полезным или всего лишь гладким. OrcaRouter не содержит ничего от Realtime-Venus; дуплексный слой здесь — это самостоятельная загрузка, и мы его не обслуживаем. Рассуждения, которые он передаёт, — это та часть, которую покрываем мы: почти 200 моделей за одним ключом по прайс-листовой цене провайдера без наценки, автоматическое переключение при сбое, когда у вышестоящего провайдера выдался неудачный день, DSL-маршрутизация, которая собирает несколько моделей в один вызов, и слияние моделей для случаев, когда суждения одной модели недостаточно. Маркер делегирования — это решение фронтенда; какая модель на него отвечает — это выбор конфигурации, и то, что этот выбор остаётся вне весов, позволяет менять его без переобучения чего-либо.

A screenshot of the GitHub repository inclusionAI/Realtime-Venus, captured 18 September 2026, showing the repository header, the file and folder listing for the Realtime-Venus-Omni and Realtime-Venus-Audio checkpoints and the harness, and the opening section of the README describing the full-duplex interaction system.

Что бы это уладило

Три вещи перевели бы Realtime-Venus из статьи с весами в модель, которую может оценить кто угодно. Независимая группа, воспроизводящая показатели продолжения Full-Duplex-Bench, потому что 97% при бэкканалах — это выдающийся показатель, а выдающиеся показатели нуждаются во втором читателе. Опубликованное значение задержки, потому что полнодуплексные системы живут или умирают от времени до первого звука, а здесь целевой показатель не заявлен. И документация для харнесса, потому что архитектура асинхронного делегирования — единственная часть этого релиза, которая действительно нова, и прямо сейчас это та часть, о которой можно прочитать, но которую нелегко внедрить.

До тех пор точное описание — узкое и скучное, и именно поэтому его стоит записать: настоящий выпуск Apache-2.0 двух полнодуплексных чекпойнтов на 9B, построенных на открытом бэкбоне, с сильными бенчмарками, заявленными самими разработчиками, без независимой проверки, без API и без анонса. Всё, что выше этой черты, — домыслы.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно