
Realtime-Venus: полнодуплексная 9B-модель Ant Group выпущена без анонса
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
12 сентября 2026 года на arXiv появился технический отчёт, описывающий Realtime-Venus — полнодуплексную систему взаимодействия, построенную на двух отдельно обученных 9B-моделях: Realtime-Venus-Omni для аудиовизуального взаимодействия и Realtime-Venus-Audio для речевого взаимодействия, — авторство которой приписывается команде Venus Team в Ant Group, работавшей совместно с Университетом Цинхуа. В течение нескольких дней репозиторий под лицензией Apache-2.0 по адресу inclusionAI/Realtime-Venus на Hugging Face содержал оба чекпоинта в виде доступных для скачивания BF16 safetensors, а также страницу проекта и сопутствующий репозиторий GitHub. А вот чего не появилось — это та часть, которую стоит отметить: ни анонсирующего поста, ни страницы продукта, ни API, ни прайс-листа, и ничего на собственных ресурсах Ant Group, что объявляло бы о существовании чего-либо из этого. Это релиз, в котором выпущено всё, кроме анонса, что делает отделение установленных фактов от утверждений всей задачей.
Что на самом деле находится на диске
Репозиторий не является заглушкой. В нём есть два каталога моделей, каждый с шардированными весами safetensors, конфигурацией и пользовательским кодом Hugging Face Transformers, который карточка предлагает загружать с помощью trust_remote_code=True. Есть файл requirements, папка assets с ресурсами token-to-waveform и эталонным голосом, а также лицензия Apache-2.0 в корне. Карточка описывает установку для Python 3.10 с CUDA и FFmpeg, а также зеркало ModelScope и путь загрузки с Hugging Face. Веса настоящие, код на месте, и ничто не мешает вам скачать его сегодня.

Два отсутствия столь же информативны, как и содержимое. Первое: репозиторий прямо заявляет, что он не развёрнут ни одним провайдером инференса — нет размещённой конечной точки, нет бессерверного варианта, нет сторонней платформы, которая бы его поддерживала. Второе: загрузки вообще не отслеживаются, а значит, нет публичного сигнала о том, сколько людей его скачали. На Hugging Face модель может выглядеть востребованной или проигнорированной; а эту по этому признаку не прочитать.
Две контрольные точки и то, что их разделяет
Оба — 9B, у обоих общая потоковая основа, и разница между ними в том, что они способны воспринимать.
• Realtime-Venus-Omni — аудиовизуальный чекпоинт. Визуальный энкодер SigLIP2 для потоковых кадров, аудиоэнкодер Whisper-Medium и языковой бэкбон Qwen3-8B. Принимает видео или изображения, аудио и текст; возвращает текст и, опционально, речевую волновую форму.
• Realtime-Venus-Audio — та же основа, но со зрением, отключённым на этапе загрузки. На входе — аудио и текст, на выходе — текст и речь. Он существует для случая, когда камера не нужна и вам нужны меньший объём занимаемой памяти и более простой путь.
• Общая спецификация — контекст из 40 960 токенов у обоих, веса BF16 у обоих, речь генерируется как дискретные токены S3, декодируемые потоковым декодером flow-matching, а не отдельной моделью синтеза речи, прикрученной в конце.
• Происхождение — в карточке модели указано, что чекпойнт Omni адаптирован из MiniCPM-o 4.5 — 9B омнимодальной модели, которую OpenBMB выпустила с открытым исходным кодом ранее в 2026 году. Это не сноска. Это означает, что вклад Ant Group — это пост-обучение, среда выполнения и архитектура делегирования, надстроенные поверх чужого потокового бэкбона, что является иным и более конкретным утверждением, чем «новая 9B омни-модель».
Единственная по-настоящему новая идея: делегирование как полноправное событие потока
В 2026 году каждая полнодуплексная система вынуждена решать одно и то же противоречие. Управление диалогом работает с гранулярностью от миллисекунд до одной секунды. Вызовы инструментов, поиск и сложные рассуждения занимают от секунд до десятков секунд. Модель, которая делает паузу, чтобы подумать, перестаёт быть полнодуплексной; модель, которая никогда не делает паузу, не может использовать инструмент.
Realtime-Venus отвечает с помощью двухконтурной среды выполнения. Цикл взаимодействия работает фиксированными секундными блоками, непрерывно принимая аудио- и видеопризнаки, обновляя состояние диалога и решая, слушать или говорить, одновременно передавая потоком текст и синхронизированную речь. Он не приостанавливается, когда выполняется фоновая работа. Второй контур — это планировщик, который в статье называется Realtime-Venus-Harness: когда фронтенд решает, что задача превышает его возможности выполнить её инлайн, он отправляет асинхронное делегирование через приватные маркеры, встроенные в его собственную скрытую последовательность, а Harness выполняет задачу в фоне и реинтегрирует результат в текущий диалог.
Деталь, из-за которой это не просто диаграмма, — то, что в статье называется causal task capture: делегированная задача выполняется на изолированном снимке состояния разговора, так что длительная фоновая задача не может быть повреждена из-за того, что разговор продолжает идти, пока она выполняется. Именно этот режим отказа заставляет большинство схем «делегируй и продолжай разговор» разваливаться на практике, и это самое интересное в отчёте.
Обвязка не в весах. Она находится в репозитории GitHub как отдельный компонент, а это значит, что часть, которая придаёт архитектуре её отличительную особенность, — это та часть, которую вам придётся собрать и которой придётся довериться самостоятельно.
Числа, и чьи именно они
Все приведённые ниже цифры взяты из технического отчёта и карточки модели. Ничто из этого не было воспроизведено кем-либо за пределами авторского коллектива, ни одна третья сторона не публиковала оценку, и нет записи в таблице лидеров, с которой можно было бы их сверить. Воспринимайте их как собственные измерения авторов.
• Видеобенчмарки, Realtime-Venus-Omni — лучший результат в шести из восьми бенчмарков, используемых в отчёте, включая StreamingBench 70,2, OVO-Bench 64,7 и Daily-Omni 81,3.
• Аудиобенчмарки для Realtime-Venus-Audio — MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8, Speech CMMLU 67,8, а также оценка VoiceBench AlpacaEval 4,81, которую в отчёте описывают как совпадающую с лучшим показателем среди сравниваемых.
• Full-Duplex-Bench v1.5 — реакция на 75% пользовательских перебиваний, с показателями продолжения 97% при поддакиваниях, 88% при речи, обращённой к другим, и 86% при фоновой речи. В отчёте утверждается, что это превосходит Gemini 3.1 Live и GPT-4o по всем трём метрикам продолжения.
На показателе Daily-Omni стоит задержаться отдельно. MiniCPM-o 4.5 — модель, на основе которой адаптирован этот чекпоинт, — показывает 80,2 на том же бенчмарке. Realtime-Venus-Omni показывает 81,3. Если оба числа подтвердятся, улучшение от масштабных усилий по постобучению и работе над рантаймом составляет примерно один пункт на бенчмарке, на котором базовая модель и так уже была сильна, — что является реалистичным результатом для такой работы и гораздо менее драматичной историей, чем заголовок «лучший в шести из восьми».

Что не установлено
Список открытых вопросов длиннее списка решённых, и это честное состояние модели, которой шесть дней.
• Независимой оценки не существует. Ни размещения на арене, ни воспроизведения третьей стороной, ни одной внешней группы, опубликовавшей хоть какое-то число.
• Нет показателя задержки в миллисекундах. В отчёте описывается частота взаимодействия раз в секунду, а в карточке документируются потоковые вызовы с частотой раз в секунду, но опубликованного значения времени до первого звука нет, а ведь именно по этому показателю фактически и выбирают решения в этой категории.
• Ни API, ни цены, и никаких заявлений о том, что появится хотя бы одно из них. Доподлинно неизвестно, это продукт, который ждёт своего часа, или исследовательский артефакт, который так и останется доступным только для скачивания.
• Никаких заявленных намерений от вендора. Отсутствие анонса не является доказательством стратегии тихого запуска; это также согласуется с репозиторием, опубликованным для статьи, и ни с чем большим.
• Нет подтверждений из продакшена для харнесса. Это несущий компонент архитектуры и при этом наименее документированный.
Почему тихий маршрут продолжает повторяться
Это уже второй раз в этом году, когда работа Ant Group над моделями стала доступна публике через репозиторий, а не через запуск. UI-Venus-2-9B, GUI-агент лаборатории, появился на Hugging Face в конце августа 2026 года без статьи, без страницы проекта и без анонса — а позднее о нём вышел отчёт. Realtime-Venus появился в обратном порядке: сначала отчёт, рядом — репозиторий, а анонс всё ещё не объявлен.
Эта схема не уникальна для Ant Group. В особенности китайские лаборатории выпускают в мир исследовательские артефакты и потребительские решения, оставляя анонс для разработчиков на потом или вовсе пропуская его. Для всех, кто следит за этой областью, это неудобно, потому что привычный сигнал — пост о запуске, тарифная сетка, сайт с документацией — как раз и отсутствует. Теперь сам артефакт служит анонсом, и внимательное его прочтение — единственный способ узнать, что именно было выпущено.
Если бы вы хотели запустить это
Карта необычно практична для столь нового релиза. Загрузка стандартна: AutoModel.from_pretrained на локальном каталоге чекпоинта с доверенным удалённым кодом, вниманием SDPA и bfloat16. Полнодуплексный стриминг включается одним вызовом, который переводит модель в дуплексный режим, после чего документированный цикл — это одна секунда streaming_prefill, за которой следует streaming_generate, и так повторяется. Память для длинных видео включается параметром memory-minutes, установленным на сорок, и описывается как не требующая обучения, что примечательно для возможности, которая обычно требует тонкой настройки. Две оговорки задокументированы, а не обнаружены: ограничение количества кадров, которое незаметно обрезает длинные видео, если не увеличить константу перед импортом утилит, и требование шрифта CJK для нелатинских субтитров, отрисовываемых в дуплексном видео.
Чего карта не даёт, так это аппаратного минимума. 9B-модель в BF16 — это примерно восемнадцать гигабайт весов ещё до всякой памяти под активации, что делает дуплексный инференс в реальном времени возможным только на серьёзном GPU и выводит его за пределы досягаемости для развёртывания на ноутбуке, для которого семейство MiniCPM-o, от которого она происходит, частично и создавалось.
Здесь есть шов, который стоит назвать, потому что именно в нём и находится место для роутера. Realtime-Venus перекладывает свою тяжёлую работу — поиск, сложные рассуждения, вызовы бизнес-API — на фоновую модель. Это делегированное плечо — обычный текстовый вывод, и именно оно решает, будет ли ваш разговорный интерфейс полезным или всего лишь гладким. OrcaRouter не содержит ничего от Realtime-Venus; дуплексный слой здесь — это самостоятельная загрузка, и мы его не обслуживаем. Рассуждения, которые он передаёт, — это та часть, которую покрываем мы: почти 200 моделей за одним ключом по прайс-листовой цене провайдера без наценки, автоматическое переключение при сбое, когда у вышестоящего провайдера выдался неудачный день, DSL-маршрутизация, которая собирает несколько моделей в один вызов, и слияние моделей для случаев, когда суждения одной модели недостаточно. Маркер делегирования — это решение фронтенда; какая модель на него отвечает — это выбор конфигурации, и то, что этот выбор остаётся вне весов, позволяет менять его без переобучения чего-либо.

Что бы это уладило
Три вещи перевели бы Realtime-Venus из статьи с весами в модель, которую может оценить кто угодно. Независимая группа, воспроизводящая показатели продолжения Full-Duplex-Bench, потому что 97% при бэкканалах — это выдающийся показатель, а выдающиеся показатели нуждаются во втором читателе. Опубликованное значение задержки, потому что полнодуплексные системы живут или умирают от времени до первого звука, а здесь целевой показатель не заявлен. И документация для харнесса, потому что архитектура асинхронного делегирования — единственная часть этого релиза, которая действительно нова, и прямо сейчас это та часть, о которой можно прочитать, но которую нелегко внедрить.
До тех пор точное описание — узкое и скучное, и именно поэтому его стоит записать: настоящий выпуск Apache-2.0 двух полнодуплексных чекпойнтов на 9B, построенных на открытом бэкбоне, с сильными бенчмарками, заявленными самими разработчиками, без независимой проверки, без API и без анонса. Всё, что выше этой черты, — домыслы.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
