Cartão de título principal de 'Realtime-Venus', com o subtítulo 'Um artigo, dois checkpoints e nenhum anúncio', com três cartões com os dizeres 'Realtime-Venus-Omni: 9B, audiovisual, Apache-2.0', 'Realtime-Venus-Audio: 9B, interação falada' e 'Ainda faltam: API, preço, post de lançamento, benchmark independente', acima de uma faixa de rodapé com os dizeres 'Todos os números de benchmark são do relatório técnico; nenhum foi reproduzido de forma independente.' O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

Realtime-Venus: o Full-Duplex 9B da Ant Group foi entregue sem um lançamento

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 12 de setembro de 2026, um relatório técnico foi publicado no arXiv descrevendo o Realtime-Venus, um sistema de interação full-duplex construído a partir de dois modelos de 9B treinados separadamente — Realtime-Venus-Omni para interação audiovisual e Realtime-Venus-Audio para interação falada — atribuído à Venus Team da Ant Group em colaboração com a Tsinghua University. Em poucos dias, um repositório Apache-2.0 sob inclusionAI/Realtime-Venus no Hugging Face continha ambos os checkpoints como safetensors BF16 disponíveis para download, além de uma página de projeto e um repositório GitHub complementar. O que não apareceu é a parte que vale a pena notar: nenhum post de lançamento, nenhuma página de produto, nenhuma API, nenhuma lista de preços e nada nas propriedades da própria Ant Group anunciando que qualquer uma dessas coisas existe. Este é um lançamento que entregou tudo, exceto o anúncio, o que faz com que separar os fatos estabelecidos das alegações seja o trabalho inteiro.

O que está realmente no disco?

O repositório não é um stub. Ele contém dois diretórios de modelo, cada um com pesos safetensors fragmentados, um arquivo de configuração e o código personalizado do Hugging Face Transformers que a ficha do modelo instrui você a carregar com trust_remote_code=True. Há um arquivo de requisitos, uma pasta assets contendo os recursos de token para forma de onda e uma voz de referência, e uma licença Apache-2.0 no nível superior. A ficha documenta a instalação para Python 3.10 com CUDA e FFmpeg, e tanto um espelho do ModelScope quanto um caminho de download do Hugging Face. Os pesos são reais, o código está lá, e nada impede você de baixá-lo hoje.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the header with the Any-to-Any, Transformers, ONNX, Safetensors, English, Chinese, multimodal, audio, video, speech, streaming, full-duplex, long-video and custom-code tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, the model card title reading 'A full-duplex interaction system with asynchronous delegation', rows for project page, ModelScope, arXiv, GitHub and licence, and a right-hand panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Duas ausências são tão informativas quanto o conteúdo. A primeira é que o repositório declara claramente que não é implantado por nenhum provedor de inferência — não há endpoint hospedado, nenhuma opção serverless, nenhuma plataforma de terceiros que o ofereça. A segunda é que os downloads não são rastreados de modo algum, o que significa que não há sinal público de quantas pessoas o baixaram. Um modelo pode parecer adotado ou ignorado no Hugging Face; este é ilegível dessa forma.

Os dois checkpoints, e o que os separa

Ambos são 9B, ambos compartilham um backbone de streaming, e a diferença entre eles está no que conseguem perceber.

• Realtime-Venus-Omni — o checkpoint audiovisual. Um codificador visual SigLIP2 para quadros em streaming, um codificador de áudio Whisper-Medium e um backbone de linguagem Qwen3-8B. Aceita vídeo ou imagens, áudio e texto; retorna texto e, opcionalmente, uma forma de onda de fala.

• Realtime-Venus-Audio — a mesma base, com a visão desativada no momento do carregamento. Entrada de áudio e texto, saída de texto e fala. Ele existe para o caso em que a câmera é irrelevante e você quer a menor pegada de memória e o caminho mais simples.

• Especificação compartilhada — contexto de 40.960 tokens em ambos, pesos BF16 em ambos, fala gerada como tokens S3 discretos decodificados por um decodificador de flow-matching em streaming, em vez de um modelo separado de texto para fala acoplado ao final.

• Linhagem — a ficha do modelo declara que o checkpoint Omni é adaptado do MiniCPM-o 4.5, o modelo omni-modal de 9B que a OpenBMB disponibilizou em código aberto no início de 2026. Isso não é uma nota de rodapé. Significa que a contribuição do Ant Group é o pós-treinamento, o runtime e o design de delegação sobrepostos ao backbone de streaming de outra pessoa, o que é uma afirmação diferente e mais específica do que "um novo modelo omni de 9B."

A única ideia genuinamente nova: a delegação como um evento de stream de primeira classe

Todo sistema full-duplex em 2026 precisa resolver a mesma contradição. O controle da conversa opera em uma granularidade de milissegundos a um segundo. Chamadas de ferramentas, recuperação e raciocínio complexo levam de segundos a dezenas de segundos. Um modelo que pausa para pensar deixa de ser full-duplex; um modelo que nunca pausa não consegue usar uma ferramenta.

O Realtime-Venus responde com um runtime de loop duplo. O loop de interação é executado em blocos fixos de um segundo, ingerindo continuamente características de áudio e vídeo, atualizando o estado da conversa e decidindo se deve ouvir ou falar, enquanto transmite texto e fala alinhada. Ele não pausa quando há trabalho em segundo plano em andamento. O segundo loop é um agendador que o artigo chama de Realtime-Venus-Harness: quando o frontend decide que uma tarefa excede o que ele pode fazer inline, ele emite uma delegação assíncrona por meio de marcadores privados incorporados em sua própria sequência oculta, e o harness executa a tarefa em segundo plano e reintegra o resultado ao diálogo em andamento.

O detalhe que faz com que isto seja mais do que um diagrama é o que o artigo chama de captura causal de tarefas — a tarefa delegada é executada sobre um instantâneo isolado do estado da conversa, para que uma tarefa de segundo plano de longa duração não possa ser corrompida pelo fato de a conversa avançar enquanto ela é executada. Esse é o modo de falha que faz a maioria dos designs de "delegar e continuar a conversar" desmoronar na prática, e é a coisa mais interessante no relatório.

O harness não está nos pesos. Ele vive no repositório do GitHub como um componente separado, o que significa que a parte que torna a arquitetura distinta é a parte que você teria que montar e confiar por conta própria.

Os números, e exatamente de quem eles são

Todos os números abaixo vêm do relatório técnico e do cartão do modelo. Nada disso foi reproduzido por ninguém fora dos autores, nenhum terceiro publicou uma avaliação, e não há entrada em ranking para conferir. Leia-os como medições dos próprios autores.

• Benchmarks de vídeo, Realtime-Venus-Omni — melhor pontuação em seis dos oito benchmarks usados no relatório, incluindo StreamingBench 70.2, OVO-Bench 64.7 e Daily-Omni 81.3.

• Benchmarks de áudio, Realtime-Venus-Audio — MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8, Speech CMMLU 67,8, e uma pontuação de 4,81 no VoiceBench AlpacaEval que o relatório descreve como correspondendo ao melhor valor de comparação.

• Full-Duplex-Bench v1.5 — resposta a 75% das interrupções do usuário, com taxas de continuação de 97% em backchannels, 88% em fala dirigida a outros e 86% em fala de fundo. O relatório afirma que isso supera Gemini 3.1 Live e GPT-4o nas três métricas de continuação.

O valor do Daily-Omni é o que merece uma pausa. O MiniCPM-o 4.5, o modelo do qual este checkpoint é adaptado, reporta 80,2 no mesmo benchmark. O Realtime-Venus-Omni reporta 81,3. Se ambos os números se confirmarem, a melhoria decorrente de um grande esforço de pós-treinamento e de runtime é de aproximadamente um ponto em um benchmark no qual o modelo base já era forte — o que é um resultado realista para esse tipo de trabalho e uma história muito menos dramática do que a manchete "melhor em seis de oito".

A generated scoreboard for 'Realtime-Venus — the scoreboard' showing a single centered card with six rows: Params 9B, Context 40,960 tokens, Licence Apache-2.0, Weight format BF16, Daily-Omni 81.3, Full-Duplex-Bench continuation 97 / 88 / 86, with the footer 'Vendor-reported from the technical report; no independent scores yet.'

O que não está estabelecido

A lista de questões em aberto é mais longa do que a lista das resolvidas, e esse é o estado honesto de um modelo com seis dias de idade.

• Não existe qualquer avaliação independente. Não é uma posição em arena, nem uma reprodução por terceiros, nem um único grupo externo que tenha publicado um número.

• Nenhum dado de latência em milissegundos. O relatório descreve uma cadência de interação de um segundo e o cartão documenta chamadas de streaming por segundo, mas não há um número publicado de time-to-first-audio, que é a métrica pela qual esta categoria é de fato comprada.

• Sem API e sem preço, e nenhuma declaração de que qualquer um dos dois esteja para chegar. Se isto é um produto em preparação ou um artefacto de investigação que permanecerá como download, é genuinamente desconhecido.

• Nenhuma intenção declarada pelo fornecedor. A ausência de um anúncio não é evidência de uma estratégia de lançamento discreta; também é compatível com um repositório publicado para um artigo e nada mais.

• Nenhuma evidência de produção para o harness. É o componente estrutural da arquitetura e o menos documentado.

Por que a rota silenciosa continua acontecendo

Esta é a segunda vez este ano que o trabalho de modelos da Ant Group chega ao público através de um repositório, e não de um lançamento. O UI-Venus-2-9B, o agente de GUI do laboratório, apareceu no Hugging Face no final de agosto de 2026 sem artigo, sem página de projeto e sem anúncio — e desde então foi seguido por um relatório. O Realtime-Venus chegou na ordem inversa: primeiro o relatório, o repositório em paralelo, e o anúncio ainda por divulgar.

O padrão não é exclusivo do Ant Group. Laboratórios chineses, em particular, têm disponibilizado ao mundo artefatos de pesquisa e implantações voltadas ao consumidor enquanto deixam o anúncio para desenvolvedores para depois, ou simplesmente o omitem. Para quem acompanha a área, isso é inconveniente, porque o sinal habitual — uma publicação de lançamento, uma tabela de preços, um site de documentação — é exatamente a parte que está faltando. O artefato agora é o anúncio, e lê-lo com atenção é a única forma de saber o que foi lançado.

Se você quisesse executá-lo

A placa é excepcionalmente prática para um lançamento tão recente. O carregamento é padrão: AutoModel.from_pretrained no diretório local de checkpoint com código remoto confiável, atenção SDPA e bfloat16. O streaming full-duplex é iniciado com uma única chamada que coloca o modelo em modo duplex, após o que o loop documentado é um segundo de streaming_prefill seguido por streaming_generate, repetido. A memória de vídeos longos é habilitada com um parâmetro memory-minutes definido como quarenta e é descrita como sem treinamento, o que é notável para um recurso que geralmente exige ajuste fino. Duas ressalvas são documentadas em vez de descobertas: um limite de quadros que trunca silenciosamente vídeos longos a menos que uma constante seja aumentada antes de importar os utilitários, e um requisito de fonte CJK para legendas não latinas renderizadas em vídeo duplex.

O que o card não oferece é um piso de hardware. Um modelo de 9B em BF16 tem aproximadamente dezoito gigabytes de pesos antes de qualquer memória de ativação, o que coloca a inferência duplex em tempo real em uma GPU robusta e fora do alcance da implantação em laptops para a qual a família MiniCPM-o, da qual ele deriva, foi parcialmente projetada.

Há aqui uma costura que vale a pena nomear, porque é onde um roteador realmente se encaixa. O Realtime-Venus delega o seu trabalho pesado — recuperação, raciocínio complexo, chamadas a APIs de negócio — a um modelo em segundo plano. Essa perna delegada é inferência de texto comum, e é a perna que decide se o seu frontend conversacional é útil ou apenas fluente. O OrcaRouter não transporta nada do Realtime-Venus; a camada duplex aqui é um download auto-hospedado e não a servimos. O raciocínio que ele entrega é a parte que cobrimos: quase 200 modelos por trás de uma única chave ao preço de tabela do fornecedor, sem margem, failover automático quando um upstream está num dia mau, uma DSL de roteamento que compõe vários modelos numa única chamada, e fusão de modelos para os casos em que o julgamento de um único modelo não é suficiente. O marcador de delegação é uma decisão do frontend; qual modelo lhe responde é uma escolha de configuração, e manter essa escolha fora dos pesos é o que lhe permite alterá-la sem treinar nada de novo.

A screenshot of the GitHub repository inclusionAI/Realtime-Venus, captured 18 September 2026, showing the repository header, the file and folder listing for the Realtime-Venus-Omni and Realtime-Venus-Audio checkpoints and the harness, and the opening section of the README describing the full-duplex interaction system.

O que resolveria isso

Três coisas fariam o Realtime-Venus passar de um artigo com pesos para um modelo que qualquer pessoa pode avaliar. Um grupo independente reproduzindo os números de continuação do Full-Duplex-Bench, porque 97% em backchannels é um número extraordinário, e números extraordinários precisam de um segundo leitor. Um número de latência publicado, porque sistemas full-duplex vivem ou morrem pelo time-to-first-audio, e este não declarou uma meta. E documentação para o harness, porque o design de delegação assíncrona é a única parte deste lançamento genuinamente nova, e, no momento, é a parte sobre a qual você pode ler, mas não adotar facilmente.

Até então, a descrição precisa é estreita e pouco empolgante, e é exatamente por isso que vale a pena registrá-la: um lançamento real sob Apache-2.0 de dois checkpoints full-duplex de 9B, construídos sobre um backbone aberto, com benchmarks fortes autodeclarados, sem verificação independente, sem API e sem anúncio. Tudo acima dessa linha é inferência.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente