
Realtime-Venus: el Full-Duplex 9B de Ant Group se lanzó sin presentación
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
El 12 de septiembre de 2026 se publicó en arXiv un informe técnico que describe Realtime-Venus, un sistema de interacción full-duplex construido a partir de dos modelos de 9B entrenados por separado —Realtime-Venus-Omni para la interacción audiovisual y Realtime-Venus-Audio para la interacción hablada—, atribuido al equipo de Venus de Ant Group en colaboración con la Universidad de Tsinghua. En cuestión de días, un repositorio con licencia Apache-2.0 bajo inclusionAI/Realtime-Venus en Hugging Face albergaba ambos checkpoints como safetensors BF16 descargables, junto con una página de proyecto y un repositorio complementario en GitHub. Lo que no apareció es la parte que merece atención: ninguna publicación de lanzamiento, ninguna página de producto, ninguna API, ninguna lista de precios y nada en las propias plataformas de Ant Group que anunciara que algo de esto existe. Este es un lanzamiento que publicó todo excepto el anuncio, lo que hace que toda la tarea consista en separar los hechos establecidos de las afirmaciones.
¿Qué hay realmente en el disco?
El repositorio no es un stub. Contiene dos directorios de modelos, cada uno con pesos safetensors fragmentados, un archivo de configuración y el código personalizado de Hugging Face Transformers que la tarjeta te indica cargar con trust_remote_code=True. Hay un archivo de requisitos, una carpeta de assets que contiene los recursos de token a forma de onda y una voz de referencia, y una licencia Apache-2.0 en el nivel superior. La tarjeta documenta la instalación para Python 3.10 con CUDA y FFmpeg, y tanto un espejo de ModelScope como una ruta de descarga de Hugging Face. Los pesos son reales, el código está ahí, y nada te impide descargarlo hoy.

Dos ausencias son tan informativas como los contenidos. La primera es que el repositorio declara claramente que no lo despliega ningún proveedor de inferencia —no hay endpoint alojado, ni opción serverless, ni plataforma de terceros que lo aloje—. La segunda es que las descargas no se rastrean en absoluto, lo que significa que no hay ninguna señal pública de cuántas personas lo han descargado. Un modelo puede parecer adoptado o ignorado en Hugging Face; este no se puede leer de esa manera.
Los dos puntos de control, y lo que los separa
Ambos son 9B, ambos comparten una arquitectura de streaming, y la diferencia entre ellos es lo que pueden percibir.
• Realtime-Venus-Omni — el checkpoint audiovisual. Un codificador visual SigLIP2 para fotogramas en streaming, un codificador de audio Whisper-Medium y un backbone de lenguaje Qwen3-8B. Acepta vídeo o imágenes, audio y texto; devuelve texto y, opcionalmente, una forma de onda de voz.
• Realtime-Venus-Audio — la misma columna vertebral con la visión desactivada en el momento de la carga. Entrada de audio y texto, salida de texto y voz. Existe para el caso en que la cámara es irrelevante y se desea la menor huella de memoria y la ruta más sencilla.
• Especificación compartida: contexto de 40.960 tokens en ambos, pesos BF16 en ambos, voz generada como tokens S3 discretos decodificados por un decodificador de flow-matching en streaming en lugar de un modelo de texto a voz independiente añadido al final.
• Linaje — la tarjeta del modelo afirma que el checkpoint Omni está adaptado a partir de MiniCPM-o 4.5, el modelo omnimodal de 9B que OpenBMB publicó como código abierto a principios de 2026. Eso no es una nota al pie. Significa que la contribución de Ant Group es el post-entrenamiento, el entorno de ejecución y el diseño de delegación superpuestos sobre la columna vertebral de streaming de otro, lo cual es una afirmación distinta y más específica que «un nuevo modelo omni de 9B».
La única idea genuinamente nueva: la delegación como un evento de flujo de primera clase
Todo sistema dúplex completo en 2026 tiene que resolver la misma contradicción. El control de la conversación funciona con una granularidad de milisegundos a un segundo. Las llamadas a herramientas, la recuperación y el razonamiento complejo tardan de segundos a decenas de segundos. Un modelo que hace una pausa para pensar deja de ser dúplex completo; un modelo que nunca hace pausas no puede usar una herramienta.
Realtime-Venus responde con un runtime de doble bucle. El bucle de interacción se ejecuta en fragmentos fijos de un segundo, ingiriendo continuamente características de audio y video, actualizando el estado de la conversación y decidiendo si escuchar o hablar, mientras transmite texto y voz alineada en streaming. No se pausa cuando hay trabajo en segundo plano en curso. El segundo bucle es un planificador que el artículo llama Realtime-Venus-Harness: cuando el frontend decide que una tarea excede lo que puede hacer en línea, emite una delegación asíncrona mediante marcadores privados incrustados en su propia secuencia oculta, y el harness ejecuta la tarea en segundo plano y reintegra el resultado en el diálogo en curso.
El detalle que hace que esto sea más que un diagrama es lo que el artículo llama captura causal de tareas: la tarea delegada se ejecuta contra una instantánea aislada del estado de la conversación, de modo que una tarea en segundo plano de larga duración no pueda verse corrompida por el hecho de que la conversación siga avanzando mientras se ejecuta. Ese es el modo de fallo que hace que la mayoría de los diseños de «delegar y seguir hablando» se vengan abajo en la práctica, y es lo más interesante del informe.
El arnés no está en los pesos. Vive en el repositorio de GitHub como un componente separado, lo que significa que la parte que hace que la arquitectura sea distintiva es la parte que tendrías que ensamblar y en la que tendrías que confiar por tu cuenta.
Los números, y exactamente de quién son
Todas las cifras que aparecen a continuación provienen del informe técnico y de la ficha del modelo. Ninguna de ellas ha sido reproducida por nadie fuera de los autores, ningún tercero ha publicado una evaluación y no hay ninguna entrada en la tabla de clasificación con la que contrastarlas. Léelas como mediciones de los propios autores.
• Benchmarks de vídeo, Realtime-Venus-Omni — mejor puntuación en seis de los ocho benchmarks que utiliza el informe, incluidos StreamingBench 70.2, OVO-Bench 64.7 y Daily-Omni 81.3.
• Benchmarks de audio, Realtime-Venus-Audio — MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8, Speech CMMLU 67.8, y una puntuación de 4.81 en VoiceBench AlpacaEval que el informe describe como equiparable a la mejor cifra de comparación.
• Full-Duplex-Bench v1.5 — respuesta al 75 % de las interrupciones del usuario, con tasas de continuación del 97 % en retroalimentación, del 88 % en habla dirigida a otros y del 86 % en habla de fondo. El informe afirma que esto supera a Gemini 3.1 Live y GPT-4o en las tres métricas de continuación.
La cifra de Daily-Omni es la que merece una pausa. MiniCPM-o 4.5, el modelo del que se adapta este checkpoint, reporta 80.2 en el mismo benchmark. Realtime-Venus-Omni reporta 81.3. Si ambas cifras se sostienen, la mejora derivada de un gran esfuerzo de postentrenamiento y de runtime es de aproximadamente un punto en un benchmark en el que el modelo base ya era fuerte, lo cual es un resultado realista para este tipo de trabajo y una historia mucho menos dramática que el titular «mejor en seis de ocho».

Qué no está establecido
La lista de preguntas abiertas es más larga que la lista de las resueltas, y ese es el estado honesto de un modelo de seis días.
• No existe ninguna evaluación independiente. Ni una ubicación en una arena, ni una reproducción por parte de terceros, ni un solo grupo externo que haya publicado una cifra.
• No hay una cifra de latencia en milisegundos. El informe describe una cadencia de interacción de un segundo y la ficha documenta llamadas de streaming por segundo, pero no hay una cifra publicada de tiempo hasta el primer audio, que es la métrica por la que realmente se compra en esta categoría.
• Ni API ni precio, y ninguna declaración de que alguno de los dos vaya a llegar. Se desconoce por completo si esto es un producto en espera o un artefacto de investigación que permanecerá como descarga.
• Ninguna intención declarada por parte del proveedor. La ausencia de un anuncio no es evidencia de una estrategia de lanzamiento discreto; también es compatible con un repositorio publicado para un artículo y nada más.
• Sin evidencia de producción para el harness. Es el componente portante de la arquitectura y el menos documentado.
Por qué la ruta silenciosa sigue ocurriendo
Esta es la segunda vez este año que el trabajo de modelos de Ant Group llega al público a través de un repositorio en lugar de un lanzamiento. UI-Venus-2-9B, el agente de GUI del laboratorio, apareció en Hugging Face a finales de agosto de 2026 sin artículo, sin página de proyecto y sin anuncio — y desde entonces ha sido seguido por un informe. Realtime-Venus llegó en el orden opuesto: primero el informe, el repositorio a la par y el anuncio aún sin publicar.
Este patrón no es exclusivo de Ant Group. Los laboratorios chinos, en particular, han estado lanzando al mundo artefactos de investigación y despliegues para consumidores mientras dejan para más tarde el anuncio dirigido a desarrolladores, o directamente lo omiten. Para cualquiera que siga el sector, esto resulta inconveniente, porque la señal habitual —una publicación de lanzamiento, una lista de precios, un sitio de documentación— es justamente la parte que falta. Ahora el artefacto es el anuncio, y leerlo con atención es la única forma de saber qué se ha lanzado.
Si quisieras ejecutarlo
Esta ficha es inusualmente práctica para un lanzamiento tan reciente. La carga es estándar: AutoModel.from_pretrained en el directorio local del checkpoint con código remoto de confianza, atención SDPA y bfloat16. El streaming full-duplex se activa con una sola llamada que cambia el modelo a modo dúplex, tras lo cual el bucle documentado es un segundo de streaming_prefill seguido de streaming_generate, repetido. La memoria para video largo se habilita con un parámetro de minutos de memoria establecido en cuarenta y se describe como libre de entrenamiento, lo cual es notable para una capacidad que normalmente requiere ajuste fino. Dos advertencias están documentadas en lugar de descubrirse: un límite de fotogramas que trunca silenciosamente el video largo a menos que se aumente una constante antes de importar las utilidades, y un requisito de fuente CJK para subtítulos no latinos renderizados en video dúplex.
Lo que la tarjeta no te da es un requisito mínimo de hardware. Un modelo de 9B en BF16 ronda los dieciocho gigabytes de pesos antes de contar siquiera con memoria de activación, lo que sitúa la inferencia dúplex en tiempo real en una GPU potente y fuera del alcance del despliegue en portátiles para el que la familia MiniCPM-o, de la que deriva, fue diseñada en parte.
Hay una costura aquí que vale la pena nombrar, porque es donde un router encaja de verdad. Realtime-Venus delega su trabajo pesado —recuperación, razonamiento complejo, llamadas a API empresariales— a un modelo en segundo plano. Esa pata delegada es inferencia de texto ordinaria, y es la pata que decide si tu frontend conversacional es útil o meramente fluido. OrcaRouter no incluye nada de Realtime-Venus; la capa dúplex de aquí es una descarga autoalojada y no la servimos. El razonamiento que delega es la parte que sí cubrimos: casi 200 modelos detrás de una sola clave al precio de lista del proveedor sin sobreprecio, conmutación por error automática cuando un upstream tiene una tarde mala, un DSL de enrutamiento que compone varios modelos en una sola llamada, y fusión de modelos para los casos en que el juicio de un solo modelo no es suficiente. El marcador de delegación es decisión del frontend; qué modelo responde a ella es una elección de configuración, y mantener esa elección fuera de los pesos es lo que te permite cambiarla sin reentrenar nada.

¿Qué lo resolvería?
Tres cosas harían pasar a Realtime-Venus de ser un artículo con pesos a un modelo que cualquiera pueda evaluar. Un grupo independiente que reproduzca las cifras de continuación de Full-Duplex-Bench, porque un 97% en retrocanales es una cifra extraordinaria y las cifras extraordinarias necesitan un segundo lector. Una cifra de latencia publicada, porque los sistemas full-duplex viven o mueren por el tiempo hasta el primer audio y este no ha declarado un objetivo. Y documentación para el arnés, porque el diseño de delegación asíncrona es la única parte de este lanzamiento que es genuinamente nueva, y ahora mismo es la parte sobre la que puedes leer pero que no es fácil adoptar.
Hasta entonces, la descripción precisa es limitada y poco emocionante, que es exactamente por lo que vale la pena anotarla: una verdadera versión Apache-2.0 de dos checkpoints full-duplex de 9B, construida sobre un backbone abierto, con sólidos benchmarks autoinformados, sin verificación independiente, sin API y sin anuncio. Todo lo que está por encima de esa línea es inferencia.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
