
Realtime-Venus vs SeedRealtime: dos formas opuestas de no estar disponible
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus y SeedRealtime son las dos mitades de la misma historia de 2026, y fallan pruebas opuestas. SeedRealtime es el modelo full-duplex nativamente audiovisual de ByteDance, activado dentro de la aplicación Doubao el 5 de agosto de 2026 de forma gratuita, llegando a una audiencia que su creador describe en cientos de millones — sin API, sin identificador de modelo, sin precio y sin objetivo de latencia. Realtime-Venus es un par de checkpoints de 9B del equipo Venus de Ant Group y la Universidad de Tsinghua, publicados el 12 de septiembre de 2026 bajo Apache-2.0 con un informe técnico y sin anuncio, ubicados en un repositorio que cualquier ingeniero puede descargar y que casi ninguno puede desplegar de forma realista. A uno de ellos no puedes invocarlo. Al otro puedes descargarlo y luego descubrir que no tienes nada donde invocarlo. Ambos están genuinamente en la frontera de la misma capacidad, y ninguno tiene un benchmark que alguien fuera de sus propios autores haya reproducido.
Dos versiones de «no puedes tenerlo»
Vale la pena ser preciso, porque la frase «no disponible» esconde una diferencia real.
SeedRealtime no está disponible del modo en que no lo está un producto de consumo: existe, funciona, tiene usuarios y la puerta simplemente está cerrada para los desarrolladores. No hay API, ni tarifario, ni portal de documentación, ni un plazo anunciado para tener uno. La vía de ByteDance al mercado ha sido la app, y la app ha bastado. Lo que obtienes como creador es una demo que puedes experimentar y no puedes integrar.
Realtime-Venus no está disponible de la misma forma en que no lo está un artefacto de investigación: los pesos son públicos, la licencia es permisiva, el código está ahí y nadie lo está ejecutando. Ningún proveedor de inferencia despliega el repositorio, y las descargas no se registran en absoluto, así que no hay ninguna señal pública que indique adopción ni lo contrario. Está disponible en el sentido que le importa a un investigador y no lo está en el sentido que le importa a un gerente de producto.
En conjunto, enmarcan la pregunta en la que está atascada actualmente toda esta categoría: los modelos que funcionan están detrás de aplicaciones para consumidores, y los modelos que puedes ejecutar no están en producción en ninguna parte.
Ambos están en el nivel que realmente distingue a 2026
Una forma útil de leer el campo en tiempo real es en tres niveles. El primero es voz semidúplex con visión añadida —asistentes por turnos que pueden ver, pero siguen funcionando por turnos. El segundo es audio dúplex completo, escuchando y hablando a la vez sin cámara: el propio Seeduplex de ByteDance, GPT-Live de OpenAI, Grok Voice Think Fast 2.0 de xAI. El tercero es dúplex completo audiovisual, donde la percepción y la expresión abarcan video y audio de forma continua.
SeedRealtime es el primer modelo del tercer nivel en alcanzar un despliegue comercial a gran escala. Realtime-Venus es un competidor de pesos abiertos en el mismo nivel: video mediante un codificador SigLIP2, audio mediante Whisper-Medium, un backbone Qwen3-8B y un bucle de interacción de un segundo que nunca deja de percibir. Su ficha de modelo afirma que está adaptado de MiniCPM-o 4.5, el modelo omnimodal de OpenBMB lanzado a principios de 2026, lo que sitúa la contribución de Ant Group en el postentrenamiento y el runtime en lugar de en la arquitectura base.
Lo que comparten, y lo que los sitúa un nivel por encima de los sistemas de solo audio, es que ninguno se detiene a mirar. La percepción visual continua mientras se habla es una capacidad genuinamente distinta de describir un solo fotograma, y ambos modelos se construyeron en torno a ella.
Cuánto valen los números de cada uno

Ninguno de los dos modelos cuenta con una evaluación comparativa de terceros. Sin embargo, la evidencia no es equivalente, y la diferencia importa.
• SeedRealtime no publica ningún benchmark en absoluto. Lo que ofrece ByteDance es la afirmación de que los problemas de ritmo del diálogo —interrumpir al usuario, responder tarde, activarse por el ruido de un desconocido— se reducen aproximadamente a la mitad en comparación con un sistema en cascada, a partir de evaluaciones humanas de extremo a extremo. Los datos subyacentes no se publican.
• Los números del predecesor tienen la misma forma. Se informó que Seeduplex, el modelo de solo audio que ByteDance incluyó en Doubao en abril de 2026, redujo a la mitad las tasas de falsas respuestas y falsas interrupciones, recortó la latencia de punto final en aproximadamente 250 milisegundos, disminuyó las respuestas prematuras en un 40 % y aumentó la satisfacción de las llamadas en 8,34 puntos en una prueba A/B a gran escala. Todo reportado por el proveedor.
• Realtime-Venus publica una tabla. Su informe afirma haber obtenido las mejores puntuaciones en seis de ocho benchmarks de video, incluidos StreamingBench 70,2, OVO-Bench 64,7 y Daily-Omni 81,3, y lidera en MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8 y Speech CMMLU 67,8 para el checkpoint de audio.
• Ambos carecen de reproducción. Una tabla publicada que nadie ha comprobado y un A/B no publicado que nadie puede comprobar son tipos distintos de falta de verificación. Ninguno de los dos es evidencia sobre la que puedas basar una decisión de adquisición.
La única comparación que vale la pena hacer dentro de los números de Realtime-Venus es contra su propia base. MiniCPM-o 4.5 reporta 80.2 en Daily-Omni; Realtime-Venus-Omni reporta 81.3. Una ganancia de un punto sobre el modelo del que se adaptó, en un benchmark que ese modelo ya manejaba, es un resultado plausible para un esfuerzo de postentrenamiento y runtime — y una afirmación mucho más modesta de lo que «el mejor en seis de ocho» parece por sí solo.

El problema de la toma de turnos, que es donde reside el full-duplex
El dúplex completo no es una característica de latencia. Es un conjunto de comportamientos: saber cuándo una pausa significa «estoy pensando» en lugar de «ya terminé», distinguir la conversación de un tercero de la de la persona que te habla, y permanecer en silencio durante una señal de retroalimentación en lugar de tratar un «mm-hm» como una interrupción.
El enfoque de SeedRealtime consiste en modelar el estado conversacional de forma nativa y eliminar por completo el detector externo de actividad de voz, de modo que la toma de turnos sea un comportamiento aprendido dentro de la red en lugar de un umbral aplicado a un flujo de audio. Ese es el mismo compromiso arquitectónico que asume Realtime-Venus, y ambos se posicionan frente a los sistemas en cascada que necesitan un componente separado para decidir quién habla.
En lo que difiere la evidencia es en que la afirmación de SeedRealtime se refiere al despliegue a escala —cientos de millones de usuarios, salas reales, ruido real—, mientras que la de Realtime-Venus se refiere a un benchmark. Los resultados de Full-Duplex-Bench v1.5 para Realtime-Venus-Audio —75 % de respuesta a interrupciones, 97 % de continuación bajo backchannels, 88 % bajo habla dirigida a otros y 86 % bajo habla de fondo, superando a Gemini 3.1 Live y GPT-4o en continuación— son las cifras más directamente relevantes que cualquiera de los dos modelos ha publicado para este problema. También son enteramente autodeclaradas, y un 97 % de continuación bajo backchannels es una cifra llamativa que merece una segunda lectura antes de que alguien la cite como un hecho.
Donde cada uno deja un constructor
La brecha práctica no es la calidad, sino la forma de la oferta.
• SeedRealtime — puedes experimentarlo gratis en Doubao y nunca integrarlo. No hay un camino de "esto es impresionante" a "esto está en mi producto".
• Realtime-Venus — puedes descargarlo, ajustarlo con fine-tuning, ejecutarlo en un entorno aislado e inspeccionar cada capa. El costo es dos checkpoints de 9B en BF16, de aproximadamente dieciocho gigabytes de pesos cada uno, más un bucle de streaming continuo por segundo, lo que significa un nodo de GPU que factura haya o no llamadas.
• Ninguno de los dos tiene una opción alojada. Ninguno de los dos puede probarse con una clave y una tarde.
Ese último punto es la razón por la que los dos modelos son más útiles como pareja que como oponentes. Entre ambos demuestran que las dos mitades del problema están resueltas —la capacidad funciona y los pesos se pueden publicar—, a la vez que muestran que nadie los ha combinado todavía en algo que un desarrollador pueda realmente invocar.
Hay una solución alternativa a la que muchos equipos recurrirán, y vale la pena aclarar qué cubre y qué no cubre. Si no puedes obtener la capa de voz, aún puedes construir la parte que piensa. Realtime-Venus delega su trabajo costoso —recuperación, razonamiento complejo, llamadas a API de negocio— a un arnés en segundo plano mediante marcadores de delegación asíncronos, y ese tramo delegado es inferencia de texto ordinaria. OrcaRouter no incluye ni Realtime-Venus ni SeedRealtime; ambas capas dúplex quedan fuera de lo que ofrecemos, y no alojamos ninguna de las dos. Casi 200 modelos de texto con una sola clave al precio de lista del proveedor sin recargo representan la mitad de la arquitectura que sí cubrimos, con conmutación automática ante fallos para que una tarea en segundo plano no falle porque un proveedor upstream haya tenido una mala tarde, un DSL de enrutamiento para componer varios modelos en una sola llamada, y fusión de modelos, donde el criterio de un solo modelo no es suficiente. No es la parte de estos sistemas que resulta difícil. Es la parte que realmente se puede comprar.

¿Qué cambiaría esta comparación?
Tres desarrollos lo zanjarían, y ninguno de ellos ha sucedido todavía. Un benchmark independiente de Realtime-Venus, porque una tabla sin un segundo lector es una afirmación y no un resultado. Una API para SeedRealtime, porque el modelo con la evidencia de despliegue más sólida es actualmente el que nadie puede usar. Y una cifra de latencia publicada por cualquiera de los dos —el tiempo hasta el primer audio es la métrica por la que se compra esta categoría, y, a la fecha de redacción, ninguno de los dos modelos ha declarado una.
Hasta entonces, el resumen honesto es que SeedRealtime es la prueba de que el dúplex completo audiovisual funciona a escala de consumidor y Realtime-Venus es la prueba de que los pesos pueden abrirse, y ninguno de esos hechos acerca a un desarrollador ni un paso más a lanzar un producto. Eso no es una crítica a ninguno de los dos laboratorios. Es la descripción de una categoría que ha resuelto el problema de investigación y todavía no el de distribución.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
