
Realtime-Venus vs Qwen-Audio-3.0-TTS: Uno lee tu guion, el otro tiene que escucharte
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
La tentadora comparación entre Realtime-Venus y Qwen-Audio-3.0-TTS es el precio por hora de audio, y arroja una respuesta limpia que es totalmente errónea. Qwen-Audio-3.0-TTS-Plus sintetiza habla a aproximadamente $27.6 por millón de caracteres, lo que equivale a cerca de $1.66 por una hora de audio final. Realtime-Venus, el sistema full-duplex de 9B que el equipo Venus de Ant Group construyó con la Universidad de Tsinghua, no tiene ningún precio porque no tiene servicio alojado — pero autoalojado te costaría un nodo de GPU funcionando de forma continua, lo que es al menos un orden de magnitud más por hora. El sintetizador gana en la aritmética. La aritmética está midiendo dos productos diferentes: Qwen-Audio-3.0-TTS recibe texto y devuelve audio, y Realtime-Venus recibe audio y video y devuelve una conversación. La pregunta que en realidad los separa no es qué generan. Es si algo tiene que responder.
El input es toda la diferencia
Qwen-Audio-3.0-TTS, lanzado por Tongyi Lab de Alibaba Cloud el 20 de julio de 2026, es un modelo de texto a voz expuesto como una API alojada y sin pesos abiertos. El texto entra por un endpoint HTTP y sale audio. No hay ruta de entrada de audio, ni turno que tomar, ni transcripción que devolver, ni concepto de ser interrumpido: el modelo nunca ha oído nada. Todo su modelo de costos es una imprenta: caracteres de entrada, audio de salida.
Realtime-Venus, en cambio, escucha de forma permanente. El checkpoint audiovisual incorpora un codificador visual SigLIP2 para fotogramas en streaming y un codificador de audio Whisper-Medium que alimenta un backbone Qwen3-8B, y ambos checkpoints ejecutan un bucle de interacción de un segundo que actualiza continuamente el estado conversacional y decide si hablar o permanecer en silencio. Produce habla mediante tokens S3 discretos y un decodificador de flow matching en streaming en lugar de una etapa de síntesis independiente, y puede devolver texto junto con la forma de onda.
Eso no es una diferencia de características. Es la diferencia entre un componente y un sistema. Ponlos uno al lado del otro y uno de ellos puede incorporarse a un pipeline que ya tiene un reconocedor de voz y un modelo de lenguaje delante. El otro reemplaza a los tres.
Un caso práctico lo hace concreto.
Toma una línea de soporte. Un cliente llama, describe mal un problema, hace una pausa a mitad de frase para encontrar un número de cuenta, es interrumpido por un anuncio de fondo y luego hace una pregunta de seguimiento antes de que el agente haya terminado de responder.
Un sistema construido sobre Qwen-Audio-3.0-TTS gestiona esto como tres proveedores y tres facturas: un reconocedor convierte el habla de quien llama en texto, un modelo de lenguaje decide qué decir y Qwen-Audio-3.0-TTS lo pronuncia. Cada salto añade latencia, y cada frontera es donde muere la prosodia. El fallo crítico es estructural: la pata de TTS no puede oír la pausa en medio de una frase que ya está pronunciando, así que la interrupción tiene que gestionarla algo situado delante de ella.
Realtime-Venus gestiona la misma llamada como un solo modelo, sin detector externo de actividad de voz, sin traspaso. Sus cifras de Full-Duplex-Bench v1.5 —75 % de respuesta a interrupciones y tasas de continuación del 97 % en señales de retroalimentación, 88 % en habla dirigida a otros y 86 % en habla de fondo— son exactamente las métricas que describen este escenario. También son autodeclaradas, provenientes del propio informe técnico del modelo, sin reproducción externa. Léalas como una afirmación de diseño, no como una medición.
Calidad de voz: uno tiene un Elo, el otro no tiene nada
Esta es la parte más desequilibrada de la comparación, y favorece a Alibaba por un amplio margen.
• Puntuación independiente — Qwen-Audio-3.0-TTS-Plus ocupa el segundo lugar en la Provider Voice Arena de Artificial Analysis con un Elo de 1.259 sobre 1.544 muestras al 18 de septiembre de 2026, por detrás de Cartesia Sonic 3.6 con 1.277 y por delante de Inworld Realtime TTS-2 con 1.247 y Speechify Simba 3.2 con 1.241.
• Dónde empezó — la propia columna de lanzamientos de la arena incluye este modelo como una entrada de septiembre de 2026, que es el nivel tal como se puntúa actualmente en lugar de la fecha de lanzamiento del 20 de julio de 2026. Cada vez que se movió, se ha mantenido entre los dos primeros en todo momento.
• Realtime-Venus — sin entrada en arena, ninguna evaluación de voz por terceros, nada. Su única cifra relacionada con la voz es una puntuación autodeclarada de VoiceBench AlpacaEval de 4,81 que el informe describe como equiparable a la mejor cifra de comparación.
• Lo que eso significa — nadie fuera de los autores ha juzgado si Realtime-Venus suena bien. Eso no es un punto en su contra; simplemente es desconocido, y desconocido es distinto de malo. Pero si la calidad de voz es el entregable, comprar un modelo con calificación Elo es mejor que aceptar uno sin calificación a ciegas.


Idioma, voces y control expresivo
El modelo de Alibaba está diseñado para la amplitud de la locución. Incluye más de mil voces, cubre dieciséis idiomas, incluidas veinte regiones dialectales chinas, y expone 86 etiquetas en línea para emoción y locución —una superficie de control que se escribe en el propio texto, además de instrucciones de locución en lenguaje natural. La salida llega hasta 48 kHz, frente a los 24 kHz de la generación anterior, y una sola síntesis puede durar hasta tres minutos. El nivel Flash apunta a unos 300 milisegundos hasta el primer paquete para la reproducción en tiempo real; el nivel Plus es el nivel de calidad y genera alrededor de dieciséis caracteres por segundo, lo que es lo bastante lento como para importar en un producto en vivo e invisible en el renderizado por lotes.
Realtime-Venus documenta inglés y chino, incluye una voz de referencia junto con los pesos y te ofrece un decodificador de tokens a forma de onda en lugar de una biblioteca de voces. La expresividad en el sentido de Qwen —etiquetas, instrucciones, mil preajustes— no tiene equivalente aquí. Lo que sí tiene es la capacidad de cambiar su forma de locución en respuesta a lo que está oyendo, lo cual es un tipo distinto de control expresivo y mucho más difícil de plasmar en una ficha técnica.
El costo de cada camino, honestamente.
Existe una advertencia real sobre la cifra de Alibaba antes de que alguien haga su presupuesto con ella. Los 27,6 dólares por millón de caracteres que se citan tan ampliamente no coinciden con la propia página de precios de Alibaba en todas las capturas, y cada nivel de precios se cobra por separado. Comprueba la cifra a nivel de cuenta en lugar de fiarte de una tabla comparativa, incluida esta.
Realtime-Venus no tiene precio de lista porque no hay nada que comprar. El costo son dos checkpoints de 9B en BF16 —aproximadamente dieciocho gigabytes de pesos cada uno antes de la memoria de activación— más un bucle de streaming continuo, lo que implica un nodo de GPU que se factura por mes, haya o no llamadas. Con un volumen constante, eso es más barato por conversación que una API de voz con facturación por uso. Con un volumen intermitente, es mucho peor, y el punto de cruce es la única cuestión financiera que importa.
Hay una tercera vía en la que muchos equipos acabarán aterrizando, y merece la pena nombrarla porque cambia la forma de la decisión. Si mantienes una cascada, la única pata que necesita ser un modelo alojado es la del medio: el razonamiento. OrcaRouter no ofrece ni Qwen-Audio-3.0-TTS ni Realtime-Venus; ambas capas de voz quedan fuera de lo que servimos, y preferimos decirlo a insinuar lo contrario. La pata de razonamiento sí es lo que cubrimos: casi 200 modelos de texto detrás de una sola clave al precio de lista del proveedor y sin margen añadido, conmutación automática por error entre proveedores upstream para que una mala tarde de un proveedor no corte una llamada en curso, un DSL de enrutamiento que compone varios modelos en una sola llamada, y fusión de modelos cuando una decisión merece más de una opinión. En una cascada, esa es la pata que más querrás poder cambiar sin negociar un contrato, y aquella en la que una bajada de precios de un proveedor llega el mismo día en lugar de en la renovación.

La clonación es un arma de doble filo
Qwen-Audio-3.0-TTS puede clonar una voz a partir de una breve muestra de referencia, de forma interlingüística, y está documentado que es robusto a entradas ruidosas o con reverberación. Esa es la capacidad comercialmente más útil de la comparación y la mayor superficie de cumplimiento. Un producto que puede reproducir la voz de cualquier hablante a partir de diez segundos de audio tiene una respuesta mucho más larga a «¿de quién es esa voz y quién la consintió?» que uno que solo habla con los ajustes preestablecidos de un proveedor.
Realtime-Venus incluye una voz de referencia junto con los pesos. Puedes clonar con ella si tienes el audio y la ejecución de entrenamiento, pero nada en la versión está pensado para que eso sea fácil, lo cual, para un despliegue autoalojado dentro de un perímetro de cumplimiento, podría decirse que es la opción predeterminada más segura.
¿Cuál estás comprando en realidad?
Compra Qwen-Audio-3.0-TTS cuando el audio sea la salida. Narración, localización, accesibilidad, doblaje, cualquier flujo de trabajo en el que el texto exista antes que el sonido y la calidad por hora renderizada sea la métrica. Empieza con Flash si la reproducción es en directo, cámbiate a Plus cuando la voz en sí sea el producto, y ponle precio al flujo de trabajo de clonación por separado de la biblioteca de presets.
Recurre a Realtime-Venus cuando la entrada sea una persona y el sistema tenga que comportarse como un oyente. Asistencia consciente de la cámara, interacción manos libres, cualquier cosa en la que un humano vaya a interrumpir a mitad de frase y espere que el sistema lo maneje. El intercambio es contundente: renuncias a una voz con clasificación Elo, a mil ajustes preestablecidos y a cualquier opción alojada, y a cambio obtienes el único de los dos que puede oírte.
La mayoría de los productos quiere ambas cosas, en lugares distintos. Lo que no deberían compartir es un modelo de costos: el precio por hora de audio es la métrica correcta para exactamente uno de estos dos modelos, y no es el que sostiene la conversación.
