Tarjeta principal del artículo que dice «Grok Voice Transcribe 2.0 vs Muse Voice Transcribe», con la insignia «COMPARATIVA DE MODELOS» y el subtítulo «un reinado de 17 días y un cuarto de segundo», con etiquetas que dicen 2,7 % frente a 3,1 % de WER final, 0,49 s frente a 0,16 s después del habla, 0,20 $ frente a 0,18 $ por hora de streaming y por lotes a mitad de precio, sobre un degradado de blanco a azul con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Grok Voice Transcribe 2.0 vs. Muse Voice Transcribe: un reinado de 17 días y un cuarto de segundo

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El 1 de septiembre de 2026, Meta dijo que Muse Voice Transcribe había ocupado el primer puesto en la evaluación de reconocimiento de voz en streaming de Artificial Analysis con una tasa de error de palabras final del 3,1 %, y esa afirmación se mantuvo incontestada durante diecisiete días. El 18 de septiembre, SpaceXAI lanzó Grok Voice Transcribe 2.0 con un 2,7 % en la misma tabla y se quedó con el puesto. Dos modelos, una clasificación, con diecisiete días de diferencia —y la comparación más interesante no es la brecha de 0,4 puntos en precisión, porque el modelo de Meta sigue siendo aproximadamente tres veces más rápido para finalizar una frase: 0,16 segundos después del final del habla frente a los 0,49 segundos de Grok Voice Transcribe 2.0. Muse Voice Transcribe es un modelo de percepción de audio en tiempo real creado por Meta Superintelligence Labs para ejecutarse dentro de los propios productos de Meta, donde un cuarto de segundo es la diferencia entre un asistente que se siente presente y uno que se siente lento. Grok Voice Transcribe 2.0 es una API de transcripción creada para que cualquiera pueda invocarla, a un precio que hace viable el trabajo por lotes. Ambas cifras son reportadas por el proveedor el día del lanzamiento, y solo una de las dos se ha situado desde entonces de forma independiente en una tabla pública.

Lo que la tabla de clasificación dice realmente ahora

El tablero AA-WER Streaming es un compuesto ponderado —AA-AgentTalk al 50 %, VoxPopuli al 25 %, Earnings22 al 25 %, aproximadamente ocho horas de audio en inglés mayormente de tipo agente— y ambos modelos se evalúan en él, lo que convierte esto en una de esas raras comparaciones directas en las que las cifras son al menos conmensurables. En comparación directa, incluidas las cifras reportadas por el proveedor:

• Precisión final de la transcripción — Grok Voice Transcribe 2.0 con 2.7% de WER frente a Muse Voice Transcribe con 3.1%

• Precisión de la primera transcripción parcial — 3,4 % frente a 3,6 %

• Tiempo hasta el primer resultado parcial: 0,49 segundos frente a 0,13 segundos

• Tiempo desde el final del habla hasta la transcripción final — 0,49 segundos frente a 0,16 segundos

• Tasa de error de diarización de hablantes — incluida, sin cifra publicada frente a un promedio de 17,5 % en la evaluación de Meta

Lee las filas de precisión y las filas de latencia por separado, porque apuntan en direcciones opuestas y ambas son ciertas. En precisión, los dos modelos están a menos de cuatro décimas de punto entre sí en transcripciones finales y a dos décimas en los primeros resultados parciales: una diferencia lo bastante pequeña como para que se invierta en la próxima versión de cualquiera de las dos empresas, y lo bastante pequeña como para que ninguna persona razonable deba elegir entre ellos por eso. En latencia, no están cerca. El modelo de Meta devuelve un resultado parcial en aproximadamente un octavo de segundo y finaliza en aproximadamente un sexto de segundo, frente a aproximadamente medio segundo en ambos sentidos para el de SpaceXAI.

Esa es toda la comparación en una sola línea: Grok Voice Transcribe 2.0 gastó latencia para comprar precisión, y Muse Voice Transcribe hizo lo contrario. SpaceXAI redujo su tasa de error de la primera parcial del 18,3 % en la versión 1.0 al 3,4 % en la 2.0, y el precio de eso fue pasar de 0,25 segundos a 0,49 segundos en la misma métrica. El modelo de Meta se diseñó en la dirección opuesta, con fragmentos de audio de 80 milisegundos y un retraso adaptativo aprendido por refuerzo que decide cuánto esperar antes de comprometerse con el texto —un mecanismo cuyo único propósito es mantener la precisión mientras mantiene rápido el compromiso. Ninguna de las dos elecciones es un error. Son respuestas a preguntas diferentes.

¿Qué pregunta estás haciendo?

Si la transcripción alimenta a un agente de voz que tiene que responder dentro de una pausa conversacional, 0,16 segundos y 0,49 segundos son productos distintos. La toma de turnos humana tolera un intervalo de unos cientos de milisegundos antes de que la interacción empiece a sentirse mal, y el presupuesto de latencia es compartido: primero la transcripción, luego el razonamiento y después la síntesis de voz. Un modelo que devuelve una transcripción final en una sexta parte de un segundo deja espacio para el resto de la canalización; uno que tarda medio segundo consume la mayor parte del presupuesto antes de que el modelo haya pensado en nada. Para eso construyó Meta, y por eso el modelo se ejecuta dentro de Meta AI en el Mac y dentro de Muse Code, en lugar de ofrecerse principalmente como un endpoint para las canalizaciones de otras personas.

Si la transcripción es un documento —la grabación de una llamada, una reunión, una videoteca, un archivo de cumplimiento—, entonces medio segundo no es nada, la diferencia de precisión sigue siendo nada, y el único número que importa es cuánto cuesta una hora de audio. Y es ahí donde estos dos se separan radicalmente, y en una dirección que sorprende a quienes solo se fijan en la tarifa de streaming.

La mitad del precio en batch, un décimo más en streaming

Meta lista Muse Voice Transcribe a $0.18 por hora de audio, o $3.00 por cada 1,000 minutos. Grok Voice Transcribe 2.0 figura a $0.10 por hora para procesamiento por lotes y $0.20 por hora para streaming. Así que:

• Streaming — Grok Voice Transcribe 2.0 a $0,20 por hora frente a Muse Voice Transcribe a $0,18, por lo que Meta es aproximadamente un 10 % más barata

• Por lote o grabado — $0.10 por hora vs $0.18, así que SpaceXAI es 44% más económico

• Incluido en el precio de lista — diarización, marcas de tiempo de palabras con confianza, sesgo de términos clave y normalización inversa de texto del lado de SpaceXAI frente a transcripción en streaming, diarización y detección de puntos finales como un solo modelo del lado de Meta

• Plan gratuito o autoalojamiento — ni lo uno ni lo otro, en ninguno de los dos casos

Un equipo que solo transmite en streaming debería ser indiferente entre ambos en cuanto al precio y debería elegir según la latencia, lo que significa Meta. Un equipo con cualquier volumen significativo de audio grabado debería fijarse en la fila de procesamiento por lotes, porque 0,08 $ por hora se acumula: 5.000 horas al mes son 500 $ en uno y 900 $ en el otro, y la diferencia de precisión entre ambos es menor que el redondeo de cualquiera de las dos cifras.

La posición de licenciamiento es idéntica en lo que importa y distinta en lo que no. Ambos son de pesos cerrados: Muse Voice Transcribe es propietario y solo está disponible a través de la API alojada de Meta, y Grok Voice Transcribe 2.0 es una API comercial que no se puede descargar. Ninguno es una opción si tu requisito es que el audio nunca salga de la infraestructura que controlas, y ambos te dejan expuesto a que un proveedor cambie bajo tus pies su precio, la versión de su modelo o su calendario de descontinuación. Esa es una consideración real y no hipotética: Grok Voice Transcribe 1.0 ya está en camino a la descontinuación menos de dos semanas después de que se lanzara su sucesor.

Screenshot of the Meta AI research post titled 'Introducing Muse Voice Transcribe', dated September 1, 2026 and marked a four minute read, showing the headline and an interactive demo card labelled 'Click to start transcribing' with the caption 'Experience Muse Voice Transcribe in real time', above the opening line describing the model as Meta's first real-time audio perception model.

La diarización, que es la función que ninguno de los dos pone por delante.

Ambos modelos realizan la atribución de hablante en una sola pasada, lo que hace dos años era un sistema separado que se añadía después, y la comparación aquí es inusualmente concreta porque Meta publicó una cifra y SpaceXAI no.

Meta informa una tasa de error de diarización promedio del 17,5 % en su evaluación, maneja 20 o más hablantes sin posprocesamiento y los maneja como parte del modelo de streaming en lugar de como un paso posterior: el «quién dijo qué» llega junto con el texto, no después de él. Eso es realmente difícil de hacer en un contexto de streaming, donde un turno de hablante solo se puede identificar una vez que se ha oído lo suficiente de él, y 17,5 % es un número real con una salvedad real: es de la propia Meta, promediado sobre un conjunto de evaluación que Meta eligió.

El modelo de SpaceXAI incluye diarización sin coste adicional y también admite hasta ocho canales de audio independientes en una sola solicitud, lo cual es una forma distinta de resolver el mismo problema: si tu audio llega como canales separados por participante, como suele ocurrir en la telefonía de los centros de contacto, la separación por canales es más fiable que la diarización y no necesita ninguna tasa de error. Si tu audio llega como un único flujo mezclado, dependes de la calidad de la diarización, y solo uno de estos dos proveedores te ha dicho cuál es.

Hay una diferencia de segundo orden que vale la pena señalar: Muse Voice Transcribe trata la diarización, la transcripción y la detección de puntos finales como un solo modelo que produce una sola salida, lo que significa que los componentes no pueden fallar de forma independiente. Grok Voice Transcribe 2.0 te permite tomar canales, términos clave y diarización como controles separados. Un solo modelo es más sencillo de ejecutar y más difícil de depurar.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Muse Voice Transcribe — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7%, first partial 3.4%, time after speech 0.49s, diarization included with no figure published, streaming $0.20 per hour, batch $0.10 per hour. The right column gives Muse Voice Transcribe the rows: final WER 3.1%, first partial 3.6%, time after speech 0.16s, diarization error 17.5% average, streaming $0.18 per hour, no batch tier published. A footer reads 'Both sets of figures vendor-reported at launch; Grok accuracy independently placed on Artificial Analysis.'

Idiomas, y en qué punto las dos tarjetas de modelo dejan de ser comparables

Meta entrenó Muse Voice Transcribe con más de 70 idiomas y verificó 25 de ellos exhaustivamente en el lanzamiento, con cambio de código nativo dentro y entre oraciones y compatibilidad con audio de más de una hora. Grok Voice Transcribe 2.0 gestiona la detección automática de idioma con cambio a mitad de grabación y aplica normalización inversa de texto —fechas, monedas, números de teléfono y direcciones de correo electrónico hablados representados en forma escrita— en 25 idiomas.

La coincidencia consiste en los 25 idiomas verificados exhaustivamente, por un lado, y los 25 idiomas de normalización, por el otro, y los dos conjuntos no son los mismos 25, y ninguno de los proveedores ha publicado la lista. "más de 70 idiomas entrenados" y "25 idiomas con soporte de formato" no son afirmaciones comparables y no deberían restarse entre sí. Lo que sí se puede decir es que Meta hace una afirmación multilingüe más amplia y SpaceXAI hace una más estrecha pero más operativa: detectar el idioma es lo mínimo indispensable, y formatear lo que el modelo oyó en algo que un sistema posterior pueda analizar es la parte que rompe las integraciones cuando falta.

La elección, y la razón por la que puede que no te corresponda tomarla.

Quita el marketing y la decisión se reduce a tres frases. Elige Muse Voice Transcribe si la transcripción se consume en vivo dentro de una conversación, porque 0,16 segundos no es un detalle. Elige Grok Voice Transcribe 2.0 si tienes audio grabado en grandes volúmenes, porque la mitad del precio por lote tampoco es un detalle. Si no necesitas ninguno de los dos extremos, elige en función de cualquier otra cosa que te limite —la región, el contrato, la integración existente—, porque la diferencia de precisión no lo decidirá.

La complicación es que uno de estos dos modelos no está realmente a la venta en el sentido habitual. Muse Voice Transcribe existe para que el propio asistente de Meta se sienta rápido, y está disponible a través de la Meta Model API en gran medida porque Meta ha decidido que el valor de ecosistema de la exposición supera el valor de la exclusividad. Eso podría cambiar, y podría cambiar rápidamente: Meta dedicó esa misma semana a abrir la plataforma de conectores de Muse a desarrolladores externos, lo que supone una empresa que invierte en su propio canal de distribución en lugar de ser un proveedor neutral para los demás. Construir una dependencia de producción sobre el modelo interno de un competidor es una apuesta a que los términos no cambiarán, y esa apuesta tiene un mal historial.

Esa asimetría es el argumento para no codificar de forma fija ninguno de los dos. OrcaRouter expone más de 200 modelos detrás de una única clave compatible con OpenAI, con conmutación automática por error entre proveedores y 0 % de sobreprecio sobre el precio de lista del proveedor, así que cuando SpaceXAI cambie el valor predeterminado a 2.0 y deje obsoleta la 1.0, o cuando Meta reposicione su API de voz, el cambio será una cadena de modelo en lugar de un proyecto de migración. Para una categoría en la que el líder ha cambiado de manos dos veces en tres semanas, la capa de enrutamiento es la parte de la pila que debería ser estable, y el modelo es la parte que no debería serlo.

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

Una cosa a la que hay que prestar atención durante el próximo mes: si Artificial Analysis vuelve a medir Muse Voice Transcribe en la tabla de streaming ahora que Grok Voice Transcribe 2.0 lo ha desplazado. El 3,1 % de Meta y el 2,7 % de SpaceXAI se reportaron ambos en el lanzamiento, pero solo el de SpaceXAI se ha situado de forma independiente. Si el número de Meta se mantiene cuando alguien lo vuelva a ejecutar, la brecha de precisión es tan pequeña como parece y la brecha de latencia lo decide todo. Si no es así, el reinado de diecisiete días fue toda la historia.