Tarjeta destacada del artículo que dice «Grok Voice Transcribe 2.0», con la insignia «NOTICIAS» y el subtítulo «El puesto n.º 1 en precisión de streaming, a un precio sin cambios», con chips que indican 2,7 % WER de transcripción final, 3,4 % de primera parcial, 0,49 s después del final del habla y $0,20 por hora de streaming, sobre un degradado de blanco a azul con el logotipo de OrcaRouter en la esquina inferior derecha.
Engineering & Research

Grok Voice Transcribe 2.0 ocupa el puesto n.º 1 en precisión de streaming a un precio sin cambios

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Grok Voice Transcribe 2.0 es el modelo de voz a texto que SpaceXAI lanzó el 18 de septiembre de 2026, y el único número que importa sobre él no es el que encabeza la publicación de lanzamiento. Es este: la primera transcripción parcial —el texto sobre el que un agente de voz realmente puede actuar mientras todavía se habla por encima de la persona que llama— pasó de una tasa de error de palabras del 18,3 % en Grok Voice Transcribe 1.0 a 3,4 %. Esa es la medición en el tablero AA-WER Streaming de Artificial Analysis, donde el nuevo modelo ahora ocupa el primer puesto tanto en la clasificación de Transcripción Final (2,7 % de WER, 0,49 segundos después del final del habla) como en la clasificación de Primera Transcripción Parcial (3,4 %, 0,49 segundos). La precisión de la transcripción final también mejoró, del 3,9 % al 2,7 %, lo cual es real pero modesto. El salto de la transcripción parcial es el que cambia lo que puedes construir.

¿Qué cambió realmente entre 1.0 y 2.0?

Las dos versiones son el mismo producto en la misma API, y SpaceXAI no hizo cambios en la interfaz: Grok Voice Transcribe 2.0 se selecciona pasando grok-voice-transcribe-2.0 a /v1/stt en lugar de grok-voice-transcribe-1.0, o eligiéndolo cuando se crea la conexión WebSocket para streaming. Las integraciones existentes que omiten el parámetro del modelo siguen recibiendo la 1.0 hasta que SpaceXAI cambie el valor predeterminado, lo cual, según la empresa, ocurrirá en las próximas semanas junto con la deprecación de la versión anterior. Hasta entonces, la 2.0 es opcional y la 1.0 se puede fijar deliberadamente, que es la forma correcta para un cambio como este: puedes hacerle una prueba A/B con tu propio audio antes de que se convierta en tu opción predeterminada de producción, lo hayas pedido o no.

Los números de Artificial Analysis, leídos en paralelo, cuentan una historia más específica que «dos veces más preciso»:

• Exactitud final de la transcripción — Grok Voice Transcribe 2.0 con un 2,7 % de WER frente a Grok Voice Transcribe 1.0 con un 3,9 % en AA-WER Streaming; ambas medidas tras el final del habla

• Precisión de la primera transcripción parcial — 3,4 % de WER frente a 18,3 %, la mayor diferencia individual entre las dos versiones

• Tiempo hasta la transcripción final — 0,49 s frente a 0,37 s, así que el nuevo modelo tarda más en confirmar que el que reemplaza

• Tiempo hasta el primer parcial — 0,49 s vs 0,25 s, igualmente más lento

• Precisión por lotes (sin streaming): 2,3 % de AA-WER en la tabla sin streaming de Artificial Analysis, frente a 4,07 % para Whisper Large v3 y 3,31 % para GPT Transcribe

• Rendimiento por lotes: aproximadamente 162× el tiempo real en la misma placa, por detrás de los 333× de MAI-Transcribe-2 y por delante de los 88× de Gemini 3.5 Transcribe

Esas líneas cuarta y quinta son la salvedad honesta de esta versión. SpaceXAI compró precisión a cambio de latencia. El nuevo modelo tarda aproximadamente un tercio de segundo más en devolver su primer resultado parcial y su transcripción final de lo que tardaba la versión 1.0. En una tabla en la que Deepgram Flux devuelve un resultado parcial en 0,02 segundos y Soniox v5 en 0,05, Grok Voice Transcribe 2.0 no compite por velocidad en absoluto: compite por acertar, y gana ese intercambio por un amplio margen. Que ese sea el intercambio correcto depende por completo de si tu aplicación es un agente de voz en vivo que necesita empezar a responder por voz, o un pipeline de transcripción en el que medio segundo es invisible.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Grok Voice Transcribe 1.0 — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% final transcript WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives Grok Voice Transcribe 1.0 3.9%, 18.3%, 0.37s and the same two prices, with throughput not measured; the footer credits both columns to Artificial Analysis.

La afirmación del «doble de preciso», verificada

El titular de SpaceXAI es que 2.0 es el doble de preciso que 1.0 al mismo precio, y su propia tabla de evaluación lo respalda en los conjuntos que eligió. En llamadas de atención al cliente en inglés de 8 kHz, la tasa de error de palabras cayó del 10,6 % al 7,1 %. En conversaciones con Grok, del 8,7 % al 3,3 %. En credenciales habladas —códigos de cuenta, números de teléfono, direcciones de correo electrónico—, del 7,2 % al 3,2 %. En comandos cortos en 19 idiomas, del 20,6 % al 6,8 %, una reducción de errores de aproximadamente dos tercios. Esos cuatro conjuntos se extraen del tráfico de producción de SpaceXAI y las comparaciones son de SpaceXAI; nadie fuera de la empresa las ha reproducido. Considera la tabla como un mapa de dónde se ajustó el modelo, no como una garantía general de precisión.

El resultado de Artificial Analysis es la parte que no está reportada por el proveedor: una prueba independiente ejecutada sobre aproximadamente ocho horas de audio, ponderada en un 50 % hacia el conjunto privado AA-AgentTalk y un 25 % cada uno hacia VoxPopuli y Earnings22. Respalda una afirmación más acotada y útil que «el doble de precisión»: que, en esa mezcla específica, este modelo es el transcriptor en streaming más preciso medido. Un detalle que vale la pena mencionar: la publicación de SpaceXAI describe un primer lugar «entre 32 modelos de streaming», mientras que la propia página de la tabla de clasificación representa 27 de 33 modelos. El ranking es real; el tamaño del conjunto en el texto de marketing es el recuento de la empresa, no el de la tabla.

También vale la pena ser preciso sobre lo que un primer puesto en AA-WER Streaming cubre y no cubre. La tabla está ponderada hacia el inglés y cargada de conversaciones de agentes. No mide tu acento, tu códec, tu vocabulario de dominio ni tu audio de centro de llamadas de ocho canales. Un modelo que la encabeza puede seguir fallando estrepitosamente en tus grabaciones, y es exactamente por eso que la ventana de adhesión importa.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first on both the Final Transcription ranking at 2.728% word error rate and 0.490s and the First Partial Transcription ranking at 3.359% and 0.489s, with Grok Voice Transcribe 1.0 further down at 18.275% on partials.

El precio no ha cambiado, y ese es el segundo hecho más importante aquí.

Grok Voice Transcribe 2.0 cuesta lo que costaba 1.0: $0.10 por hora de audio para lotes y archivos grabados a través del endpoint REST, $0.20 por hora de audio para streaming a través del WebSocket. En el tablero de precios de Artificial Analysis, el SKU de streaming queda en $3.33 por cada 1,000 minutos y el SKU por lotes en $1.67 — la misma tarifa por lotes que Microsoft cobra por MAI-Transcribe-2, y aproximadamente un tercio de lo que cuesta ElevenLabs Scribe v2 Realtime por minuto de streaming.

La diarización, las marcas de tiempo a nivel de palabra con puntuaciones de confianza y el sesgo de términos clave se incluyen en esa tarifa en lugar de facturarse por separado, lo cual no es algo universal en este mercado. Gemini 3.5 Transcribe Live cobra por token tanto en la entrada de audio como en la salida de texto, por lo que tu costo varía según cuánto diga el modelo, no solo según cuánto haya durado el audio. Una tarifa plana por hora es más fácil de pronosticar y más fácil de comparar entre proveedores, y como OrcaRouter transfiere los precios de lista de los proveedores con un 0% de margen, un cambio en esa tarifa por parte del proveedor se reflejaría de nuestro lado el mismo día, en lugar de después de un ciclo de reajuste de precios.

Lo que la API realmente te da

La lista de capacidades es amplia y en su mayor parte heredada más que nueva, algo que conviene saber si estás evaluando la actualización basándote únicamente en las funciones:

• Procesamiento por lotes y en streaming en un solo modelo — REST para archivos grabados de hasta 500 MB, WebSocket en wss://api.x.ai/v1/stt con resultados provisionales emitidos aproximadamente cada 500 ms

• Incluye diarización de hablantes, además de transcripción multicanal de hasta 8 canales independientes

• Marcas de tiempo a nivel de palabra con puntuaciones de confianza, para que puedas aplicar un umbral a los tramos de baja confianza en lugar de confiar por igual en toda la transcripción

• Sesgo de términos clave de hasta 100 términos de dominio por solicitud, cada uno de hasta 50 caracteres

• Normalización inversa de texto para números, fechas, monedas, números de teléfono y direcciones de correo electrónico, con formato de forma escrita compatible con 25 idiomas

• Eliminación de muletillas y detección de fin de turno de Smart Turn dirigidas directamente a agentes de voz

• Detección automática de idioma con cambio de idioma a mitad de la grabación en una sola pasada, en 12 formatos de audio y frecuencias de muestreo de 8 kHz a 48 kHz

• Límites de servicio de 10 solicitudes por segundo tanto en REST como en streaming, y 100 sesiones de streaming simultáneas por equipo, alojados en us-east-1

La única nota de producción que no está en la lista de funciones: el servicio se ejecuta en una sola región. Si tu audio se origina fuera de Estados Unidos, el tramo de red ahora forma parte de tu presupuesto de latencia, y AA-WER Streaming incorpora explícitamente el retraso de red en su medición de tiempos. SpaceXAI ofrece términos de retención cero de datos y cita SOC 2 Type II, BAAs y opciones de residencia de datos en la UE, por lo que la historia de cumplimiento está más desarrollada que la geográfica.

Screenshot of the SpaceXAI docs.x.ai Speech-to-Text page listing the Grok Voice Transcribe 2.0 REST and WebSocket endpoints, the grok-voice-transcribe-2.0 model parameter, the 500 MB file limit, key-term biasing and the published rate limits.

Quién debería mover, y a qué prestar atención

Si ya está en Grok Voice Transcribe 1.0 y su aplicación actúa sobre transcripciones parciales —detección de turnos, interrupción, respuestas de agente en vivo—, la brecha de precisión parcial de 18.3% a 3.4% es lo suficientemente grande como para que probar 2.0 no sea opcional. Ese número que pasa de "normalmente incorrecto" a "normalmente correcto" es la diferencia entre una transcripción parcial que puede enrutar y una que solo puede mostrar. Si su aplicación espera transcripciones finales en archivos grabados, la mejora es real pero menor, y los 0.12 segundos añadidos de latencia de confirmación son el costo de ello.

Si estás con un proveedor completamente distinto, la razón para mirar este lanzamiento no es el puesto en la tabla de clasificación — es que un laboratorio de frontera acaba de mejorar su modelo de transcripción por un amplio margen sin subir el precio, que es lo que parece un mercado cuando la precisión deja de ser aquello por lo que cobras. La ruta de actualización también es la más barata: un parámetro, ningún cambio de código, ningún contrato nuevo y un pin disponible si algo sale mal.

Lo siguiente que hay que vigilar es el cambio de predeterminado. Cuando SpaceXAI convierta 2.0 en el predeterminado y empiece a dejar obsoleto 1.0, todas las integraciones que nunca pasaron un parámetro de modelo se pasarán al nuevo modelo a la vez, incluido el cambio de latencia. Los equipos que dependen de la antigua temporización parcial de 0,25 segundos deberían fijar la versión ahora en lugar de descubrir el cambio en producción. Lo segundo que hay que vigilar es la reproducción independiente: la entrada de Artificial Analysis es una medición real, pero es una sola tabla sobre una sola mezcla de audio, y ningún tercero ha publicado todavía una ejecución 1.0 frente a 2.0 en igualdad de condiciones sobre audio de producción.