
Grok Voice Transcribe 2.0 vs GPT Transcribe: mismo precio de streaming, diferente precisión
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
La coincidencia es casi demasiado perfecta. En el tablero AA-WER Streaming de Artificial Analysis, Grok Voice Transcribe 2.0 y GPT Live Transcribe —el punto de conexión de transcripción en streaming— figuran ambos exactamente a $3,33 por cada 1.000 minutos de audio. Grok Voice Transcribe 2.0, de SpaceXAI, lanzado el 18 de septiembre de 2026, devuelve una transcripción final con una tasa de error de palabras del 2,7%, 0,49 segundos después del final del habla, y un primer resultado parcial al 3,4%. GPT Live Transcribe, que se lanzó junto con GPT Transcribe el 28 de julio de 2026, devuelve su transcripción final al 3,9% y su primer resultado parcial al 6,3%. Mismo precio, y aproximadamente 1,2 puntos de precisión de transcripción final más 2,9 puntos de precisión de transcripción parcial a favor de SpaceXAI. El lado por lotes de la misma comparación no es en absoluto una coincidencia: GPT Transcribe cuesta $4,50 por cada 1.000 minutos frente a los $1,67 de Grok Voice Transcribe 2.0, una diferencia del 63% en la ruta de archivos grabados.
Dos apuestas diferentes sobre cómo mejora la transcripción
La respuesta de OpenAI a la precisión es el contexto. GPT Transcribe y GPT Live Transcribe aceptan prompts de forma libre, listas de palabras clave y listas de idiomas esperados, y en las sesiones de Realtime los turnos transcritos anteriores se retroalimentan como contexto para los posteriores. En el benchmark Context Aware ASR de OpenAI, ese condicionamiento elevó la precisión semántica de GPT Live Transcribe del 38,5 % al 44,6 % —una cifra reportada por el proveedor, y que mide si sobrevivió el significado en lugar de si las palabras eran correctas. El intercambio que ofrece OpenAI es explícito: dale al modelo información sobre lo que está a punto de escuchar, y transcribirá tu dominio mejor que un modelo general con la misma precisión bruta.
La respuesta de SpaceXAI es el modelo en sí. Grok Voice Transcribe 2.0 sí tiene un mecanismo de sesgo —hasta 100 términos clave por solicitud, cada uno de hasta 50 caracteres—, pero es una lista de vocabulario, no un prompt. Puedes decirle que "OrcaRouter" y "Kubernetes" son palabras reales; no puedes darle un párrafo que explique que esta es una llamada de soporte sobre un reembolso. La mejora de precisión en 2.0 proviene, en cambio, del reentrenamiento: en los propios conjuntos de evaluación derivados de producción de SpaceXAI, la tasa de error de palabras cayó del 8,7 % al 3,3 % en audio conversacional, del 10,6 % al 7,1 % en telefonía de 8 kHz, del 7,2 % al 3,2 % en credenciales habladas y del 20,6 % al 6,8 % en comandos cortos en 19 idiomas. Esos son los números de la empresa sobre el audio de la empresa, no reproducidos por nadie fuera de ella, y describen un modelo que mejoró en el problema acústico en lugar de uno que mejoró cuando se le dice qué esperar.
La diferencia práctica se manifiesta en la segunda hora de trabajo. Un modelo condicionado por el contexto puede ser drásticamente mejor de lo que sugiere su benchmark sin procesar, porque tú proporcionaste el vocabulario y el dominio. También puede alucinar las palabras clave que proporcionaste: pon "OrcaRouter" en el prompt y un modelo que no puede oír la palabra con claridad puede producirla de todos modos. Un modelo sesgado hacia términos clave se degrada de manera más elegante, porque el sesgo desplaza la probabilidad de un término en lugar de afirmar que está presente. Ninguno de los dos modos de fallo aparece en una tabla de clasificación, y ambos aparecerán en tus registros.
Los números, uno al lado del otro
• Precisión de la transcripción final (en streaming) — Grok Voice Transcribe 2.0 con un 2,7 % de WER frente a GPT Live Transcribe con un 3,9 % en AA-WER Streaming, ambos según Artificial Analysis
• Precisión parcial inicial (streaming) — 3,4 % frente a 6,3 %, la mayor diferencia de la comparación y la que decide el comportamiento del agente de voz
• Tiempo hasta la transcripción final: 0,49 s frente a 0,81 s después de terminar el habla, así que el modelo más preciso también es el más rápido en confirmar
• Tiempo hasta la primera respuesta parcial — 0,49 s vs. 0,26 s, la única columna de latencia que OpenAI gana de forma contundente
• Precio de streaming — $3.33 por 1,000 minutos para ambos, normalizado por Artificial Analysis a partir de $0.20/hora de Grok y $0.017/minuto de OpenAI
• Precisión por lotes (sin streaming) — Grok Voice Transcribe 2.0 con 2.3 % de AA-WER frente a GPT Transcribe con 3.31 %
• Precio por lote — $1.67 por 1.000 minutos vs. $4.50 por 1.000 minutos, desde $0.10/hora frente a $0.0045/minuto
• Rendimiento por lotes — aproximadamente 162× el tiempo real frente a aproximadamente 41× en la misma placa
Lee esa lista como dos columnas en lugar de un solo veredicto. OpenAI gana en latencia de la primera parcial por un margen claro y ofrece un mecanismo de contexto que Grok no tiene. SpaceXAI gana en precisión final en ambos modos, precisión de las parciales en streaming, capacidad de procesamiento y el precio por lotes por un amplio margen. No hay ninguna columna en la que GPT Live Transcribe sea a la vez más rápido y más preciso que Grok Voice Transcribe 2.0; hay una columna en la que es más rápido, y es la primera.

¿En qué ruta de lote estás realmente?
La brecha de $1.67 frente a $4.50 es el número menos ambiguo aquí, y vale la pena ser precisos sobre por qué existe. OpenAI redujo el precio de esta línea de productos un 25% cuando lanzó GPT Transcribe, desde la era de GPT-4o Transcribe, y $0.0045 por minuto fue el resultado. SpaceXAI dejó su tarifa por lotes intacta en $0.10 por hora cuando pasó de la versión 1.0 a la 2.0 — mejoró el modelo y cobró lo mismo, lo cual es algo más difícil de hacer y una mejor señal sobre hacia dónde va el mercado. MAI-Transcribe-2 de Microsoft llegó al idéntico $0.10 por hora como oferta por tiempo limitado, así que el punto de $1.67 por cada 1,000 minutos se ha convertido en el piso de los laboratorios de frontera para la transcripción por lotes, más que en el número promocional de un solo proveedor.
Con diez mil horas de audio al mes, esa diferencia es de aproximadamente $2,830 frente a $450. Para un archivo de pódcast, una acumulación de grabaciones de llamadas pendientes o una biblioteca multimedia que se transcribe de forma retroactiva, la diferencia de precio eclipsa cualquier diferencia de precisión entre 2.3% y 3.31% de WER. Para un agente de streaming, donde ambos productos cuestan lo mismo, la precisión y la latencia son lo único que queda por discutir.
Hay una diferencia estructural detrás de esas tarifas que vale la pena nombrar: Grok Voice Transcribe 2.0 cobra una tarifa plana por hora de audio, y GPT Live Transcribe cobra por minuto, pero Gemini 3.5 Transcribe Live cobra por token tanto en la entrada de audio como en la salida de texto. Solo una de esas tres hace que tu factura sea función de lo que el modelo decide decir. Si tu volumen es lo suficientemente grande como para que la previsión importe, las tarifas planas son más fáciles de defender ante quien firma la factura — y como OrcaRouter transfiere los precios de lista de los proveedores con un 0 % de margen, un recorte del lado del proveedor como el 25 % de OpenAI estaría activo de nuestro lado el mismo día en que se anuncie, no en la próxima renovación.

Lo que ninguno de los dos modelos es
GPT Transcribe y GPT Live Transcribe son dos productos, no uno con un interruptor. El modelo por lotes se encarga de archivos completados, transcripciones de archivos transmitidos y turnos confirmados en sesiones de Realtime, y procesa audio aproximadamente 34 veces más rápido que en tiempo real según las propias cifras de OpenAI — Artificial Analysis mide 41× en su harness. El modelo de streaming es el más caro, a $0.017 por minuto, y el que tiene una tasa de error 10× mayor en los parciales. Elegir OpenAI significa elegir cuál de esos dos problemas tienes, porque el endpoint más barato no puede hacer el trabajo del otro.
Grok Voice Transcribe 2.0 es un solo modelo con dos transportes: los mismos pesos sirven /v1/stt por REST para archivos de hasta 500 MB y wss://api.x.ai/v1/stt por WebSocket para audio en vivo, con resultados provisionales emitidos aproximadamente cada 500 ms. La velocidad de streaming es exactamente el doble que la velocidad por lotes, en lugar de ser un producto diseñado por separado, lo que significa que la precisión que mides en tu audio archivado es la precisión que deberías esperar en vivo. También significa que no hay un segundo modelo que evaluar: un conjunto de prompts, un conjunto de términos clave, un conjunto de expectativas.
La paridad de funciones es cercana, pero no idéntica. Ambos devuelven marcas de tiempo a nivel de palabra; Grok Voice Transcribe 2.0 asigna una puntuación de confianza a cada palabra, lo que permite aplicar un umbral a los tramos de baja confianza en lugar de confiar por igual en toda la transcripción. Ambos hacen diarización de hablantes, y la de Grok está incluida sin coste adicional. Ambos manejan la normalización inversa de texto para números, fechas, monedas y datos de contacto. Grok Voice Transcribe 2.0 añade transcripción multicanal en hasta 8 canales independientes, eliminación de muletillas y detección de fin de turno Smart Turn; las incorporaciones distintivas de GPT Transcribe son el condicionamiento de contexto a nivel de prompt y, del lado de Realtime, la transferencia automática de turnos anteriores. OpenAI no ha publicado un recuento de idiomas compatibles para ninguno de los dos modelos; Grok Voice Transcribe 2.0 documenta docenas de idiomas con cambio a mitad de grabación y formato de forma escrita en 25.

Cómo decidir, y cómo probarlo
Si estás creando un agente de voz que tiene que responder antes de que el interlocutor termine, la columna de transcripción parcial es tu variable de decisión, y separa limpiamente los dos modelos: Grok Voice Transcribe 2.0 es 2,9 puntos más preciso en las parciales, pero tarda 0,23 segundos más en producirlas. Elige SpaceXAI si una parcial incorrecta es peor que una tardía: enrutamiento, escalado, respuestas activadas por cumplimiento normativo. Elige OpenAI si una parcial tardía es peor que una incorrecta, y si dispones del vocabulario del dominio para alimentar el mecanismo de contexto de modo que se reduzca la brecha de precisión. Luego mide ambos, porque el comportamiento de transcripción parcial de ninguno de los dos proveedores sobre ocho horas de conversación de agentes en inglés predice lo que hará cualquiera de ellos con tu acento, tu códec y tu jerga.
Si estás transcribiendo archivos, la decisión es mucho más fácil: $1.67 frente a $4.50 por cada 1,000 minutos y 2.3% frente a 3.31% de WER, y ambos apuntan en la misma dirección. La única razón para quedarse en GPT Transcribe para trabajo por lotes es si el mecanismo de condicionamiento de contexto está haciendo algo por tu audio que la brecha de precisión bruta no puede compensar — lo cual es una posibilidad real en grabaciones altamente específicas de un dominio, y una que se puede probar.
Ninguno de los modelos de transcripción está hoy en el catálogo de OrcaRouter, así que las llamadas en sí van a la API propia del proveedor. Lo que sí está detrás de una sola clave de OrcaRouter es todo lo que la transcripción alimenta: el modelo de agente, el resumidor, el clasificador, el código que decide qué hacer con el texto. Ahí es donde suele aparecer el segundo contrato —un proveedor para el habla, otro para el modelo que razona sobre ella— y no tiene por qué. Una sola clave para más de 200 modelos, conmutación automática si un proveedor se degrada y el DSL de enrutamiento si quieres enviar una solicitud a través de varios modelos y comparar antes de comprometerte. Es una afirmación más modesta que «enrutamos tu transcripción», y es la verdadera.
Lo que hay que observar es si OpenAI responde en precisión en lugar de en contexto. La compañía ya ha lanzado dos generaciones de transcripción en un año y ha recortado precios una vez; el mecanismo de contexto es genuinamente diferenciador, pero en la tabla que mide la transcripción bruta actualmente se sitúa por detrás de SpaceXAI y de Microsoft. Si llega un GPT Transcribe 2 con el mecanismo de contexto intacto y la tasa de error reducida al rango del 2%, esta comparación se invierte en el lado del procesamiento por lotes de la noche a la mañana, y el precio de streaming, ya idéntico, convierte eso en una carrera que vale la pena seguir.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
