
{{1}}Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe: El carril del streaming le pertenece a uno de ellos{{/1}}
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 y Gemini 3.5 Transcribe son los dos modelos de voz a texto de frontera más nuevos de laboratorios rivales, y la forma honesta de compararlos es admitir de entrada que no están hechos para la misma tarea. El Grok Voice Transcribe 2.0 de SpaceXAI, lanzado el 18 de septiembre de 2026, es un modelo orientado en primer lugar a streaming con un modo por lotes adjunto: encabeza la tabla AA-WER Streaming con una tasa de error de palabras del 2,7 % para transcripciones finales y del 3,4 % para los primeros parciales, ambos llegando 0,49 segundos después del final del habla. Gemini 3.5 Transcribe, lanzado el 26 de agosto de 2026, es un modelo orientado en primer lugar a lotes con una SKU de streaming adjunta, y sus dos mitades se comportan de manera muy diferente — la ruta pregrabada mide 2,6 % de AA-WER en la tabla no streaming de Artificial Analysis, mientras que el endpoint separado gemini-3.5-transcribe-live mide un 4,0 % en la tabla de streaming a 0,40 segundos. Pon esos cuatro números uno al lado del otro y la forma de este enfrentamiento es obvia: están cerca en precisión donde Gemini 3.5 Transcribe es fuerte, y no están cerca donde Grok Voice Transcribe 2.0 lo está.
El único carril en el que ambos luchan
Ambos modelos pueden transcribir audio en vivo, así que el streaming es el único ámbito donde una comparación directa tiene sentido. Ahí, Grok Voice Transcribe 2.0 supera a Gemini 3.5 Transcribe Live por 1.3 puntos en precisión de transcripción final — 2.7% frente a 4.0% de WER en el mismo banco de pruebas, las mismas aproximadamente ocho horas de audio y la misma ponderación 50/25/25 en AA-AgentTalk, VoxPopuli y Earnings22. Eso no es una diferencia de redondeo; a esos índices de error, es aproximadamente una palabra incorrecta adicional de cada setenta y cinco transcritas por el modelo de Google. En las primeras transcripciones parciales, la brecha es aún mayor: 3.4% frente a 5.8%, y las parciales son las transcripciones sobre las que un agente de voz en vivo tiene que actuar antes de que el hablante haya terminado.
La latencia juega en sentido contrario, y esta es la parte de la comparación que se pierde. Gemini 3.5 Transcribe Live devuelve su transcripción final 0,40 segundos después del final del habla, frente a los 0,49 de Grok, y su primera transcripción parcial en 0,25 segundos frente a los 0,49 de Grok: aproximadamente el doble de rápido hasta la primera palabra utilizable. Ninguno de los dos modelos compite con el extremo genuinamente rápido de esta tabla, donde Deepgram Flux marca 0,02 segundos y Soniox v5, 0,05, pero entre estos dos el intercambio es explícito: Google habla antes, SpaceXAI tiene más probabilidades de acertar cuando lo hace. Para un agente que gestiona los turnos de conversación y no debe hablar por encima de quien llama, 0,24 segundos de latencia parcial adicional son un coste real que la mejora en la precisión tiene que justificar.

Dónde gana realmente Gemini 3.5 Transcribe
La cobertura de idiomas es la más clara, y no hay comparación. El modelo de Google maneja más de 85 idiomas; Grok Voice Transcribe 2.0 admite docenas, con formato de forma escrita —la normalización de texto inversa que convierte números, fechas, monedas y direcciones de correo electrónico hablados en sus formas escritas— documentada en 25 idiomas. Si tu audio está en portugués, vietnamita o una mezcla con cambio de código de dos idiomas dentro de una misma frase, la pregunta de qué modelo es más preciso en el tablero de Artificial Analysis es en gran medida académica, porque ese tablero está ponderado hacia el inglés y tiene mucha conversación de agentes. Google reporta un WER de 5,50 % en streaming y 5,04 % en no streaming en FLEURS en su propia suite multilingüe, cifras reportadas por el proveedor y no reproducidas de forma independiente, pero que al menos describen el caso multilingüe de algún modo.
La segunda ventaja es el nivel gratuito. Gemini 3.5 Transcribe incluye tokens de entrada y salida gratuitos en la API de Google, con la advertencia de que el contenido del nivel gratuito se usa para mejorar los productos de Google, mientras que el del nivel de pago no. Para un prototipo, un proyecto secundario o una herramienta interna que procesa audio que de otro modo no pagarías por transcribir, esa es una opción real que ningún proveedor que cobre por hora puede igualar. Grok Voice Transcribe 2.0 es de pago desde la primera hora de audio.
Y la tercera es que Gemini 3.5 Transcribe es un modelo multimodal general con un modo de transcripción, no un servicio de ASR creado específicamente para ello. Se le pueden dar instrucciones, puede tomar texto como contexto, y vive en la misma superficie de API que todo lo demás que Google ofrece. Si la transcripción es un paso dentro de una canalización que también necesita razonamiento sobre la transcripción, mantener ambos en una sola llamada al modelo vale algo que una tasa de error por palabra no captura.
El cálculo de precios, por mil minutos
Artificial Analysis normaliza ambos modelos a un coste por cada 1000 minutos de audio, que es la única forma de comparar una tarifa plana por hora con la facturación por tokens:
• Por lotes, pregrabado — Grok Voice Transcribe 2.0 a $1,67 por 1.000 minutos ($0,10/hora) frente a Gemini 3.5 Transcribe a $5,00 por 1.000 minutos ($0,30/hora, desde $2,00 por 1 millón de tokens de entrada y $12,00 por 1 millón de tokens de salida)
Streaming — Grok Voice Transcribe 2.0 a $3,33 por 1.000 minutos ($0,20/hora) frente a Gemini 3.5 Transcribe Live a aproximadamente $5,40 por 1.000 minutos, combinado a partir de $3,50 por 1M de tokens de entrada de audio y $21,00 por 1M de tokens de salida de texto
• Rendimiento por lotes — Grok Voice Transcribe 2.0 a aproximadamente 162× respecto al tiempo real frente a Gemini 3.5 Transcribe a aproximadamente 88× en la misma placa, por lo que el modelo más económico también es el más rápido para el trabajo con archivos
• Límite de sesión en vivo — Grok Voice Transcribe 2.0 transmite a través de un WebSocket sin un límite de sesión publicado más allá de 100 sesiones concurrentes por equipo frente a Gemini 3.5 Transcribe Live limitado a 10 minutos por sesión
Esa última línea es el detalle operativo que decide más arquitecturas que las cifras de precisión. Un techo de 10 minutos en una sesión en vivo significa que las llamadas largas, las reuniones largas y las transmisiones largas deben cortarse y restablecerse, y cada restablecimiento es una costura donde se pierde contexto. El endpoint de streaming de Grok tiene un techo de tamaño de archivo de 500 MB en la ruta por lotes y un límite de concurrencia por equipo de 100 sesiones en la ruta de streaming, lo cual es un tipo diferente de restricción: rendimiento en lugar de duración.
La facturación por tokens merece entenderse antes de que te decidas por el lado de Google, porque hace que tu factura sea una función de dos variables en lugar de una. Gemini cobra por la entrada de audio y por la salida de texto por separado, así que un modelo que produce un formato verboso o se repite cuesta más que uno que no lo hace, y un idioma con palabras más largas cuesta más que uno con palabras más cortas. La tarifa plana por hora de Grok no varía con nada de eso. Para cargas de trabajo de alto volumen, la tarifa plana es más fácil de pronosticar, y como OrcaRouter transfiere los precios de lista de los proveedores con un 0% de margen, un cambio por parte de cualquiera de los proveedores llega a tu factura el día en que ocurre, en lugar de en la próxima renovación del contrato.

Formas de las características: lo que cada una se niega a hacer
Las listas de capacidades divergen más de lo que sugieren las cifras de precisión, y las diferencias están en puntos que importan a aplicaciones específicas:
• Diarización de hablantes: incluida sin coste adicional en Grok Voice Transcribe 2.0; no es compatible con Gemini 3.5 Transcribe Live, por lo que las transcripciones en vivo con atribución de hablante no están disponibles en absoluto en ese endpoint
• Marcas de tiempo a nivel de palabra — Grok Voice Transcribe 2.0 las devuelve con puntuaciones de confianza por palabra; Gemini 3.5 Transcribe Live no devuelve ninguna, lo que descarta el umbralado por confianza y la alineación precisa de subtítulos
• Audio multicanal — Grok Voice Transcribe 2.0 transcribe hasta 8 canales independientes en una sola pasada; Gemini 3.5 Transcribe Live no tiene equivalente, por lo que las grabaciones de llamadas multicanal necesitan sesiones por canal
• Sesgo por términos clave — Grok Voice Transcribe 2.0 acepta hasta 100 términos de dominio por solicitud; Gemini 3.5 Transcribe acepta vocabulario personalizado y sugerencias de idioma opcionales
• Infraestructura para agentes de voz — Grok Voice Transcribe 2.0 incorpora eliminación de muletillas y detección de fin de turno Smart Turn; Gemini 3.5 Transcribe Live cubre el caso de streaming, pero deja la lógica de turnos a la aplicación
• Gestión de entrada — Grok Voice Transcribe 2.0 admite la carga directa de archivos de hasta 500 MB en 12 formatos de audio; la ruta de audio pregrabado de Gemini 3.5 Transcribe requiere una URL HTTPS pública con un límite de 15 minutos y 300 MB, y no puede combinar su modo de formato Smart con marcas de tiempo por palabra ni etiquetas de hablante
El patrón en esa lista es que SpaceXAI creó un producto de transcripción y Google creó una capacidad de transcripción. La diarización, las marcas de tiempo, la división de canales y la detección de turnos son las funciones que necesitas cuando la transcripción es toda la aplicación; la capacidad de recibir prompts, la amplitud de idiomas y una sola API para todo son lo que quieres cuando la transcripción es un paso dentro de una aplicación más grande. Ninguna lista es mejor en abstracto, y un equipo que elija basándose solo en la precisión acabará echando en falta el conjunto que no necesitaba.

Elegir entre ellos, y qué cambia la respuesta
Recurra a Grok Voice Transcribe 2.0 cuando la transcripción tenga que ser correcta mientras el audio aún se está reproduciendo: toma de turnos de agentes en vivo, subtitulado en tiempo real que no puede permitirse errores, flujos de contact center donde la atribución de hablante y la separación de canales son parte de los requisitos, o cualquier pipeline por lotes donde tanto $1.67 por 1,000 minutos como un rendimiento 162× importen. Recurra a Gemini 3.5 Transcribe cuando el audio sea multilingüe en un idioma fuera del conjunto documentado de Grok, cuando la transcripción alimente a un modelo que también tenga que razonar sobre ella, cuando quiera un nivel gratuito con el que crear prototipos, o cuando el 2.6% de AA-WER de la ruta por lotes sea simplemente suficiente para lo que está haciendo y la cobertura de idiomas adicional valga más que la diferencia de precio.
Lo que la mayoría de los equipos realmente hace aquí no es elegir. Ambos modelos son accesibles a través de una sola clave API de OrcaRouter junto con más de 200 otros modelos, lo que significa que puedes enrutar el tráfico de agentes en vivo a Grok Voice Transcribe 2.0 y los archivos multilingües largos a Gemini 3.5 Transcribe sin mantener dos contratos de proveedor, dos relaciones de facturación y dos conjuntos de credenciales. Esa también es la forma de resolver la cuestión de la precisión para tu propio audio: ejecuta ambos en las mismas grabaciones, compara las transcripciones que realmente obtuviste y deja que el DSL de enrutamiento envíe el tráfico donde corresponda. La tabla de clasificación te dice qué modelo gana en ocho horas de conversaciones de agente en inglés de otra persona; solo tu propio audio te dice cuál gana en el tuyo.
La pregunta abierta es qué sucede con esa brecha de streaming cuando Google revise próximamente el endpoint Live. Gemini 3.5 Transcribe Live se lanzó en vista previa pública y su cifra del 4.0% se midió aproximadamente un día después de que se pudiera invocar — una señal temprana fuerte, pero que ha tenido menos tiempo para asentarse que el número de Grok que ahora le supera. Si Google cierra la brecha de streaming de 1.3 puntos mientras mantiene la latencia parcial de 0.25 segundos, el dilema deja de ser un dilema y la ventaja de Grok se reduce a precio y características. Hasta entonces, la división es clara: los parciales más rápidos son de Google, los más precisos son de SpaceXAI, y ningún modelo en el ranking es ambas cosas.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
