
Gemini 3.5 Transcribe Live frente a Gemini 3.5 Transcribe: qué endpoint debe llamar tu aplicación
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Inteligencia49Código
Cuando Google lanzó la familia Gemini 3.5 Transcribe el 26 de agosto de 2026, incluyó dos modelos que comparten nombre y misión, pero están diseñados para diferentes etapas de una conversación: Gemini 3.5 Transcribe Live, el endpoint de streaming servido a través de la Live API, y Gemini 3.5 Transcribe, el endpoint para audio pregrabado servido a través de la Interactions API. El error que cometen la mayoría de los equipos en la primera semana es tratar esto como un solo modelo con dos botones. Son dos SKU: distintas APIs, distintos precios, distintos límites estrictos; y la comparación de precisión entre ellos no es una lucha justa, porque se miden bajo reglas diferentes. Este artículo los pone uno al lado del otro para que la decisión dependa de tu carga de trabajo, no de una tabla de clasificación.
Los dos de un vistazo
• API — Gemini 3.5 Transcribe Live se ejecuta en la API Live (WebSocket, transmisión bidireccional), mientras que Gemini 3.5 Transcribe se ejecuta en la API Interactions (archivo de entrada, transcripción de salida).
• Trabajo — conversación en vivo, subtitulado, agentes de voz vs reuniones, registros de llamadas, audio de archivo.
• Exactitud — 4.0% WER en streaming vs 2.6% WER no streaming, según Artificial Analysis, citado por Google; diferentes regímenes de medición, no directamente comparables.
• Latencia — una transcripción final 0,40 s después de que termina el habla, frente al procesamiento por lotes de un archivo completo.
• Sesión — límite de 10 minutos por sesión en vivo frente a archivos de hasta 60 minutos (30 minutos con diarización y marcas de tiempo habilitadas).
• Altavoces — ninguno en el lado de streaming frente a hasta tres altavoces con marcas de tiempo a nivel de palabra en el lado pregrabado.
• Precio: aproximadamente $0.009 por minuto combinado frente a aproximadamente $0.005 por minuto combinado.

La decisión de arquitectura: Interactions API o Live API
Ambos modelos se encuentran bajo la familia Gemini Audio de Google, y ambos están en vista previa pública. La diferencia comienza en el transporte. gemini-3-5-transcribe-live abre un WebSocket y lo mantiene abierto: el audio sin procesar se transmite continuamente — la estructura común es de fragmentos PCM de 16 kHz o 24 kHz a 16 bits — y el modelo devuelve transcripciones parciales mientras hablas, y luego una transcripción final para cada enunciado cuando termina el discurso. gemini-3-5-transcribe toma un archivo completo, lo procesa y devuelve la transcripción final con atribución de hablante y marcas de tiempo a nivel de palabra.
La decisión de transporte determina todo lo demás. Si tu producto muestra las palabras tal como se dicen —un subtítulo en vivo, un agente de voz que lee la intención a mitad de frase, un asistente de llamadas que actúa mientras la llamada está en curso— estás en la ruta Live. Si tu producto produce un registro —una nota de reunión, un registro de llamadas, un archivo— estás en la ruta Interactions. La confusión es que ambos producen texto; la diferencia está en si el texto es un estado en tiempo real o un artefacto final.
Precisión: el impuesto del streaming es real.
Artificial Analysis, el laboratorio independiente de referencia cuyas cifras cita {{1}}Google{{/1}} en su publicación de lanzamiento, mide una tasa media de error de palabras del 4,0% para el endpoint de streaming y del 2,6% para el de no streaming. En el benchmark multilingüe FLEURS, {{1}}Google{{/1}} reporta un 5,50% en streaming frente a un 5,04% en no streaming. La cifra del 2,6% sitúa a {{2}}Gemini 3.5 Transcribe{{/2}} en el puesto #5 de la clasificación WER de AA en su lanzamiento, por detrás de ElevenLabs Scribe v2 con un 2,2% y de Microsoft MAI-Transcribe-1.5 con un 2,4% — esas son mediciones de AA, no afirmaciones de {{1}}Google{{/1}}.
La cifra de streaming no es una versión peor de la misma prueba. Es un régimen distinto: el modelo se compromete con las palabras antes de haber oído el final de la frase, y lo paga. No elijas entre una y otra basándote solo en la precisión, porque en cualquier carga de trabajo concreta la diferencia podría invertirse. Elige según las restricciones: el endpoint de streaming tiene un límite de sesión de 10 minutos, sin diarización de hablantes y sin marcas de tiempo; el endpoint de prec grabado gestiona archivos de una hora, atribuye hasta tres hablantes y devuelve marcas de tiempo a nivel de palabra. Si tu aplicación necesita etiquetas de hablante, el modelo de streaming simplemente no puede hacer el trabajo, diga lo que diga su WER.

Lo que comparten
Los dos endpoints comparten el motor de 'transcripción inteligente', y en las funciones compartidas la elección entre ellos es neutral:
• 85+ idiomas con detección automática, incluido el cambio de idioma a mitad de transmisión en la ruta Live.
• Limpieza de disfluencias: se eliminan los rellenos, se resuelven las autocorrecciones ("martes — no, miércoles" queda como el día corregido).
• Autoformato — puntuación, mayúsculas y estructura de párrafos aplicadas al resultado.
• Vocabulario personalizado: hasta 1000 términos para jerga y nombres de productos; la documentación de Google recomienda aproximadamente 100 para obtener los mejores resultados.
Una advertencia que aplica a ambos: la limpieza "inteligente" que hace legible la salida es una decisión de diseño que sacrifica la fidelidad verbatim. Las frases incómodas se suavizan; el texto es la lectura del modelo de la intención, no un acta judicial. Para transcripciones exactas querrás una opción verbatim donde se ofrezca, y querrás verificar el comportamiento con tu propio audio en cualquier caso.
Costo por minuto: el premium en vivo
Google cobra el audio en tokens a 25 tokens de audio por segundo, con una salida de aproximadamente 175 tokens de texto por minuto de transcripción. A los precios de lista, el costo combinado por minuto de audio es de aproximadamente $0.005 para gemini-3-5-transcribe y de aproximadamente $0.009 para gemini-3-5-transcribe-live — entrada a $2 frente a $3.50 por millón de tokens, salida a $12 frente a $21 por millón de tokens. Ambos tienen un nivel gratuito hoy.
La versión premium compra la ruta en tiempo real, no más precisión: pagas aproximadamente un 80% más por minuto por el endpoint de streaming, y transcribe con un WER más alto. Ese es el marco honesto. El modelo pre-grabado es tanto más barato como más preciso; el modelo de streaming existe porque algunos productos no pueden esperar a que el archivo termine.
¿En qué endpoint deberías construir?
• Subtítulos y leyendas en vivo — Gemini 3.5 Transcribe Live, y consulta el límite sin marcas de tiempo si necesitas una salida sincronizada con el tiempo.
• Agentes de voz — Gemini 3.5 Transcribe Live para detectar la intención a mitad de frase; planifica teniendo en cuenta el límite de 10 minutos para sesiones largas.
• Reuniones, entrevistas, archivo — Gemini 3.5 Transcribe, para el 2.6% WER, atribución de hablante y marcas de tiempo a nivel de palabra.
• Análisis posteriores a la llamada — Gemini 3.5 Transcribe para el registro finalizado; Gemini 3.5 Transcribe Live solo si el análisis debe ejecutarse durante la llamada.
• Audio continuo largo — Gemini 3.5 Transcribe, porque un archivo de 60 minutos supera a empalmar sesiones en vivo de diez minutos a mano.

La capa por encima de la transcripción
Ninguno de los dos modelos es algo que OrcaRouter aloje — no enrutamos voz a texto hoy en día, y llamarás directamente a la API de Google para cualquiera de los dos endpoints. Lo que una capa de enrutamiento hace para un pipeline de voz es situarse por encima de la transcripción: el resumidor, el extractor de entidades, el modelo de elementos de acción que convierte un flujo en una decisión. Esa capa es donde OrcaRouter demuestra su valor: una API sobre más de 200 modelos al precio de lista del proveedor sin recargo, conmutación automática por error entre proveedores y un DSL de enrutamiento que compone varios modelos en una sola llamada. Elige el endpoint de transcripción según la carga de trabajo y luego ejecuta el modelo que lee la transcripción detrás de una sola clave.
En resumen
Gemini 3.5 Transcribe Live y Gemini 3.5 Transcribe son de la misma familia y productos diferentes. Elige Live cuando la transcripción debe existir antes de que termine la conversación y puedes aceptar una sesión de 10 minutos, sin etiquetas de hablante y sin marcas de tiempo. Elige Transcribe cuando la salida es un registro y la precisión y la atribución importan más que la velocidad: es más barato, más preciso y mucho menos limitado. La única respuesta incorrecta es asumir que un solo endpoint hace ambas cosas.
