Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe — qué endpoint debería llamar tu aplicación Ilustración regenerada.
Guides & Insights

Gemini 3.5 Transcribe Live frente a Gemini 3.5 Transcribe: qué endpoint debe llamar tu aplicación

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Cuando Go​ogle lanzó la familia Ge​mini 3.5 Transcribe el 26 de agosto de 2026, incluyó dos modelos que comparten nombre y misión, pero están diseñados para diferentes etapas de una conversación: Ge​mini 3.5 Transcribe Live, el endpoint de streaming servido a través de la Live API, y Ge​mini 3.5 Transcribe, el endpoint para audio pregrabado servido a través de la Interactions API. El error que cometen la mayoría de los equipos en la primera semana es tratar esto como un solo modelo con dos botones. Son dos SKU: distintas APIs, distintos precios, distintos límites estrictos; y la comparación de precisión entre ellos no es una lucha justa, porque se miden bajo reglas diferentes. Este artículo los pone uno al lado del otro para que la decisión dependa de tu carga de trabajo, no de una tabla de clasificación.

Los dos de un vistazo

• API — Ge​mini 3.5 Transcribe Live se ejecuta en la API Live (WebSocket, transmisión bidireccional), mientras que Ge​mini 3.5 Transcribe se ejecuta en la API Interactions (archivo de entrada, transcripción de salida).

• Trabajo — conversación en vivo, subtitulado, agentes de voz vs reuniones, registros de llamadas, audio de archivo.

• Exactitud — 4.0% WER en streaming vs 2.6% WER no streaming, según Artificial Analysis, citado por Go​ogle; diferentes regímenes de medición, no directamente comparables.

• Latencia — una transcripción final 0,40 s después de que termina el habla, frente al procesamiento por lotes de un archivo completo.

• Sesión — límite de 10 minutos por sesión en vivo frente a archivos de hasta 60 minutos (30 minutos con diarización y marcas de tiempo habilitadas).

• Altavoces — ninguno en el lado de streaming frente a hasta tres altavoces con marcas de tiempo a nivel de palabra en el lado pregrabado.

• Precio: aproximadamente $0.009 por minuto combinado frente a aproximadamente $0.005 por minuto combinado.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe - the scoreboard'. Left column Gemini 3.5 Transcribe Live: API Live API streaming, WER 4.0% streaming, Final latency 0.40s after speech, Session 10-minute cap, Speaker ID not supported, Timestamps none. Right column Gemini 3.5 Transcribe: API Interactions API files, WER 2.6% non-streaming, Final latency batch async, Session 60-minute files (30 with diarization), Speaker ID up to 3 speakers, Timestamps word-level. Footer reads 'WER per Artificial Analysis, cited by Google; limits per Google launch materials.'

La decisión de arquitectura: Interactions API o Live API

Ambos modelos se encuentran bajo la familia Ge​mini Audio de Go​ogle, y ambos están en vista previa pública. La diferencia comienza en el transporte. gemini-3-5-transcribe-live abre un WebSocket y lo mantiene abierto: el audio sin procesar se transmite continuamente — la estructura común es de fragmentos PCM de 16 kHz o 24 kHz a 16 bits — y el modelo devuelve transcripciones parciales mientras hablas, y luego una transcripción final para cada enunciado cuando termina el discurso. gemini-3-5-transcribe toma un archivo completo, lo procesa y devuelve la transcripción final con atribución de hablante y marcas de tiempo a nivel de palabra.

La decisión de transporte determina todo lo demás. Si tu producto muestra las palabras tal como se dicen —un subtítulo en vivo, un agente de voz que lee la intención a mitad de frase, un asistente de llamadas que actúa mientras la llamada está en curso— estás en la ruta Live. Si tu producto produce un registro —una nota de reunión, un registro de llamadas, un archivo— estás en la ruta Interactions. La confusión es que ambos producen texto; la diferencia está en si el texto es un estado en tiempo real o un artefacto final.

Precisión: el impuesto del streaming es real.

Artificial Analysis, el laboratorio independiente de referencia cuyas cifras cita {{1}}Google{{/1}} en su publicación de lanzamiento, mide una tasa media de error de palabras del 4,0% para el endpoint de streaming y del 2,6% para el de no streaming. En el benchmark multilingüe FLEURS, {{1}}Google{{/1}} reporta un 5,50% en streaming frente a un 5,04% en no streaming. La cifra del 2,6% sitúa a {{2}}Gemini 3.5 Transcribe{{/2}} en el puesto #5 de la clasificación WER de AA en su lanzamiento, por detrás de ElevenLabs Scribe v2 con un 2,2% y de Microsoft MAI-Transcribe-1.5 con un 2,4% — esas son mediciones de AA, no afirmaciones de {{1}}Google{{/1}}.

La cifra de streaming no es una versión peor de la misma prueba. Es un régimen distinto: el modelo se compromete con las palabras antes de haber oído el final de la frase, y lo paga. No elijas entre una y otra basándote solo en la precisión, porque en cualquier carga de trabajo concreta la diferencia podría invertirse. Elige según las restricciones: el endpoint de streaming tiene un límite de sesión de 10 minutos, sin diarización de hablantes y sin marcas de tiempo; el endpoint de prec grabado gestiona archivos de una hora, atribuye hasta tres hablantes y devuelve marcas de tiempo a nivel de palabra. Si tu aplicación necesita etiquetas de hablante, el modelo de streaming simplemente no puede hacer el trabajo, diga lo que diga su WER.

A screenshot of the Artificial Analysis speech-to-text leaderboard page showing the WER Index (Non-streaming) view with model rows including an entry for Gemini 3.5 Transcribe alongside ElevenLabs and Deepgram, plus AA-WER Index dataset filters, captured August 27 2026.

Lo que comparten

Los dos endpoints comparten el motor de 'transcripción inteligente', y en las funciones compartidas la elección entre ellos es neutral:

• 85+ idiomas con detección automática, incluido el cambio de idioma a mitad de transmisión en la ruta Live.

• Limpieza de disfluencias: se eliminan los rellenos, se resuelven las autocorrecciones ("martes — no, miércoles" queda como el día corregido).

• Autoformato — puntuación, mayúsculas y estructura de párrafos aplicadas al resultado.

• Vocabulario personalizado: hasta 1000 términos para jerga y nombres de productos; la documentación de Google recomienda aproximadamente 100 para obtener los mejores resultados.

Una advertencia que aplica a ambos: la limpieza "inteligente" que hace legible la salida es una decisión de diseño que sacrifica la fidelidad verbatim. Las frases incómodas se suavizan; el texto es la lectura del modelo de la intención, no un acta judicial. Para transcripciones exactas querrás una opción verbatim donde se ofrezca, y querrás verificar el comportamiento con tu propio audio en cualquier caso.

Costo por minuto: el premium en vivo

Go​ogle cobra el audio en tokens a 25 tokens de audio por segundo, con una salida de aproximadamente 175 tokens de texto por minuto de transcripción. A los precios de lista, el costo combinado por minuto de audio es de aproximadamente $0.005 para gemini-3-5-transcribe y de aproximadamente $0.009 para gemini-3-5-transcribe-live — entrada a $2 frente a $3.50 por millón de tokens, salida a $12 frente a $21 por millón de tokens. Ambos tienen un nivel gratuito hoy.

La versión premium compra la ruta en tiempo real, no más precisión: pagas aproximadamente un 80% más por minuto por el endpoint de streaming, y transcribe con un WER más alto. Ese es el marco honesto. El modelo pre-grabado es tanto más barato como más preciso; el modelo de streaming existe porque algunos productos no pueden esperar a que el archivo termine.

¿En qué endpoint deberías construir?

• Subtítulos y leyendas en vivo — Ge​mini 3.5 Transcribe Live, y consulta el límite sin marcas de tiempo si necesitas una salida sincronizada con el tiempo.

• Agentes de voz — Ge​mini 3.5 Transcribe Live para detectar la intención a mitad de frase; planifica teniendo en cuenta el límite de 10 minutos para sesiones largas.

• Reuniones, entrevistas, archivo — Ge​mini 3.5 Transcribe, para el 2.6% WER, atribución de hablante y marcas de tiempo a nivel de palabra.

• Análisis posteriores a la llamada — Ge​mini 3.5 Transcribe para el registro finalizado; Ge​mini 3.5 Transcribe Live solo si el análisis debe ejecutarse durante la llamada.

• Audio continuo largo — Gemini 3.5 Transcribe, porque un archivo de 60 minutos supera a empalmar sesiones en vivo de diez minutos a mano.

A generated decision card titled 'Which endpoint - by workload' with a left column headed 'Pick Transcribe Live if' listing live captions, voice agents reading intent mid-sentence, and in-call analytics, and a right column headed 'Pick Transcribe if' listing meetings and interviews, call logs needing speaker labels, word-level timestamps for alignment, and long continuous audio, a footer reading 'Both are Google APIs in public preview since Aug 26 2026', and the OrcaRouter logo in the bottom-right corner.

La capa por encima de la transcripción

Ninguno de los dos modelos es algo que OrcaRouter aloje — no enrutamos voz a texto hoy en día, y llamarás directamente a la API de Google para cualquiera de los dos endpoints. Lo que una capa de enrutamiento hace para un pipeline de voz es situarse por encima de la transcripción: el resumidor, el extractor de entidades, el modelo de elementos de acción que convierte un flujo en una decisión. Esa capa es donde OrcaRouter demuestra su valor: una API sobre más de 200 modelos al precio de lista del proveedor sin recargo, conmutación automática por error entre proveedores y un DSL de enrutamiento que compone varios modelos en una sola llamada. Elige el endpoint de transcripción según la carga de trabajo y luego ejecuta el modelo que lee la transcripción detrás de una sola clave.

En resumen

Ge​mini 3.5 Transcribe Live y Ge​mini 3.5 Transcribe son de la misma familia y productos diferentes. Elige Live cuando la transcripción debe existir antes de que termine la conversación y puedes aceptar una sesión de 10 minutos, sin etiquetas de hablante y sin marcas de tiempo. Elige Transcribe cuando la salida es un registro y la precisión y la atribución importan más que la velocidad: es más barato, más preciso y mucho menos limitado. La única respuesta incorrecta es asumir que un solo endpoint hace ambas cosas.