Tarjeta de título principal para 'Transcripción inteligente con Gemini 3.5 Transcribe' que muestra una forma de onda de sonido convirtiéndose en texto formateado, un globo marcado con 85+ idiomas, chips de etiquetas de hablantes, los números destacados 2.6% WER no streaming y ~$0.005/min combinado, y el logotipo de OrcaRouter en la esquina inferior derecha.
Engineering & Research

Transcripción inteligente con Gemini 3.5 Transcribe

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Gemini 3.5 Transcribe entró en vista previa pública el 26 de agosto de 2026, y es el primer modelo de voz a texto de Google que se vende genuinamente como un modelo Gemini: lo invocas a través de la API de Gemini con un ID de modelo, el audio se valora en tokens, y Google indica el costo por minuto de audio en su página de precios. Ese último detalle es el que la cobertura para consumidores pasa por alto. Las historias del día del lanzamiento hablan de la eliminación de muletillas y la edición de voz en Gboard, pero lo que realmente cambió para los desarrolladores es que la transcripción ahora se asienta en la misma superficie de API que el resto de la línea Gemini, con atribución de hablante y marcas de tiempo a nivel de palabra en el modelo base, en lugar de en un complemento aparte. Este artículo se lee como una referencia de API, porque ese es el vacío que deja abierta la primera ola de cobertura.

Dos advertencias de antemano para que los números a continuación no induzcan a error. Go​ogle no llama a Gemini 3.​5 Transcribe "el modelo de transcripción de voz a texto más preciso que tenemos" — la afirmación es que es el modelo más preciso para interacciones de voz inteligentes, lo cual es una afirmación diferente, y la diferencia importa cuando se leen las cifras de WER. Y todo lo que aquí se describe corresponde a una vista previa pública: los dos ID de modelo, los precios y las cifras de referencia son lo que Go​ogle ofrece hoy, y todo puede cambiar antes de la disponibilidad general.

Las dos rutas de API — y los IDs de modelo a recordar

Gemini 3.5 Transcribe se distribuye como dos endpoints, y elegir el correcto es la primera decisión arquitectónica que toma un equipo:

• gemini-3-5-transcribe — la ruta pregrabada a través de la API Interactions. Envía un archivo y recibe la transcripción con atribución de hablante (hasta tres hablantes; tres o más es experimental) y marcas de tiempo a nivel de palabra. Este es el caballo de batalla para el procesamiento por lotes y asíncrono.

• gemini-3-5-transcribe-live: la ruta en tiempo real a través de la Live API. Transmisión bidireccional con latencia de menos de un segundo, orientada a conversaciones en vivo, subtitulación e interfaces controladas por voz.

La división refleja cómo está organizado el resto de la familia G​emini Audio, y es importante porque "live" es un SKU distinto con su propio precio. Varias lecturas iniciales de este lanzamiento asumen que un solo modelo hace ambas cosas; no es así.

A generated two-card infographic titled 'Gemini 3.5 Transcribe - two API paths' showing the pre-recorded Interactions API path on the left labeled gemini-3-5-transcribe with a file-in transcript-out flow and speaker attribution, and the streaming Live API path on the right labeled gemini-3-5-transcribe-live with bidirectional streaming and sub-second latency, a footer reading 'Public preview, August 2026', and the OrcaRouter logo in the bottom-right corner.

Lo que realmente significa "transcripción inteligente"

El anuncio de Google presenta esto como un avance más allá de la precisión fonética hacia la comprensión. Las funciones que se derivan de ese enfoque son las que deben evaluarse, más que el enfoque en sí.

• Manejo de disfluencias: se eliminan los "ums" y los "ahs", y se resuelven las autocorrecciones. «Quedemos el martes — no, el miércoles» se transcribe como el día corregido, no como la transcripción de un falso comienzo. Esa es una decisión que toma el modelo, y es en ese sentido que Go​ogle lo llama inteligente.

• Autoformato: la salida se devuelve como texto pulido, con puntuación, uso de mayúsculas y minúsculas y estructura de párrafos aplicados, no como un flujo de tokens en bruto.

• Identificación de múltiples hablantes: hasta tres hablantes atribuidos en audio pregrabado con marcas de tiempo a nivel de palabra; más de tres hablantes es experimental. Esto se encuentra en el modelo base en lugar de un servicio de diarización separado.

• Vocabulario personalizado: puede sesgar el reconocimiento hacia jerga, nombres de productos y ortografías inusuales {{1}}mediante el suministro de un vocabulario{{/1}}, {{2}}que es el mecanismo para dominios verticales{{/2}}.

• Más de 85 idiomas — detección automática, con acentos y dialectos regionales señalados explícitamente.

• Llamada a funciones — el modelo puede delegar tareas como la generación de imágenes o el análisis de archivos a otros modelos de G​emini, lo que convierte la transcripción en un componente de un agente más amplio en lugar de un paso final.

• Captura de entidades — Go​ogle afirma tener un buen rendimiento en audio ruidoso del mundo real y en entidades alfanuméricas como códigos postales e ID de pedidos.

La cobertura de prensa también ha informado de una ventana de contexto de 96,000 tokens (aproximadamente una hora de audio de reuniones sin dividir) y detección de emociones. Ambos son coherentes con el enfoque del lanzamiento, pero la ficha del modelo que publicó Go​ogle no los destaca, por lo que deben tratarse como información reportada y no confirmada hasta que aparezca una hoja de especificaciones de GA.

A generated single-column scoreboard titled 'Gemini 3.5 Transcribe - the scoreboard' with rows Release Aug 26 2026 public preview, Languages 85+ auto-detect, WER 2.6% non-streaming / 4.0% streaming, Price ~$0.005 per minute blended, APIs transcribe plus transcribe-live, and Context ~96K tokens reported, a footer reading 'WER per Artificial Analysis, cited by Google; context window press-reported', and the OrcaRouter logo in the bottom-right corner.

Los números de precisión, etiquetados

Las cifras de WER que cita Go​ogle provienen de Artificial Analysis: una tasa de error de palabra promedio del 4,0% para transcripción en streaming y del 2,6% para transcripción no streaming. En el benchmark multilingüe FLEURS, Go​ogle reporta un 5,50% de WER para streaming y un 5,04% para no streaming. Go​ogle también afirma una mejora del 70% en el tiempo hasta la transcripción final en comparación con su predecesor, Chirp 3.

La lectura honesta es esta: son mediciones independientes en el sentido de que Artificial Analysis no es Go​ogle, pero son mediciones seleccionadas por Google, publicadas dentro del propio anuncio de Go​ogle, de un modelo que lleva un día disponible. Nadie fuera de Go​ogle ha realizado todavía una comparación adversarial cara a cara contra los modelos de pesos abiertos con los que la mayoría de los equipos lo comparan, y los materiales de lanzamiento no contienen ninguna comparación directa contra la familia Whisper ni contra la línea Parakeet de NVIDIA. La cifra de un 70% más rápido que Chirp-3 es una afirmación del proveedor, y punto. Trata el 2,6% y el 4,0% como señales tempranas sólidas, no como hechos establecidos.

Lo que cuesta

La página de precios de Google muestra cada modelo en tokens y en minutos estimados de audio. Para gemini-3-5-transcribe, la estimación combinada es de aproximadamente $0.005 por minuto de audio a precios de lista — entrada unos $0.003/min, salida unos $0.002/min. Para gemini-3-5-transcribe-live, la estimación combinada es de aproximadamente $0.009 por minuto. Ambos ofrecen un nivel gratuito hoy en día.

Esas cifras por minuto son estimaciones derivadas de una tasa de tokens asumida (25 tokens de audio por segundo de entrada, 175 tokens de texto por minuto de salida), por lo que cambian si Go​ogle modifica el cálculo de tokens. Lo sólido es el principio: el precio de lista es el precio. Ese es exactamente el principio bajo el que opera un router de paso directo como OrcaRouter — margen del 0%, precio de lista del proveedor transmitido tal cual —, así que si Go​ogle reduce el precio de la transcripción durante la ventana de vista previa a disponibilidad general, la reducción se refleja en nuestro lado el mismo día, no después de que un revendedor actualice una tarifa.

Dónde se está implementando

Para los desarrolladores, la vista previa pública de hoy significa dos superficies: la API de G​emini en Go​ogle AI Studio, y la Plataforma de Agentes Empresariales de G​emini para cargas de trabajo empresariales. En el lado del consumidor, G​emini 3.​5 Transcribe ya impulsa la función de dictado Rambler en Gboard en Android y la aplicación G​emini en macOS. Chrome es el siguiente: hablar para escribir en cualquier campo web, seguido de Search Live, G​emini Live, Docs, Keep y Gmail. Para un equipo que lo evalúa, la respuesta práctica es más simple: hoy se puede llamar desde el código, en inglés, en las regiones donde la API de G​emini está disponible.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Lo que esto significa para tu pipeline

Lo genuinamente nuevo no es un número de WER. Es que Go​ogle ahora vende transcripción con las dos funciones que los equipos antes ensamblaban por su cuenta — etiquetas de hablante y marcas de tiempo a nivel de palabra — en el modelo base, sobre una superficie de API de G​emini que admite llamadas a funciones. Si estabas construyendo un pipeline de notas de reunión diarizadas a partir de un transcriber simple, un diarizador separado y una pasada de formateo, este es el primer modelo de Go​ogle que colapsa esos pasos. La pregunta abierta es cómo resiste el 2.6% de WER no streaming en tu propio audio, y hasta que aparezca una reproducción independiente, lo responsable para un equipo de producción es probar una muestra real a través de la API en lugar de presupuestar según los benchmarks que Go​ogle eligió. Para el trabajo de LLM que corre sobre la transcripción — resumen, extracción estructurada, elementos de acción — esa es la capa donde el enrutamiento demuestra su valor, y es la capa que cubre OrcaRouter: una API para más de 200 modelos, conmutación automática por error entre proveedores y un DSL de enrutamiento que compone varios modelos en una sola llamada. El paso de transcripción en sí deberías probarlo con tu propio audio antes de confiar en el número titular de cualquiera.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube