
Transcripción inteligente con Gemini 3.5 Transcribe
- 智谱NUEVOZ.ai: GLM 5.3 Flash2026-08-26$0.07 / $0.25 por 1M de tokens
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
Gemini 3.5 Transcribe entró en vista previa pública el 26 de agosto de 2026, y es el primer modelo de voz a texto de Google que se vende genuinamente como un modelo Gemini: lo invocas a través de la API de Gemini con un ID de modelo, el audio se valora en tokens, y Google indica el costo por minuto de audio en su página de precios. Ese último detalle es el que la cobertura para consumidores pasa por alto. Las historias del día del lanzamiento hablan de la eliminación de muletillas y la edición de voz en Gboard, pero lo que realmente cambió para los desarrolladores es que la transcripción ahora se asienta en la misma superficie de API que el resto de la línea Gemini, con atribución de hablante y marcas de tiempo a nivel de palabra en el modelo base, en lugar de en un complemento aparte. Este artículo se lee como una referencia de API, porque ese es el vacío que deja abierta la primera ola de cobertura.
Dos advertencias de antemano para que los números a continuación no induzcan a error. Google no llama a Gemini 3.5 Transcribe "el modelo de transcripción de voz a texto más preciso que tenemos" — la afirmación es que es el modelo más preciso para interacciones de voz inteligentes, lo cual es una afirmación diferente, y la diferencia importa cuando se leen las cifras de WER. Y todo lo que aquí se describe corresponde a una vista previa pública: los dos ID de modelo, los precios y las cifras de referencia son lo que Google ofrece hoy, y todo puede cambiar antes de la disponibilidad general.
Las dos rutas de API — y los IDs de modelo a recordar
Gemini 3.5 Transcribe se distribuye como dos endpoints, y elegir el correcto es la primera decisión arquitectónica que toma un equipo:
• gemini-3-5-transcribe — la ruta pregrabada a través de la API Interactions. Envía un archivo y recibe la transcripción con atribución de hablante (hasta tres hablantes; tres o más es experimental) y marcas de tiempo a nivel de palabra. Este es el caballo de batalla para el procesamiento por lotes y asíncrono.
• gemini-3-5-transcribe-live: la ruta en tiempo real a través de la Live API. Transmisión bidireccional con latencia de menos de un segundo, orientada a conversaciones en vivo, subtitulación e interfaces controladas por voz.
La división refleja cómo está organizado el resto de la familia Gemini Audio, y es importante porque "live" es un SKU distinto con su propio precio. Varias lecturas iniciales de este lanzamiento asumen que un solo modelo hace ambas cosas; no es así.

Lo que realmente significa "transcripción inteligente"
El anuncio de Google presenta esto como un avance más allá de la precisión fonética hacia la comprensión. Las funciones que se derivan de ese enfoque son las que deben evaluarse, más que el enfoque en sí.
• Manejo de disfluencias: se eliminan los "ums" y los "ahs", y se resuelven las autocorrecciones. «Quedemos el martes — no, el miércoles» se transcribe como el día corregido, no como la transcripción de un falso comienzo. Esa es una decisión que toma el modelo, y es en ese sentido que Google lo llama inteligente.
• Autoformato: la salida se devuelve como texto pulido, con puntuación, uso de mayúsculas y minúsculas y estructura de párrafos aplicados, no como un flujo de tokens en bruto.
• Identificación de múltiples hablantes: hasta tres hablantes atribuidos en audio pregrabado con marcas de tiempo a nivel de palabra; más de tres hablantes es experimental. Esto se encuentra en el modelo base en lugar de un servicio de diarización separado.
• Vocabulario personalizado: puede sesgar el reconocimiento hacia jerga, nombres de productos y ortografías inusuales {{1}}mediante el suministro de un vocabulario{{/1}}, {{2}}que es el mecanismo para dominios verticales{{/2}}.
• Más de 85 idiomas — detección automática, con acentos y dialectos regionales señalados explícitamente.
• Llamada a funciones — el modelo puede delegar tareas como la generación de imágenes o el análisis de archivos a otros modelos de Gemini, lo que convierte la transcripción en un componente de un agente más amplio en lugar de un paso final.
• Captura de entidades — Google afirma tener un buen rendimiento en audio ruidoso del mundo real y en entidades alfanuméricas como códigos postales e ID de pedidos.
La cobertura de prensa también ha informado de una ventana de contexto de 96,000 tokens (aproximadamente una hora de audio de reuniones sin dividir) y detección de emociones. Ambos son coherentes con el enfoque del lanzamiento, pero la ficha del modelo que publicó Google no los destaca, por lo que deben tratarse como información reportada y no confirmada hasta que aparezca una hoja de especificaciones de GA.

Los números de precisión, etiquetados
Las cifras de WER que cita Google provienen de Artificial Analysis: una tasa de error de palabra promedio del 4,0% para transcripción en streaming y del 2,6% para transcripción no streaming. En el benchmark multilingüe FLEURS, Google reporta un 5,50% de WER para streaming y un 5,04% para no streaming. Google también afirma una mejora del 70% en el tiempo hasta la transcripción final en comparación con su predecesor, Chirp 3.
La lectura honesta es esta: son mediciones independientes en el sentido de que Artificial Analysis no es Google, pero son mediciones seleccionadas por Google, publicadas dentro del propio anuncio de Google, de un modelo que lleva un día disponible. Nadie fuera de Google ha realizado todavía una comparación adversarial cara a cara contra los modelos de pesos abiertos con los que la mayoría de los equipos lo comparan, y los materiales de lanzamiento no contienen ninguna comparación directa contra la familia Whisper ni contra la línea Parakeet de NVIDIA. La cifra de un 70% más rápido que Chirp-3 es una afirmación del proveedor, y punto. Trata el 2,6% y el 4,0% como señales tempranas sólidas, no como hechos establecidos.
Lo que cuesta
La página de precios de Google muestra cada modelo en tokens y en minutos estimados de audio. Para gemini-3-5-transcribe, la estimación combinada es de aproximadamente $0.005 por minuto de audio a precios de lista — entrada unos $0.003/min, salida unos $0.002/min. Para gemini-3-5-transcribe-live, la estimación combinada es de aproximadamente $0.009 por minuto. Ambos ofrecen un nivel gratuito hoy en día.
Esas cifras por minuto son estimaciones derivadas de una tasa de tokens asumida (25 tokens de audio por segundo de entrada, 175 tokens de texto por minuto de salida), por lo que cambian si Google modifica el cálculo de tokens. Lo sólido es el principio: el precio de lista es el precio. Ese es exactamente el principio bajo el que opera un router de paso directo como OrcaRouter — margen del 0%, precio de lista del proveedor transmitido tal cual —, así que si Google reduce el precio de la transcripción durante la ventana de vista previa a disponibilidad general, la reducción se refleja en nuestro lado el mismo día, no después de que un revendedor actualice una tarifa.
Dónde se está implementando
Para los desarrolladores, la vista previa pública de hoy significa dos superficies: la API de Gemini en Google AI Studio, y la Plataforma de Agentes Empresariales de Gemini para cargas de trabajo empresariales. En el lado del consumidor, Gemini 3.5 Transcribe ya impulsa la función de dictado Rambler en Gboard en Android y la aplicación Gemini en macOS. Chrome es el siguiente: hablar para escribir en cualquier campo web, seguido de Search Live, Gemini Live, Docs, Keep y Gmail. Para un equipo que lo evalúa, la respuesta práctica es más simple: hoy se puede llamar desde el código, en inglés, en las regiones donde la API de Gemini está disponible.

Lo que esto significa para tu pipeline
Lo genuinamente nuevo no es un número de WER. Es que Google ahora vende transcripción con las dos funciones que los equipos antes ensamblaban por su cuenta — etiquetas de hablante y marcas de tiempo a nivel de palabra — en el modelo base, sobre una superficie de API de Gemini que admite llamadas a funciones. Si estabas construyendo un pipeline de notas de reunión diarizadas a partir de un transcriber simple, un diarizador separado y una pasada de formateo, este es el primer modelo de Google que colapsa esos pasos. La pregunta abierta es cómo resiste el 2.6% de WER no streaming en tu propio audio, y hasta que aparezca una reproducción independiente, lo responsable para un equipo de producción es probar una muestra real a través de la API en lugar de presupuestar según los benchmarks que Google eligió. Para el trabajo de LLM que corre sobre la transcripción — resumen, extracción estructurada, elementos de acción — esa es la capa donde el enrutamiento demuestra su valor, y es la capa que cubre OrcaRouter: una API para más de 200 modelos, conmutación automática por error entre proveedores y un DSL de enrutamiento que compone varios modelos en una sola llamada. El paso de transcripción en sí deberías probarlo con tu propio audio antes de confiar en el número titular de cualquiera.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
