
Gemini 3.5 Transcribe vs Whisper Large v3 Turbo: ¿debe reemplazarse la línea base?
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
Whisper Large v3 Turbo es el modelo al que la frase "conversión de voz a texto" se refiere por defecto en gran parte de la industria, y Gemini 3.5 Transcribe es el primer modelo de transcripción de Google que se vende explícitamente como un desafío a esa línea base, en lugar de como una API de voz genérica. Gemini 3.5 Transcribe, en vista previa pública desde el 26 de agosto de 2026, replantea la transcripción como una tarea de razonamiento: resuelve autocorrecciones, formatea la salida, atribuye hablantes y llama a otros modelos de Gemini por sí mismo. Whisper Large v3 Turbo es la destilación de 809 millones de parámetros de OpenAI del Whisper Large-v3, con licencia MIT, autoalojable, de 99 idiomas, y aproximadamente de cuatro a ocho veces más rápido que el modelo del que se destiló, según el hardware. Uno es una capa de inteligencia gestionada sobre audio; el otro es un componente libre y bien comprendido que puedes ejecutar donde quieras. La pregunta que esta página existe para responder es más acotada y más útil que "cuál es mejor": ¿cuándo deja de ser suficientemente buena la línea base?
La base, por si olvidaste lo buena que es.
Whisper Large v3 Turbo se merece su estatus de predeterminado, así que el argumento a favor viene primero:
• Se ejecuta en cualquier lugar — licencia MIT, pesos abiertos, instalable en una laptop, una sola GPU, o una función serverless. Sin proveedor, sin medidor, sin datos que salgan de tu red.
• Es rápido — el decodificador destilado (32 capas de codificador, 4 capas de decodificador, reducido de 32) lo hace aproximadamente cuatro veces más rápido que Whisper Large-v3 en hardware típico, más en algunos, mientras conserva la mayor parte de su precisión. La propia cifra de OpenAI es de unas ocho veces en una A100.
Cubre 99 idiomas para transcripción, una lista más amplia que los 85+ de Gemini 3.5 Transcribe.
• Su precisión está bien documentada: 2,1% de WER en LibriSpeech test-clean, 4,2% en test-other, 9,1% en Common Voice English — cifras que han sido replicadas por la comunidad durante años.
• El ecosistema es enorme — faster-whisper, whisper.cpp, exportaciones ONNX, y todos los frameworks de inferencia que ya usas. Si puedes ejecutar un modelo, puedes ejecutar este.

Para la transcripción por lotes de inglés y casi inglés a gran escala, Whisper Large v3 Turbo es el referente actual por razones estructurales que ninguna brecha de benchmark puede superar fácilmente: es gratis, es tuyo y está en todas partes.

Lo que Gemini 3.5 Transcribe añade además
El valor del retador gestionado no es que supere la línea base en inglés limpio; esa es una batalla que los números ni siquiera pueden resolver limpiamente todavía. Su valor es el trabajo que ocurre más allá de las palabras, algo que Whisper explícitamente no hace:
• Atribución de orador: hasta tres oradores con marcas de tiempo a nivel de palabra, {{1}}en el modelo base{{/1}}. {{2}}Whisper{{/2}} transcribe {{3}}un flujo de voz{{/3}}; {{4}}no tiene concepto de quién dijo qué{{/4}}.
• Formato inteligente: se eliminan las disfluencias, se resuelven las autocorrecciones, se aplican puntuación y mayúsculas. Whisper devuelve las palabras tal como se hablan, con los «ums» y todo.
• Vocabulario personalizado — sesgo hacia jerga y ortografías inusuales. Whisper no tiene ese mecanismo; tú posprocesas o afinas.
• Llamada a funciones — la transcripción puede transferirse a otros modelos de Gemini, convirtiéndola en un paso de un pipeline de agente en lugar de la salida final.
• Sesiones largas: aproximadamente una hora de audio en una sola pasada (contexto de 96K reportado por la prensa), frente a la necesidad práctica de Whisper de dividir y recomponer archivos largos.
Ese es un producto diferente. Es lo que Google quiere decir con "transcripción inteligente", y es la parte de la comparación que no depende de la aritmética de los benchmarks.
La cuestión de la precisión que aún nadie puede responder con claridad
Las cifras destacadas de los dos modelos no se enfrentan realmente. El WER no continuo de Gemini 3.{{1}}5{{/1}} Transcribe es del {{2}}2.6%{{/2}}, una medición de Artificial Analysis citada por Go{{3}}ogle{{/3}}, calculada sobre más de 85 idiomas. El {{4}}2.1%{{/4}} de Whisper Large v3 Turbo en LibriSpeech test-clean es un punto de referencia en inglés del propio artículo de destilación de Ope{{5}}nAI{{/5}}, replicado ampliamente. Corpus diferentes, cobertura de idiomas diferente, proveedores diferentes. Lo que se puede decir con honestidad: en inglés limpio, la línea base abierta y el contendiente gestionado están plausiblemente en el mismo rango, y la ventaja del modelo gestionado son sus características multilingües y estructurales, no una victoria demostrada de WER en inglés. Los materiales de lanzamiento de Go{{6}}ogle{{/6}} no contienen ninguna comparación directa contra los modelos de la familia Whisper, y aún no existe una comparación adversaria independiente porque Gemini 3.{{7}}5{{/7}} Transcribe se hizo público hace solo un día. Hasta que aparezca una, la corona de la precisión está sin reclamar, y cualquier artículo — incluido este — que declare un ganador en WER a partir de estas dos cifras se está excediendo.

Costo: gratis de ejecutar frente a $0.005 por minuto
Whisper Large v3 Turbo tiene un costo de hardware y no tiene medidor. Si lo ejecutas en una GPU que ya tienes, el costo marginal por minuto transcrito es casi nulo; si alquilas una GPU, el costo es lo que cueste la instancia mientras trabaja. Gemini 3.5 Transcribe cobra aproximadamente $0.005 por minuto de audio combinado, con la SKU en vivo en torno a $0.009 por minuto y un nivel gratuito. Con mil horas de audio, eso son unos $300 en el medidor de Gemini frente a unos pocos dólares de tiempo de GPU en la base abierta. Esa brecha es la verdadera historia de costos de este enfrentamiento, y es por eso que la base mantendrá su estatus predeterminado para el trabajo por lotes de inglés de alto volumen durante mucho tiempo. La economía del modelo administrado solo se equipara cuando las funciones que incluye — diarización, formato, control de vocabulario — te costarían tiempo de ingeniería montarlas sobre Whisper.
Idiomas y streaming
Whisper Large v3 Turbo lista 99 idiomas frente a los 85+ de Gemini, pero la historia práctica multilingüe es diferente: Whisper transcribe los 99 de una sola pasada sin autodetección, y su precisión se degrada más en idiomas de bajos recursos y con ruido — la contrapartida de un modelo destilado. Gemini autodetecta entre sus 85+ y Google destaca acentos y dialectos regionales. Para streaming, Whisper no tiene un modelo nativo en tiempo real; los despliegues en tiempo real usan faster-whisper y frameworks similares en tu propio hardware, mientras que Gemini 3.5 Transcribe tiene un endpoint en vivo diseñado a medida, con una latencia de menos de un segundo afirmada y un precio acorde. Si tu carga de trabajo es en vivo y multilingüe, el endpoint gestionado es más sencillo de operar; si es por lotes y en inglés, la línea base abierta es más barata.
El veredicto, tal como es
Whisper Large v3 Turbo sigue siendo la opción por defecto adecuada para la transcripción por lotes en inglés a gran escala, para cualquier cosa que deba ejecutarse en tu propia infraestructura y para equipos que quieren un artefacto congelado y auditable. Gemini 3.5 Transcribe es la elección correcta cuando la transcripción tiene que ser más que palabras — etiquetas de orador, formato limpio, vocabulario de dominio, cobertura multilingüe o un gancho de agente — y cuando estás dispuesto a pagar por esas funciones. Ambos coexisten, y el patrón que abarata esa coexistencia es un límite de enrutamiento: el transcriptor que se ajusta al audio, y luego la capa LLM que decide qué sucede con el texto. Esa capa es lo que opera OrcaRouter: una API para más de 200 modelos, conmutación por error automática entre proveedores y un DSL de enrutamiento para componer varios modelos en una sola llamada. Ninguno de los dos modelos de voz está alojado de nuestro lado; la elección de transcripción se da entre tu GPU y el medidor de Google, y ambos seguirán existiendo durante mucho tiempo.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
