
Resumen diario de IA, 19 de septiembre: Grok Voice Transcribe 2.0 ya está disponible y Meta abre Muse a los desarrolladores
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 ya está disponible en la Grok Voice API desde el 18 de septiembre de 2026, a $0.10 por hora de audio para transcripción grabada y $0.20 por hora para streaming — las mismas tarifas que SpaceXAI cobraba por la versión 1.0. Esa misma semana, Meta abrió la plataforma de conectores Muse a desarrolladores externos, permitiendo que cualquier servicio exponga su API existente y que el agente Muse de Meta la llame en nombre de un usuario. Parecen titulares no relacionados de dos empresas distintas sobre dos productos distintos, y durante la mayor parte de los últimos dos años lo habrían sido. Leídos juntos, son la misma historia: la transcripción se está convirtiendo en una entrada, y la lucha se ha trasladado a quién posee la llamada que la consume.
Empieza por los precios, porque son la parte sobre la que un lector puede actuar hoy. Luego la precisión, que es real pero más limitada de lo que sugiere el planteamiento del lanzamiento. Después la pieza de Meta, que es la que importará dentro de seis meses.
Tarifa plana, y lo que significa si ya pagas por la transcripción
Grok Voice Transcribe 2.0 cuesta lo mismo que 1.0. No un "desde" igual, ni una tarifa promocional que caduque: idéntico, a $0.10 por hora de audio para trabajo por lotes y $0.20 por hora para streaming, lo que equivale a $1.67 y $3.33 por cada 1000 minutos. La diarización de hablantes, las marcas de tiempo a nivel de palabra con puntuaciones de confianza, la normalización inversa de texto, la eliminación de muletillas y el sesgo por términos clave están todos incluidos en ese precio en lugar de venderse aparte como complementos, lo que no es la norma de la categoría.
El efecto práctico es aritmético más que dramático. Un equipo que transcribe 5000 horas de audio de centro de contacto al mes paga 500 $ por la ruta por lotes en cualquier caso, y el nuevo modelo devuelve el mismo volumen con una tasa de error sustancialmente menor. Nada de la migración cambia lo que pagas, que es exactamente por lo que la migración es fácil de justificar: no hay ninguna decisión de coste que tomar, solo una decisión de calidad, y la calidad aumentó.
Las integraciones existentes migran pasando grok-voice-transcribe-2.0 como el parámetro model en /v1/stt, o seleccionándolo al abrir la sesión de WebSocket para streaming. Sin cambios de esquema, sin un nuevo endpoint, sin recodificación de tu pipeline de audio. SpaceXAI ha dejado 1.0 como predeterminado por ahora, así que una integración que nunca toca el parámetro model sigue recibiendo la versión antigua hasta que la compañía lo cambie, lo cual, según dice, ocurrirá en las próximas semanas, junto con la deprecación de 1.0. Vale la pena usar esa ventana de forma deliberada: dirige una copia en la sombra de tu audio de producción a 2.0 y compara las transcripciones con lo que publicas hoy, porque una vez que el predeterminado cambie, lo estarás ejecutando lo hayas probado o no.
El resto de la hoja de especificaciones no ha cambiado de forma y merece la pena conocerlo si estás dimensionando un despliegue en lugar de solo evaluar la precisión: 12 formatos de audio de entrada, desde audio telefónico de 8 kHz hasta 48 kHz, hasta ocho canales de audio independientes en una sola solicitud, 100 términos clave por solicitud para vocabulario de dominio, detección automática de idioma con cambio a mitad de grabación, y normalización inversa de texto en 25 idiomas, de modo que las fechas, las divisas, los números de teléfono y las direcciones de correo electrónico hablados se devuelvan escritos tal como los escribiría una persona. Los límites del servicio son 10 solicitudes por segundo y 100 sesiones de streaming simultáneas por equipo, y el servicio se ejecuta en una única región —us-east-1—, que es la única línea de la hoja que debería hacer que un equipo de producción se detenga a pensar, porque una API de voz de una sola región es una interrupción de una sola región.
Dónde se movió realmente la precisión
La afirmación del lanzamiento es «el doble de preciso», y las cifras subyacentes son más específicas y menos uniformes que esa frase. En el panel AA-WER Streaming de Artificial Analysis, que es la medición independiente en este caso, las dos versiones se separan así:
• Precisión final de la transcripción — Grok Voice Transcribe 2.0 con una tasa de error de palabras del 2,7 % frente a Grok Voice Transcribe 1.0 con el 3,9 %, ambas medidas después de que el hablante se detiene
• Precisión de la primera transcripción parcial — 3,4 % de WER frente a 18,3 %, que es la mayor diferencia individual entre las dos versiones con un amplio margen
• Tiempo hasta la transcripción final — 0,49 segundos frente a 0,37 segundos, así que 2.0 es más lento en esta medida en lugar de más rápido
• Tiempo hasta el primer parcial — 0,49 segundos frente a 0,25 segundos, la misma operación en la dirección opuesta
Ese último par es lo más interesante de la hoja. Grok Voice Transcribe 2.0 compró su precisión con aproximadamente un cuarto de segundo de latencia, en ambas direcciones. Para un agente de voz eso es un costo real —es la diferencia entre una pausa natural y una pausa que quien llama nota— y para un pipeline por lotes es invisible. La mejora de la primera parcial es la que cambia lo que puedes construir, porque una transcripción parcial es el texto sobre el que un agente puede razonar mientras quien llama todavía está hablando. Pasar del 18,3 % al 3,4 % en ese número es la diferencia entre que una parcial sea una indicación aproximada y que una parcial sea utilizable. La transcripción final pasando del 3,9 % al 2,7 % es una buena mejora que ningún usuario notará.

SpaceXAI también publicó cuatro evaluaciones internas, y vale la pena leerlas con la etiqueta adjunta — son los números de la propia compañía sobre su propio audio, no reproducidos de forma independiente:
• Llamadas de atención al cliente de 8 kHz — del 10,6 % de WER en 1.0 al 7,1 % en 2.0
• Conversaciones con Grok — del 8,7 % al 3,3 %
• Credenciales pronunciadas en voz alta, es decir, nombres, correos electrónicos y datos de la cuenta leídos en voz alta — del 7,2 % al 3,2 %
• Frases cortas en 19 idiomas — del 20,6 % al 6,8 %
La fila de 8 kHz es la que hay que retener. El audio telefónico es la entrada común más difícil de esta categoría y la que realmente tienen la mayoría de los compradores de centros de contacto, y una caída del 10,6 % al 7,1 % en ella es más importante para esos compradores que la cifra principal del panel.
La afirmación de la tabla de clasificación, leída con honestidad
SpaceXAI afirma que el modelo ocupa el primer puesto entre 32 modelos de streaming en cuanto a precisión. La tabla de Artificial Analysis sí lo coloca primero tanto en las clasificaciones de transcripción final como de primera parcial —pero la página de la tabla representa 27 de 33 modelos, así que el "32" es el recuento de la propia empresa, y la clasificación corresponde a un conjunto cuya composición el lector debería entender. AA-WER Streaming es un compuesto ponderado de tres conjuntos en inglés: AA-AgentTalk con un 50 %, VoxPopuli con un 25 % y Earnings22 con un 25 %, aproximadamente ocho horas de audio en total, y está fuertemente ponderado hacia el habla conversacional de estilo agente. No mide acentos, códecs de telefonía, vocabulario del dominio ni audio multicanal de centros de llamadas de ninguna manera estructurada.
Nada de eso hace que la cifra sea incorrecta. Hace que sea específica. Un modelo que encabeza una tabla de clasificación en inglés ponderada por conversación de agentes es la elección correcta para audio en inglés con forma de conversación de agentes, y la razón honesta para creer que el resultado de 8 kHz es la evaluación interna del proveedor en lugar de la tabla pública. Los compradores con un perfil de audio diferente deberían probar con su propio audio en vez de leer la clasificación como un veredicto general — lo cual era cierto antes de este lanzamiento y lo seguirá siendo después del próximo.

Meta abre los conectores de Muse a los desarrolladores
La segunda historia de la semana es la de Meta. Muse, el agente personal que Meta lanzó el 8 de septiembre en iOS, Android, muse.ai y WhatsApp, ahora acepta conectores de terceros: un servicio expone su API, y Muse aporta el agente, el navegador y el contexto del usuario que convierten esa API en algo que una persona puede invocar con solo pedirlo. El enfoque que Meta le dio es una división del trabajo: tú aportas la API, nosotros aportamos la intención y el usuario. Los primeros conectores nombrados fueron Notion y la herramienta de notas de reuniones Granola, además de los que Meta lanzó por su cuenta.
Merece la pena precisar qué es esto y qué no es. No es un protocolo abierto entre agentes. Construir un conector te da distribución dentro de la propia base de usuarios de Muse y en ningún otro lugar; construir contra un protocolo abierto te da alcance a través de cada agente compatible y ninguna base de usuarios en particular. Meta tampoco ha publicado las partes que un desarrollador necesitaría tener en cuenta para planificar — el proceso de revisión de conectores, la superficie de integración técnica, cómo Muse elige entre dos conectores que se superponen, o cómo un desarrollador mide si un conector realmente generó algún uso.
Lo que no está en duda es la dirección. Muse ejecuta el agente de cada usuario en su propia máquina virtual con su propio navegador y una capa de revisión independiente delante de las acciones salientes, y guarda tokens sustitutos en lugar de claves de API reales. Esa arquitectura solo tiene sentido si el plan es que el agente llame a muchas cosas. Las API de transcripción están entre las cosas a las que llama un agente, y Meta tiene la suya: Muse Voice Transcribe, el modelo en tiempo real que Meta lanzó a principios de septiembre a 0,18 dólares por hora de audio. Una plataforma que posee tanto el agente como un modelo de voz tiene un motivo obvio para dirigir su propio tráfico a su propio modelo, y los desarrolladores que construyen sobre conectores deberían asumir que ese es el valor predeterminado, a menos que algo haga que deje de serlo.

Lo que realmente debería hacer un equipo que lanza voz este mes
Ambas historias apuntan en la misma dirección. La precisión del habla está convergiendo —tres modelos a menos de un punto y medio entre sí en la misma tabla en el plazo de tres semanas—, y los diferenciadores que quedan son el precio, la latencia, la licencia y quién controla el enrutamiento. Eso hace que la elección de a dónde va tu llamada de transcripción sea más determinante que la elección de qué modelo la responde, porque querrás cambiar esa respuesta varias veces a lo largo del próximo año.
Esta es la capa en la que se encuentra OrcaRouter. Una sola clave de API cubre más de 200 modelos detrás de endpoints compatibles con OpenAI, con conmutación por error automática entre proveedores, de modo que un servicio de voz de una sola región que tenga una mala tarde deja de ser tu caída. Pasamos el precio de lista del proveedor con un 0 % de margen, lo que significa que una rebaja de precio de un proveedor o una nueva versión de modelo está disponible en nuestro lado el mismo día, en lugar de esperar a un reajuste de precios. Y como cada modelo está detrás de un solo contrato, mover una carga de trabajo de transcripción de un modelo a otro es un cambio de cadena de modelo en lugar de una segunda adquisición.
Tres acciones concretas para esta semana. Si usas Grok Voice Transcribe 1.0, prueba 2.0 en la sombra con tu propio audio ahora, mientras 1.0 sigue siendo la opción predeterminada y aún controlas el cambio. Si estás evaluando voz en streaming para un agente, mide el tiempo hasta el primer parcial con tu propio presupuesto de latencia en lugar de confiar en la tabla de clasificación de alguien más — el cuarto de segundo que este modelo dedicó a ganar precisión o no es nada o es fatal, según lo que tu agente haga con el texto. Y si estás construyendo algo que algún día un agente personal podría llamar, sigue de cerca el programa de conectores Muse, porque el argumento de distribución que presenta es más fuerte que el detalle técnico con el que se lanzó.
