
Gemini 3.7 Flash vs Grok 4.6: la guerra de precios de Google contra el agente de autoverificación de SpaceXAI
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0259Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0258Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0166Inteligencia82Código
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
Tres semanas después de que Gemini 3.6 Flash fracasara en gran medida, Google redujo el precio a la mitad y lanzó Gemini 3.7 Flash — un movimiento que la mayoría de la cobertura interpretó como un disparo directo contra Grok 4.6, el buque insignia orientado a agentes que SpaceXAI había lanzado el día anterior a $2 y $6. El momento es la historia: dos modelos cercanos a la frontera, con un día de diferencia, ambos dirigidos al mismo comprador — un equipo que quiere codificación agéntica sin pagar precios de frontera — y con precios basados en filosofías opuestas. Google está comprando la respuesta con una promoción de cinco meses. SpaceXAI está vendiendo confianza por tarea a un precio de lista fijo.
Grok 4.6, lanzado el 12 de agosto de 2026, es el refinamiento de SpaceXAI de su base Grok 4.5 de 1,5 billones de parámetros, diseñado para agentes de larga duración que verifican la finalización de sus propias subtareas, con una ventana de contexto de 500K, entrada de texto e imagen, y una tarifa de $2/$6 que se duplica a partir de 200K+ tokens de entrada. Gemini 3.7 Flash, lanzado el 13 de agosto de 2026, es el refinamiento algorítmico de Gemini 3.6 Flash por parte de Google — contexto de 1M, entrada multimodal que incluye video y audio, y una tarifa promocional de $0,75/$3,75 que se duplica a $1,50/$7,50 el 1 de enero de 2027. En el índice independiente Artificial Analysis Intelligence Index, Grok 4.6 se sitúa en 61, un claro paso por encima de las lecturas iniciales de aproximadamente 56 para Gemini 3.7 Flash.
La guerra de precios, una línea por dimensión
• Precio por 1M de entrada — Gemini 3.7 Flash $0.75 (intro) vs Grok 4.6 $2.00. Google ofrece un precio más de un 60% inferior.
• Precio por 1M de salida — Gemini 3.7 Flash $3.75 (intro) vs Grok 4.6 $6.00.
• Después del 1 de enero de 2027 — Gemini se duplica a $1.50/$7.50 frente a Grok sin cambios en $2/$6.
• Ventana de contexto — Gemini 3.7 Flash 1M vs Grok 4.6 500K.
• Facturación de entrada larga — Gemini cobra una tarifa plana en toda su ventana; Grok se duplica a $4/$12 con 200K o más de entrada.
• Tokens de razonamiento — Gemini los factura como salida; el costo de Grok se captura en ~$0,84 por tarea, medido de forma independiente.
En resumen: Gemini 3.7 Flash es más barato en todas las líneas de la etiqueta hoy, y la mayor parte de esa ventaja se evapora el 1 de enero. Grok 4.6 tiene el mismo precio en agosto que tendrá en marzo.

A dónde fue el dinero de Gemini 3.7 Flash
Las propias cifras de Google reportan grandes saltos para Gemini 3.7 Flash con respecto a 3.6 Flash: 65.3% en DeepSWE v1.1 (frente al 49.0%), 43.6% en FrontierCode 1.1 Main (frente al 34.4%), 85.8% en Terminal-bench 2.1 (frente al 78.0%), y un Elo de 1588 en WebDev Arena (frente a 1538). Estas son cifras reportadas por el proveedor, sin reproducir: el tipo de cifra que mide una trayectoria, no un veredicto entre proveedores. Pero la trayectoria es lo importante: las correcciones llegaron tres semanas después de un lanzamiento que los críticos habían descartado en gran medida, lo que te dice que Google considera el nivel Flash como el campo de batalla, no el buque insignia.
La otra cosa que hace la promoción de Google es acortar la ventana de compra. A $0.75/$3.75 el modelo es lo bastante barato como para probarlo en volumen; a $1.50/$7.50 sigue siendo competitivo pero ya no es un arma de guerra de precios. Cualquier equipo de producción que lo adopte en la ventana de introducción debería reevaluar su economía en diciembre, no asumir que el número se mueve con ellos.
A dónde fue el dinero de Grok 4.6
La propuesta de Grok 4.6 es diferente: no tokens más baratos, sino menos desperdiciados. Fue entrenado para autoverificarse — para comprobar que una subtarea está realmente terminada antes de continuar — y la medición independiente respalda el efecto: Artificial Analysis sitúa su coste en aproximadamente $0.84 por tarea, con un GDPVal-AA v2 de 1,753 y un índice de inteligencia de 61. Son cifras de terceros, y son la cifra más sólida de esta comparativa, porque capturan lo que el precio por token no refleja: un modelo que necesita menos pasos para completar un trabajo es más barato por trabajo terminado, incluso a un precio por token más alto.
La contrapartida es donde el modelo más barato tiene margen. El contexto de 500K de Grok 4.6 es la mitad del de 1M de Gemini 3.7 Flash, y su tarifa de $2/$6 se duplica por encima de 200K de entrada — por lo tanto, las cargas de trabajo de contexto largo y alta entrada son exactamente donde el precio de lista de Grok 4.6 deja de ser competitivo frente a la tarifa promocional de Gemini.
La economía por tarea
Con el precio de lanzamiento, la tarifa combinada de Gemini 3.7 Flash con una división de entrada/salida 80/20 es de aproximadamente $1.35 por millón de tokens; el precio de Grok 4.6 con la misma división es de $2.80 por millón antes de su penalización por entradas largas. Sobre el papel, el modelo de Google parece el ganador en volumen por goleada. La complicación es que los tokens de razonamiento de Gemini se facturan como salida, sus afirmaciones de referencia tienen una semana de antigüedad y su eficiencia por tarea aún no se ha medido de forma independiente, mientras que la de Grok 4.6 sí. Tokens baratos más turnos desperdiciados pueden costar más que tokens caros que terminan, y este es un enfrentamiento donde un lado tiene datos sobre esa cuestión y el otro no.
Apostar por el nuevo modelo sin apostar el pipeline.
Grok 4.6 está en OrcaRouter al precio de lista de $2/$6 de SpaceXAI con un margen del 0%, incluido el escalón 2x por encima de 200K, que la página del modelo obtiene en vivo de la capa de enrutamiento. Gemini 3.7 Flash tiene un día de vida y está en la API propia de Google; su predecesor Gemini 3.6 Flash está en OrcaRouter al precio de lista de Google.


Si la pregunta que esta comparación realmente plantea es «¿debo apostar mi pipeline de agentes por el nuevo modelo barato?», la capa de enrutamiento es la cobertura: una regla de conmutación por error que ejecuta el agente en Grok 4.6 hoy y cambia a Gemini 3.7 Flash el día que llegue, o un panel de fusión donde ambos responden y un juez los reconcilia — el tipo de configuración para el que existe el DSL de enrutamiento, y una que no requiere elegir bando antes de que la evidencia esté disponible.
La lectura honesta
Si quieres el token más barato hoy y confías en el plazo de tres semanas, Gemini 3.7 Flash es la apuesta agresiva: la guerra de precios es real, las ganancias en los benchmarks están reportadas y la ventana de lanzamiento es un descuento genuino. Si quieres un modelo cuya eficiencia de agente se mide de forma independiente, cuyo precio no se mueve en enero y cuyo bucle de autoverificación está diseñado para trabajos de larga duración, Grok 4.6 es la opción conservadora, y los datos de AA le dan una ventaja en el costo por tarea terminada. Un lado es una oferta con cuenta regresiva; el otro es un precio con historial. Ambas son defendibles, lo que convierte esto en una comparación real y no en una formalidad.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
