
Claude Haiku 5.5 vs Gemini 3.7 Flash: Uno de estos dos ya está retirado
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Hay un hecho incómodo que subyace a cualquier Claude Haiku 5.5 frente a Gemini 3.7 Flash comparación escrita hoy: Gemini 3.7 Flash ha quedado obsoleto. El proveedor lo lanzó el 13 de agosto de 2026, lo sustituyó por Gemini 3.8 Flash el 2 de septiembre, y Artificial Analysis ahora mantiene la página de la 3.7 con una marca de obsolescencia. Claude Haiku 5.5, en cambio, se lanzó el 7 de octubre de 2026 y conlleva un compromiso de retirada no antes de octubre de 2027.
Eso no hace que la comparación sea inútil. Cambia la pregunta. Esto ya no se trata de “a cuál de estos dos debería llamar” —para la mayoría de los equipos, la respuesta es ninguno, porque la línea 3.7 ha sido superada dentro de su propia familia. Para lo que sí sirve es para algo más sutil y, podría decirse, más útil: una lectura clara de la velocidad a la que se movió el nivel flash de Google en tres semanas, y de qué partes de la ficha técnica de un modelo de nivel flash determinan realmente si se usa.
Lo que todavía puedes medir
Ambos modelos se han ejecutado en el mismo panel independiente, que es el único lugar donde los dos pueden compararse en absoluto. En Artificial Analysis Intelligence Index v4.3.2, Claude Haiku 5.5 obtiene 43,40 en su configuración Max frente a 39,06 de Gemini 3.7 Flash en su configuración High —una diferencia de 4,33 puntos.
Ambos proveedores también publican sus propios conjuntos de evaluación, y no se superponen de una manera que permita una comparación directa. Las filas independientes compartidas son las cuatro que Artificial Analysis ejecutó en ambos:
• Terminal Bench 4.0 — 0,3283 para Claude Haiku 5.5 frente a 0,1364 para Gemini 3.7 Flash. Una brecha absoluta de 19 puntos, y la asimetría más amplia del conjunto.
• SciCode — 0,5498 frente a 0,5718. Gemini 3.7 Flash se impone por 2,2 puntos.
• Humanity's Last Exam — 0.4439 frente a 0.4787. Gemini 3.7 Flash por 3.5 puntos.
• AutomationBench, puntuación parcial — 0,3541 frente a 0,6203. Gemini 3.7 Flash por 27 puntos.
Lean ese conjunto con atención, porque contiene el resultado interesante. Gemini 3.7 Flash gana tres de los cuatro benchmarks compartidos y aun así pierde el índice compuesto por 4,3 puntos. Un índice es una combinación ponderada, y la ponderación sitúa las filas de terminal y código —donde la brecha va en la dirección contraria por un margen mucho mayor— por delante del agregado de las demás. Eso no es tanto un artefacto de puntuación como una declaración sobre para qué sirve el índice: pretende predecir si un modelo es capaz de terminar un trabajo, y en esa cuestión la línea 3.7 era débil de un modo que sus respetables puntuaciones en benchmarks científicos no alcanzaban a ocultar.

En qué era realmente mala la línea 3.7
Dos filas cuentan la historia mejor que el índice.
Terminal Bench 4.0 con 0.1364 es un número bajo, y queda junto a un 0.8577 en la generación anterior de Terminal Bench del mismo modelo. Eso no es un modelo que empeoró; es un benchmark que cambió lo que mide, y Gemini 3.7 Flash no hizo la transición. Claude Haiku 5.5, en el mismo benchmark revisado, obtiene 0.3283 —no es espectacular en términos absolutos, pero es casi dos veces y media la cifra de 3.7 Flash, en la fila que predice más directamente el rendimiento en codificación agéntica.
La segunda fila es Tau-Bench Banking, donde Gemini 3.7 Flash obtiene una puntuación de 0.3278. La fiabilidad del uso de herramientas en un dominio estructurado es exactamente aquello para lo que se despliega un modelo barato, y una puntuación inferior a 0.33 es el tipo de cifra que mata silenciosamente un proyecto piloto. Claude Haiku 5.5 no tiene una cifra publicada de Tau-Bench en la misma tabla, así que no hay comparación disponible ahí — lo honesto es decirlo en lugar de inferir una.
Donde Gemini 3.7 Flash se mantuvo firme es donde siempre se ha mantenido firme: GPQA con 0.9455 y MMMU-Pro con 0.8549 son ambas fortalezas genuinas, y su entrada multimodal nunca estuvo en duda. El fallo estaba en la parte de la hoja de especificaciones que decide si funciona un bucle de agente, no en la parte que gana filas en la tabla de clasificación.
¿Qué cambió en las tres semanas después de eso?
Gemini 3.8 Flash llegó el 2 de septiembre de 2026, y el movimiento dentro del propio nivel Flash de Google es la comparación más útil para cualquiera que esté planificando un pipeline para 2027.
En el mismo índice, Gemini 3.8 Flash mide 40,93 frente al 39,06 de la línea 3.7 — una ganancia de 1,87 puntos en tres semanas. Terminal Bench 4.0 pasó de 0,1364 a 0,1970. Tau-Bench Banking pasó de 0,3278 a 0,4495. Esas son exactamente las filas en las que el modelo 3.7 tenía peor desempeño, lo que sugiere que el sucesor apuntó precisamente a esta debilidad en lugar de a una mejora general de capacidades.
El precio no se movió en absoluto. Gemini 3.7 Flash figuraba a 0,75 $ de entrada y 3,75 $ de salida por millón de tokens, y Gemini 3.8 Flash se lanzó con los mismos 0,75 $ y 3,75 $: la misma tarifa idéntica, asociada a un modelo dos puntos de índice mejor en las filas que importan para los agentes.

La tabla de tarifas es donde esta comparación realmente da un giro
Frente a Claude Haiku 5.5, el precio de Google lo es todo y no está ni cerca.
• Entrada — Claude Haiku 5.5: $0,10 por millón de tokens hasta 100.000, $0,50 por encima; Gemini 3.7 Flash: $0,75 fijo, o siete veces y media la tarifa de Anthropic dentro del primer tramo.
• Salida — $0.50 para Claude Haiku 5.5 dentro del primer nivel, $2.50 por encima de este; $3.75 para Gemini 3.7 Flash.
• Entrada en caché — $0.01 y $0.125 para Claude Haiku 5.5; $0.075 de lectura y $0.75 de escritura para Gemini 3.7 Flash.
• Contexto — un millón de tokens para ambos. Salida máxima — 128.000 tokens para Claude Haiku 5.5 frente a 65.536 para Gemini 3.7 Flash.
• Modalidad de entrada: texto e imágenes para Claude Haiku 5.5; texto, imágenes, voz y vídeo para Gemini 3.7 Flash. Esta sigue siendo la única línea en la que la especificación de Google es estrictamente más amplia, y sobrevivió intacta al relevo por la 3.8.
• Costo independiente por tarea de Index finalizada — $0,21 para Claude Haiku 5.5 frente a $0,93 para Gemini 3.7 Flash. Una brecha de 4,4× que es más amplia de lo que sugeriría la proporción de entrada de siete y medio a uno, porque el modelo de Anthropic es el verboso en este caso: 162.164 tokens de salida por tarea de Index frente a 58.387 para Gemini 3.7 Flash. Anthropic también documenta un tokenizador compartido con Claude 4.7 y posteriores que cuenta aproximadamente un 30% más de tokens para el mismo texto, lo que empuja en la misma dirección.
• Velocidad — 212,3 segundos por tarea de Index para Gemini 3.7 Flash frente a 424,6 para Claude Haiku 5.5. El modelo de Google es el más rápido de los dos por un factor de dos, que es la única línea de esta sección en la que el modelo más barato no es también el mejor.
Qué significa esto si estás eligiendo hoy
La interpretación práctica es que ninguno de estos dos es la respuesta correcta, por razones distintas.
Gemini 3.7 Flash está obsoleto, tiene el mismo precio que su sucesor y es peor que ese sucesor justo en las filas que necesita un modelo de producción barato. Recomendarlo sería recomendar una tabla de tarifas adosada a un modelo superado: el sucesor cuesta lo mismo y hace más. Nadie que tenga que elegir entre estos dos en octubre de 2026 debería acabar en la línea 3.7, y el hecho de que su tabla de tarifas no haya cambiado es lo que lo decide.
Claude Haiku 5.5 es el modelo activo, y en tareas de entrada y salida de texto es más barato según cualquier medida, obtiene una puntuación más alta en la métrica compuesta y es muchísimo mejor en las dos filas que predicen el éxito agéntico. También es el más lento y no puede aceptar voz ni vídeo. Que eso importe es una cuestión de tu pipeline, no de los modelos.
La tercera opción, que la brecha de puntos de índice entre 3,8 y 3,7 hace visible, es que el nivel flash de Google avanza lo bastante rápido como para que una comparación de hace tres semanas ya sea cosa del pasado. Considera que cualquier enfrentamiento directo entre niveles flash tiene una vida útil medida en semanas, no en trimestres.
Corriendo por el lado que te toque
Gemini 3.8 Flash —el sucesor, no el obsoleto 3.7— está en el catálogo de OrcaRouter al precio de lista de Google, con un 0 % de recargo, así que la tarifa que publica Google es la tarifa que llega a tu factura, y un cambio de su lado está activo en el nuestro el mismo día. Claude Sonnet 5.5 y Claude Opus 5.5 también están en el catálogo, lo que convierte una prueba de enrutamiento con dos proveedores en una configuración y no en un proyecto: una sola API para más de 200 modelos, una sola clave, conmutación por error automática por debajo, y el DSL de enrutamiento cuando prefieres mantener la escalada en la ruta en lugar de en el código.
Gemini 3.7 Flash en sí no está en nuestro catálogo, y Claude Haiku 5.5 tampoco. Ambos siguen siendo accesibles a través de las API propias de sus proveedores y, en el caso de Google, de varias plataformas de terceros. Merece la pena decirlo con claridad en lugar de dejar que el lector lo descubra por su cuenta.

El número que hay que quitar
No es la brecha de 4,33 puntos del índice. Es que Gemini 3.7 Flash ganó tres de los cuatro benchmarks compartidos y aun así perdió en el compuesto por cuatro puntos, porque el benchmark al que el índice da más peso era en el que obtuvo 0,1364. Las puntuaciones en ciencias de un modelo de gama flash pueden parecer buenas mientras falla en aquello para lo que se compran los modelos baratos.
El corolario es que el sucesor corrigió precisamente esas filas en el plazo de tres semanas, a un precio sin cambios. A la vista de esta evidencia, la presión competitiva en este nivel no es el precio. Es si el modelo puede completar una tarea de varios pasos, y eso ahora avanza más rápido de lo que lo hacen las tarifas.
