
Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite: más barato por token, más caro por respuesta
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Claude Haiku 5.5 cuesta $0,10 por millón de tokens de entrada y $0,50 por millón de tokens de salida. Gemini 3.5 Flash-Lite cuesta $0,30 y $2,50 en esos mismos dos medidores. El modelo de Anthropic cuesta un tercio en la entrada y un quinto en la salida, y obtiene 43,40 frente a 22,2 en el Artificial Analysis Intelligence Index v4.3.2 — una diferencia de más de veinte puntos en un campo donde diez es un salto generacional. Según la tarifa, esta no es una comparación reñida, y en cuanto a capacidad, tampoco lo es.
En la factura, la comparación está muy reñida, y va en sentido contrario. Ponga ambos modelos en la misma tabla independiente y cóbrele a cada uno por una tarea terminada en lugar de por un token, y Gemini 3.5 Flash-Lite salemás barato por respuesta. Artificial Analysis sitúa a Claude Haiku 5.5 en 0,21 $ por tarea del Índice de Inteligencia y a Gemini 3.5 Flash-Lite en 0,1235 $, una ventaja de 1,7 a uno para el modelo que paga cinco veces más por cada token que emite.
Esa inversión es todo lo que hay en esta comparación. Claude Haiku 5.5 reemplaza el nivel más barato que Anthropic haya lanzado jamás y supera a todo lo que está cerca en la tabla compartida. Gemini 3.5 Flash-Lite se lanzó el 21 de julio de 2026 y ha sido la opción más rentable de esta franja desde el verano. La pregunta que en realidad tiene un comprador no es cuál es mejor, porque la respuesta a eso ya está resuelta. Es cuál poner delante de una solicitud que deba devolverse de forma económica.
Todo lo siguiente es por millón de tokens en dólares estadounidenses. Los precios de lista son las tarifas publicadas por los propios proveedores. Las puntuaciones independientes, las cifras de costo por tarea y las mediciones de velocidad atribuidas a Artificial Analysis son de ese evaluador. Las cifras de latencia de Gemini 3.5 Flash-Lite provienen de nuestro propio tráfico medido. Cuando una cifra figura en el registro del modelo que conservamos en lugar de leerse de la página del evaluador ese día, hemos tratado a ese evaluador como la fuente y no a nosotros mismos.
La etiqueta y la factura no coinciden
La diferencia de coste por tarea no se explica por la tarifa, y la razón por la que existe vale la pena conocerla antes de que cualquiera de los dos modelos se acerque a producción.
Claude Haiku 5.5 es verboso, y el evaluador lo dice con todas las letras. Al ejecutar el Intelligence Index, Artificial Analysis registró 440 millones de tokens de salida del modelo frente a una mediana de 100 millones en general, y lo marcó como muy verboso. El razonamiento se factura como salida, el razonamiento está activado por defecto con un control de esfuerzo que empieza en medio, y una tarifa de entrada barata no ayuda a una carga de trabajo cuya factura es mayormente de salida.
Gemini 3.5 Flash-Lite tampoco es conciso, pero es mensurablemente menos costoso por trabajo. La misma tabla registra 17.507 tokens de salida por tarea de índice completada en su caso — 10.405 de ellos de razonamiento y 7.102 de respuesta. Si se contrasta eso con el volumen de tokens del modelo de Anthropic, la aritmética se resuelve: una ventaja de cinco a uno en la tarifa de salida se ve parcialmente consumida por un modelo que emite la respuesta más grande, y lo que sobrevive a nivel de tarea es una pequeña desventaja en lugar de una gran ventaja.
Hay un segundo efecto, más silencioso, que opera de la misma manera. La documentación de Anthropic dice que Claude Haiku 5.5 usa el tokenizador compartido con Claude 4.7 y posteriores, por lo que el mismo texto cuenta como aproximadamente un 30 % más de tokens de lo que contaba en el modelo al que este reemplaza. La tasa cayó en un factor de tres frente al nivel de Google. El recuento de tokens no lo hizo, y en el mismo texto aumentó.
Ambos modelos, en las cifras que importan
Tarifas de caché y precios de lista según la documentación propia de Anthropic y Google; cifras independientes atribuidas a Artificial Analysis; latencia en vivo de nuestra propia ventana de tráfico de siete días. Datos en caché al 2026-10-08.

• Entrada — Claude Haiku 5.5, $0.10 hasta 100.000 tokens y $0.50 por encima; Gemini 3.5 Flash-Lite, $0.30 fijos en una ventana de 1.048.576 tokens.
• Salida — Claude Haiku 5.5 $0,50 hasta 100.000 tokens y $2,50 por encima; Gemini 3.5 Flash-Lite $2,50 tarifa plana.
• Entrada en caché — Claude Haiku 5.5 $0.01 hasta 100,000 tokens y $0.05 por encima; Gemini 3.5 Flash-Lite $0.03. Las escrituras de caché son de $0.125 y $0.625 por millón de tokens para Claude Haiku 5.5.
• Contexto y salida — un millón de tokens para cada uno. La salida máxima es de 128.000 tokens para Claude Haiku 5.5 frente a los 65.536 de Gemini 3.5 Flash-Lite, por lo que el techo de Anthropic es aproximadamente el doble.
• Modalidad de entrada: texto e imágenes para Claude Haiku 5.5; texto, imágenes, video, audio y archivos para Gemini 3.5 Flash-Lite. Ambos devuelven texto.
• Puntuación independiente — 43,40 para Claude Haiku 5.5 (Max), segundo de 182 modelos en Intelligence Index v4.3.2, frente a 22,2 para Gemini 3.5 Flash-Lite, nonagésimo sexto de 147 y en el percentil treinta y cuatro de esa tabla.
• Costo independiente por tarea — $0.21 frente a $0.1235 en la misma placa.
• Rendimiento — 241.9 tokens de salida por segundo medidos para Claude Haiku 5.5 por Artificial Analysis, frente a 280.0 para Gemini 3.5 Flash-Lite medidos en nuestro propio playground durante los últimos siete días. Son dos entornos de prueba, no uno, así que léelos como un orden de magnitud y no como una carrera.
Veintiún puntos, y de qué están hechos
Una diferencia de veintiún puntos en un índice que ronda los sesenta no es un margen. Es la diferencia entre un modelo que puede sostener un bucle agéntico y un modelo al que debería encomendársele una única llamada bien especificada.
Los dos proveedores no miden los arneses de pruebas del otro, así que sus propios conjuntos de pruebas no pueden alinearse. Anthropic publica los resultados de GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 y FrontierCode para Claude Haiku 5.5; Google publica los suyos para el nivel Flash-Lite; ninguno ejecutó los del otro. La única comparación en igualdad de condiciones disponible es el tablero independiente, y ahí el modelo de Anthropic va por delante por un margen que no es nada estrecho.
Las puntuaciones parciales del evaluador para Gemini 3.5 Flash-Lite dejan constancia del perfil de ese nivel. Registra un 83,8 % en GPQA Diamond y un 54,2 % en SWE-Bench Pro, un 54 % en Terminal-bench 2.1, un 41,3 % en SciCode y un 39,2 % en MLE-Bench, y un 18,8 % en Humanity's Last Exam. Esas son las cifras de un nivel competente y de propósito general: fuerte en preguntas de conocimiento, visiblemente por detrás en las evaluaciones de razonamiento e investigación más difíciles. Claude Haiku 5.5, con 43,40 en la puntuación compuesta, se sitúa en una banda completamente distinta, y la conclusión práctica es que el trabajo que requiere planificación de varios pasos a largo plazo no es tarea para el nivel de Google en absoluto.
Un millón de tokens de ventana, y 65.536 de respuesta
Las dos ventanas de contexto tienen el mismo tamaño y no son el mismo producto.
El contexto largo en Gemini 3.5 Flash-Lite se degrada con la distancia de una manera que vale la pena cuantificar antes de confiar en él. En GDM-MRCR v2, la evaluación de recuperación de ocho agujas, promedia 72.2% cuando las agujas se encuentran dentro de 128,000 tokens y 21.3% en la variante puntual de un millón de tokens. Su cifra de Recuperación de contexto largo es 76%, y CharXiv Reasoning se sitúa en 74.5% sin herramientas y 76.5% con ellas. Una ventana de un millón de tokens es una capacidad real; recuperar de forma fiable desde el extremo lejano de la misma es una capacidad menor, y los dos números anteriores son la distancia entre ambas. La ventana del modelo Claude no se ha medido de la misma manera en el mismo tablero, por lo que no hay una cifra equivalente disponible para él, y este artículo no inventará una.
Los límites de salida son la diferencia más útil de inmediato. Claude Haiku 5.5 emitirá 128.000 tokens en una sola respuesta; Gemini 3.5 Flash-Lite se detiene en 65.536. Si el artefacto que quieres de vuelta es un archivo largo, una migración completa, una suite de pruebas generada o una reescritura a escala de transcripción, uno de estos dos modelos puede producirlo en una sola llamada y el otro no, y un trabajo dividido en dos llamadas cuesta más del doble que una sola llamada, porque el prefijo compartido se envía dos veces.

El audio y el vídeo no son una cuestión de precio.
Gemini 3.5 Flash-Lite acepta video, audio y archivos a la misma tarifa que el texto. Claude Haiku 5.5 acepta texto e imágenes.
Para un pipeline que ingiere llamadas grabadas, capturas de pantalla o metraje de vigilancia, la diferencia de capacidad que importa no son los veintiún puntos de índice. Es que uno de estos modelos toma la entrada directamente, y el otro necesita una etapa de transcripción o extracción de fotogramas delante —un segundo modelo, una segunda factura y un nuevo modo de fallo situado entre la fuente y la respuesta—. Los equipos en esa situación no están eligiendo entre dos niveles baratos. Están eligiendo entre un modelo y un pipeline.
Lo inverso se cumple para las imágenes y los documentos. Ambos modelos leen imágenes de forma nativa, y Claude Haiku 5.5 lo hace con 43,40 en el compuesto, así que una carga de trabajo de extracción de imágenes de páginas o de comprensión de diagramas en la que no haya audio pertenece al lado de Anthropic por los números, más que por un argumento de modalidad.
Ejecutando uno de los dos desde aquí
Gemini 3.5 Flash-Lite está en el catálogo de OrcaRouter al precio de lista de Google con un 0 % de margen, lo que significa que la tarifa del proveedor se repercute tal cual en lugar de prorratearse, y un cambio en la tarjeta de precios de Google llega a tu factura el mismo día que llega a la suya. Se trata de una sola clave y un solo SDK para el nivel de Google junto con Claude Sonnet 5.5 y Claude Opus 5.5, que también están en el catálogo, así que una comparación A/B entre un tramo de Google Flash-Lite y un tramo de Anthropic ya es una configuración, y no un proyecto de integración. La conmutación por error automática está por debajo, de modo que ningún tramo constituye un punto único de fallo, y el DSL de enrutamiento expresará la escalada en la ruta si ese es el lugar al que pertenece la lógica.
El perfil de latencia de ese tramo se basa en nuestra propia medición y no en la del proveedor. Durante los últimos siete días de tráfico real, Gemini 3.5 Flash-Lite ha mantenido un p50 de 2.426 milisegundos y un p95 de 8.600 milisegundos a 280 tokens de salida por segundo, con una tasa de error del 0,313 %. Léelo como una ventana móvil y no como una promesa: cambia a medida que cambian el tráfico y las condiciones del proveedor, y el número en el que confiar para una canalización determinada es el que midas tú mismo después de una semana.

Claude Haiku 5.5 no está en el catálogo. Se lanzó el 7 de octubre de 2026 —un día antes de que se escribiera esto— y hoy no es enrutable desde nosotros, así que el lado de Anthropic de esta comparación actualmente solo es accesible en Anthropic. Decirlo con claridad es mejor que dejarlo implícito. Una brecha entre que un modelo se lance y que se pueda invocar a través de nosotros es normal, no es una promesa sobre cuándo se cierra, y un lector que planifique una migración debería planificar en torno al calendario que puede ver y no al que preferiría.
¿Cuál, y para quién?
Si el trabajo es texto que entra y texto que sale, si los prompts caben en menos de 100.000 tokens y la tarea requiere varios pasos o agentes de horizonte largo, Claude Haiku 5.5 es el modelo más fuerte por veintiún puntos y el más barato por token por un factor de tres a cinco. Presupuesta según el costo por tarea en lugar de la lista de precios, espera alrededor de $0.21 para el tipo de trabajo que mide el consejo independiente, y vuelve a contar tus prompts antes de pronosticar cualquier cosa, porque el cambio de tokenizador mueve el conteo alrededor de un treinta por ciento por sí solo.
Si el trabajo es corto, de gran volumen y tiene forma de respuesta —una etiqueta, una categoría, una extracción, una decisión de salvaguarda—, entonces la aritmética favorece a Gemini 3.5 Flash-Lite, y lo hace por una razón poco glamurosa. La factura de una llamada que emite muy poco está dominada por la entrada, las dos tarifas de entrada son 0,30 $ frente a 0,10 $, y la huella de tarea mucho más corta del modelo de Google hace que la tarifa más barata se lleve el trabajo terminado aunque pierda en el precio de etiqueta. Añade entrada de vídeo, audio o archivos y la elección deja de ser cuestión de precio por completo.
Lo que la comparación realmente resuelve es más limitado que «el nuevo Haiku es barato». Resuelve que la tarifa destacada de un nivel barato es una mala guía de lo que ese nivel te cuesta, y que el modelo que parece tres veces más caro en la página de precios puede enviarte la factura más pequeña. Sea cual sea tu elección, mide los tokens que emites y no los que envías, porque en ambos modelos ese es el medidor con el que realmente se calcula la factura.
