Una tarjeta hero generada para «Tarifas idénticas, tres veces la factura», con la insignia «MISMA ETIQUETA», el antetítulo «DOS MODELOS, $0,10 Y $0,50, UNA PREGUNTA» y el subtítulo «Claude Haiku 5.5 frente a GPT-6 Luna: los mismos dos números, y umbrales muy diferentes». Cuatro chips muestran «$0,10 / $0,50 ambos», «100K vs 272K», «$0,21 vs $0,07» y «43,40 vs 38,12». Dos tarjetas debajo están etiquetadas «LO MISMO» («$0,10 de entrada y $0,50 de salida en el primer tramo, y una ventana de 1 M de tokens en ambos») y «NO ES LO MISMO» («el escalón se sitúa en 100.000 tokens frente a 272.000, y el costo por tarea difiere en un factor de tres»). Un pie de página dice «Tarifas de lista publicadas por los proveedores; mediciones independientes de Artificial Analysis, consultadas el 8 de octubre de 2026». El logotipo de OrcaRouter está superpuesto en la esquina inferior derecha.
Guides & Insights

Claude Haiku 5.5 vs GPT-6 Luna: mismo precio de etiqueta, el triple en la factura

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Claude Haiku 5.5 y GPT-6 Luna tienen el mismo precio sobre el papel: 0,10 $ por millón de tokens de entrada y 0,50 $ por millón de tokens de salida, las mismas dos cifras hasta el céntimo, de dos proveedores que rara vez coinciden en algo. La publicación de lanzamiento de Anthropic incluso imprime las puntuaciones de Luna en la columna junto a las suyas, algo que los proveedores no hacen con los modelos que consideran que no representan ninguna amenaza.

Las dos tarjetas divergen en todo lo que esconde la etiqueta. Luna mantiene esa tarifa hasta los 272.000 tokens antes de que suba; Claude Haiku 5.5 sube a los 100.000. Claude Haiku 5.5 obtiene 43,40 en el Artificial Analysis Intelligence Index v4.3.2 frente al 38,12 de Luna — y cuesta $0,21 por tarea finalizada del Index frente a los $0,07 de Luna. Mismo precio, el triple de factura, cinco puntos más de inteligencia. Ese es todo el intercambio, y es más limpio que la mayoría de las comparativas directas de esta franja.

Dos tarjetas, una al lado de la otra

Por millón de tokens en dólares estadounidenses, según las tarifas publicadas de Anthropic y OpenAI tal como se reflejan en nuestro propio catálogo, con mediciones independientes atribuidas a Artificial Analysis. Almacenado en caché el 2026-10-08.

A generated scoreboard titled 'Claude Haiku 5.5 vs GPT-6 Luna - two cards, side by side'. Claude Haiku 5.5 reads input $0.10 under the first tier and $0.50 past 100,000, output $0.50 and $2.50 past 100,000, maximum output 128,000 tokens, Intelligence Index v4.3.2 43.40, cost per task $0.21, output speed 241.9 tokens per second. GPT-6 Luna reads input $0.10 under the first tier and $0.20 past 272,000, output $0.50 and $0.75, maximum output 128,000 tokens, Intelligence Index v4.3.2 38.12, cost per task $0.07, output speed 129.4 tokens per second. A footer reads 'Vendors' published list rates; independent measurements from Artificial Analysis.'

• Entrada — Claude Haiku 5.5 $0.10 hasta 100,000 tokens, $0.50 por encima de eso. GPT-6 Luna $0.10 hasta 272,000 tokens, $0.20 por encima de eso.

• Salida — Claude Haiku 5.5 $0,50 hasta 100.000 tokens, $2,50 por encima de eso. GPT-6 Luna $0,50 hasta 272.000 tokens, $0,75 por encima de eso.

• Entrada y escrituras en caché: ambas a $0,01 y $0,125 por debajo del primer umbral, con Claude Haiku 5.5 pasando a $0,05 y $0,625 tras superar los 100.000 tokens, y GPT-6 Luna a $0,02 y $0,25 tras superar los 272.000.

• Contexto y salida — 1M de tokens para ambos; 128.000 de salida máxima para ambos. Estos dos son genuinamente de la misma forma.

• Pensamiento — adaptativo en ambos, ambos con un parámetro de esfuerzo. El esfuerzo predeterminado de Claude Haiku 5.5 es medio; no todas las puntuaciones publicadas están en esa configuración.

• Puntuación independiente — Claude Haiku 5.5 (Max) 43.40, segundo de 182 modelos. GPT-6 Luna (Max) 38.12, octavo de 182.

• Costo independiente por tarea — $0.21 frente a $0.07.

• Velocidad — 241,9 tokens de salida por segundo frente a 129,4, medido por el mismo evaluador.

El umbral es donde está la diferencia

Ambos proveedores armaron una tabla de tarifas de dos niveles. Lo hicieron en puntos muy distintos, y la ubicación importa mucho más que la cifra que figura arriba.

El escalón de Anthropic está en 100.000 tokens. Por debajo de él pagas 0,10 $ y 0,50 $; por encima, cinco y cinco veces más: 0,50 $ y 2,50 $. Anthropic afirma que los prompts por debajo del umbral representaban alrededor del 90% de las solicitudes a su anterior modelo Haiku, lo cual refleja la propia mezcla de tráfico del proveedor y es una descripción razonable de las cargas de trabajo de llamadas cortas en general.

El escalón de OpenAI se sitúa en 272.000 tokens. Por debajo, $0,10 y $0,50 — idénticos a Anthropic. Por encima, $0,20 y $0,75, el doble y un aumento del 50%. Ese es un escalón mucho más suave y comienza casi tres veces más lejos.

Toma un prompt de 200.000 tokens, un tamaño plausible para un pipeline de documentos largos y totalmente razonable para una ventana de 1M de tokens. En Claude Haiku 5.5, esa solicitud se factura en el segundo nivel: $0.50 de entrada, $2.50 de salida. En GPT-6 Luna sigue siendo el primer nivel: $0.10 de entrada, $0.50 de salida. Cinco veces la tarifa de entrada y cinco veces la tarifa de salida, en la misma solicitud, entre dos modelos con el mismo precio anunciado. Eso no es un matiz: para una carga de trabajo con prompts largos, es toda la comparación.

¿Por qué la misma tarifa genera el triple en la factura?

El costo por tarea es el número que debería decidir un pipeline de alto volumen, y aquí los dos modelos toman caminos distintos de una forma que la tabla de tarifas no puede explicar.

Artificial Analysis sitúa a GPT-6 Luna (Max) en 0,07 $ por tarea del Intelligence Index y a Claude Haiku 5.5 (Max) en 0,21 $ —un factor de tres, con tarifas idénticas, por una diferencia de 5,28 puntos en la puntuación. La causa está en la misma página y no es sutil. Claude Haiku 5.5 generó 440 millones de tokens de salida al ejecutar el Index frente a una mediana de 100 millones, y el evaluador lo califica de muy verboso. GPT-6 Luna generó 140 millones frente a la misma mediana de 100 millones, y se lo describe como algo verboso. El triple de tokens de salida es el triple de factura cuando la salida es el medidor que domina.

Los propios números de Anthropic apuntan en la misma dirección. Los gráficos de coste frente a precisión del proveedor trazan Haiku 5.5 a lo largo del rango de esfuerzo, y la cita destacada del lanzamiento es que Sonnet 5.5 y Opus 5.5 siguen siendo las mejores opciones para el trabajo complejo de codificación con agentes, mientras que Haiku 5.5 se posiciona para compactación, resumen y subagentes en su lugar. Cuanto más pequeña es la tarea, menos de ese problema de verbosidad compras —que es precisamente la carga de trabajo para la que se construyó el modelo, y precisamente la carga de trabajo en la que una brecha de coste de tres veces vale la pena comprobar contra tus propios registros en lugar de los de un ranking.

Una entrada más en el libro mayor, procedente de la documentación de Anthropic en lugar de la del evaluador: Claude Haiku 5.5 usa el tokenizador más reciente que comparte con Claude 4.7 y versiones posteriores, por lo que el mismo texto cuenta como aproximadamente un 30 % más de tokens que en el Haiku anterior. La tarifa es la misma que la de Luna; el tokenizador no.

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 specifications row and the published pricing table, with the per-million-token input, output and cache rates and the 100,000-token threshold at which the second tier begins.

Qué dice la propia tabla de Anthropic sobre Luna

La página de lanzamiento de Ant​hropic incluye GPT-6 Luna como una columna en su tabla de benchmarks, y la manera honesta de reportarlo es con la atribución correspondiente: estas son evaluaciones de Ant​hropic, ejecutadas en el entorno de pruebas de Ant​hropic, frente al modelo de un competidor. Son reportadas por el proveedor, no reproducidas de forma independiente, y que un proveedor ejecute su propia suite frente a las puntuaciones de un rival es una comparación que hay que sopesar en lugar de aceptar.

• Trabajo de conocimiento — GDPval-AA v2.1 en 1620 para Claude Haiku 5.5 frente a 1437 para GPT-6 Luna. AA-Briefcase v1.1 en 1578 frente a 1336.

• Uso de computadora — subconjunto sin conexión de OSWorld 2.1 con 72,4 % frente a 48,9 %.

• Codificación agéntica — Terminal-Bench 4.0 con un 39,2 % frente a un 16,4 %; FrontierCode 1.1 (Main) con un 46,4 % frente a un 42,4 %.

• Razonamiento visual — Chartography con 46,4% sin herramientas frente a 29,1%.

En el banco de pruebas del propio proveedor, Claude Haiku 5.5 lidera todas las filas. En el independiente, lidera por un margen menor —43,40 frente a 38,12—, que es la relación habitual entre la tabla de un proveedor y la de un tercero, y la razón por la que ambas se incluyen aquí. Las dos coinciden en la dirección y discrepan en la magnitud.

El proyecto de ley es el voto decisivo

Pon los cuatro hechos que realmente importan frente a frente y la elección deja de ser reñida para la mayoría de las cargas de trabajo.

GPT-6 Luna es más barato por tarea completada por un factor de tres en la medición independiente, su primer nivel de precio llega dieciocho veces más lejos en la ventana de contexto, sus tasas por encima del umbral son más bajas en ambos medidores, y es el único de los dos cuya penalización por contexto largo es una duplicación en lugar de un salto de cinco veces. Claude Haiku 5.5 va por delante en inteligencia medida por un margen que es real y modesto, más rápido por un factor de casi dos en salida y —en el propio banco de pruebas del proveedor, donde la brecha es más amplia— por delante en cada fila de benchmark publicada.

Si tus llamadas son cortas, si el rendimiento es la limitación, o si la diferencia de calidad se nota en tu propia evaluación, paga el triple. Si tus llamadas son largas, si las genera una máquina y nunca las lee un humano, o si estás usando un nivel de clasificación que se ejecuta un millón de veces al día, los mismos $0.10 y $0.50 te darán una factura de un tercio del tamaño del otro lado, y la capacidad a la que renuncias son cinco puntos en una tabla en la que ambos modelos están cerca de lo más alto.

Llamar a cualquiera de los dos desde un solo lugar

Lo útil de una comparación tan ajustada es que no deberías tener que fiarte de la palabra de nadie, ni siquiera de la nuestra. GPT-6 Luna está hoy en el catálogo de OrcaRouter a la tarifa del proveedor con un 0 % de margen —la misma estructura de tarifas indicada arriba, traspasada en lugar de combinada— y también lo están Claude Sonnet 5.5 y Claude Opus 5.5, lo que convierte una prueba de escalado desde una opción barata hasta un nivel intermedio en una configuración en lugar de un proyecto. Una clave, un SDK, conmutación automática por error por debajo, y el DSL de enrutamiento si la escalada va en la ruta en lugar de en tu aplicación.

Claude Haiku 5.5 todavía no está en el catálogo. Decirlo sin rodeos es más útil que insinuar lo contrario: el lado Luna de esta comparación es invocable por nosotros esta mañana, y se tiene que acceder al lado de Ant​hropic en Ant​hropic hasta que deje de ser así.

A screenshot of the OrcaRouter catalogue page for GPT-6 Luna, showing the model identifier openai/gpt-6-Luna, the provider OpenAI, a 1M-token context window, 128,000 maximum output, the release date September 22 2026, the $0.10 per million input and $0.50 per million output rates and a p50 time to first token of 1.49 seconds.

¿Qué cambiaría la respuesta?

Dos cosas, y ambas merecen observarse en lugar de estimarse.

El primero es si la verbosidad cambia. El costo por tarea de Claude Haiku 5.5 es función de cuántos tokens gasta por respuesta con esfuerzo máximo, y el parámetro de esfuerzo es la palanca para eso. Un equipo que fija el esfuerzo más bajo —el valor predeterminado del propio modelo es medio, no máximo— verá una cifra de costo por tarea más cercana a la de Luna y una puntuación también más cercana a la de Luna. El intercambio está disponible; cuánto vale es una cuestión sobre tu evaluación, no sobre el modelo.

La segunda es si las cifras independientes de coste por tarea se mantienen a medida que ambos modelos acumulan más ejecuciones medidas. Una sola posición en la tabla es una instantánea, y una diferencia de tres veces que aparece en una instantánea merece confirmarse con tu propia factura antes de reconstruir un pipeline en torno a ella. Para eso sirve el endpoint compartido.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario