Tarjeta principal titulada Claude Sonnet 5.5 vs Grok 4.6, con el subtítulo «la tarifa dice una cosa y la factura de tokens dice otra», con píldoras que indican salida $10 vs $6, coste por tarea $7.60 vs $1.86, e Índice 56 vs 44, y un pie de página que cita Artificial Analysis v4.3.2 y precios de proveedores.
Guides & Insights

Claude Sonnet 5.5 vs Grok 4.6: la tarifa dice una cosa, la factura de tokens dice otra

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La aritmética de los titulares parece resuelta antes de que empiece el artículo. Grok 4.6 cuesta $2 por millón de tokens de entrada y $6 por millón de tokens de salida; Claude Sonnet 5.5 cuesta $2 y $10. El modelo de Space​XAI es un 40 % más barato en salida, iguala en entrada y está disponible de forma general desde el 12 de agosto de 2026 —lo suficiente para que sus peculiaridades estén documentadas en lugar de ser rumores. El modelo de Anthro​pic llegó el 28 de septiembre de 2026, un día antes de que se escribiera esto, y es, por un amplio margen, lo más nuevo de la categoría.

Luego llegas a las cifras de eficiencia independientes y el orden se invierte. Artificial Analysis mide los modelos de la clase GPT y Claude sobre una base de costo por tarea junto con su Intelligence Index, y en la revisión v4.3.2 los dos modelos aquí son $1.86 por tarea de índice para Grok 4.6 y $7.60 para Claude Sonnet 5.5. El modelo con la tarifa más barata es el caro de operar, por un factor de cuatro. Averiguar por qué, y cuándo esa inversión se mantiene y cuándo no, es toda la comparación.

Dos modelos, dos posiciones en sus propias familias

Grok 4.6 es el actual buque insignia de la línea Grok: la propia documentación para desarrolladores de SpaceXAI lo incluye como el más reciente, y sucedió a Grok 4.5 con la misma ventana de contexto de 500.000 tokens, la misma superficie de entrada de texto, imágenes y archivos, y el mismo precio base. Admite esfuerzo de razonamiento configurable, llamada a herramientas nativa, salidas estructuradas y la superficie completa de muestreo, y como modelo de OpenAI Responses de primera clase se integra en marcos de agentes existentes sin una capa de traducción. Artificial Analysis lo sitúa con un Índice de Inteligencia de 44, en el puesto 31 de los 216 modelos que mide, con una cifra de GPQA Diamond del 94,9%.

Two-column scoreboard for Claude Sonnet 5.5 and Grok 4.6 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, verbosity 410M output tokens. Right column Grok 4.6: input $2.00 per million, output $6.00 per million, 500K-token context, AA Intelligence Index 44, cost per Index task $1.86, verbosity 94M output tokens. A footer line reads Index, cost per task and verbosity per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 es la segunda incorporación de la generación 5.5 de Anthropic y el modelo que la compañía ha posicionado como la mejor combinación de velocidad e inteligencia de su gama. Se distribuye como claude-sonnet-5-5/ en la API de Claude y las tres principales nubes, cuenta con una ventana de contexto de 1M de tokens con un límite de salida síncrona de 128K, mantiene las tarifas de $2 / $10 de Claude Sonnet 5 para entrada, salida y almacenamiento en caché, y está disponible con retención de datos cero. En la misma revisión del índice obtiene 56 puntos y ocupa el tercer lugar de 216.

Así que los dos no están realmente en el mismo mercado. Uno es un modelo frontera de 500.000 tokens que lleva siete semanas a la venta a una tarifa ajustada. El otro es un nivel de propósito general de 1M de tokens que no cuesta más por token que su predecesor y obtiene doce puntos más en el compuesto. Aun así, vale la pena hacer la comparación, porque ambos son modelos de 2 $ de entrada y ahí es donde empiezan realmente las decisiones de compra.

La brecha cuádruple que nadie pone en una diapositiva

Las tarjetas de tarifas fijan el precio de los tokens. Las facturas están denominadas en tareas, y la cantidad de tokens que un modelo gasta para llegar a una respuesta es una decisión de diseño, no una constante. Ahí es donde estos dos divergen, y las cifras medidas son contundentes:

• Tarifa de salida Sonnet $5.5 por millón frente a Grok 4.6 $6 por millón

• Coste por tarea del Intelligence Index — Claude Sonnet 5.5 $7,60 vs Grok 4.6 $1,86

• Verbosidad en el índice — Claude Sonnet 5.5 410 M tokens de salida frente a Grok 4.6 94 M

• Índice de inteligencia — Claude Sonnet 5.5 56 vs Grok 4.6 44, ambos en v4.3.2

• Velocidad de salida — Grok 4.6 medida en 67,7 tokens por segundo frente a una mediana de 82,7; Anthropic informa que Claude Sonnet 5.5 genera salida un 30 % o más rápido que Claude Sonnet 5, que Artificial Analysis cronometró en 78,7 tokens por segundo

La línea de verbosidad es el mecanismo. Un modelo que emite cuatro veces la cantidad de tokens no necesita una tasa de salida un 67 % superior para costar cuatro veces más por tarea, pero ayuda, y aquí ambos efectos apuntan en la misma dirección. El propio planteamiento de Anthropic respalda la interpretación en lugar de contradecirla: el material de lanzamiento afirma que Claude Sonnet 5.5 «cuesta hasta un 30 % menos por tarea» que Claude Sonnet 5 con precios idénticos por token, lo que es una afirmación sobre el recuento de tokens, no sobre las tarifas. Frente a una línea base externa mucho más austera, esa misma propiedad se convierte en el mayor riesgo de costos del modelo.

Nada de esto hace que la brecha del índice desaparezca. Doce puntos de composite son una diferencia real de capacidad, y una tarea más barata que falla no es más barata. Sí significa que la pregunta honesta no es "qué tarifa es más baja", sino "cuántos tokens requiere la tarea más difícil", y ese número solo existe una vez que ejecutas tu propia carga de trabajo.

Artificial Analysis model page for Claude Sonnet 5 (Adaptive Reasoning, Max Effort), released June 2026, showing an Intelligence Index of 38, an output speed of 78.7 tokens per second against an average of 83, a cost of $2.00 per million input tokens and $10.00 per million output tokens, $5.09 per Intelligence Index task, a verbosity of 370M output tokens, and a 1M-token context window.

Contexto, esfuerzo y la forma de la integración

La segunda divergencia es arquitectónica, y decide cuál de las dos puedes adoptar sin reescribir nada.

OrcaRouter model page for grok/grok-4.6, attributed to SpaceXAI and dated 2026-08-12, showing a 500K-token context window, text, image and file input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 3.00 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

Claude Sonnet 5.5 cambia seis comportamientos con respecto a Claude Sonnet 5, y cinco de ellos rompen la compatibilidad. El envío de thinking: {"type": "disabled"}/ ahora devuelve un 400 y debe reemplazarse con between_tools/. El uso forzado de herramientas — tool_choice/ de "any"/ o una herramienta con nombre — se rechaza de plano, por lo que un bucle que fuerza una llamada válida según el esquema tiene que pasar a auto/ con uso estricto de herramientas o salidas estructuradas. La versión anterior, computer_20251124/, de la herramienta de uso de computadora, se rechaza en la Claude API y Google Cloud. Los bloques de pensamiento ahora están vinculados al modelo y a la cuenta que los produjo, por lo que una conversación puede llevar su razonamiento hacia adelante desde Claude Sonnet 5, pero no lateralmente hacia una familia de modelos diferente. Y la herramienta advisor ya no acepta Claude Opus 4.8, Claude Opus 4.7 ni Claude Sonnet 5 como asesores detrás de un ejecutor Sonnet 5.5.

Grok 4.6 no pide nada de eso. Es un modelo con formato de OpenAI y la superficie de muestreo intacta, y la migración desde Grok 4.5 es un cambio de cadena de modelo. Sin embargo, su propia estructura de costos tiene una trampa, y es un reflejo exacto de la de Anthropic: la tarifa de $2 / $6 se aplica hasta 200.000 tokens de entrada, y todo lo que supere esa cifra se factura a $4 / $12. Claude Sonnet 5.5 cobra la tarifa estándar en toda la ventana de 1M.

Coloque las dos estructuras una junto a la otra y la decisión deja de girar en torno a qué proveedor es más barato:

• Prompts breves, resultados densos — la tendencia de Grok 4.6 a usar menos tokens y su menor tasa de salida ganan de forma decisiva

• Entradas muy largas — la tarifa plana de 1M de Claude Sonnet 5.5 empieza a superar a un tramo que se duplica mucho antes del límite de contexto

• Grandes salidas individuales — el límite de 128K de Sonnet 5.5 coincide con el de Grok 4.6, y alcanza los 300K en la API Message Batches detrás del output-300k-2026-03-24/ encabezado

• Código existente con el formato de OpenAI — Grok 4.6 no necesita cambios; Sonnet 5.5 necesita el trabajo de uso de herramientas y de pensamiento mencionado arriba

Poner ambos en una sola credencial

Mantener una comparación entre dos proveedores en la cabeza es fácil. Ejecutarla es donde se esconde el costo: dos cuentas, dos conjuntos de límites, dos superficies de facturación y un recuento de tokens que hay que medir dos veces antes de que signifique algo.

OrcaRouter reduce todo eso a un único endpoint compatible con OpenAI que abarca más de 200 modelos, con el precio de lista del proveedor aplicado tal cual y sin margen alguno, de modo que un cambio de tarifas del proveedor, ya sea por el lado de Grok o por el de Claude, se refleja aquí el mismo día en lugar de en la siguiente renovación de contrato. Toda la línea Grok 4.x está en el catálogo con las tarifas del propio proveedor, y Claude Sonnet 5 es enrutable desde el 30 de junio a los $2 / $10 de Anthropic — el modelo que aún sostiene la mayor parte del tráfico de la API de Claude, con una medición de 150 tokens de salida por segundo y un tiempo p50 hasta el primer token de unos cinco segundos.

Claude Sonnet 5.5 en concreto aún no está en nuestro catálogo. Hasta que lo esté, la vía para acceder a él es la API propia del proveedor, y la forma de probarlo sin apostar una carga de trabajo a un modelo que nadie ha evaluado de forma independiente más allá de un único resultado compuesto es enviarle un porcentaje del tráfico con failover automático, con Grok 4.6 o Claude Sonnet 5 recogiendo lo que este deje caer. Probar un nivel completamente nuevo es una decisión de enrutamiento, no un proyecto de migración.

Qué hacer con los números

Grok 4.6 es el mejor modelo al que recurrir cuando el trabajo es corto, la salida es densa y la integración ya habla OpenAI. Es mediblemente más ligero por tarea que cualquier otra cosa en esta banda de precio, sus controles de muestreo están intactos, y siete semanas de disponibilidad significan que otras personas ya han encontrado sus modos de fallo.

Claude Sonnet 5.5 es el mejor modelo cuando la entrada es enorme, cuando la puntuación compuesta es lo que estás comprando, o cuando el trabajo es lo suficientemente agéntico como para que una brecha de doce puntos en el índice y un techo de salida de 128K importen más que una diferencia de cuatro veces en el coste por tarea. La lista de verificación de migración es real, y es un día de trabajo en lugar de una edición de la cadena del modelo.

Lo que lo resolvería es una medición de tokens por tarea sobre tu propio tráfico, ejecutada en ambos. Cada número de este artículo que decide el resultado —1,86 $ frente a 7,60 $, 94 M frente a 410 M— es un proxy de esa única cifra, y es la única de ellas que puedes obtener tú mismo.

Comparados en este artículo4

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario