Tarjeta principal generada titulada Claude Sonnet 5.5 vs Grok 4.5, con el subtítulo dos tarifas de entrada de $2 y una espera de seis minutos, que muestra tres tarjetas de estadísticas: primer token 370.8s vs 6.9s, costo por tarea $7.60 vs $1.04 e Índice de Inteligencia 56 vs 39, con un pie de página que dice Índice, costo por tarea y latencia según Artificial Analysis v4.3.2; precios según los proveedores.
Guides & Insights

Claude Sonnet 5.5 vs Grok 4.5: dos tarifas de entrada de $2 y una espera de seis minutos

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Claude Sonnet 5.5 y Grok 4.5 cobran el mismo precio por los tokens de entrada: 2,00 $ por millón de tokens. Ahí acaba el acuerdo, y hay un número que lo demuestra mejor que cualquier tabla de especificaciones. En la revisión v4.3.2 del Índice de Inteligencia de Artificial Analysis, la mediana del tiempo hasta el primer token de respuesta para Claude Sonnet 5.5 en su ajuste Max Effort es de 370,8 segundos. Para Grok 4.5 es de 6,9 segundos. La misma tarifa de entrada. Cincuenta y tres veces más de espera antes de que vuelva algo siquiera. Claude Sonnet 5.5, lanzado el 28 de septiembre de 2026, y Grok 4.5, lanzado el 8 de julio de 2026 y ya superado dos veces dentro de su propia familia, son las dos maneras más baratas de entrar en la primera mitad de la frontera sobre el papel, y el papel está ocultando la decisión que de verdad importa: qué estás comprando con la espera.

Esa cifra necesita su salvedad de inmediato, porque un número de latencia sin una configuración no significa nada: 370,8 segundos es el modo de razonamiento predeterminado de Anthropic con el máximo esfuerzo, que gasta un presupuesto de pensamiento muy grande antes de emitir un token de respuesta. Quien llama y quiere un primer token rápido configura otra cosa. Pero la dirección es real y no es un artefacto: Artificial Analysis mide la velocidad de salida de Claude Sonnet 5.5 en 138,7 tokens por segundo, solo por detrás de un puñado de modelos, y la de Grok 4.5 en 59,2. El modelo que espera durante más tiempo también escribe más rápido. Lo que estás eligiendo es entre una deliberación larga seguida de una respuesta rápida, y una breve seguida de una más lenta.

¿Qué cambió el 28 de septiembre?

Claude Sonnet 5.5 tiene un día de vida. A​nthropic lo lanzó el 28 de septiembre de 2026 bajo el identificador de API claude-sonnet-5-5, junto con Bedrock, Goo​gle Cloud y Microsoft Foundry, y lo describe como un modelo que funciona un 30 % más rápido que Claude Sonnet 5 y que cuesta hasta un 30 % menos por tarea en la mayoría de los trabajos. Esas son cifras del proveedor y no se han reproducido de forma independiente; el precio con el que se compara es real, porque la tarifa se mantuvo sin cambios en $2.00 por millón de tokens de entrada, $10.00 por millón de salida, $0.20 por lecturas de caché y $2.50 por escrituras de caché. La ventana es de 1,000,000 de tokens con un límite de salida síncrona de 128,000 tokens, y 300,000 tokens en la API de Message Batches detrás de la output-300k-2026-03-24 cabecera. El corte de conocimiento es junio de 2026. La retención de datos cero está disponible desde el lanzamiento, y A​nthropic no retirará el modelo antes del 28 de septiembre de 2027.

Artificial Analysis model page for Claude Sonnet 5.5 in its Adaptive Reasoning, Max Effort, Default Fallback configuration, released September 2026, showing an Intelligence Index of 56, an output speed of 138.7 tokens per second, $2.00 per million input tokens and $10.00 per million output tokens, $7.60 per Intelligence Index task, 410M output tokens generated during the Index evaluation, and a 1M-token context window.

A​nthropic también es inusualmente explícita en su propia página de documentación sobre el costo de la actualización: cinco cambios disruptivos separan a Claude Sonnet 5.5 del modelo en el que se ejecuta actualmente la mayor parte del tráfico de Claude, y se tratan más abajo.

Grok 4.5 es la propuesta más antigua y la más complicada. SpaceXAI —la empresa que sigue distribuyendo bajo la marca x​AI en sus tarjetas de modelo— lo lanzó el 8 de julio de 2026 como una mezcla de expertos de 1,5 billones de parámetros, entrenada junto con el editor de código Cursor, con una ventana de 500.000 tokens, entrada de texto, imagen y archivos, y un argumento de lanzamiento construido casi por completo sobre la economía de tokens en lugar de las mejores puntuaciones. Ya no es el buque insignia. Tanto Grok 4.6 como Grok 4.7 existen, ambos tienen el mismo precio de lista de $2.00 / $6.00, y nuestro catálogo incluye los tres. Por lo tanto, la pregunta interesante en septiembre de 2026 no es si Grok 4.5 es bueno; es si algo sigue justificando recurrir al más antiguo de los tres.

La factura no es la tarifa

Pon los dos lado a lado en el tablero independiente y la forma de la operación aparece.

• Intelligence Index, revisión v4.3.2 — Claude Sonnet 5.5 56 con Max Effort vs Grok 4.5 39

• Coste por tarea de Index — Claude Sonnet 5.5 $7.60 frente a Grok 4.5 $1.04, ambos medidos, no estimados

• Tarifa de salida — Claude Sonnet 5.5 $10.00 por millón frente a Grok 4.5 $6.00 por millón

• Velocidad de salida — Claude Sonnet 5.5 138,7 tokens/seg frente a Grok 4.5 59,2 tokens/seg

• Tiempo hasta el primer token de respuesta, Máximo esfuerzo — Claude Sonnet 5.5 370.8 s vs Grok 4.5 6.9 s

Tokens generados en toda la evaluación de Index — Claude Sonnet 5.5 410 vs Grok 4.5 77

• Contexto — Claude Sonnet 5.5 1.000.000 tokens frente a Grok 4.5 500.000 tokens

La línea de verbosidad es el mecanismo detrás de la brecha de costo por tarea, y es el número más útil de esta página. Un modelo que emite 410 millones de tokens en una evaluación donde su rival emite 77 millones no necesita una tasa de salida 67% mayor para costar siete veces más por tarea — pero de todos modos la tiene, y ambos efectos empujan en la misma dirección. El propio enfoque de Anthropic concuerda con la interpretación en lugar de contradecirla: "hasta un 30% menos por tarea" es una afirmación sobre el recuento de tokens, no sobre las tasas, porque las tasas no cambiaron entre Claude Sonnet 5 y Claude Sonnet 5.5. Artificial Analysis llega a la misma conclusión desde el otro lado y describe el modelo en lenguaje sencillo como notablemente rápido pero muy verboso. Frente a un modelo austero, esa misma propiedad es el mayor riesgo operativo de Claude Sonnet 5.5.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Grok 4.5, the scoreboard, with six matched rows: input price $2.00 vs $2.00, output price $10.00 vs $6.00, Intelligence Index 56 vs 39, cost per task $7.60 vs $1.04, first token 370.8 s vs 6.9 s, and context window 1,000,000 vs 500,000 tokens, with a footer reading Index, cost per task and latency per Artificial Analysis v4.3.2; prices per the vendors.

Dónde la tarifa barata de Grok 4.5 deja de ser barata

La línea de $2.00 / $6.00 es un nivel, no una tarifa. Según la propia documentación para desarrolladores de SpaceXAI, ese precio se aplica hasta 200,000 tokens de entrada y se duplica a $4.00 de entrada y $12.00 de salida a partir de ahí. La ventana de Grok 4.5 es de 500,000 tokens, así que la segunda mitad de la ventana que anuncia cuesta el doble que la primera mitad. Cargar un prompt a escala de repositorio en Grok 4.5 no es una operación de $6 de salida; es una operación de $12 de salida, y en ese punto el modelo con la tarifa de salida "costosa" de $10 es el más barato en cualquier solicitud que también emita muchos tokens.

Claude Sonnet 5.5 no tiene una categoría equivalente. La tarifa de $2.00 / $10.00 se mantiene en toda la ventana de 1,000,000 de tokens, y las lecturas de caché se facturan a $0.20 —una décima parte de la tarifa de entrada—, lo que hace que el caso de contexto largo sea viable en la práctica y no solo sobre el papel.

El tamaño de la ventana es la otra mitad de ese argumento y apunta en la misma dirección. La ventana de Grok 4.5 es de 500.000 tokens y cada uno de ellos se factura a la tarifa anunciada. Claude Sonnet 5.5 tiene 1.000.000 de tokens con los que trabajar, y la forma de la carga de trabajo es lo que hace que eso importe: un repositorio sobre el que razonar, una transcripción larga de agente, un montón de documentos que tiene que mantenerse a la vista. El doble de techo, sin cortes por nivel a la mitad de este, y lecturas de caché a una décima parte de la tarifa de entrada son lo que convierten el arrastrar tanto contexto a lo largo de muchas llamadas en una partida de gasto en lugar de un presupuesto.

La diferencia práctica no es sutil:

• Prompts cortos con salida densa — Grok 4.5 gana en tasa y vuelve a ganar en hábito de tokens

• Prompts que superan los 200.000 tokens de entrada — la tarifa de Grok 4.5 se duplica y la de Claude Sonnet 5.5 no

• Trabajo interactivo sensible a la latencia — Grok 4.5 responde primero, por un amplio margen, con la configuración predeterminada

• Ejecuciones agénticas de horizonte largo — la puntuación compuesta y el límite de salida de 128K de Claude Sonnet 5.5 son aquello por lo que pagas el coste adicional de tarea, y el límite de 300K de Batches lo extiende aún más

La migración no es una cadena de modelo

Cualquiera que pase de Claude Sonnet 5 a Claude Sonnet 5.5 debería leer la nota de migración de Anthropic antes de escribir código, porque cambiaron cinco comportamientos y solo uno de ellos falla de forma evidente y en un lugar obvio.

• Los valores no predeterminados de temperatura, top_p o top_k ahora devuelven un 400 — un pipeline con uso intensivo de muestreo deja de funcionar en lugar de degradarse

• thinking: {"type": "disabled"} devuelve un 400 y debe convertirse en between_tools, con el esfuerzo restringido a low, medium o high; xhigh y max se rechazan

• Uso forzado de herramientas — tool_choice con "any" o una herramienta con nombre — se rechaza de plano, así que un bucle que fuerza una llamada válida según el esquema tiene que pasar a auto con uso estricto de herramientas o salidas estructuradas

• La antigua computer_20251124 herramienta de uso de computadora se rechaza en la API de Claude y en Goo​gle Cloud

• Los bloques de pensamiento están vinculados al modelo y la cuenta que los producen, por lo que el razonamiento se transmite desde Claude Sonnet 5, pero no de forma lateral a una familia diferente — y la herramienta de asesor ya no acepta Claude Opus 4.8, Claude Opus 4.7 ni Claude Sonnet 5 como asesores detrás de un ejecutor Sonnet 5.5

Hay un sexto cambio que no hace fallar nada en absoluto, lo que lo convierte en el peligroso: el texto entre llamadas a herramientas ahora se devuelve dentro de bloques de pensamiento. Una aplicación que transmite ese texto a un usuario se queda en silencio entre llamadas a herramientas hasta que establece un valor de visualización o desactiva por completo el pensamiento inicial. Nada da error. La salida simplemente deja de aparecer.

Grok 4.5 no pide nada de eso. Es un modelo con formato de OpenAI y la superficie de muestreo intacta, y pasar a él desde los propios predecesores de Grok 4.5 es un cambio de cadena de modelo. El coste de migración recae por completo en el lado de Claude, y es un día de trabajo en lugar de una tarde.

Ambos en una sola credencial, y el límite honesto de eso

Mantener en la cabeza una comparación entre dos proveedores es fácil; llevarla a cabo es donde se esconde el costo. OrcaRouter pone más de 200 modelos detrás de un único endpoint compatible con OpenAI, con el precio de lista del proveedor aplicado tal cual y sin margen añadido, así que un cambio de tarifa en cualquiera de las dos partes está activo aquí el mismo día, en lugar de en la próxima renovación del contrato, con conmutación automática por error entre proveedores upstream y un DSL de enrutamiento para componer llamadas. Toda la línea Grok está en el catálogo a las propias tarifas de SpaceXAI, y Grok 4.5 se puede enrutar como grok/grok-4.5 a $2.00 de entrada y $6.00 de salida por millón de tokens a lo largo de su ventana de 500,000 tokens.

Claude Sonnet 5.5 no está en nuestro catálogo, y esta página no va a insinuar lo contrario. La ruta hacia él hoy es la propia API de Anthropic, o Bedrock y Google Cloud si ahí es donde ya reside tu infraestructura. Claude Sonnet 5 se puede enrutar aquí desde el 30 de junio a los $2.00 y $10.00 de Anthropic y sigue siendo el modelo por el que más tráfico de la API de Claude circula, lo que lo convierte en el objetivo natural de conmutación por error mientras Claude Sonnet 5.5 todavía tiene un día de vida y está fuera de la evidencia de producción de cualquiera.

Una salvedad corresponde a todo lo anterior, y no es menor. La fila de Grok 4.5 de arriba es el argumento de venta del proveedor tal como nuestro catálogo lo reproduce actualmente; el contador de tráfico de esa entrada marca cero en los últimos siete días y su cifra de rendimiento no se está midiendo, con el tiempo hasta el primer token situado en el mínimo de un segundo que suele mostrar un modelo apenas invocado. Que un modelo no tenga tráfico reciente aquí no es evidencia de que el modelo sea malo —4.6 y 4.7 son adonde han ido las llamadas de la familia—, pero sí significa que las cifras operativas de esa página son escasas, y la cifra de latencia en la que vale la pena confiar es la lectura de una ruta activa.

OrcaRouter model page for grok/grok-4.5, dated 2026-07-08, showing a 500K-token context window, text, image and file input, the pricing row of $2.00 input and $6.00 output per million tokens, a p50 time to first token of 1.00 s, a p95 of 4.0 s, and a traffic counter reading Collecting.

¿Cuál elegir?

Grok 4.5 es el modelo correcto cuando el prompt es corto, la respuesta es densa y la integración ya habla OpenAI —y cuando la solicitud no superará los 200.000 tokens de entrada, porque más allá de esa línea la aritmética cambia de manos. También es la elección correcta cuando un primer token tiene que llegar en segundos, no en minutos. Lo que no es es el actual buque insignia de Grok; Grok 4.6 y Grok 4.7 están por encima, al mismo precio de lista, y la razón para elegir 4.5 en lugar de cualquiera de los dos tiene que ser específica.

Claude Sonnet 5.5 es el modelo correcto cuando el prompt es enorme, el trabajo es lo bastante agéntico como para que diecisiete puntos de Index y un techo de salida de 128K justifiquen un coste siete veces mayor por tarea, o cuando la puntuación compuesta es simplemente lo que se está comprando. Su verbosidad es una decisión de diseño, no un defecto, y es el número que hay que medir en tu propio tráfico antes de comprometerte — porque $7.60 por tarea de Index frente a $1.04 es un proxy de una cifra que solo tu carga de trabajo puede producir.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario