Tarjeta de título principal generada para Claude Sonnet 5.5 vs Gemini 3.1 Pro, con el subtítulo 'Más barato por token, once veces más caro por tarea', que muestra $2.00 y $10.00 por millón de tokens frente a $2.00 y $12.00 con un límite de salida de 65,536 tokens indicado a la derecha, y el logotipo de OrcaRouter compuesto en la esquina inferior derecha.
Guides & Insights

Claude Sonnet 5.5 vs Gemini 3.1 Pro: más barato por token, once veces más caro por tarea

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

En la lista de precios, Claude Sonnet 5.5 es el modelo más barato y no está ni cerca en cuanto a capacidad. Alcanzó la disponibilidad general el 28 de septiembre de 2026 a $2.00 por millón de tokens de entrada y $10.00 por millón de tokens de salida; Gemini 3.1 Pro, anunciado el 19 de febrero de 2026 y que todavía se sirve desde un punto de acceso de vista previa, cuesta $2.00 y $12.00. Sonnet 5.5 también obtiene 56 en el Intelligence Index v4.3 de Artificial Analysis frente a los 30 de Gemini 3.1 Pro Preview —una brecha de veintiséis puntos en un mismo entorno de evaluación. El contexto de 1,048,576 tokens de Gemini es la única cifra destacada que gana de forma absoluta. Sin embargo, el mismo evaluador informa que completar una tarea de final abierto cuesta $0.67 en el modelo de Google y $7.60 en el de Anthropic, lo que supone un factor de once en sentido contrario. Ambas cifras son correctas, y la razón por la que coexisten —un límite de salida de 65,536 tokens por un lado y un problema de verbosidad por el otro— es lo que constituye toda esta comparación.

Qué es realmente cada endpoint

Corrige las identidades antes de la aritmética. El sujeto aquí es anthropic/claude-sonnet-5.5, lanzado el 28 de septiembre de 2026, entrada de texto, imagen y archivo, contexto de 1.000.000 tokens, salida máxima de 128.000 tokens, pensamiento adaptativo con un parámetro de esfuerzo que por defecto es alto en Claude Platform. El oponente es google/gemini-3.1-pro-preview, lanzado el 19 de febrero de 2026, entrada de texto, imagen, video, audio y archivo, contexto de 1.048.576 tokens, salida máxima de 65.536 tokens. Uno de esos dos nombres lleva una palabra que el otro no, y no es decoración.

El sufijo de vista previa ha estado presente durante siete meses. Google lanzó varias versiones de Flash en ese periodo y ningún sucesor para el nivel Pro; el modelo al que reemplazó 3.1 Pro figura como descontinuado. Nada de eso es un defecto del modelo —ha estado en funcionamiento, estable y con el precio correcto todo el tiempo—, pero sí significa que el endpoint contra el que estás integrando no está cubierto por un compromiso de ciclo de vida de disponibilidad general, y esta familia ya retiró un modelo Pro. Trátalo como un elemento permanente en la lista, no como una nota al pie, porque cambia lo que cuesta una decisión de arquitectura a varios años si te equivocas.

Dos números que apuntan en direcciones opuestas

La comparación por token primero, porque es la que todo el mundo ejecuta y favorece al modelo más nuevo.

• Entrada — $2.00 por millón en ambos; un empate exacto en la tarifa anunciada

• Salida — $10.00 para Claude Sonnet 5.5 frente a $12.00 para Gemini 3.1 Pro; el modelo de Anthropic es 17% más barato

• Lectura de caché — $0.20 por millón en ambos casos por debajo del límite del nivel

• Escritura de caché — $2.50 por millón para la ventana de cinco minutos en Claude Sonnet 5.5 frente a $0.375 para Gemini 3.1 Pro; Google es aproximadamente siete veces más barato para escribir una entrada de caché

• Contexto — 1.000.000 frente a 1.048.576; una diferencia sin consecuencias prácticas.

• Salida máxima — 128.000 tokens frente a 65.536; el modelo de Anthropic tiene casi el doble del límite máximo

• Modalidad de entrada — texto, imagen y archivo frente a texto, imagen, video, audio y archivo

Luego, la comparación por tarea, del mismo evaluador, en la misma semana, en una configuración de máximo esfuerzo en ambos lados: $7,60 para Claude Sonnet 5.5 frente a $0,67 para Gemini 3.1 Pro. Once veces. El mecanismo está documentado en la misma página en lugar de inferido — Sonnet 5.5 generó 410 millones de tokens en toda la suite de índices frente a una mediana de 88 millones para el campo, al que el evaluador describe como muy verboso, mientras que a Gemini 3.1 Pro se lo describe como bastante conciso. Cuando un modelo escribe varias veces más que el otro, una ventaja del 17% en la tarifa de salida no sobrevive al contacto con la factura.

La lección va más allá de estos dos modelos: una tabla de tarifas pone precio a un token, y se te factura por el trabajo terminado. Cualquier comparación que se detenga en la hoja de precios está midiendo la cantidad equivocada.

El límite del nivel en 200.000 tokens

El precio de Gemini 3.1 Pro no es plano, y el escalón es lo bastante grande como para invertir partes de la comparación anterior. Por debajo de un prompt de 200.000 tokens, las tarifas son de $2.00 de entrada y $12.00 de salida con una lectura de caché de $0.20. Por encima de ese umbral, toda la llamada se vuelve a tarificar a $4.00 de entrada, $18.00 de salida y $0.40 de lectura de caché: la tarifa de entrada se duplica hasta ser exactamente el doble que la de Claude Sonnet 5.5, y la salida pasa de ser un 17 % más barata en el lado de Anthropic a un 80 % más cara en el lado de Google.

El límite no es exótico. Un prompt de 200.000 tokens es un código base pequeño, un conjunto extenso de contratos, unas horas de transcripción o un agente que lleva un rato trabajando. El trabajo con contexto largo es precisamente para lo que se vende una ventana de 1M de tokens, así que el nivel que más recompensa la ventana es también el nivel en el que desaparece la ventaja de precio. Si tus prompts superan habitualmente los 200.000 tokens, evalúa Gemini 3.1 Pro a $4,00 y $18,00, no a las tarifas de la página de inicio.

Las escrituras en caché merecen su propia frase, porque se invierten en la dirección opuesta y sobreviven al cambio de nivel. A 0,375 $ por millón frente a 2,50 $, Gemini es mucho más barato para poblar una caché, y esa tarifa no se mueve cuando cruzas el límite. Para un agente que reconstruye un prefijo grande en cada turno en lugar de reutilizar uno, esa sola línea puede ser una ventaja estructural mayor que la tarifa de entrada, y es la única línea de esta comparación que ninguna frontera de nivel toca.

El techo de 65.536 tokens, y por qué determina la arquitectura

La cifra que más cambia lo que puedes construir es la salida máxima: 65.536 tokens en Gemini 3.1 Pro frente a 128.000 en Claude Sonnet 5.5. Un techo no es una métrica de rendimiento; es una restricción sobre si una tarea cabe en una sola llamada.

Cualquier cosa que emita un artefacto grande — un archivo fuente completo, un informe largo, un documento completo, un conjunto de datos estructurado — por encima de 65,536 tokens en el caso de Gemini debe descomponerse en una cadena de llamadas con estado pasado entre ellas. La descomposición cuesta más tokens de entrada en cada paso, más código de orquestación y un nuevo modo de fallo en las uniones donde termina un fragmento y comienza el siguiente. Una segunda restricción lo agrava: el propio material de Anthropic sitúa el umbral práctico de Sonnet 5.5 para trabajo largo y fiable materialmente más alto, y el techo de Gemini es el más ajustado de los dos por un factor de dos. Si tu artefacto más largo es de 40,000 tokens, esta sección es irrelevante y deberías comparar por coste por tarea. Si es de 100,000, el techo ya ha tomado la decisión por ti.

Modalidad, el único eje que Gemini domina por completo

Gemini 3.1 Pro acepta vídeo y audio; Claude Sonnet 5.5 acepta texto, imágenes y archivos, y no puede aceptar ninguno de los dos. Para una carga de trabajo centrada en medios —grabaciones de llamadas, capturas de pantalla, vídeo de producto, audio de reuniones—, no hay sustitución posible en este emparejamiento, y la comparación de precios es irrelevante porque solo uno de los dos endpoints puede aceptar la entrada. Para cargas de trabajo de texto e imágenes, los conjuntos de capacidades se solapan y rige la aritmética de precios anterior.

El otro número operativo de Gemini merece mencionarse porque es fácil pasarlo por alto en una página que abre con la inteligencia: nuestro catálogo mide una latencia mediana hasta el primer token de 10.000 ms en el p50 y una tasa de salida cercana a 1.283 tokens por segundo, con una tasa de error a siete días del 56,8%. Es un modelo extremadamente rápido con una tasa de fallos observada muy alta — una combinación que le sienta mucho mejor al trabajo por lotes con presupuestos generosos de reintentos que a cualquier cosa por la que un usuario esté esperando. Claude Sonnet 5.5 es, en comparación, el perfil más lento y más estable. La tasa de error no aparece en la página de inicio de ninguno de los dos proveedores; es el tipo de cifra que solo sale a la luz cuando los candidatos están detrás de un único endpoint que los mide, y esa es una razón para evaluar a ambos desde un solo lugar en vez de desde dos paneles distintos.

Qué enrutar y adónde

Envíalo a Claude Sonnet 5.5 cuando el trabajo sea de texto o imagen, cuando el listón de calidad sea lo bastante alto como para que importe una brecha de veintiséis puntos en el índice, cuando los artefactos de salida sean lo bastante largos como para necesitar el límite de 128.000 tokens, o cuando la carga de trabajo sea interactiva y una tasa de error del 56,8 % sea inaceptable. En tareas estructuradas y acotadas, la penalización por verbosidad que produce la cifra de 7,60 $ se disipa en gran medida, y la ventaja por token se convierte en dinero real.

Envíalo a Gemini 3.1 Pro cuando la entrada contenga video o audio, cuando los prompts se mantengan por debajo de 200,000 tokens y el volumen sea alto, cuando escribas cachés grandes con frecuencia y la escritura de caché de $0.375 se acumule, o cuando la tarea tenga forma de lote y el costo por tarea sea la única columna que importe: a $0.67 por tarea frente a $7.60, puedes permitirte muchísimos reintentos.

Ambos son enrutables en OrcaRouter hoy mismo. google/gemini-3.1-pro-preview y anthropic/claude-sonnet-5 son ambas entradas activas del catálogo con una sola credencial al precio de lista del proveedor y con un 0 % de recargo, lo que significa que la división anterior puede expresarse como una regla de enrutamiento en lugar de como dos integraciones — las solicitudes con formato multimedia a un endpoint y las solicitudes de texto e imagen al otro, con conmutación por error si cualquiera de los dos empieza a dar errores. Claude Sonnet 5.5 aún no es una ruta en nuestra plataforma; cuando se incluya en el catálogo, la misma regla lo cubrirá sin necesidad de una nueva clave.

El veredicto honesto para este enfrentamiento: Claude Sonnet 5.5 es el mejor modelo por un amplio margen y el más barato por token, y Gemini 3.1 Pro es aproximadamente once veces más barato por tarea terminada en trabajo de final abierto, seis veces más barato para escribir una caché, y el único de los dos que puede ver un video. Cualquiera que te cite la lista de precios está describiendo una comparación que no existe; la que sí existe trata de qué solicitudes puedes acotar.

A two-column scoreboard for Claude Sonnet 5.5 and Gemini 3.1 Pro Preview across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column Gemini 3.1 Pro Preview: input $2.00 rising to $4.00 over 200K tokens, output $12.00 rising to $18.00, cache read $0.20, cache write $0.375, 1,048,576-token context with a 65,536-token max output, input modality text, image, video, audio and file, AA Intelligence Index v4.3 score 30, $0.67 per task on the index run. The card heading reads "Cheaper per token, eleven times dearer per finished task", and a footer line notes that Gemini 3.1 Pro remains a preview endpoint seven months after its February 19, 2026 announcement.Screenshot of the OrcaRouter model page for Google Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), showing the model header, the 1,048,576-token context window, the 65,536-token maximum output, audio, file, image, text and video input, the Vision, Audio, Tools, JSON and Reasoning capability tags, a 10.00-second p50 time to first token, a "Public benchmarks by Google · 2026-02-19" line, and the $2.00 input and $12.00 output prices per million tokens.Screenshot of Artificial Analysis's model page for Gemini 3.1 Pro Preview, marked a proprietary model and released February 2026, showing In $2.00 and Out $12.00 with a 90% cache discount, the Intelligence Index score of 30, an output rate of 114 tokens per second, the $0.67 average cost per task, and 67M output tokens described as fairly concise against a median of 88M.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario