
GPT-6.1 Sol vs GPT-5.6 Sol: cuatro puntos y medio de índice, la mitad de la factura, dos regresiones
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
OpenAI lanzó GPT-6.1 Sol el 29 de septiembre de 2026, once semanas después de GPT-5.6 Sol, que se lanzó el 9 de julio de 2026 como el buque insignia de la generación anterior. Ambos siguen a la venta, ambos siguen siendo invocables, y la diferencia entre ellos en la tabla neutral es de 4,8 puntos — 51,8 frente a 47,0 en el Índice de Inteligencia de Artificial Analysis, ambos medidos con el máximo esfuerzo de razonamiento en la misma suite de diez evaluaciones. La diferencia de precio es mucho mayor que la diferencia de puntuación: 0,72 $ por tarea de índice completada frente a 1,99 $, y 2,00 $/10,00 $ por millón de tokens frente a 4,00 $/20,00 $. Esa es la versión corta. La versión larga es que la actualización no es uniforme, y dos de las evaluaciones retrocedieron.
Qué es cada modelo, y qué reemplazó a qué
GPT-5.6 Sol era lo más alto de la línea 5.6: un modelo cerrado, solo disponible vía API, con una ventana de contexto de 1.050.000 tokens, un límite de salida de 128.000 tokens, entrada de texto, imagen y archivos, y una escala de razonamiento que iba desde none hasta max. OpenAI lo describía como el nivel creado para el trabajo más difícil: flujos de trabajo de agentes de largo horizonte, ingeniería de software con varios archivos y razonamiento profundo, y con un precio acorde de 4,00 y 20,00 dólares por millón de tokens, con la entrada en caché a 0,40 y las escrituras en caché a 5,00. Por encima de 272.000 tokens de entrada, pasaba a 8,00 y 30,00 dólares, y contaba con un nivel Batch a 2,50 y 15,00 dólares.
GPT-6.1 Sol es el modelo de gama media de la generación que vino después: por debajo de GPT-6 Astra y por encima de GPT-6 Luna, y ahora es el modelo al que OpenAI dirige a los desarrolladores sensibles al costo. Mantiene la ventana de 1.050.000 tokens y el límite de salida de 128.000 tokens, extiende el conocimiento del 20 de abril al 30 de abril de 2026 y reduce la escala de esfuerzo de seis peldaños a cinco — , medium (high, xhigh, max. El valor none que aceptaba GPT-5.6 Sol ahora devuelve un error, y la guía de migración de OpenAI es explícita en que la sustitución es low, no una actualización silenciosa.
Vale la pena detenerse en esto, porque es el único cambio de la versión que cuesta dinero en lugar de ahorrarlo. Una canalización que recurría a none para obtener una llamada barata, rápida y sin razonamiento ya no dispone de esa configuración, en ninguna de las dos familias de modelos. El nivel más barato de GPT-6.1 Sol es un nivel de razonamiento, y los tokens de razonamiento se facturan como tokens de salida, tanto si puedes verlos como si no.
La escalera, peldaño a peldaño
El panel independiente publica una puntuación y un coste de ejecución para cada ajuste de esfuerzo en ambos modelos, lo que convierte la comparación directa en algo más útil que una sola comparación. Alineados con ajustes equivalentes:
• Escala de esfuerzo, GPT-6.1 Sol — max 51,8 a $0,72 por tarea de índice; xhigh 51,0 a $0,39; high 50,2 a $0,32; medium (el predeterminado) 47,8 a $0,21 • Velocidad de salida — 59,7 tokens por segundo para GPT-6.1 Sol frente a 87,8 para GPT-5.6 Sol
• Tiempo hasta el primer fragmento — 332 segundos para GPT-6.1 Sol frente a una cifra más rápida para GPT-5.6 Sol, en comparación con una mediana del tablero cercana a 4 segundos
• Tokens de salida en la ejecución del índice — 67,2 millones para GPT-6.1 Sol frente a 90,0 millones para GPT-5.6 Sol
• Precio de entrada / salida — $2,00 / $10,00 frente a $4,00 / $20,00
• Entrada en caché — $0,10 frente a $0,40; escrituras de caché $2,50 frente a $5,00
• Tarifa por lotes — no publicada para GPT-6.1 Sol frente a $2,50 / $15,00 para GPT-5.6 Sol
• Tramo de contexto largo — por encima de 272.000 tokens de entrada, GPT-6.1 Sol cambia el precio a $4,00 / $15,00 por toda la solicitud frente a los $8,00 / $30,00 de GPT-5.6 Sol
• Mínimo de esfuerzo — low vs none
De esa lista se desprenden dos cosas. La primera es que la rebaja de precio es estructural y no promocional: la tarifa estándar de GPT-6.1 Sol, de $2.00 y $10.00, queda por debajo de la tarifa por lote de GPT-5.6 Sol, de $2.50 y $15.00, de modo que incluso el nivel con descuento del modelo antiguo es más caro que el precio de lista del modelo nuevo. La segunda es que la actualización no es una línea recta en cuanto a latencia. GPT-6.1 Sol genera resultados aproximadamente un tercio más despacio y tardó 332 segundos hasta el primer fragmento en las pruebas de prompts largos del tablero —el mismo orden de magnitud que los 107 segundos de GPT-6 Sol y aproximadamente ochenta veces la mediana del tablero. Si construiste un producto interactivo sobre GPT-5.6 Sol, esto es una regresión funcional independiente de cualquier benchmark, y la solución es arquitectónica, no un parámetro.

Dos evaluaciones fueron en la dirección equivocada
La ganancia compuesta es de 4,8 puntos. Los componentes no son uniformemente positivos, y las puntuaciones por evaluación del consejo así lo indican:
• SciCode — GPT-6.1 Sol 0.542 frente a GPT-5.6 Sol 0.571. Una regresión de 2.9 puntos en programación científica.
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575.1 frente a GPT-5.6 Sol Elo 1611.3. Una regresión de 36 puntos de Elo en trabajo de conocimiento económicamente valioso.
• Humanity's Last Exam — GPT-6.1 Sol 0.529 frente a GPT-5.6 Sol 0.495. Una ganancia de 3.4 puntos.
• Terminal-Bench 4.0 — GPT-6.1 Sol 0.561 frente a GPT-5.6 Sol 0.399. Una ganancia de 16 puntos, el mayor movimiento individual de la comparación.
• AA-Omniscience — GPT-6.1 Sol 41.5 frente a GPT-5.6 Sol 22.0, que tiene que ver con la fiabilidad del conocimiento y la alucinación más que con la recuperación bruta.
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — los cinco restantes, que completan el compuesto y son donde se obtiene el resto de la ganancia de 4.8 puntos.
Un modelo que es significativamente mejor en trabajo de terminal, sustancialmente mejor en fiabilidad fáctica y mediblemente peor en programación científica y en el Elo de trabajo profesional no es un modelo estrictamente mejor. Es un punto diferente en la frontera, y fue colocado allí deliberadamente: el propio marco de lanzamiento de OpenAI para GPT-6.1 Sol es coste por tarea completada con una calidad casi de buque insignia, no la puntuación máxima. Si tu carga de trabajo tiene forma de SciCode o de GDPval, el número compuesto no es el que se aplica a tu caso, y la regresión sí.
GPT-5.6 Sol todavía tiene el resultado publicado de contexto largo.
El único punto en el que el modelo más antiguo tiene una cifra que el más nuevo no tiene es la precisión de recuperación en la banda de contexto donde cambia el tarifario de GPT-6.1 Sol. GPT-5.6 Sol tiene un resultado publicado de MRCR v2 de ocho agujas del 91,5 % en el rango de 256.000 a 512.000 tokens. GPT-6.1 Sol no tiene una contraparte publicada y, por encima de 272.000 tokens de entrada, toda su solicitud se vuelve a tarificar a 2× la entrada y la caché, y 1,5× la salida.
Si se combinan esos dos hechos, el segmento donde la economía del nuevo modelo es más débil es exactamente el segmento donde el modelo antiguo tiene la única fortaleza documentada. Los ahorros no desaparecen — $4.00 y $15.00 en el nivel reajustado frente a $8.00 y $30.00 en el propio nivel de contexto largo de GPT-5.6 Sol siguen siendo una reducción a la mitad —, pero el relato del precio a la mitad es un relato de cargas de trabajo generales, y un pipeline de recuperación de contexto largo no lo es. Si esa es tu carga de trabajo, GPT-5.6 Sol a $4.00 y $20.00 con un 91.5% publicado es un lugar defendible en el que quedarse.
Los otros resultados publicados de GPT-5.6 Sol permanecen intactos y son la razón por la que algunos equipos no cambiarán: BrowseComp 90.4 para agentes de investigación web, Terminal-Bench 2.1 con 88.8 y 88.0, SWE-Bench Pro 64.6, Agents' Last Exam 53.6, OSWorld 2.0 con 62.6. Esos son reportados por OpenAI, en el harness de OpenAI, y se reportaron en julio. Lo que ha cambiado desde entonces es que la tabla ahora puntúa ambos modelos en una misma suite con un mismo conjunto de configuraciones, y el modelo más antiguo pierde en la puntuación compuesta y en el coste.
La migración en sí es un cambio de cadena, con una excepción
Mismo proveedor, misma superficie de API, adyacentes en el ranking, misma ventana y mismo límite de salida — así que, para la mayoría de los stacks, esto se reduce a un identificador de modelo y un precio que baja a la mitad. Las excepciones son concretas y vale la pena nombrarlas antes de hacer el cambio.
Si tu código establece reasoning.effort en none o minimal, fallará en lugar de degradarse, y low es el sustituto documentado. Si tu tráfico supera los 272.000 tokens de entrada, revisa el tramo con el precio actualizado antes de calcular el ahorro. Si tu producto depende del tiempo hasta el primer token, mide antes de lanzarlo, porque la cifra de 332 segundos de la tabla no es un error de redondeo. Y si tus evaluaciones incluyen una porción con forma de SciCode o de GDPval, ejecuta esa porción en ambos modelos en lugar de confiar en el resultado compuesto.
Ambos modelos están en OrcaRouter a los propios precios de lista de OpenAI — GPT-6.1 Sol a $2.00 y $10.00 con entrada en caché a $0.10, GPT-5.6 Sol a $4.00 y $20.00 con entrada en caché a $0.40 — bajo un modelo de traspaso que pone un cambio de precios de OpenAI de nuestro lado el mismo día en que se produce, en lugar de después de que un revendedor renegocie. Como la lista de precios se traspasa sin cambios en vez de con un margen añadido, la aritmética de este artículo es la aritmética que obtienes: el mismo modelo de $0.72 por tarea, la misma reducción a la mitad, sin ningún recargo de plataforma añadido por ninguna de las partes.

El uso práctico de tener ambos detrás de un mismo endpoint es que la comparación se mantiene viva. Envía el tráfico nuevo a GPT-6.1 Sol, mantén GPT-5.6 Sol a un solo cambio de configuración de distancia como opción de respaldo y como ruta de contexto largo, y deja que la conmutación por error automática cubra la ventana en la que la disponibilidad y la habilitación para Enterprise de un buque insignia de dos meses de antigüedad todavía se están asentando. Una migración que reduce la factura a la mitad y hace retroceder dos sub-benchmarks no es una decisión que se toma una vez y se olvida; es una que se toma por ruta, y una capa de enrutamiento es lo que hace que eso salga barato.

Donde cada uno pertenece
• Trabajo general agéntico y de terminal — GPT-6.1 Sol. Dieciséis puntos en Terminal-Bench 4.0 y la mitad del precio no es una decisión reñida.
• Fiabilidad factual, productos de respuestas recuperadas — GPT-6.1 Sol, en una brecha de AA-Omniscience de casi veinte puntos.
• Programación científica — revisa primero tus propias evaluaciones. El tablero muestra una regresión de 2,9 puntos, y el compuesto no la mostrará.
• Trabajo de conocimiento económicamente valioso — la misma precaución. La regresión de Elo de GDPval-AA es de 36 puntos.
• Recuperación de contexto largo por encima de 272.000 tokens — GPT-5.6 Sol, hasta que GPT-6.1 Sol tenga una cifra publicada en esa banda.
• Superficies interactivas y sensibles a la latencia — mide antes de migrar. Salida más rápida, primer token mucho más lento.
• Llamada sin razonamiento más barata — ninguna de las dos. Esa configuración ya no existe en esta familia.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
