Una tarjeta hero generada titulada 'GPT-6.1 Sol vs la generación GPT-6', encabezada por 'Una generación, 48 veces el costo', que muestra cuatro peldaños apilados etiquetados GPT-6 Astra (Índice 52,7, $3,26 por tarea), GPT-6.1 Sol (Índice 51,8, $0,72 por tarea), GPT-6 Sol (Índice 47,6, $1,05 por tarea) y GPT-6 Luna (Índice 38,1, $0,07 por tarea), con un pie de página que dice 'Cifras: Artificial Analysis v4.3.2.' y el logotipo de OrcaRouter en la esquina inferior derecha.
Engineering & Research

GPT-6.1 Sol vs la generación GPT-6: una generación de uno

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El proveedor añadió un cuarto nombre a su línea de modelos el 29 de septiembre de 2026 y lo llamó una generación, y la aritmética de la gama es lo más interesante al respecto: GPT-6.1 Sol es toda la generación. GPT-6 Luna y GPT-6 Sol, ambos lanzados el 22 de septiembre de 2026, permanecen sin cambios; GPT-6 Astra, disponible desde el 4 de septiembre de 2026, permanece sin cambios; la actualización 6.1 tocó exactamente un nivel. Mientras tanto, GPT-6.1 Sol, a $2.00 de entrada y $10.00 de salida por millón de tokens, obtiene 51.83 en el Artificial Analysis Intelligence Index por $0.724 por tarea — dentro de 0.84 puntos de GPT-6 Astra, que cuesta $3.2575 por tarea a $10.00/$50.00. La misma generación en la etiqueta, cuatro economías diferentes por debajo.

Eso hace que "¿debería usar la generación GPT-6?" sea la pregunta equivocada. La gama abarca un rango de 48× en costo por tarea y un rango de 14.6 puntos en inteligencia medida, y la respuesta depende por completo de a qué nivel te refieras. Aquí está la escalera, medida.

Los cuatro peldaños, tal como se midieron

A chart titled 'The GPT-6 ladder - measured', subtitle 'Artificial Analysis Intelligence Index, and the measured cost of one task', with four horizontal bars whose lengths are proportional to the Intelligence Index: GPT-6 Luna Index 38.1 / $0.068 per task, GPT-6 Sol Index 47.6 / $1.05 per task, GPT-6.1 Sol Index 51.8 / $0.72 per task, GPT-6 Astra Index 52.7 / $3.26 per task; footer 'Bar length is proportional to the Intelligence Index (0-60 scale). All figures: Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

• GPT-6 Luna — Índice 38,12, $0,10 / $0,50 por 1M, $0,01 en caché, $0,0678 por tarea, 50.012 tokens de salida, 100,1 s hasta el primer token
• GPT-6 Sol — Índice 47,63, $2,00 / $10,00, $0,20 en caché, $1,045 por tarea, 31.000 tokens de salida, 124,3 s
• GPT-6.1 Sol — Índice 51,83, $2,00 / $10,00, $0,10 en caché, $0,724 por tarea, 38.128 tokens de salida, 332,0 s
• GPT-6 Astra — Índice 52,67, $10,00 / $50,00, $1,00 en caché, $3,2575 por tarea, 27.206 tokens de salida, 400,4 s

Cada uno de ellos tiene la misma ventana de contexto de 1.050.000 tokens y la misma salida máxima de 128.000 tokens, y todos aceptan entrada de texto, imagen y archivo. Los niveles no se diferencian por indicadores de capacidad. Se diferencian por cuánto pensamiento estás dispuesto a pagar, y los dos extremos de esa escala están separados por un factor de 48 por tarea.

Qué cambió realmente la actualización 6.1

Tres cosas, y solo una de ellas es una puntuación.

La puntuación se movió: de 47,63 a 51,83, 4,2 puntos, en una semana. La tasa de entrada en caché se redujo a la mitad, de $0,20 a $0,10 por millón, y por eso el costo medido por tarea bajó de $1,045 a $0,724 pese a que los precios de lista eran idénticos: la misma tarifa, una factura distinta. Y el recuento de tokens de salida subió de 31.000 a 38.128, mientras que el tiempo de reloj por tarea pasó de 321 a 640, que es el único aspecto en el que la actualización fue a peor y el menos visible en cualquier ficha técnica.

Frente a Astra, la comparación es la que sorprende a la gente. GPT-6.1 Sol está 0.84 puntos de índice por detrás del modelo insignia y es 4.5 veces más barato por tarea. La ventaja que le queda a Astra no es su puntuación de índice; es el conjunto de evaluaciones en las que se la mide en solitario, y la única capacidad que OpenAI describe como exclusiva de ella —encontrar vulnerabilidades de seguridad novedosas—, razón por la cual el modelo está calificado como "crítico" según el propio Preparedness Framework del proveedor y sus configuraciones más capaces están restringidas a socios verificados.

La tarjeta de OrcaRouter para GPT-6 Astra es el extremo más alto e insignia de la misma escala: 10,00 $ / 50,00 $, un p50 de 1,64 segundos hasta el primer token, 40,7 millones de tokens en siete días, y la misma ventana de contexto de 1.050.000 tokens que comparten todos los niveles.

A screenshot of the OrcaRouter model page for openai/gpt-6-astra, showing the $10.00 input and $50.00 output per-million prices, a 1.64 s p50 time to first token, 40.7M tokens over seven days, a 1,050,000-token context window and 128K max output with text/image/file input, above the OpenAI-compatible code sample.

Frente al Sol 6.0, la actualización es casi una mejora directa —más índice, menos dinero—, con la salvedad de que el modelo 6.1 es un modelo diferente y no un punto de control, y reemite su razonamiento de forma más verbosa. Frente a Luna no es una comparación en absoluto: 10,7 veces el coste por 13,7 puntos de índice, lo cual es un buen intercambio para trabajo arduo y uno terrible para trabajo de gran volumen.

Lo que nuestros propios datos de enrutamiento dicen que el mercado ya decidió

Una cosa que esta comparación tiene y una ficha técnica no es una visión del uso real. A lo largo de los siete días que terminaron el 7 de octubre de 2026 en nuestra propia capa de enrutamiento, GPT-6.1 Sol transportó 284,2 millones de tokens y el GPT-6 Sol al que reemplazó transportó 950 mil: una diferencia de 300 veces para dos modelos con una semana de diferencia de antigüedad, que es el aspecto que tiene un reemplazo de nivel desde dentro. GPT-6 Luna, el nivel económico, transportó 641,6 millones, más que ambos modelos Sol combinados. GPT-6 Astra transportó 40,7 millones.

Interpreta eso como tres comportamientos distintos. El trabajo de alto volumen fue a parar al nivel barato en el mayor volumen. El trabajo serio se consolidó en el Sol más reciente en la semana siguiente a su lanzamiento, abandonando el modelo al que sustituyó. Y el buque insignia siguió siendo un nicho: el peldaño más capaz, el menos usado, por equipos cuyo problema es el único que solo él resuelve. La gama no es una escalera que la gente sube; es un conjunto de herramientas entre las que la gente elige, y eligen por nivel, no por generación.

Por eso el nivel pertenece en la solicitud, no en la arquitectura

El problema práctico de una generación de cuatro niveles es que la respuesta correcta cambia según la tarea y según la semana —como muestran las cifras de tráfico anteriores, el mercado volvió a decidirse en el plazo de siete días. Codificar de forma fija el nombre de un solo modelo en una aplicación es lo que convierte una gama en un compromiso.

Los cuatro son accesibles a través de un único endpoint de OrcaRouter: una sola API para más de 200 modelos con el precio de lista del proveedor aplicado directamente, con un 0 % de recargo. Esa última parte es fundamental aquí concretamente porque tres de los cuatro niveles comparten un precio de lista o una tarifa de caché que ya ha cambiado una vez: la tarifa de caché de GPT-6.1 Sol se redujo a la mitad en la primera semana desde su lanzamiento, y un medidor de traspaso directo es lo que hace que eso llegue automáticamente a tu factura.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample.

Dos características de la capa de enrutamiento merecen ser nombradas para esta gama en particular. El DSL de enrutamiento permite que el nivel sea un parámetro de la solicitud en lugar de un despliegue: nivel económico para la pasada de extracción, 6.1 Sol para la pasada de razonamiento, Astra solo para las llamadas que necesitan lo que Astra hace de manera única. Y la fusión de modelos permite que un panel de ellos responda una pregunta juntos, que es la forma honesta de usar un buque insignia al que no puedes permitirte enrutar todo: se convierte en una voz en un panel en lugar de la factura completa.

Qué hacer con una generación de uno

No compres la generación. Compra un peldaño, y vuelve a comprarlo cuando los peldaños se muevan.

Para trabajo de alto volumen y sensible a la latencia, GPT-6 Luna a $0.0678 por tarea y 100 segundos hasta el primer token es el nivel que ya soporta la mayor parte del tráfico, y el precio está un orden de magnitud por debajo de cualquier otra opción en la escalera. Para razonamiento general y programación, GPT-6.1 Sol es ahora el predeterminado que solía ser el modelo 6.0 — mismo precio de lista, mejor índice, la mitad del costo de caché, y el tiempo de tarea de 640 segundos es lo único que hay que probar con su propia carga de trabajo antes de asumir que la actualización es gratuita. Para las tareas que necesitan medición de frontera o el trabajo de seguridad que solo realiza el buque insignia, GPT-6 Astra sigue siendo el único peldaño que las realiza, a 4.5 veces el costo del peldaño por debajo de él.

Lo que hay que observar es si la actualización 6.1 llega a los demás niveles. Si Luna o Astra reciben el mismo tratamiento, cambia la forma de la escala y, con ella, la aritmética por tarea de este artículo. Hasta entonces, «GPT-6.1» designa un solo modelo, y tratarlo como una familia es la forma en que los equipos terminan pagando tarifas de modelo insignia por extracción.