Una tarjeta hero generada para GPT-6.1 Sol titulada «Llegó la puntuación independiente», con insignias que dicen «Publicado: 29 de septiembre de 2026», «Índice de inteligencia: 52 con esfuerzo máximo» y «Costo por tarea de índice: $0.72», un pie de página que dice «Cifras independientes según Artificial Analysis, índice v4.3.2, consultadas el 30 de septiembre de 2026», y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Ya está aquí la primera puntuación independiente de GPT-6.1 Sol: 0,84 puntos por detrás de Astra, con menos de una cuarta parte del coste de la tarea

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Todos los análisis de GPT-6.1 Sol publicados en los días posteriores al lanzamiento de Ope​nAI en el DevDay del 29 de septiembre de 2026 —incluido el de este blog— llevaban la misma salvedad: las cifras de capacidad eran del proveedor y ninguna parte externa había puntuado el modelo. Esa salvedad ha quedado obsoleta. Artificial Analysis tiene una fila de GPT-6.1 Sol en su Intelligence Index, ejecutada con el máximo esfuerzo de razonamiento, y es la primera cifra en la corta vida de este modelo que Ope​nAI no produjo. Marca 51.8 frente a 52.7 de GPT-6 Astra y 47.5 de GPT-6 Sol —una diferencia de menos de un punto con el buque insignia de $10/$50, y un salto de 4.3 puntos respecto al modelo al que reemplaza GPT-6.1 Sol. El número que hace interesante la fila es el que está al lado: la tabla pone precio a la ejecución de evaluación que hay detrás de cada puntuación, y la ejecución del índice de GPT-6.1 Sol costó $0.72 por tarea, mientras que la de Astra costó $3.26. Cuatro veces y media el dinero por 0.84 puntos es toda la comparación en una línea, y ahora es una línea medida en lugar del encuadre que un proveedor hace de ella.

La fila en sí, y sobre qué se ejecutó

A screenshot of the Artificial Analysis model page for GPT-6.1 Sol at maximum reasoning effort, headed 'GPT-6.1 Sol (max) Intelligence, Performance & Price Analysis', with a class-rank strip above the summary naming the model's Intelligence, Speed, Cost and Verbosity positions out of 221 models. The summary paragraph reports an Intelligence Index score of 52 against a median of 26 across 221 models in the class, $2.00 per million input tokens and $10.00 per million output tokens, $0.72 per task to evaluate on the Intelligence Index, and 67 tokens per second against an average of 74, with 67 million output tokens generated against a board median of 82 million; a panel to its right lists a 1M-token context window together with text-and-image input. The page names Intelligence Index v4.3.2 and its ten constituent evaluations.

Artificial Analysis publica su Intelligence Index como un compuesto de diez evaluaciones, y la versión en funcionamiento el 30 de septiembre de 2026 era la v4.3.2 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience y AA-LCR v1.1. Los tres modelos de OpenAI de este artículo se basan en esa misma versión, por lo que la comparación que aparece a continuación es homogénea de una manera en la que la propia tabla de lanzamiento de un proveedor nunca lo es. El panel también registra la fecha de lanzamiento que tiene para el modelo —2026-09-29, la fecha de DevDay— y lo evalúa en la configuración de máximo esfuerzo, que es el ajuste que la página menciona en su propio encabezado.

• Índice de inteligencia — 51,8 para GPT-6.1 Sol (max), 52,7 para GPT-6 Astra (max), 47,5 para GPT-6 Sol (max).
• Costo por tarea de índice — 0,72 $ para GPT-6.1 Sol, 3,26 $ para Astra, 1,05 $ para GPT-6 Sol. Esta es la cifra del propio tablero sobre lo que costó ejecutar una evaluación completa del índice, no una tarifa oficial.
• Tokens de salida consumidos en la ejecución — 67,2 millones para GPT-6.1 Sol, 60,0 millones para Astra, 76,8 millones para GPT-6 Sol. El propio comentario de AA califica los 67 millones como "bastante conciso" frente a una mediana del tablero de 82 millones, lo que supone una segunda victoria, más discreta, sobre el modelo al que reemplaza.
• Velocidad de salida — 66,8 tokens por segundo para GPT-6.1 Sol, 57,0 para Astra, 76,2 para GPT-6 Sol.
• Precios tal como los enumera el tablero — 2,00 $ de entrada y 10,00 $ de salida por millón de tokens para GPT-6.1 Sol, con entrada en caché a 0,10 $ y escrituras de caché a 2,50 $. Esos cuatro números coinciden exactamente con la página de precios del proveedor, que es lo menos llamativo y lo más útil de la fila: una lista independiente de las tarifas que ya citamos.

Una nota de encuadre antes de que los números se utilicen como munición. El índice de AA consta de diez evaluaciones, y las evaluaciones con las que OpenAI encabezó su propio anuncio —DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1— no están entre ellas. AA ejecuta su propia variante de AutomationBench, que no es el mismo harness que la versión de AutomationBench que citó el proveedor. Así que el registro independiente no confirma ni refuta las cuatro afirmaciones principales de la publicación de lanzamiento; mide un conjunto de tareas en gran medida diferente, y vale la pena leerlo como una segunda opinión sobre la forma del modelo más que como un veredicto sobre esas frases concretas.

Astra sigue ganando, por menos de un punto, por cuatro veces y media el dinero

A generated scoreboard titled 'GPT-6.1 Sol - the independent scoreboard', listing six rows: Intelligence Index 51.8 at maximum effort, cost per index task $0.72 against GPT-6 Astra's $3.26, output tokens on the run 67.2 million, output speed 66.8 tokens per second, price $2.00 input and $10.00 output per million tokens with cached input at $0.10, and release date September 29, 2026. A footer reads that all figures are per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.

Ambos modelos exponen una escalera de esfuerzo, y el tablero ahora ha publicado una puntuación y un coste de ejecución para cada peldaño de ambos. Puestas en paralelo, las escaleras dicen algo que la comparación de titulares por sí sola no puede: la mejor configuración de GPT-6.1 Sol no compite con la mejor de Astra. Compite con la segunda mejor de Astra.

• GPT-6.1 Sol, máx. — 51.8, $0.72 por tarea de índice. GPT-6 Astra, máx. — 52.7, $3.26.
• GPT-6.1 Sol, xhigh — 51.0, $0.39. GPT-6 Astra, xhigh — 52.4, $2.31.
• GPT-6.1 Sol, alto — 50.2, $0.32. GPT-6 Astra, alto — 50.9, $1.73.
• GPT-6.1 Sol, medio — 47.8, $0.21. GPT-6 Astra, medio — 49.6, $1.54.
• GPT-6.1 Sol, bajo — 42.1, $0.13. GPT-6 Astra, bajo — 45.8, $0.82.

Astra lidera en cada nivel, que es el resumen honesto del enfrentamiento y también la parte menos interesante de este. La parte interesante es el tipo de cambio. Si quieres la configuración de Astra más barata que supere lo mejor de GPT-6.1 Sol, es Astra en xhigh: 52,4 frente a 51,8, por $2,31 frente a $0,72. Eso es 0,56 de un punto de índice por $1,59 más por ejecución de evaluación — aproximadamente 3,2 veces el costo por menos del uno por ciento de la puntuación. Ve en la otra dirección y baja GPT-6.1 Sol a xhigh, y renuncias a 0,8 puntos mientras la factura cae a $0,39, que es 5,9 veces más barato que el xhigh de Astra y una novena parte del costo de la ejecución de máximo esfuerzo de Astra.

Hay una segunda lectura de la misma escalera que argumenta en contra de comprar Astra con el máximo esfuerzo. Los cuatro peldaños inferiores de Astra son todos más baratos que su máximo, y su xhigh está 0,29 puntos por debajo de su máximo —poco más de medio punto porcentual de puntuación a cambio de una reducción del 29 % en el coste de ejecución. Cualquier conversación de adquisición sobre este par que empiece en «Astra al máximo» y termine en «Astra cuesta 4,5 veces más» está dejando fuera de la comparación los peldaños más baratos de la propia Astra.

Seis evaluaciones son para Astra, dos son para GPT-6.1 Sol, dos empatan.

El compuesto oculta una división. Puntuado evaluación por evaluación con el máximo esfuerzo, GPT-6.1 Sol no es un Astra uniformemente un poco peor: es mejor en dos cosas y peor en seis.

• GDPval-AA — Elo 1575.1 para GPT-6.1 Sol frente a 1541.9 de Astra, una ventaja de 33 puntos en tareas de trabajo profesional. Esta es la mayor victoria independiente individual del modelo más económico.
• AA-LCR v1.1, razonamiento de contexto largo — 0.830 frente a 0.807. GPT-6.1 Sol va por delante.
• AA-Briefcase v1.1 — Elo 1564.2 frente a 1568.9. Astra por 4.7.
• AutomationBench-AA — 0.649 frente a 0.685. Astra por 3.6 puntos.
• Terminal-Bench 4.0 — 0.561 frente a 0.591. Astra por 3.0 puntos.
• SciCode — 0.542 frente a 0.565. Astra por 2.3 puntos.
• Humanity's Last Exam — 0.529 frente a 0.547. Astra por 1.8 puntos.
• AA-Omniscience — 41.5 frente a 43.4. Astra por 1.9 puntos.
• GDP.pdf y CritPt — empates absolutos en 0.310 y 0.317 respectivamente, en ambos modelos.

Dos de esas filas valen más que su posición en la lista. El margen de GDPval-AA es el único lugar donde la ventaja del modelo más barato es lo bastante grande como para sobrevivir a un cambio de harness, y recae exactamente en la carga de trabajo que sostiene la línea de posicionamiento del proveedor: trabajo profesional con abundancia de documentos. Y los dos empates exactos están en las evaluaciones con las diferencias más estrechas, lo que recuerda que una brecha compuesta de 0,84 puntos se está armando a partir de filas que, individualmente, van desde una victoria de 33 puntos hasta una derrota de 3,6 puntos.

Frente al modelo al que reemplaza, el aumento es real pero no uniforme.

La comparación que importa para cualquiera que ya esté ejecutando GPT-6 Sol en una ruta de producción es la que 6.1 Sol hace con su propio predecesor, y el historial independiente es más contundente al respecto que la publicación del proveedor. Ocho de cada diez evaluaciones mejoran. Dos retroceden.

• SciCode — GPT-6.1 Sol obtiene 0.542 donde GPT-6 Sol obtuvo 0.576. El modelo más nuevo es peor en código científico por 3.5 puntos.
• AA-LCR v1.1 — 0.830 para 6.1 Sol frente a 0.837 para GPT-6 Sol. Por un pelo, pero en la dirección equivocada, en la evaluación de contexto largo.
• AA-Omniscience — 41.5 frente a 27.1. Este es el mayor movimiento de la fila: un salto de 14.4 puntos en la evaluación de conocimiento, y la precisión en ese conjunto sube de 0.545 a 0.621.
• Tasa de alucinación en el mismo conjunto — 0.543 para GPT-6.1 Sol, por debajo de 0.601 para GPT-6 Sol y aún por encima de 0.513 de GPT-6 Astra. AA-Omniscience divide su puntuación en «lo acertó» y «confiadamente equivocado», y esa división es donde la actualización 6.1 se justifica: es un modelo significativamente menos deshonesto que Sol, y sigue siendo el más deshonesto de los tres.
• Terminal-Bench 4.0 — 0.561 frente a 0.439, una ganancia de 12.2 puntos. AA-Briefcase — 1482.8 a 1564.2 Elo. GDP.pdf — 0.248 a 0.310.

La interpretación es que esto fue una actualización de conocimientos y herramientas más que una actualización de razonamiento. Las evaluaciones que más cambiaron son las que premian saber cosas y no inventarlas; la evaluación que cayó es una acotada y técnica. Quien se haya pasado a 6.1 Sol por el ahorro de caché obtiene la mejora de conocimientos como beneficio adicional y no debería asumir que se extiende a cada arnés de pruebas que ejecute.

Dónde lo clasifica el tablero y qué está por encima

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Sol — the independent scoreboard', with both columns carrying the same six labels. Left column 'GPT-6.1 Sol (max)': Intelligence Index 51.8, cost per index task $0.72, SciCode 0.542, long-context reasoning 0.830, AA-Omniscience 41.5, hallucination rate 0.543. Right column 'GPT-6 Sol (max)': Intelligence Index 47.5, cost per index task $1.05, SciCode 0.576, long-context reasoning 0.837, AA-Omniscience 27.1, hallucination rate 0.601. A footer reads 'Figures per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.'

En el orden predeterminado del Intelligence Index de la tabla de clasificación, GPT-6 Astra con esfuerzo máximo ocupa el 7.º puesto y GPT-6.1 Sol con esfuerzo máximo ocupa el 10.º, mientras que GPT-6 Sol con esfuerzo máximo queda en el 20.º. Las nueve filas por encima de GPT-6.1 Sol son dos configuraciones de Astra, tres configuraciones de Claude Opus 5.5, una configuración de Claude Sonnet 5.5 y dos configuraciones de Claude Fable 5.1, así que el modelo al que más cerca está GPT-6.1 Sol es el buque insignia de su propia familia, y el modelo al que en realidad ha desplazado en ese orden es su propio predecesor, trece puestos más abajo.

Si se omite el ajuste de esfuerzo, el orden se comprime de una forma que importa para la planificación de costes: GPT-6.1 Sol con xhigh ocupa el puesto 13, con high el 15, con medium el 19 y con low el 35, mientras que Astra se sitúa en el puesto 14 con high, el 16 con medium y el 26 con low. En otras palabras, GPT-6.1 Sol con xhigh supera en la tabla a Astra con high, y GPT-6.1 Sol con medium supera a Astra con low. El esfuerzo es aquí una palanca más importante que la elección de modelo, al menos entre estos dos.

Qué hacer con el número, sinceramente

La afirmación del proveedor que esta fila puso a prueba era que GPT-6.1 Sol casi iguala al modelo insignia a aproximadamente una quinta parte del precio. La versión independiente de esa frase es: se queda a 0,84 puntos de índice del modelo insignia, y la ejecución de evaluación que hay detrás de su puntuación costó el 22 % de la del modelo insignia. Eso se acerca lo suficiente a la afirmación como para que nadie deba sentirse engañado por ella, y es una afirmación más contundente que «no verificado» en todos los sentidos que le importan a un comprador.

Lo que la fila no hace es poner precio a tu carga de trabajo. Una ejecución de índice es una mezcla concreta de tareas, y el número que decide una factura real es la tarifa frente a tu propio perfil de tokens — y por eso la línea de caché sigue siendo la línea que hay que modelar: los $0.10 de entrada en caché de GPT-6.1 Sol frente al $1.00 de Astra son una diferencia de diez veces que ninguna puntuación de índice toca. De nuestro lado se aplica el mismo traspaso: OrcaRouter sirve GPT-6 Astra, GPT-6 Sol y GPT-6 Luna a los propios precios de lista de OpenAI sin ningún margen añadido, así que el día que se mueva la tarifa de un proveedor, la tarifa de nuestro lado se mueve con ella en lugar de esperar a un segundo contrato. GPT-6.1 Sol no está en nuestras rutas — el catálogo público devuelve "model not found" para openai/gpt-6.1-sol hoy, y no hay forma honesta de describir un modelo que no podemos servir. Lo que una sola clave de API sí te compra ahora mismo es el par sobre el que el benchmark realmente discute — Astra para el trabajo más difícil, Sol para el volumen — con los precios de lista de los proveedores traspasados sin recargo y conmutación por error automática entre proveedores cuando uno de ellos falla.

Dos cosas afinarían esto aún más. Un segundo arnés independiente sobre el mismo modelo nos diría si la ventaja en GDPval-AA es una propiedad del modelo o de esa evaluación, y es el dato ausente más útil de la fila. Y una medición independiente del nivel de contexto largo de 272.000 tokens importaría más que otro punto compuesto, porque ahí es donde el precio de esta familia deja de ser barato.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario