GPT-6.1 Sol용으로 생성된 히어로 카드로, 제목은 ‘독립 점수가 도착했습니다’, 배지에는 ‘출시: 2026년 9월 29일’, ‘지능 지수: 최대 노력 시 52’, ‘지수 작업당 비용: $0.72’가 표시되어 있으며, 하단에는 ‘Artificial Analysis에 따른 독립 수치, index v4.3.2, 2026년 9월 30일 확인’이 적혀 있고, 오른쪽 아래 모서리에는 OrcaRouter 로고가 있습니다.
Guides & Insights

GPT-6.1 Sol의 첫 독립 평가 점수 공개: Astra에 0.84점 뒤지지만, 작업 비용은 4분의 1 미만

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

모든 글은 GPT-6.1 Sol에 관해 Ope​nAI의 2026년 9월 29일 DevDay 출시 이후 며칠 동안 발표되었으며 — 이 블로그도 포함해 — 같은 단서를 달고 있었다: 성능 수치는 벤더의 것이었고 어떤 제3자도 이 모델을 평가하지 않았다는 것이다. 이제 그 단서는 더 이상 유효하지 않다. Artificial Analysis는 자사의 Intelligence Index에 최대 추론 노력으로 실행한 GPT-6.1 Sol 행을 갖고 있으며, 이는 이 모델의 짧은 생애에서 Ope​nAI가 산출하지 않은 첫 번째 수치다. 이는 51.8로, 52.7을 기록한 GPT-6 Astra 및 47.5를 기록한 GPT-6 Sol과 비교된다 — 10달러/50달러 플래그십과의 격차는 1점 미만이고, GPT-6.1 Sol이 대체하는 모델보다 4.3점 상승한 것이다. 이 행을 흥미롭게 만드는 숫자는 그 옆에 있는 숫자다: 이 리더보드는 각 점수 이면의 평가 실행 비용을 산정하는데, GPT-6.1 Sol의 인덱스 실행은 작업당 0.72달러였고 Astra는 3.26달러였다. 0.84점을 위해 4.5배의 비용이 든다는 것이 이 비교의 전부를 한 줄로 보여주며, 이제 그것은 벤더의 표현이 아니라 측정된 한 줄이다.

행 자체와 그것이 실행된 대상

A screenshot of the Artificial Analysis model page for GPT-6.1 Sol at maximum reasoning effort, headed 'GPT-6.1 Sol (max) Intelligence, Performance & Price Analysis', with a class-rank strip above the summary naming the model's Intelligence, Speed, Cost and Verbosity positions out of 221 models. The summary paragraph reports an Intelligence Index score of 52 against a median of 26 across 221 models in the class, $2.00 per million input tokens and $10.00 per million output tokens, $0.72 per task to evaluate on the Intelligence Index, and 67 tokens per second against an average of 74, with 67 million output tokens generated against a board median of 82 million; a panel to its right lists a 1M-token context window together with text-and-image input. The page names Intelligence Index v4.3.2 and its ten constituent evaluations.

Artificial Analysis는 자사의 Intelligence Index를 10개 평가의 합성 지표로 공개하며, 2026년 9월 30일 기준으로 실행 중이던 버전은 v4.3.2였습니다 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1. 이 글에 등장하는 세 OpenAI 모델은 모두 같은 버전을 기반으로 하므로, 아래 비교는 벤더 자체의 출시 표에서는 결코 불가능한 방식의 동일 조건 비교입니다. 이 보드는 또한 해당 모델에 대해 보유한 출시일 — 2026-09-29, DevDay 날짜 — 을 기록하고, 페이지가 자체 제목에서 명시하는 설정인 max-effort 구성으로 이를 평가합니다.

• Intelligence Index — GPT-6.1 Sol (max)의 경우 51.8, GPT-6 Astra (max)의 경우 52.7, GPT-6 Sol (max)의 경우 47.5.
• 인덱스 작업당 비용 — GPT-6.1 Sol의 경우 $0.72, Astra의 경우 $3.26, GPT-6 Sol의 경우 $1.05. 이는 전체 인덱스 평가를 한 번 실행하는 데 든 비용에 대한 리더보드 자체의 수치이며, 요율표가 아닙니다.
• 실행에 소모된 출력 토큰 — GPT-6.1 Sol의 경우 6,720만, Astra의 경우 6,000만, GPT-6 Sol의 경우 7,680만. AA의 자체 논평에서는 6,700만을 리더보드 중앙값 8,200만과 비교해 "상당히 간결하다"고 말하는데, 이는 자신이 대체하는 모델에 대한 두 번째이자 더 조용한 승리입니다.
• 출력 속도 — GPT-6.1 Sol의 경우 초당 66.8토큰, Astra의 경우 57.0, GPT-6 Sol의 경우 76.2.
• 리더보드에 나열된 가격 — GPT-6.1 Sol의 경우 백만 토큰당 입력 $2.00 및 출력 $10.00, 캐시된 입력은 $0.10, 캐시 쓰기는 $2.50. 이 네 수치는 공급업체의 가격 페이지와 정확히 일치하는데, 이는 이 행에서 가장 극적이지 않으면서 가장 유용한 점입니다: 우리가 이미 인용한 요율의 독립적인 목록입니다.

숫자가 공격의 무기로 쓰이기 전에 한 가지 전제를 짚고 넘어가자. AA의 지수는 열 개의 평가로 구성되는데, OpenAI가 자사 발표문의 첫머리에 내세운 평가들 — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 — 은 그 안에 없다. AA는 자체 AutomationBench 변형을 운영하는데, 이는 벤더가 인용한 AutomationBench 버전과 동일한 하네스가 아니다. 따라서 독립적인 기록은 출시 게시물의 네 가지 핵심 주장을 확인하지도 반박하지도 않는다. 그것은 대체로 다른 과제 집합을 측정하며, 그 특정 문장들에 대한 평결이라기보다 모델의 형태에 대한 제2의 의견으로 읽을 가치가 있다.

Astra는 4.5배의 비용을 들이고도 1점 미만 차이로 여전히 이긴다

A generated scoreboard titled 'GPT-6.1 Sol - the independent scoreboard', listing six rows: Intelligence Index 51.8 at maximum effort, cost per index task $0.72 against GPT-6 Astra's $3.26, output tokens on the run 67.2 million, output speed 66.8 tokens per second, price $2.00 input and $10.00 output per million tokens with cached input at $0.10, and release date September 29, 2026. A footer reads that all figures are per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.

두 모델 모두 에포트 래더를 제공하며, 이제 리더보드는 두 모델의 모든 단계에 대한 점수와 실행 비용을 공개했다. 나란히 놓고 보면, 이 래더들은 단일 헤드라인 수치가 말할 수 없는 것을 말해준다: GPT-6.1 Sol의 최고 구성은 Astra의 최고 구성이다. 그것은 Astra의 두 번째로 좋은 구성과 경쟁하고 있다.

• GPT-6.1 Sol, max — 51.8, 인덱스 작업당 $0.72. GPT-6 Astra, max — 52.7, $3.26.
• GPT-6.1 Sol, xhigh — 51.0, $0.39. GPT-6 Astra, xhigh — 52.4, $2.31.
• GPT-6.1 Sol, high — 50.2, $0.32. GPT-6 Astra, high — 50.9, $1.73.
• GPT-6.1 Sol, medium — 47.8, $0.21. GPT-6 Astra, medium — 49.6, $1.54.
• GPT-6.1 Sol, low — 42.1, $0.13. GPT-6 Astra, low — 45.8, $0.82.

Astra는 모든 단계에서 앞서는데, 이는 이 맞대결에 대한 정직한 요약이며 동시에 가장 흥미롭지 않은 부분이기도 하다. 흥미로운 부분은 환율이다. GPT-6.1 Sol의 최고 성능을 이기는 가장 저렴한 Astra 구성은 xhigh의 Astra이다: 52.4 대 51.8, $2.31 대 $0.72. 이는 평가 실행당 $1.59를 더 내고 지수 포인트 0.56을 얻는 것이다 — 점수의 1퍼센트도 안 되는 차이를 위해 약 3.2배의 비용을 지불하는 셈이다. 반대 방향으로 가서 GPT-6.1 Sol을 xhigh로 낮추면, 0.8포인트를 포기하는 대신 비용은 $0.39로 떨어지는데, 이는 Astra의 xhigh보다 5.9배 저렴하고 Astra의 최대 노력 실행의 9분의 1이다.

같은 사다리에 대한 두 번째 해석은 최대 노력으로 Astra를 구매하는 것에 반대한다. Astra의 네 개 더 낮은 단은 모두 최대 단보다 저렴하며, xhigh는 최대보다 0.29점 낮다. 이는 실행 비용을 29% 줄이는 대가로 점수의 0.5%를 조금 넘게 희생하는 것에 불과하다. 이 두 제품에 관한 어떤 구매 논의든 "Astra를 최대로"에서 시작해 "Astra가 4.5배 더 비싸다"로 끝난다면, Astra 자체의 더 저렴한 단들을 비교에서 빼놓고 있는 것이다.

평가 여섯 개는 Astra로, 두 개는 GPT-6.1 Sol로, 두 개는 동점입니다

종합 점수는 분열을 감춘다. 최대 노력으로 평가별로 채점하면, GPT-6.1 Sol은 일률적으로 약간 더 나쁜 Astra가 아니다 — 두 가지에서는 더 낫고 여섯 가지에서는 더 나쁘다.

• GDPval-AA — GPT-6.1 Sol의 Elo 1575.1 대 Astra의 1541.9, 전문 업무 작업에서 33점 차이로 앞섬. 이것은 더 저렴한 모델의 가장 큰 단일 독립적 승리입니다.
• AA-LCR v1.1, 장문맥 추론 — 0.830 대 0.807. GPT-6.1 Sol이 앞섭니다.
• AA-Briefcase v1.1 — Elo 1564.2 대 1568.9. Astra가 4.7 앞섬.
• AutomationBench-AA — 0.649 대 0.685. Astra가 3.6점 앞섬.
• Terminal-Bench 4.0 — 0.561 대 0.591. Astra가 3.0점 앞섬.
• SciCode — 0.542 대 0.565. Astra가 2.3점 앞섬.
• Humanity's Last Exam — 0.529 대 0.547. Astra가 1.8점 앞섬.
• AA-Omniscience — 41.5 대 43.4. Astra가 1.9점 앞섬.
• GDP.pdf 및 CritPt — 각각 0.310과 0.317에서 두 모델 모두 완전 동점.

그 행들 중 두 개는 목록에서의 위치보다 더 가치가 있다. GDPval-AA 격차는 더 저렴한 모델의 우위가 평가 하네스 변경에도 살아남을 만큼 충분히 큰 유일한 지점이며, 그것은 정확히 공급업체의 포지셔닝 문구가 주장하는 워크로드 — 전문적이고 문서 비중이 높은 작업 — 에 해당한다. 그리고 두 개의 완전한 동점은 가장 좁은 편차를 보인 평가들에 있는데, 이는 0.84점의 종합 격차가 개별적으로는 33점 승리부터 3.6점 패배까지 분포하는 행들로부터 조립되고 있음을 상기시켜 준다.

대체하는 모델과 비교하면, 성능 향상은 실질적이지만 균일하지는 않다

프로덕션 경로에서 이미 GPT-6 Sol을 실행 중인 사람이라면 누구에게나 중요한 비교는 6.1 Sol이 자신의 전임자와 겨루는 비교이며, 독립적인 기록은 그 점에 관해 벤더의 게시물보다 더 예리하다. 평가 10개 중 8개는 개선된다. 2개는 퇴보한다.

• SciCode — GPT-6.1 Sol은 0.542점을 기록한 반면, GPT-6 Sol은 0.576점을 기록했습니다. 최신 모델은 과학 코드에서 3.5점 더 나쁩니다.
• AA-LCR v1.1 — 6.1 Sol은 0.830, GPT-6 Sol은 0.837입니다. 장문맥 평가에서 아주 근소한 차이지만, 방향은 잘못됐습니다.
• AA-Omniscience — 41.5 대 27.1. 이는 이 행에서 가장 큰 변화입니다: 지식 평가에서 14.4점 상승했고, 해당 세트의 정확도는 0.545에서 0.621로 올랐습니다.
• 동일 세트에서의 환각률 — GPT-6.1 Sol은 0.543으로, GPT-6 Sol의 0.601에서 내려갔지만 여전히 GPT-6 Astra의 0.513보다 높습니다. AA-Omniscience는 점수를 "정답"과 "확신에 찬 오답"으로 나누는데, 6.1 리프레시가 진가를 발휘하는 지점이 바로 이 구분입니다: 이는 Sol보다 의미 있게 덜 부정직한 모델이며, 여전히 세 모델 중 가장 부정직합니다.
• Terminal-Bench 4.0 — 0.561 대 0.439로 12.2점 상승. AA-Briefcase — Elo 1482.8에서 1564.2로. GDP.pdf — 0.248에서 0.310으로.

해석은 이것이 추론의 갱신이라기보다 지식과 도구의 갱신이었다는 것이다. 가장 많이 움직인 평가들은 아는 것과 지어내지 않는 것을 보상하는 평가들이고, 하락한 평가는 좁고 기술적인 하나다. 캐시 절약을 위해 6.1 Sol로 옮긴 사람은 지식 향상을 덤으로 얻는 것이며, 그것이 자신이 실행하는 모든 하네스에까지 확장된다고 가정해서는 안 된다.

보드가 그것을 어디에 순위 매기는지, 그리고 그 위에 무엇이 있는지

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Sol — the independent scoreboard', with both columns carrying the same six labels. Left column 'GPT-6.1 Sol (max)': Intelligence Index 51.8, cost per index task $0.72, SciCode 0.542, long-context reasoning 0.830, AA-Omniscience 41.5, hallucination rate 0.543. Right column 'GPT-6 Sol (max)': Intelligence Index 47.5, cost per index task $1.05, SciCode 0.576, long-context reasoning 0.837, AA-Omniscience 27.1, hallucination rate 0.601. A footer reads 'Figures per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.'

리더보드의 기본 Intelligence Index 순서에서 GPT-6 Astra는 최대 노력 설정에서 7위, GPT-6.1 Sol은 최대 노력 설정에서 10위이며, GPT-6 Sol은 최대 노력 설정에서 20위입니다. GPT-6.1 Sol 위에 있는 아홉 행은 Astra 구성 두 개, Claude Opus 5.5 구성 세 개, Claude Sonnet 5.5 구성 한 개, Claude Fable 5.1 구성 두 개입니다 — 따라서 GPT-6.1 Sol과 가장 가까운 모델은 자기 제품군의 플래그십이고, 그 순서에서 실제로 밀어낸 모델은 13계단 아래에 있는 자기 전임자입니다.

effort 설정을 빼면 순위가 비용 계획에 중요할 정도로 압축된다: GPT-6.1 Sol은 xhigh에서 13위, high에서 15위, medium에서 19위, low에서 35위인 반면, Astra는 high에서 14위, medium에서 16위, low에서 26위다. 다시 말해, GPT-6.1 Sol은 xhigh에서 Astra의 high보다 순위표에서 앞서고, GPT-6.1 Sol은 medium에서 Astra의 low보다 앞선다. 여기서는 Effort가 모델 선택보다 더 큰 레버다, 적어도 이 둘 중에서는.

그 번호를 어떻게 해야 할까, 솔직히

이 행이 검증한 공급업체의 주장은 GPT-6.1 Sol이 약 5분의 1 가격으로 플래그십과 거의 맞먹는다는 것이었습니다. 그 문장의 독립적인 버전은 다음과 같습니다. GPT-6.1 Sol은 플래그십과의 차이가 0.84 지수 포인트 이내이며, 그 점수를 뒷받침하는 평가 실행 비용은 플래그십의 22%였습니다. 이는 그 주장에 충분히 가까워서 누구도 그것에 속았다고 느낄 필요가 없으며, 구매자에게 중요한 모든 측면에서 “미검증”보다 더 강력한 진술입니다.

이 행이 하지 않는 일은 여러분의 워크로드에 가격을 매기는 것입니다. 인덱스 실행은 특정한 작업들의 조합이며, 실제 청구액을 결정하는 숫자는 여러분 자신의 토큰 프로필에 대입한 요율표입니다 — 그래서 캐시 라인이 여전히 모델링해야 할 라인인 것입니다: GPT-6.1 Sol의 캐시 입력 $0.10 대 Astra의 $1.00은 어떤 인덱스 점수도 건드리지 못하는 10배 차이입니다. 우리 쪽에도 동일한 패스스루가 적용됩니다: OrcaRouter는 GPT-6 Astra, GPT-6 Sol, GPT-6 Luna를 OpenAI 자체 정가로 마크업 없이 제공하므로, 벤더 요율이 움직이는 날 우리 쪽 요율도 함께 움직이며 별도의 계약을 기다리지 않습니다. GPT-6.1 Sol은 우리 경로에 없습니다 — 공개 카탈로그는 openai/gpt-6.1-sol에 대해 오늘 "model not found"를 반환하며, 우리가 서빙할 수 없는 모델을 정직하게 설명할 방법은 없습니다. 지금 하나의 API 키로 실제로 살 수 있는 것은 벤치마크가 진짜로 논쟁하는 그 한 쌍입니다 — 가장 어려운 작업에는 Astra, 대량 작업에는 Sol — 제공자 정가가 마크업 없이 그대로 전달되고, 제공자 중 하나에 오류가 발생하면 제공자 간 자동 페일오버가 이루어집니다.

이 점을 더욱 선명하게 만들어 줄 두 가지가 있습니다. 동일한 모델에 대한 두 번째 독립적 하네스는 GDPval-AA의 우위가 모델의 속성인지 아니면 그 평가의 속성인지 알려 줄 것이며, 이는 이 행에서 가장 유용하게 빠져 있는 단일 데이터 포인트입니다. 그리고 272,000토큰 장문맥 등급에 대한 독립적 측정은 또 하나의 종합 점수보다 더 중요할 것입니다. 왜냐하면 바로 그 지점에서 이 제품군의 가격이 더 이상 저렴하지 않게 되기 때문입니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트