'GPT-6.1 Sol vs GPT-6 Astra — 점수판'이라는 제목의 생성된 2열 비교 스코어보드. 왼쪽 열 'GPT-6.1 Sol': '지능 지수: 51.8 (최대)', '지수 작업당 비용: $0.72', '입력: 1M당 $2.00', '캐시된 입력: 1M당 $0.10', '출력: 1M당 $10.00', '출시: 2026년 9월 29일' 행. 오른쪽 열 'GPT-6 Astra': '지능 지수: 52.7 (최대)', '지수 작업당 비용: $3.26', '입력: 1M당 $10.00', '캐시된 입력: 1M당 $1.00', '출력: 1M당 $50.00', '출시: 2026년 9월 3일' 행. 바닥글: '지수 수치는 Artificial Analysis, Intelligence Index v4.3.2 기준, 2026년 9월 30일 조회; 가격은 OpenAI가 공개한 요금표 기준.'
Guides & Insights

GPT-6.1 Sol vs GPT-6 Astra: 지수 1점, 요금표는 5배

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

GPT-6.1 Sol와 GPT-6 Astra는 같은 제품군의 중간급 모델과 플래그십으로, 출시 간격은 4주입니다 — Sol은 2026년 9월 29일, Astra는 2026년 9월 3일 — 그리고 이번 주까지 두 모델의 비교는 전적으로 Ope​nAI 자체 수치에 기반하고 있었습니다. 이제는 더 이상 그렇지 않습니다. Artificial Analysis가 동일한 지수 버전에서 최대 추론 노력으로 두 모델을 모두 평가했고, 그 결과 Astra에 유리한 0.84점 격차가 GPT-6.1 Sol에 유리한 평가 실행당 비용 4.5배 격차와 나란히 놓여 있습니다. 요금표에서는 그 비율이 훨씬 더 극명합니다: Astra는 입력과 출력에서 GPT-6.1 Sol의 5배, 캐시된 입력에서는 10배입니다. 이 페이지가 답하는 질문은 그 프리미엄이 손가락으로 가리킬 수 있는 무언가를 사 주는 곳은 어디이며, 단순히 이름값인 곳은 어디인가입니다.

두 모델이 무엇인지, 그리고 보드가 무엇을 측정했는지

둘 다 텍스트와 이미지를 입력받아 텍스트를 출력하며, 1,050,000토큰 컨텍스트 윈도우와 최대 128,000 출력 토큰을 갖추고, 둘 다 low, medium, high, xhigh, max의 다섯 단계 effort 래더를 제공합니다. 더 이상 지원하지 않지만, 없음 설정은 GPT-6 Sol이 여전히 허용합니다. 둘 다 파인튜닝은 지원하지 않습니다. 중요한 차이는 가격표에 나와 있는 그대로입니다: Astra는 플래그십 등급이고, GPT-6.1 Sol은 그 아래 등급의 리프레시이며, 더 새로운 모델에 대한 OpenAI 자체의 포지셔닝 문구는 "더 낮은 비용으로 복잡한 작업을 위한 near-Astra 성능"입니다.

Artificial Analysis는 그 주장을 자사의 Intelligence Index에서 점수화합니다 — 버전 v4.3.2의 10개 평가이며, 두 모델 모두 동일한 버전입니다 — 그리고 각 모델에 대해 자사가 보유한 출시일을 기록합니다. 그것은 모델 페이지가 제목에 명시하는 최대 노력 구성으로 두 모델을 모두 평가합니다. 다음은 그 비교와, 인덱스가 대신 해 주지 않는 비용 계산입니다.

• GPT-6.1 Sol — 2026-09-29 출시, 최대 노력에서 Intelligence Index 51.8, 백만 토큰당 입력 $2.00 / 캐시됨 $0.10 / 캐시 쓰기 $2.50 / 출력 $10.00.
• GPT-6 Astra — 2026-09-03 출시, 최대 노력에서 Intelligence Index 52.7, 백만 토큰당 입력 $10.00 / 캐시됨 $1.00 / 캐시 쓰기 $12.50 / 출력 $50.00.
• 둘 다 아님 — 받아들입니다: none 추론 노력; 입력이 272,000 토큰을 초과하면 둘 다 전체 요청의 입력 및 캐시 요율을 2배, 출력을 1.5배로 다시 책정합니다. Astra의 장문 컨텍스트 등급은 입력 $20.00 / 캐시됨 $2.00 / 출력 $75.00; GPT-6.1 Sol의 등급은 $4.00 / $0.20 / $15.00입니다.
• 둘 다 — Responses API를 통해 웹 검색, 파일 검색, 이미지 생성, 코드 인터프리터, 호스팅 셸, apply patch, 스킬, 컴퓨터 사용, MCP 및 도구 검색을 지원합니다.

0.84 지수 포인트, 평가 청구서의 4.5배

A screenshot of the Artificial Analysis model page for GPT-6.1 Sol at maximum reasoning effort, with a class-rank strip above the summary naming the model's Intelligence, Speed, Cost and Verbosity positions out of 221 models, a summary paragraph reporting an Intelligence Index score of 52 against a class median of 26, $2.00 per million input tokens and $10.00 per million output tokens, $0.72 per task to evaluate on the Intelligence Index, and 67 tokens per second against a class average of 74. A lower band on the same page states that Intelligence Index v4.3.2 incorporates ten evaluations and lists them.

보드 위에 두 수치가 나란히 놓여 있고, 그 둘이 함께 전체 논증을 이룬다. 최대 노력에서 GPT-6 Astra는 52.7점을 기록한다. 최대 노력에서 GPT-6.1 Sol은 51.8점을 기록한다. 각 점수 옆에 보드는 그 뒤의 지수를 실행하는 데 든 비용도 공개한다: Astra는 작업당 $3.26, GPT-6.1 Sol은 $0.72. 한 문장으로 읽으면 — 4.5배의 비용으로 0.84점 — 이는 두 회사가 이 두 모델에 관해 공개한 수치 중 의사결정에 가장 관련성이 큰 숫자다.

두 모델은 또한 노력 사다리의 각 지점에 대한 점수도 공개하는데, 이를 통해 동일한 설정이 아니라 동일한 지출에서 비교를 실행할 수 있습니다:

• 최대 노력 — GPT-6.1 Sol 51.8, 실행당 $0.72 vs GPT-6 Astra 52.7, $3.26.
• 매우 높음 — 51.0, $0.39 vs 52.4, $2.31.
• 높음 — 50.2, $0.32 vs 50.9, $1.73.
• 중간 — 47.8, $0.21 vs 49.6, $1.54.
• 낮음 — 42.1, $0.13 vs 45.8, $0.82.

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Astra — the scoreboard', with both columns carrying the same six labels. Left column 'GPT-6.1 Sol': Intelligence Index (max) 51.8, cost per index task $0.72, input $2.00 per 1M, cached input $0.10 per 1M, output $10.00 per 1M, released September 29, 2026. Right column 'GPT-6 Astra': Intelligence Index (max) 52.7, cost per index task $3.26, input $10.00 per 1M, cached input $1.00 per 1M, output $50.00 per 1M, released September 3, 2026. A footer reads that index figures are per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026, and prices per OpenAI's published rate cards.

모델 전반에 걸쳐 단계를 나란히 맞춰 놓으면, 어느 벤더도 광고하지 않는 사실이 드러난다: Astra 자체의 high에서 max까지의 격차는 1.8 지수 포인트로, Astra를 max로 설정했을 때와 GPT-6.1 Sol을 max로 설정했을 때의 전체 격차의 두 배가 넘는다. 다시 말해, GPT-6.1 Sol 대신 Astra를 선택하는 것은 Astra의 high effort 대신 Astra의 max effort를 선택하는 것보다 더 적은 점수를 얻게 해준다 — 그리고 그 두 선택 중 두 번째는 첫 번째 비용의 일부만 든다. 그 1.8점에 진짜로 민감한 워크로드를 가진 사람이라면 모델 열을 확인하기 전에 effort 설정을 확인해야 한다.

Astra의 프리미엄이 여전히 가치를 발휘하는 곳

종합 점수는 근소하지만, 개별 평가는 그렇지 않다. 최대한의 노력으로 항목별로 채점했을 때, GPT-6 Astra는 10개 중 6개에서 우위를 점하며, 그 우위를 점하는 항목들은 답변하기보다 행동하기를 포함하는 항목들이다.

• AutomationBench-AA, 도구 전반에 걸친 다단계 워크플로 — Astra 0.685 대 GPT-6.1 Sol 0.649. Astra가 3.6점 앞섬.
• Terminal-Bench 4.0, 실제 환경에서의 터미널 작업 — 0.591 대 0.561. Astra가 3.0점 앞섬.
• SciCode — 0.565 대 0.542. Astra가 2.3점 앞섬.
• Humanity's Last Exam — 0.547 대 0.529. Astra가 1.8점 앞섬.
• AA-Omniscience — 43.4 대 41.5, 그리고 동일 세트에서 Astra의 환각률은 0.513으로 GPT-6.1 Sol의 0.543입니다. Astra는 더 정확할 뿐만 아니라 모른다고 말할 의향도 더 높습니다.
• AA-Briefcase v1.1, 전문적인 산출물 — Elo 1568.9 대 1564.2. Astra가 4.7 앞섬.

그 패턴은 이를 바탕으로 계획을 세울 만큼 충분히 일관적입니다: 작업이 모델로 하여금 긴 행동 연쇄를 혼동 없이 유지해야 하는 경우 — 터미널을 조작하고, 여러 도구를 사용하는 워크플로를 실행하고, 문서 형태의 결과물을 생성하는 경우 — Astra의 우위는 실제이며 여러 하네스에서 반복 가능합니다. 작업이 한 턴에 답하는 지식 질문인 경우에는 그 우위가 대부분 사라집니다.

더 저렴한 모델이 우위를 차지하는 경우, 캐시 라인을 포함하여

GPT-6.1 Sol은 일률적으로 약간 더 나쁜 Astra가 아니다. 긴 자료를 읽고 추론하는 능력을 높게 평가하는 평가들에서는 앞서고, 요금표에서는 그 지표가 결코 보지 못하는 격차로 앞선다.

• GDPval-AA, 전문 작업을 전문가 산출물과 대조해 평가 — GPT-6.1 Sol은 Elo 1575.1, Astra는 1541.9. 5분의 1 비용인 모델이 33점 앞서며, 이 항목에서 단연 가장 큰 독립적 우위다.
• AA-LCR v1.1, 장문 컨텍스트 추론 — 0.830 대 0.807. GPT-6.1 Sol이 앞선다.
• GDP.pdf — 0.310으로 완전한 동점이며, CritPt도 0.317로 마찬가지다.
• 캐시된 입력 — 100만 토큰당 $0.10, Astra는 $1.00. 에이전트 경제성을 결정하는 항목인데 지수에는 전혀 반영되지 않았다.
• 출력 속도 — 동일 평가 실행에서 초당 66.8토큰 대 56.95토큰이며, 출력 토큰은 6,720만 개를 사용해 Astra의 6,000만 개와 대비된다. 두 모델 모두 빠르지 않다. GPT-6.1 Sol이 둘 중 더 빠르다.

두 요금표 모두에 가격이 책정된 에이전트 월

안정적인 프리픽스를 다시 전송하는 워크로드를 가정해 보겠습니다: 월 4천만 개의 입력 토큰 중 85%가 캐시에서 제공되고, 여기에 출력 토큰 4백만 개가 더해집니다. GPT-6.1 Sol의 요금표에서 이는 캐시된 읽기에 $3.40, 캐시되지 않은 입력에 $12.00, 출력에 $40.00 — $55.40이 한 달 비용입니다. GPT-6 Astra의 경우, 동일한 트래픽은 캐시된 읽기에 $34.00, 캐시되지 않은 입력에 $60.00, 출력에 $200.00 — $294.00. 워크로드는 동일하지만 청구서는 5.3배 더 큽니다.

두 가지 임계값이 그 계산을 바꿔 놓으며, 둘 다 마이그레이션 결정을 내린 뒤가 아니라 내리기 전에 비용을 산정해 볼 가치가 있습니다. 첫 번째는 단일 요청의 입력 토큰 272,000개입니다. 이 선을 넘으면 요청 전체가 입력 및 캐시 요율의 두 배, 출력 요율의 1.5배로 다시 책정되며, 이에 따라 GPT-6.1 Sol은 $4.00 / $0.20 / $15.00로, Astra는 $20.00 / $2.00 / $75.00로 바뀝니다. 두 번째는 effort 단계 자체입니다. GPT-6.1 Sol을 max에서 xhigh로 낮추면 0.8포인트를 대가로 index-run 비용이 $0.72에서 $0.39로 줄어들고, Astra를 max에서 high로 낮추면 1.8포인트를 대가로 $3.26가 $1.73로 줄어듭니다. 캐시 비중이 높은 에이전트 루프에서는 effort 설정이 모델 열보다 더 큰 비용 레버이며, 이는 이 두 모델을 일반적으로 비교하는 방식과 정반대입니다.

무엇을 실행할지, 그리고 실제로 무엇을 호출할 수 있는지

증거로 볼 때, 이 분할은 마케팅이 시사하는 것보다 더 깔끔하다. 긴 행동 연쇄를 견뎌야 하는 작업 — 터미널 세션, 도구를 많이 쓰는 자동화, 환각된 문단 하나가 큰 비용을 초래하는 문서 산출물 — 은 GPT-6 Astra로 라우팅하고, 추가 1.8점이 당신의 작업에 실제로 적용된다고 측정한 것이 아니라면 max 대신 high로 실행하는 것을 고려하라. 지식 비중이 크거나 캐시 비중이 크거나 주로 읽기 위주인 모든 작업은 GPT-6.1 Sol로 라우팅하라: 전문 업무 평가에 더 강하고, 장문 컨텍스트 추론에 더 강하고, 더 빠르며, 실제 청구서를 지배하는 항목에서 5~10배 더 저렴하다.

A screenshot of the OrcaRouter model catalogue filtered to the query gpt-6, headed '3 models - 1 providers - one API key, one bill', showing three OpenAI cards side by side: openai/gpt-6-luna described as the fast, cost-efficient model in the GPT-6 series, openai/gpt-6-sol described as the cost-efficient high-end model positioned below the flagship, and openai/gpt-6-astra described as the flagship for demanding long-horizon work. Each card carries vision, tools and reasoning tags and a base-rate block; the GPT-6 Astra card reads $10.00 input, $50.00 output, $1.00 cache read and $12.50 cache write per million tokens.

오늘 당장 호출할 수 있는 것이 정직한 부분입니다. OrcaRouter는 GPT-6 Astra를 OpenAI 자체 정가로 제공합니다 — 입력 $10.00, 출력 $50.00, 캐시 읽기 $1.00, 캐시 쓰기 $12.50 요율에, 272K 재가격 책정 규칙까지 공급사가 공개한 그대로 정확히 전달하며 — GPT-6 Sol, GPT-6 Luna도 함께 제공합니다. GPT-6.1 Sol은 제공하지 않습니다: 공개 카탈로그는 openai/gpt-6.1-sol에 대해 "model not found"를 반환하며, 우리는 라우팅할 수 없는 모델을 설명하지 않겠습니다. 공급사 정가는 마크업 없이 그대로 전달되므로, 그 모델이 출시되는 날 우리 쪽에서는 재가격 책정 단계 없이 OpenAI의 요율로 제공됩니다. 오늘 이 맞대결에서 사용할 수 있는 쪽은 하나의 API 키 뒤에 있는 플래그십이며, 요청마다 둘 중 하나를 고르는 대신 저렴한 모델과 비싼 모델을 하나의 호출로 구성하고 싶다면 라우팅 DSL을 사용할 수 있습니다.

주목해야 할 한 가지는 이 비교에서 빠져 있는 행이다. 벤더 수치도 독립 지표도, 이 두 단계에서 당신의 자체 트래픽이 어떻게 동작할지는 알려주지 않는다. 그리고 이를 알아내는 유일하게 저렴한 방법은 페일오버가 주도권을 쥔 상태에서 동일한 작업 세트를 양쪽 모두를 통해 실행해 보는 것이다. 그 실험은 두 절반 모두 호출 가능할 때는 키 하나로 끝나는 실험이고, 그 전까지는 반쪽짜리 실험이다.