
GPT-6.1 Sol vs GPT-6 Astra: 지수 1점, 요금표는 5배
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 397 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 195 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- xAISpaceXAI: Grok 4.62026-08-1244지능77코딩
GPT-6.1 Sol와 GPT-6 Astra는 같은 제품군의 중간급 모델과 플래그십으로, 출시 간격은 4주입니다 — Sol은 2026년 9월 29일, Astra는 2026년 9월 3일 — 그리고 이번 주까지 두 모델의 비교는 전적으로 OpenAI 자체 수치에 기반하고 있었습니다. 이제는 더 이상 그렇지 않습니다. Artificial Analysis가 동일한 지수 버전에서 최대 추론 노력으로 두 모델을 모두 평가했고, 그 결과 Astra에 유리한 0.84점 격차가 GPT-6.1 Sol에 유리한 평가 실행당 비용 4.5배 격차와 나란히 놓여 있습니다. 요금표에서는 그 비율이 훨씬 더 극명합니다: Astra는 입력과 출력에서 GPT-6.1 Sol의 5배, 캐시된 입력에서는 10배입니다. 이 페이지가 답하는 질문은 그 프리미엄이 손가락으로 가리킬 수 있는 무언가를 사 주는 곳은 어디이며, 단순히 이름값인 곳은 어디인가입니다.
두 모델이 무엇인지, 그리고 보드가 무엇을 측정했는지
둘 다 텍스트와 이미지를 입력받아 텍스트를 출력하며, 1,050,000토큰 컨텍스트 윈도우와 최대 128,000 출력 토큰을 갖추고, 둘 다 low, medium, high, xhigh, max의 다섯 단계 effort 래더를 제공합니다. 더 이상 지원하지 않지만, 없음 설정은 GPT-6 Sol이 여전히 허용합니다. 둘 다 파인튜닝은 지원하지 않습니다. 중요한 차이는 가격표에 나와 있는 그대로입니다: Astra는 플래그십 등급이고, GPT-6.1 Sol은 그 아래 등급의 리프레시이며, 더 새로운 모델에 대한 OpenAI 자체의 포지셔닝 문구는 "더 낮은 비용으로 복잡한 작업을 위한 near-Astra 성능"입니다.
Artificial Analysis는 그 주장을 자사의 Intelligence Index에서 점수화합니다 — 버전 v4.3.2의 10개 평가이며, 두 모델 모두 동일한 버전입니다 — 그리고 각 모델에 대해 자사가 보유한 출시일을 기록합니다. 그것은 모델 페이지가 제목에 명시하는 최대 노력 구성으로 두 모델을 모두 평가합니다. 다음은 그 비교와, 인덱스가 대신 해 주지 않는 비용 계산입니다.
• GPT-6.1 Sol — 2026-09-29 출시, 최대 노력에서 Intelligence Index 51.8, 백만 토큰당 입력 $2.00 / 캐시됨 $0.10 / 캐시 쓰기 $2.50 / 출력 $10.00.
• GPT-6 Astra — 2026-09-03 출시, 최대 노력에서 Intelligence Index 52.7, 백만 토큰당 입력 $10.00 / 캐시됨 $1.00 / 캐시 쓰기 $12.50 / 출력 $50.00.
• 둘 다 아님 — 받아들입니다: none 추론 노력; 입력이 272,000 토큰을 초과하면 둘 다 전체 요청의 입력 및 캐시 요율을 2배, 출력을 1.5배로 다시 책정합니다. Astra의 장문 컨텍스트 등급은 입력 $20.00 / 캐시됨 $2.00 / 출력 $75.00; GPT-6.1 Sol의 등급은 $4.00 / $0.20 / $15.00입니다.
• 둘 다 — Responses API를 통해 웹 검색, 파일 검색, 이미지 생성, 코드 인터프리터, 호스팅 셸, apply patch, 스킬, 컴퓨터 사용, MCP 및 도구 검색을 지원합니다.
0.84 지수 포인트, 평가 청구서의 4.5배

보드 위에 두 수치가 나란히 놓여 있고, 그 둘이 함께 전체 논증을 이룬다. 최대 노력에서 GPT-6 Astra는 52.7점을 기록한다. 최대 노력에서 GPT-6.1 Sol은 51.8점을 기록한다. 각 점수 옆에 보드는 그 뒤의 지수를 실행하는 데 든 비용도 공개한다: Astra는 작업당 $3.26, GPT-6.1 Sol은 $0.72. 한 문장으로 읽으면 — 4.5배의 비용으로 0.84점 — 이는 두 회사가 이 두 모델에 관해 공개한 수치 중 의사결정에 가장 관련성이 큰 숫자다.
두 모델은 또한 노력 사다리의 각 지점에 대한 점수도 공개하는데, 이를 통해 동일한 설정이 아니라 동일한 지출에서 비교를 실행할 수 있습니다:
• 최대 노력 — GPT-6.1 Sol 51.8, 실행당 $0.72 vs GPT-6 Astra 52.7, $3.26.
• 매우 높음 — 51.0, $0.39 vs 52.4, $2.31.
• 높음 — 50.2, $0.32 vs 50.9, $1.73.
• 중간 — 47.8, $0.21 vs 49.6, $1.54.
• 낮음 — 42.1, $0.13 vs 45.8, $0.82.

모델 전반에 걸쳐 단계를 나란히 맞춰 놓으면, 어느 벤더도 광고하지 않는 사실이 드러난다: Astra 자체의 high에서 max까지의 격차는 1.8 지수 포인트로, Astra를 max로 설정했을 때와 GPT-6.1 Sol을 max로 설정했을 때의 전체 격차의 두 배가 넘는다. 다시 말해, GPT-6.1 Sol 대신 Astra를 선택하는 것은 Astra의 high effort 대신 Astra의 max effort를 선택하는 것보다 더 적은 점수를 얻게 해준다 — 그리고 그 두 선택 중 두 번째는 첫 번째 비용의 일부만 든다. 그 1.8점에 진짜로 민감한 워크로드를 가진 사람이라면 모델 열을 확인하기 전에 effort 설정을 확인해야 한다.
Astra의 프리미엄이 여전히 가치를 발휘하는 곳
종합 점수는 근소하지만, 개별 평가는 그렇지 않다. 최대한의 노력으로 항목별로 채점했을 때, GPT-6 Astra는 10개 중 6개에서 우위를 점하며, 그 우위를 점하는 항목들은 답변하기보다 행동하기를 포함하는 항목들이다.
• AutomationBench-AA, 도구 전반에 걸친 다단계 워크플로 — Astra 0.685 대 GPT-6.1 Sol 0.649. Astra가 3.6점 앞섬.
• Terminal-Bench 4.0, 실제 환경에서의 터미널 작업 — 0.591 대 0.561. Astra가 3.0점 앞섬.
• SciCode — 0.565 대 0.542. Astra가 2.3점 앞섬.
• Humanity's Last Exam — 0.547 대 0.529. Astra가 1.8점 앞섬.
• AA-Omniscience — 43.4 대 41.5, 그리고 동일 세트에서 Astra의 환각률은 0.513으로 GPT-6.1 Sol의 0.543입니다. Astra는 더 정확할 뿐만 아니라 모른다고 말할 의향도 더 높습니다.
• AA-Briefcase v1.1, 전문적인 산출물 — Elo 1568.9 대 1564.2. Astra가 4.7 앞섬.
그 패턴은 이를 바탕으로 계획을 세울 만큼 충분히 일관적입니다: 작업이 모델로 하여금 긴 행동 연쇄를 혼동 없이 유지해야 하는 경우 — 터미널을 조작하고, 여러 도구를 사용하는 워크플로를 실행하고, 문서 형태의 결과물을 생성하는 경우 — Astra의 우위는 실제이며 여러 하네스에서 반복 가능합니다. 작업이 한 턴에 답하는 지식 질문인 경우에는 그 우위가 대부분 사라집니다.
더 저렴한 모델이 우위를 차지하는 경우, 캐시 라인을 포함하여
GPT-6.1 Sol은 일률적으로 약간 더 나쁜 Astra가 아니다. 긴 자료를 읽고 추론하는 능력을 높게 평가하는 평가들에서는 앞서고, 요금표에서는 그 지표가 결코 보지 못하는 격차로 앞선다.
• GDPval-AA, 전문 작업을 전문가 산출물과 대조해 평가 — GPT-6.1 Sol은 Elo 1575.1, Astra는 1541.9. 5분의 1 비용인 모델이 33점 앞서며, 이 항목에서 단연 가장 큰 독립적 우위다.
• AA-LCR v1.1, 장문 컨텍스트 추론 — 0.830 대 0.807. GPT-6.1 Sol이 앞선다.
• GDP.pdf — 0.310으로 완전한 동점이며, CritPt도 0.317로 마찬가지다.
• 캐시된 입력 — 100만 토큰당 $0.10, Astra는 $1.00. 에이전트 경제성을 결정하는 항목인데 지수에는 전혀 반영되지 않았다.
• 출력 속도 — 동일 평가 실행에서 초당 66.8토큰 대 56.95토큰이며, 출력 토큰은 6,720만 개를 사용해 Astra의 6,000만 개와 대비된다. 두 모델 모두 빠르지 않다. GPT-6.1 Sol이 둘 중 더 빠르다.
두 요금표 모두에 가격이 책정된 에이전트 월
안정적인 프리픽스를 다시 전송하는 워크로드를 가정해 보겠습니다: 월 4천만 개의 입력 토큰 중 85%가 캐시에서 제공되고, 여기에 출력 토큰 4백만 개가 더해집니다. GPT-6.1 Sol의 요금표에서 이는 캐시된 읽기에 $3.40, 캐시되지 않은 입력에 $12.00, 출력에 $40.00 — $55.40이 한 달 비용입니다. GPT-6 Astra의 경우, 동일한 트래픽은 캐시된 읽기에 $34.00, 캐시되지 않은 입력에 $60.00, 출력에 $200.00 — $294.00. 워크로드는 동일하지만 청구서는 5.3배 더 큽니다.
두 가지 임계값이 그 계산을 바꿔 놓으며, 둘 다 마이그레이션 결정을 내린 뒤가 아니라 내리기 전에 비용을 산정해 볼 가치가 있습니다. 첫 번째는 단일 요청의 입력 토큰 272,000개입니다. 이 선을 넘으면 요청 전체가 입력 및 캐시 요율의 두 배, 출력 요율의 1.5배로 다시 책정되며, 이에 따라 GPT-6.1 Sol은 $4.00 / $0.20 / $15.00로, Astra는 $20.00 / $2.00 / $75.00로 바뀝니다. 두 번째는 effort 단계 자체입니다. GPT-6.1 Sol을 max에서 xhigh로 낮추면 0.8포인트를 대가로 index-run 비용이 $0.72에서 $0.39로 줄어들고, Astra를 max에서 high로 낮추면 1.8포인트를 대가로 $3.26가 $1.73로 줄어듭니다. 캐시 비중이 높은 에이전트 루프에서는 effort 설정이 모델 열보다 더 큰 비용 레버이며, 이는 이 두 모델을 일반적으로 비교하는 방식과 정반대입니다.
무엇을 실행할지, 그리고 실제로 무엇을 호출할 수 있는지
증거로 볼 때, 이 분할은 마케팅이 시사하는 것보다 더 깔끔하다. 긴 행동 연쇄를 견뎌야 하는 작업 — 터미널 세션, 도구를 많이 쓰는 자동화, 환각된 문단 하나가 큰 비용을 초래하는 문서 산출물 — 은 GPT-6 Astra로 라우팅하고, 추가 1.8점이 당신의 작업에 실제로 적용된다고 측정한 것이 아니라면 max 대신 high로 실행하는 것을 고려하라. 지식 비중이 크거나 캐시 비중이 크거나 주로 읽기 위주인 모든 작업은 GPT-6.1 Sol로 라우팅하라: 전문 업무 평가에 더 강하고, 장문 컨텍스트 추론에 더 강하고, 더 빠르며, 실제 청구서를 지배하는 항목에서 5~10배 더 저렴하다.

오늘 당장 호출할 수 있는 것이 정직한 부분입니다. OrcaRouter는 GPT-6 Astra를 OpenAI 자체 정가로 제공합니다 — 입력 $10.00, 출력 $50.00, 캐시 읽기 $1.00, 캐시 쓰기 $12.50 요율에, 272K 재가격 책정 규칙까지 공급사가 공개한 그대로 정확히 전달하며 — GPT-6 Sol, GPT-6 Luna도 함께 제공합니다. GPT-6.1 Sol은 제공하지 않습니다: 공개 카탈로그는 openai/gpt-6.1-sol에 대해 "model not found"를 반환하며, 우리는 라우팅할 수 없는 모델을 설명하지 않겠습니다. 공급사 정가는 마크업 없이 그대로 전달되므로, 그 모델이 출시되는 날 우리 쪽에서는 재가격 책정 단계 없이 OpenAI의 요율로 제공됩니다. 오늘 이 맞대결에서 사용할 수 있는 쪽은 하나의 API 키 뒤에 있는 플래그십이며, 요청마다 둘 중 하나를 고르는 대신 저렴한 모델과 비싼 모델을 하나의 호출로 구성하고 싶다면 라우팅 DSL을 사용할 수 있습니다.
주목해야 할 한 가지는 이 비교에서 빠져 있는 행이다. 벤더 수치도 독립 지표도, 이 두 단계에서 당신의 자체 트래픽이 어떻게 동작할지는 알려주지 않는다. 그리고 이를 알아내는 유일하게 저렴한 방법은 페일오버가 주도권을 쥔 상태에서 동일한 작업 세트를 양쪽 모두를 통해 실행해 보는 것이다. 그 실험은 두 절반 모두 호출 가능할 때는 키 하나로 끝나는 실험이고, 그 전까지는 반쪽짜리 실험이다.
