GPT-6 Astra vs Solar Pro 4라고 적힌 타이틀 카드, 부제는 '12개의 인덱스 포인트, 한쪽에는 512K 윈도, 그리고 일요일에 바뀌는 가격 비율', 발치에 가격표가 달린 두 개의 빛나는 큐브 기계를 그린 생성 일러스트 위에.
Guides & Insights

GPT-6 Astra vs Solar Pro 4: 12개 지수 포인트와 일요일에 바뀌는 가격 비율

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 두 모델에 공통인, 독립적으로 진행된 두 평가에서 GPT-6 Astra는 Solar Pro 4를 일반 지식에서는 큰 차이로, 실제로 모델이 사용되는 영역에서는 더 좁은 차이로 앞섭니다. Artificial Analysis는 GPT-6 Astra를 Intelligence Index에서 54.7, GPQA Diamond에서 96.1로 평가합니다. 같은 평가 기관은 Solar Pro 4를 42와 86.8로 평가합니다. 에이전트 작업에서는 격차가 Terminal-Bench 2.1과 τ²-Banking에서 각각 11점과 6점으로 줄어듭니다. 한편 가격 이야기에는 거의 아무도 주목하지 않은 마감 시한이 따라붙어 있습니다: Solar Pro 4의 현재 프로모션은 00:00 UTC에 종료되며, 그 날짜는 2026년 10월 11일 일요일, 그때 이 모델은 백만 입력 토큰당 $0.09에서 $0.15로, 백만 출력 토큰당 $0.36에서 $0.60로 바뀝니다. 따라서 이 비교가 답해야 할 질문은 어느 모델이 더 나은가가 아닙니다. 약 12.5점의 능력 격차가 출력 요금의 42배에서 139배를 정당화하는지이며, 그 답은 두 모델 중 어느 쪽의 속성이라기보다 여러분의 워크로드의 속성입니다.

이번 주말에 바뀌는 것까지 포함한 요금표들

Solar Pro 4의 정가는 입력 100만 토큰당 $0.30, 캐시 입력 $0.06, 출력 $1.20이며, Upstage는 출시 이후 줄곧 정가보다 낮은 가격으로 운영해 왔습니다. Upstage 자체 가격 페이지의 요금표는 명확하므로, 예산을 어느 숫자에 맞춰야 할지 추측할 필요가 없습니다:

• 2026년 10월 11일 00:00 UTC까지 진행되는 Upstage 프로모션 — 100만 토큰당 입력 $0.09, 캐시 $0.018, 출력 $0.36br /> • 2026년 10월 11일 이후 Upstage 프로모션 — 100만 토큰당 입력 $0.15, 캐시 $0.03, 출력 $0.60, 종료일이 명시되지 않은 가격이므로 이에 맞춰 예산을 책정해야 함br /> • Upstage 정가 — 100만 토큰당 입력 $0.30, 캐시 $0.06, 출력 $1.20br /> • GPT-6 Astra 최대 272,000 입력 토큰 — 100만 토큰당 입력 $10.00, 캐시 $1.00, 캐시 쓰기 $12.50, 출력 $50.00br /> • GPT-6 Astra 272,000 입력 토큰 초과 — 100만 토큰당 입력 $20.00, 캐시 $2.00, 캐시 쓰기 $25.00, 출력 $75.00, 임계값을 초과하면 요청 전체에 적용됨

비율로 보면, Solar Pro 4의 프로모션 이후 요금 기준으로 입력에서 11배, 출력에서 5.6배이고, 정가와 비교하면 33배와 42배이며, 오늘의 프로모션 수치로 두 모델을 측정하면 111배와 139배다. 격차가 그렇게 큰 이유는 분수의 양쪽이 모두 움직이기 때문이다. Astra의 카드는 시장의 최상단에 있고 Solar Pro 4는 현재 그 최하단 근처에 있다.

장문 컨텍스트 규칙은 두 번 읽어볼 가치가 있는 또 다른 항목입니다. 왜냐하면 이 규칙은 대칭적이지 않기 때문입니다. Astra의 임계값은 272,000토큰에 있고, 그 규칙은 요청 전체 재과금입니다. 즉 긴 요청의 모든 토큰에 입력 2배, 출력 1.5배가 청구되며, 경계를 넘어선 토큰만 그런 것이 아닙니다. Upstage의 요금표에는 이에 상응하는 단계가 없으므로, 400,000토큰 Solar Pro 4 요청은 4,000토큰 요청과 정확히 동일한 토큰당 요율로 청구됩니다. 프롬프트가 일상적으로 25만 토큰을 넘는다면 Astra의 실효 입력 요율은 $10.00이 아니라 $20.00이며, 지불하는 격차는 512K 컨텍스트 모델이 경쟁하는 바로 그 워크로드에서 더 벌어집니다.

12점 격차는 어디에서 비롯되는가

두 모델 모두 서드파티 수치를 갖추고 있어 이 티어의 대부분보다 비교가 더 쉽습니다. 두 모델을 관통하는 패턴은 일관됩니다: Solar Pro 4가 자체 전작 대비 얻은 향상은 에이전트 작업에 집중되었고, 바로 그 지점에서 Astra에 가장 가깝습니다.

• 인텔리전스 지수 — GPT-6 Astra 54.7, Solar Pro 4 42br /> • GPQA Diamond, 대학원 수준 과학 — Astra 96.1, Solar Pro 4 86.8br /> • Terminal-Bench 2.1, 실제 터미널 조작 — Astra 88.4, Solar Pro 4 75.1br /> • τ²-Banking, 정책에 반하는 도구 사용 — Astra 41.4, Solar Pro 4 35.0br /> • 장문맥 회상, AA-LCR — Astra 80.7, Solar Pro 4 71br /> • 평균 평가 작업 실행 비용 — Astra $0.0516, Solar Pro 4 $0.0039에서 $0.0155 사이br /> • 평가 작업당 실제 소요 시간 — Astra 약 8.6분, 초당 약 70토큰을 반환하는 모델 기준

태스크 비용 항목이 논쟁을 다시 정리하는 대목이다. Solar 4에서 어려운 평가 태스크 하나를 실행하는 비용은 어떤 티어가 적용되는지에 따라 4~13센트인 반면, 표준 요율의 Astra에서는 5센트다. ‘출력 가격 42배’와 ‘태스크당 비용 13배’는 모두 같은 두 모델 쌍에 대해 사실이며, 청구서에 나타나는 숫자는 두 번째다. 차이는 Astra가 Artificial Analysis의 측정에 따르면 Solar 4의 전신보다 더 적은 토큰으로 답에 도달한다는 점이다 — 태스크당 43,000토큰 — 그리고 여전히 태스크를 끝내는 데 더 비싼 모델이지만, 42배 더 비싼 것과는 거리가 멀다.

Solar Pro 4 열에 관한 두 가지 주의사항이 있습니다. 이 모델은 더 적은 토큰을 사용하면서도 작업당 실제 소요 시간(wall-clock) 기준으로는 Astra보다 느립니다. 또한 공개된 에이전트 점수에는 알아둘 만한 특이점이 있습니다. 전작의 평가에서 Solar Pro 4는 주로 답변을 거부함으로써 정직성 점수를 크게 끌어올렸는데, 질문의 41%만 시도한 반면 Pro 3는 92%를 시도했습니다. 행동해야 하는 에이전트에게 거부는 자신감 있게 틀린 답변보다 종종 더 낫습니다. 하지만 이는 모든 통과율 비교를 읽는 방식을 바꿉니다.

Comparison card with two columns. GPT-6 Astra: Intelligence Index 54.7, $10.00/$50.00 per 1M, long-context tier $20.00/$75.00 above 272K in, cached input $1.00, 1,050,000 context and 128,000 max output, Terminal-Bench 2.1 88.4. Solar Pro 4: Intelligence Index 42, promotion $0.09/$0.36 to 11 October 2026, then $0.15/$0.60, list $0.30/$1.20, 512,000 context and 128,000 max output, Terminal-Bench 2.1 75.1

어느 벤더의 카드도 제공해 주지 않는 비교

위의 벤치마크 행들은 서로 일치합니다. 각 측은 동일한 평가를 실행했습니다. 흥미로운 것은 빠져 있는 행들인데, 두 공급업체가 무엇을 공개할지에 대해 의견이 다르기 때문입니다.

• 추론 노력(reasoning effort) — Astra는 다섯 개의 명명된 수준(low, medium, high, xhigh, max)을 제공하며, Solar Pro 4는 최소한 medium 설정을 포함하는 reasoning_effort 파라미터를 문서화하고 있고, 이 단계에 관한 Upstage의 자료는 빈약합니다br /> • 아키텍처 — Astra의 파라미터 수는 공개되지 않았으며, Solar Pro 4의 파라미터 수도 공개되지 않았습니다. 따라서 어느 쪽도 더 저렴한 형제 모델들이 제공하는 서빙 경제성 공개를 제공하지 않습니다br /> • 부하 상황에서의 긴 컨텍스트 동작 — Astra는 비용 임계값과 문서화된 회수(recall) 점수를 공개하며, Upstage는 윈도우만 공개하고 자체적인 회수 평가는 없습니다br /> • 입력 표면 — Astra는 텍스트, 이미지, 파일을 받으며, Solar Pro 4는 텍스트 모델입니다br /> • 모달리티 상한 — 양쪽 모두 최대 출력 토큰이 128,000개로, 이는 저렴한 모델이 동등 수준에 도달하기에는 이례적인 지점이며, 긴 생성 작업에 있어 Solar Pro 4의 스펙표에서 가장 유용한 단일 항목입니다

reasoning-effort 항목은 겉보기보다 훨씬 중요하다. 사고 예산을 낮출 수 있게 해주는 모델은 쉬운 요청당 실효 가격이 대표 요금보다 훨씬 낮은 모델이다. 왜냐하면 추론이 필요 없는 작업에서는 더 적은 추론 토큰에 대해서만 비용을 내기 때문이다. 두 공급업체 모두 이 매개변수를 제공하지만, 각 수준이 토큰으로 얼마의 비용을 뜻하는지는 어느 쪽도 공개하지 않는다. 따라서 이 두 모델 사이의 실제 배수를 알아내는 유일한 방법은 자신의 트래픽에서 측정하는 것이다.

Text card headed 'Cost per token is not cost per finished task' with rows: average evaluation task $0.0516 on GPT-6 Astra and $0.0039-$0.0155 on Solar Pro 4; input $0.09 vs $10.00 per 1M; output $0.36 vs $50.00 per 1M; roughly 8.6 minutes wall clock per task on GPT-6 Astra

손익분기점, 간단히 말하면

잠시 인덱스 포인트는 무시하고 워크로드를 고정해 두자. 애플리케이션이 최대 50만 토큰에 달하는 문서에 대한 추출, 분류, 요약 또는 구조화된 출력이라면, Solar Pro 4는 Astra가 따라올 수 없는 속도로 작업을 수행하며, 추론 사다리가 전혀 필요하지 않습니다 — JSON 추출 작업에서 그럴듯한 품질 차이가 출력에서 42배의 가치가 있는 경우는 없습니다. 애플리케이션이 계획을 세우고, 도구를 호출하고, 실패한 단계에서 복구하며, 반드시 완료해야 하는 장기 지평 에이전트라면, 11점의 Terminal-Bench 격차와 6점의 τ²-Banking 격차가 완료 여부를 예측하는 수치이며, 실패한 에이전트 실행은 실행 전체 가격에 재시도 비용을 더한 비용이 발생합니다.

진정으로 어려운 경우는 중간이다: 짧고 어렵고 단발성인 추론 작업으로, 여기서 Astra의 GPQA 우위는 크고 작업당 비용은 여전히 몇 센트에 불과하다. 그곳에서 결정 요인은 요금표가 아니라 토큰 수이며, 그것에 답하는 유일한 측정은 두 모델 모두에 자신의 프롬프트를 실행하고 사용량을 읽는 것이다. 또한 가격 인하가 가장 강하게 작용하는 경우이기도 하다. 왜냐하면 더 저렴한 모델이 더 비싼 모델과 비교해 시험되는 모델이고, 더 저렴한 모델의 요율에서 67% 변동은 월요일과 오늘 사이에 시험의 산술을 바꾸기 때문이다.

Text card headed 'Which tier gets your traffic' with rows mapping extraction and summarisation to Solar Pro 4, single-shot hard reasoning to GPT-6 Astra decided on tokens per answer, long-horizon agent runs to GPT-6 Astra on Terminal-Bench 2.1 88.4 vs 75.1, and prompts beyond 272K tokens to either with Astra repricing the whole request to $20.00/$75.00

이것이 구매 주문이 아니라 라우팅 결정인 이유

GPT-6 Astra는 OrcaRouter 카탈로그에 openai/gpt-6-astra로 등록되어 있으며, OpenAI 자체 정가에 0% 마크업만 붙여 그대로 제공됩니다. 바로 이것이 이런 비교가 계약이 아니라 규칙으로 귀결되는 이유입니다. Upstage의 Solar 제품군은 경우가 다르며, 저희가 늘 쓰는 솔직한 표현을 그대로 인용하자면 이렇습니다: OrcaRouter는 어떤 Upstage 모델도 라우팅하지 않으므로 Solar Pro 4는 여기서 이용할 수 없습니다 — 이 모델은 Upstage 자체 API와 여러 서드파티 플랫폼에서 제공되며, 위의 가격표는 저희 것이 아니라 그들의 것입니다.

이 페어링에서 라우터가 실제로 맡는 역할은 티어 분할입니다. 저렴한 모델과 비싼 모델은 하나의 OpenAI 호환 엔드포인트 뒤에 있고, 라우팅 규칙은 추출 트래픽을 적합한 티어로 보내며, 자동 페일오버는 저렴한 모델이 오류를 내거나 파서가 거부하는 출력을 반환할 때 호출을 더 강력한 모델로 승격합니다. 그 마지막 메커니즘이 이 비교가 만들어내는 오라우팅 위험에 대한 실질적인 해답입니다. 비용이 많이 드는 실패 모드는 잘못된 모델을 선택하는 것이 아니라, 잘못된 모델을 선택하고 그 비용을 두 번 치르는 것입니다.

일요일 전에 해야 할 일

Solar Pro 4가 여러분의 스택 후보라면, 이번 주가 그것을 테스트할 수 있는 가장 저렴한 주입니다. 프로모션 요금은 10월 11일 00:00 UTC까지 유지되며, 프로모션 이후 요금인 $0.15와 $0.60은 이미 정가보다 3분의 1 낮고, 모델이 직접 공개한 증거 — Terminal-Bench와 τ²-Banking 수치 — 는 여러분이 자신의 태스크 세트에서 한나절이면 재현할 수 있는 작업을 말해 줍니다. 두 모델을 동일한 프롬프트에서 실행하고, 추론 설정을 일정하게 유지하며, 호출당 토큰이 아니라 완료된 작업당 토큰을 기록하세요. 거기서 나오는 숫자가 중요한 유일한 배수이며, 그것은 42×가 아닐 것입니다. 그런 다음, 더 저렴한 쪽이 이기면 테스트하던 가격이 일요일에 만료된다는 점, 더 비싼 쪽이 이기면 여러분이 지불하는 것이 바로 그 12.5 지수 포인트라는 점을 알고 결정하세요.

GPT-6 Astra는 OrcaRouter 카탈로그에 openai/gpt-6-astra로 등록되어 있으며, OpenAI 자체 정가로 0% 마크업 없이 그대로 제공됩니다.