GPT-6.1 Sol 대 GLM-5.3 비교를 위한 생성된 히어로 카드로, 제목은 '지수 포인트 일곱 개, 비용은 2.8배'이며, 배지에는 'GPT-6.1 Sol: 지수 작업당 $0.72', 'GLM-5.3: 지수 작업당 $2.01', 'GLM-5.3 가중치: 2026년 8월 25일부터 다운로드 가능'이라고 적혀 있고, 푸터에는 'Artificial Analysis v4.3.2 기준 독립 수치, 최대 노력; AI 생성 카드'라고 적혀 있으며, 오른쪽 아래 모서리에 OrcaRouter 로고가 있습니다.
Guides & Insights

GPT-6.1 Sol vs GLM-5.3: 가중치는 출시됐는데, 청구서는 그대로였다

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

OpenAI는 GPT-6.1 Sol을 2026년 9월 29일 DevDay 기조연설에서 공개했고, Z.ai는 GLM-5.3을 6주 앞선 2026년 8월 18일에 공개한 뒤 그 체크포인트를 일주일 동안 보류했다. 그 보류는 끝났다: zai-org/GLM-5.3은 8월 25일부터 Hugging Face에 올라와 있으며, 약 7,530억 개 파라미터 가운데 토큰당 약 400억 개가 활성화되는 BF16/FP8 체크포인트이고, 이후 다운로드 140만 건을 넘어섰다. 그리하여 8월부터 대부분의 비교가 던져온 질문 — 이것은 오픈 모델인가, 임대인가? — 에 답이 나왔지만, 그 답이 계산을 바꾸지는 못했다. 독립 리더보드에서 GPT-6.1 Sol은 51.8점을 기록하고 완료된 인덱스 작업당 $0.72가 드는 반면, GLM-5.3은 44.8점에 $2.01이 든다. 이제 토큰당 더 저렴한 모델을 소유할 수 있으면서도 완료된 작업 하나당 거의 세 배를 더 지불하게 된 것이다.

각 모델이 실제로 무엇인지

GPT-6.1 Sol은 Open​AI의 중급형 GPT-6 모델로, GPT-6 Astra 플래그십보다 한 단계 아래이고 저가형 GPT-6 Luna보다 위입니다. 1,050,000토큰 컨텍스트 창과 128,000토큰 출력 상한, 2026년 4월 30일 지식 컷오프를 갖추고 있으며 텍스트, 이미지, 파일을 입력으로 받습니다. 추론은 low에서 max까지 실행되며 기본값은 medium입니다; GPT-6 Sol이 허용했던 none 및 minimal 값은 이제 오류를 반환하며, Open​AI의 자체 마이그레이션 지침에서는 개발자에게 low로 대체하라고 안내합니다. 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $10.00이며, 캐시된 입력은 $0.10입니다.

GLM-5.3은 소프트웨어 엔지니어링과 장기 지평 에이전틱 작업을 위한 Z.ai의 현행 플래그십으로, GLM-5.2와 동일한 전문가 혼합(mixture-of-experts) 기반 위에 구축되었으며, 성능 향상은 더 큰 모델이 아니라 후속 학습(post-training)에서 비롯됩니다. 텍스트 입력, 텍스트 출력 방식으로 — 어떤 가격에서도 비전 기능은 없습니다 — 1M 토큰 윈도우, 128,000 토큰 출력 상한을 갖추고 있으며 사고(thinking) 기능이 영구적으로 켜져 있습니다. 비추론 모드가 없으며, 이는 지연 시간에 민감한 호출에 있어 엄격한 제약입니다. Z.ai는 백만 토큰당 입력 $1.40, 출력 $4.40에 캐시 입력 $0.26으로 책정하고 있으며, 자체 카탈로그에서는 입력 $1.26, 출력 $3.96에 캐시 읽기 $0.234로 제공하므로, 벤더의 가격표가 더 보수적인 수치이며 논의의 기준으로 삼아야 할 값입니다.

요율표, 그리고 그것을 뒤집는 선

각 차원당 한 줄, 각 줄에 양쪽 모두:

• 입력 — GPT-6.1 Sol 100만당 $2.00 vs GLM-5.3 100만당 $1.40; GLM이 30% 더 저렴
• 출력 — GPT-6.1 Sol 100만당 $10.00 vs GLM-5.3 100만당 $4.40; GLM이 56% 더 저렴
• 캐시 입력 — GPT-6.1 Sol 100만당 $0.10 vs GLM-5.3 100만당 $0.26; 순서가 뒤바뀌어 Sol이 2.6배 더 저렴
• 장문맥 조항 — GPT-6.1 Sol은 입력 토큰 272,000 초과 시 전체 요청 가격을 입력 및 캐시 2배, 출력 1.5배로 재책정 vs GLM-5.3은 공개 카드에 이에 상응하는 조항 없음
• 컨텍스트 및 출력 — 입력 1,050,000 / 출력 128,000 vs 입력 1M / 출력 128,000; 5% 차이로 미미함
• 모달리티 — 텍스트, 이미지, 파일 입력, 텍스트 출력 vs 텍스트 전용
• 추론 하한 — GPT-6.1 Sol 낮음, 중간(기본값), 높음, xhigh, 최대 vs GLM-5.3 항상 켜짐, 낮출 하한 없음
• 가중치 — 비공개, API 전용 vs 공개, 다운로드 가능, FP8
• 독립 점수, 최대 노력 기준 Artificial Analysis v4.3.2 — 51.8 vs 44.8
• 인덱스 작업당 독립 비용 — $0.72 vs $2.01
• 인덱스 실행을 위한 출력 토큰 — 6,700만 vs 2억 1,000만

img src="2.png" alt="'GPT-6.1 Sol vs GLM-5.3 - 스코어보드'라는 제목의 생성된 2단 비교 스코어보드. 왼쪽 열 'GPT-6.1 Sol': 행은 '지능 지수: 51.8', '지수 작업당 비용: $0.72', '입력 가격: 1M당 $2.00', '출력 가격: 1M당 $10.00', '지수 실행 시 출력 토큰: 67M', '가중치: 비공개'. 오른쪽 열 'GLM-5.3': 행은 '지능 지수: 44.8', '지수 작업당 비용: $2.01', '입력 가격: 1M당 $1.40', '출력 가격: 1M당 $4.40', '지수 실행 시 출력 토큰: 210M', '가중치: Hugging Face에 공개'. 하단에는 'Artificial Analysis v4.3.2의 최대 노력 기준 독립 수치; 공급업체 정가.'라고 적혀 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 있습니다." /> 그 마지막 두 항목이 이번 맞대결의 승부를 결정하는 지점이며, 결코 미세한 효과가 아닙니다.

A generated two-column comparison scoreboard titled 'GPT-6.1 Sol vs GLM-5.3 - the scoreboard'. Left column 'GPT-6.1 Sol': rows reading 'Intelligence Index: 51.8', 'Cost per index task: $0.72', 'Input price: $2.00 per 1M', 'Output price: $10.00 per 1M', 'Output tokens on index run: 67M', 'Weights: closed'. Right column 'GLM-5.3': rows reading 'Intelligence Index: 44.8', 'Cost per index task: $2.01', 'Input price: $1.40 per 1M', 'Output price: $4.40 per 1M', 'Output tokens on index run: 210M', 'Weights: open on Hugging Face'. A footer reads 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.' The OrcaRouter logo sits in the bottom-right corner.

2억 1천만 토큰 문제

Artificial Analysis는 리더보드의 모든 모델에 동일한 10개 평가 스위트를 실행하고 각 점수의 근거가 되는 토큰 수를 공개한다. GLM-5.3은 실행을 완료하면서 약 2억 1천만 개의 출력 토큰을 생성했다. GPT-6.1 Sol은 6천7백만 개를 생성했다. 리더보드에서 각 모델의 비교 클래스와 대조해 보면, GLM-5.3의 2억 1천만은 약 1억 4천만인 클래스 중앙값을 웃도는 반면, Sol의 6천7백만은 점수가 매겨지는 플래그십 클래스의 대략 8천1백만 중앙값을 크게 밑돈다. 출력은 모든 요금표에서 비싼 쪽이므로, GLM-5.3의 출력 항목에 대한 대표적인 56% 할인은 측정과 맞닥뜨리면 유지되지 않는다: 토큰은 3.1×로 내보내면서 가격은 0.44×이고, 3.1 × 0.44는 1.37이다 — GLM-5.3은 실질적으로 더 저렴한 요금표에도 불구하고 이 워크로드에서는 더 비싼 모델이다.

보드 자체의 작업당 비용 수치는 방향과 대략적인 규모를 확인해 준다. $2.01 대 $0.72는 2.8배로, 토큰 비율만으로 시사되는 것보다 더 큰데, GLM-5.3이 작업당 입력 및 캐시 항목에서도 더 많은 비용을 지불하기 때문이다. 이것이 무엇을 증명하고 무엇을 증명하지 않는지는 정확히 짚을 가치가 있다: 인덱스 실행은 10개의 고정 평가이며, 그 평가에서의 장황함은 여러분의 트래픽에서의 장황함과 같지 않다. 하지만 구매자에게 토큰은 청구되는 대상이고, 모델이 긴 답변을 생성해야 하는 모든 작업 세트에서 차이의 형태는 동일하다.

부분 상쇄분은 캐시 입력 항목이다. GLM-5.3의 캐시 읽기는 $1.40 기준가 대비 $0.26이고, GPT-6.1 Sol의 캐시 읽기는 $2.00 기준가 대비 $0.10이다. Sol은 안정적인 프리픽스가 있는 모든 워크로드를 좌우하는 요율에서 2.6배 우위를 점한다. 트래픽이 한 문단짜리 답변이 딸린 대규모 고정 코퍼스라면 GLM-5.3이 단연 더 저렴한 선택지이므로 그것을 택해야 한다. 트래픽이 이 두 모델이 모두为目标으로 만들어진 트래픽, 즉 에이전트 루프, 리포지토리 규모 편집, 긴 생성 출력과 비슷하다면, 캐시 입력 이점은 3배 토큰 비율에 비하면 잡음 수준으로 줄어든다.

공급업체 번호가 어디에 들어가는지

Z.ai의 출시 수치는 강력하며, 언제나 그렇듯 재현되지 않았다. Terminal-Bench 2.1은 88.2, DeepSWE v1.1은 66.9, CyberGym은 84.5, ExploitBench는 54.4, AutomationBench는 48.2, GDPval-AA v2는 1769 Elo. 두 번 읽어볼 가치가 있는 단 하나의 수치는 Terminal-Bench 3.0의 28.3이다 — 후속 벤치마크이자, 이전 벤치마크에서의 88.2에 대한 정정이다. 모델은 포스트트레이닝이 겨냥한 벤치마크에서는 뛰어날 수 있지만, 같은 벤치마크의 차세대 버전에서는 평범할 수 있다.

Open​AI의 GPT-6.1 Sol 출시 수치는 원시 점수가 아니라 완료된 작업당 비용을 중심으로 전적으로 구성되어 있다: DeepSWE v1.1은 더 낮은 추론 노력으로 GPT-6 Sol의 최고 기록을 6.4퍼센트 포인트 앞섰고, AutomationBench 1.0.6은 중간 노력에서 Claude Opus 5.5보다 2.2포인트 높았으며, OSWorld 2.0은 최대 노력에서 GPT-6 Sol보다 7포인트 올랐고, Terminal-Bench Science 0.1은 작업당 비용 절반 이하로 GPT-6 Sol을 두 배 이상 능가했다. 이는 모두 Open​AI의 하네스에서, Open​AI의 설정으로, Open​AI의 선정된 벤치마크 세트에서 나온 결과이며, 그중 어느 것도 독립적으로 재현된 바 없다.

두 공급업체가 공개한 세트 사이의 중복은 적고, 이용 가능한 유일한 직접 비교는 동일한 벤치마크에 관한 것입니다: Z.ai는 DeepSWE v1.1에서 66.9를 보고하고, Open​AI는 GPT-6 Sol — 6.1이 대체하는 모델 — 에 대해 68.8을 보고하며, 6.1 Sol이 자체 전임 모델 대비 6.4포인트 향상되었다고 보고합니다. 공급업체가 보고한 비교에서는 2포인트 차이이고, Open​AI 자체 델타에서는 대략 6포인트 차이입니다. 이는 통제된 비교에 가깝고, 독립 위원회가 말하는 바를 그대로 말해 줍니다: 능력 면에서는 거의 동등하지만, 작업을 끝내는 데 드는 비용에서는 큰 격차가 있습니다.

하나의 API, 아니면 두 개의 계약

두 모델 모두 OrcaRouter에 있으며, 이것이 이 조합에서 이례적인 부분입니다. GPT-6.1 Sol은 출시 당일 OpenAI 자체 정가로 카탈로그에 등록되었습니다 — 백만 토큰당 $2.00 및 $10.00, 캐시 입력 $0.10, 272,000토큰 구간의 $4.00 및 $15.00 단계도 공급업체가 명시한 그대로 전달됩니다 — 그리고 GLM-5.3은 $1.26 및 $3.96, 캐시 읽기 $0.234로 그 옆에 자리합니다. 어느 쪽에도 추가 금액은 붙지 않습니다. 플랫폼은 제공업체의 정가를 변경 없이 그대로 전달하기 때문에, 공급업체의 가격 인하가 리셀러가 재협상한 뒤가 아니라 같은 날 우리 쪽에 나타납니다.

A screenshot of the OrcaRouter model page for z-ai/glm-5.3, showing the listing dated 2026-08-18, the model described as Z.ai (Zhipu AI)'s latest flagship for complex software engineering and long-horizon agentic tasks, a 1M-token context with 128K maximum output, text in and text out, and the pass-through list price of $1.26 input and $3.96 output per million tokens, with the page's own pricing tabs and a 4.00 s median time to first token visible.

이 특정 조합에서는 대부분의 경우보다 이것이 더 중요하다. 둘 중 하나를 선택하는 문제는 "어느 쪽이 더 나은가"가 아니라, 여러분 자신의 출력 길이에 대한 임계값이며, Z.ai가 요금표를 개편하거나 OpenAI가 6.1 티어의 티어 경계를 바꾸는 순간 그 임계값은 움직일 것이다. 두 모델을 하나의 키 뒤에 두고, 둘 사이의 자동 페일오버와 배포가 아니라 구성에서 바꾸는 라우팅 규칙을 함께 두는 것이야말로, 임계값을 놓고 논쟁하는 대신 실제 트래픽에서 그 임계값을 시험해 볼 수 있게 해준다. Sol의 캐시 라인이 여러분의 워크로드에서 이긴다면 그것으로 라우팅하고, 여러분의 답변 길이가 짧게 유지되어 컨텍스트 절벽이 없는 GLM-5.3의 정액 요금제가 그 구간에서 이긴다면 대신 그것으로 라우팅하라 — 같은 키, 두 번째 계약도, 두 번째 청구서도 없다.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

오늘 꼭 하나를 골라야 한다면, 어느 거죠?

• 긴 생성 출력, 에이전트 루프, 출력이 많은 작업 — GPT-6.1 Sol, 그리고 토큰 수를 적용하면 격차는 거의 3배에 이릅니다. 여기서는 요금표가 거짓말을 하고 측정은 그렇지 않습니다.
• 안정적인 프리픽스, 짧은 답변 — GLM-5.3. 캐시된 입력 및 입력 요금이 정말로 더 낫고 장황함이 발목을 잡을 기회가 없습니다.
• 272,000 입력 토큰을 초과하는 모든 요청 — GLM-5.3. GPT-6.1 Sol은 그 경계에서 전체 요청의 가격을 다시 매기지만 GLM-5.3의 요금표에는 이에 상응하는 단계가 없기 때문입니다.
• 이미지나 문서를 시각적 입력으로 사용하는 모든 것 — GPT-6.1 Sol. GLM-5.3은 텍스트 전용이며 이 부분에서는 격차가 큽니다.
• 자체 경계 내에서의 추론, 또는 공급업체 약관 변경에 대한 대비 — GLM-5.3, 그리고 이제 다운로드는 약속된 것이 아니라 실제로 존재합니다. 하드웨어 예산을 잡으세요: 체크포인트는 대형 FP8 아티팩트이며 자체 호스팅은 API 결정이 아니라 자본 결정입니다.
• 지연에 민감한 호출 — 둘 다 주의 없이는 어렵습니다. GLM-5.3은 추론을 끌 방법이 없고, GPT-6.1 Sol은 최소 수준이 낮음, 그리고 독립 보드에서 자체 첫 토큰까지의 시간은 보드 중앙값 3.7에 대해 332초로 측정되었습니다.

이 글에서 비교한 모델3

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트