GPT-6.1 Sol 대 DeepSeek V4 Pro를 위한 생성된 히어로 카드로, 제목은 '세 개의 잣대, 세 가지 다른 답변'이며, 세 개의 지표 카드에는 '혼합 가격 4배', '지수 작업당 비용 1.07배', '인텔리전스 지수 16점'이 적혀 있고, '하나는 독점 모델이며 이미지를 본다. 다른 하나는 MIT 라이선스 오픈 웨이트이며 텍스트 전용이다.'라는 문구가 있으며, 푸터에는 '가격은 OpenAI 및 DeepSeek 기준, 지수 및 작업당 비용 수치는 Artificial Analysis 기준이며, 이는 오픈 웨이트 모델과 독점 모델을 서로 다른 피어 그룹에서 비교한다.'가 적혀 있고, 오른쪽 아래 모서리에는 OrcaRouter 로고가 있다.
Guides & Insights

GPT-6.1 Sol vs DeepSeek V4 Pro: 세 개의 미터, 세 가지 다른 답변

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

얼마나 차이가 나는지 물어보면 GPT-6.1 Sol과 DeepSeek V4 Pro 사이에는, 솔직한 답은 어느 척도를 보느냐에 달려 있고, 그 세 척도는 대부분의 모델 비교가 모든 것에 대해 엇갈리는 것보다 더 크게 서로 어긋난다. 백만 토큰당 가격에서 입력 대 출력 3:1 비율로 혼합하면, 둘은 $4.00 대 $0.99, 즉 네 배 차이다. 동일한 평가 스위트를 실행하는 데 실제로 든 비용에서는 과제당 $0.72 대 $0.67, 즉 7퍼센트 차이다. Artificial Analysis Intelligence Index에서는 51.8 대 36, 즉 16점인데, 이는 결정적처럼 들리지만 각 수치가 누구와 비교되었는지 보기 전까지는 그렇다. 왜냐하면 그 평가자의 자체 방법론은 두 모델을 서로 다른 리그에 놓기 때문이다. GPT-6.1 Sol은 2026년 9월 29일에 입력 $2.00, 출력 $10.00, 1,050,000토큰 창으로 출시되었다. DeepSeek V4 Pro는 MIT 라이선스의 전문가 혼합(Mixture-of-Experts) 플래그십으로, 매개변수 1조 6,000억 개에 활성 490억 개이며, 2026년 8월 13일에 $0.66 및 $1.98, 1,048,576토큰 창으로 출시되었다. 하나는 다운로드할 수 있는 텍스트 모델이다. 다른 하나는 이미지를 본다. 세 척도 중 실제로 어느 것을 기준으로 방향을 잡아야 하는지 가려내는 것이 바로 이 일의 전부다.

인덱스 행은 보이는 것과 같은 비교가 아닙니다

가장 많이 인용되는 숫자부터 시작하겠습니다. 바로 그 숫자가 가장 자주 잘못 인용되기 때문입니다.

Artificial Analysis는 리더보드와 함께 자사의 방법론을 공개하는데, 여기서 중요한 문장이 두 개 있습니다. 오픈 웨이트 모델은 같은 크기 등급의 다른 오픈 웨이트 모델과만 비교된다고 합니다 — 초소형, 소형, 중형, 대형이며, 경계는 1,500억 파라미터입니다. 독점 모델은 대신 가격대 전반에서 비교되며, 입력 대 출력 비율을 3:1로 혼합해 평가합니다. 이 둘은 서로 다른 비교 대상 집단입니다. DeepSeek V4 Pro 0813은 오픈 웨이트입니다 — 평가기관의 자체 FAQ가 그렇게 밝히며 공개된 것을 가리킵니다 — 그리고 총 1.6조 파라미터로 오픈 웨이트 대형 등급에 속합니다. GPT-6.1 Sol은 독점 모델이며 자체 가격대의 모델들을 상대로 채점됩니다.

따라서 같은 표의 인접한 행에 나란히 있는 51.8과 36은 일대일 맞대결이 아니다. 그것들은 하나의 피어 세트에 대한 점수와 또 다른 피어 세트에 대한 점수이며, 바로 그렇기 때문에 작업별 비용 수치는 비교할 수 있지만 원시 지수 숫자는 비교할 수 없다. DeepSeek V4 Pro가 다운로드 가능한 모델치고 좋은지 알고 싶다면, 36이 그 답을 제시하는 숫자다. 호스팅된 프런티어 모델을 상대로 어떻게 하는지 알고 싶다면, 지수 열은 알려주지 않을 것이며, 이 경우 정직한 선택은 51.8에서 36을 빼고 그것을 격차라고 부르는 대신 그렇다고 말하는 것이다.

깔끔하게 비교할 수 있는 것: 가격 카드, 컨텍스트 및 출력 한도, 모달리티 목록, 그리고 동일한 평가 스위트를 실행하는 비용 — 마지막 수치는 점수가 아니라 동일한 작업을 계산한 것이기 때문이다.

원시 미터가 말해 주는 것

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, credited to DeepSeek and dated 2026-04-24, showing the model identifier, text-only input with tools, JSON and reasoning, a 1M-token context window with a 384K maximum output, and a rate row reading $0.66 input and $1.98 output per million tokens alongside a 1.92-second median latency and a 1030.7M seven-day traffic figure.

• 입력 가격 — 백만 토큰당 GPT-6.1 Sol $2.00 vs DeepSeek V4 Pro $0.66

• 출력 가격 — GPT-6.1 Sol $10.00 대 DeepSeek V4 Pro $1.98, 평일 두 개의 4시간 UTC 시간대 안에서 $1.32와 $3.96으로 단계적 변경

• 캐시 읽기 — GPT-6.1 Sol $0.10 vs DeepSeek V4 Pro 백만 토큰당 $0.022; 둘 다 캐시를 지원하며, 저렴한 쪽이 다시 4.5배 더 저렴

• 인덱스 작업당 비용 — GPT-6.1 Sol $0.72 vs DeepSeek V4 Pro $0.67

• 인덱스 스위트에서 생성된 출력 토큰 — GPT-6.1 Sol 67M vs DeepSeek V4 Pro 160M

• 최대 출력 — DeepSeek V4 Pro 384,000 토큰 vs GPT-6.1 Sol 128,000 토큰

• 모달리티 — GPT-6.1 Sol은 텍스트, 이미지, 파일을 입력받고, DeepSeek V4 Pro는 텍스트만 입력받습니다

네 번째와 다섯 번째 줄이 흥미로운 짝이다. DeepSeek V4 Pro는 동일한 스위트에서 2.4배 더 많은 토큰을 출력하고도 작업당 7% 더 저렴하게 끝낸다. 출력 단가가 GPT-6.1 Sol의 5분의 1이기 때문이다. 이것이 단가가 아니라 출력량을 측정할 때 가격 주도형 모델이 보이는 모습이다. 장황함은 실재하지만, 그 이점을 지우지는 않는다. 타이밍 윈도가 별표(*)다. 평일의 4시간 블록 두 개 — 일주일 168시간 중 40시간 — 는 표시 단가를 $1.32와 $3.96으로 두 배로 올리며, 그 할증은 그렇지 않았다면 두 카드 중 어느 쪽에서든 가장 저렴했을 동일한 토큰들에 적용된다.

더 저렴한 모델이 하지 않는 것

세 가지입니다. 그리고 각각은 타협이 아니라 확고한 한계입니다.

이 모델은 보지 못합니다. DeepSeek V4 Pro는 텍스트 입력, 텍스트 출력입니다. 스크린샷, 스캔한 PDF, 차트 판독, 티켓 속 다이어그램은 전혀 다루지 못합니다. 컴퓨터 사용 및 문서 중심 워크플로——GPT-6.1 Sol이 정확히 겨냥하는 워크로드——는 어떤 가격에서도 선택할 수 없습니다. 파이프라인에서 이미 이미지를 비전 모델로 라우팅하고 있다면 이는 문제가 되지 않습니다. 그렇지 않다면 이것이 결정적 제약입니다.

이것은 계획을 세울 수 있는 릴리스 주기를 갖고 있지 않다. "deepseek-v4-pro"라는 이름은 8월부터 0813 빌드를 가리켜 왔고, 거기까지 오는 과정은 조용하지 않았다: 벤더는 해당 빌드의 지원 종료를 9월 14일자로 발표했다가 그 날짜 이틀 전에 발표를 철회했으며, 요금은 그대로 둔 채 API를 계속 제공했다. 우리 자체 카탈로그에도 여전히 동일한 컨텍스트, 출력 상한, 동시성 한도로 플래그십으로 올라 있다. 이틀 만에 지원 중단 발표를 철회할 수 있는 벤더는 철회하지 않기로 할 수도 있다. 운영상 얻을 교훈은 이 모델이 불안정하다는 것이 아니라 그 이름이 하나의 포인터라는 점이며, 동작을 라우트 이름이 아니라 빌드 식별자에 고정하는 것이 값싼 보험이다.

그것은 주변 지식을 함께 담고 있지 않다. GPT-6.1 Sol은 나온 지 8일밖에 되지 않았는데도 이미 독립적인 구성 하나가 공개되어 있다. DeepSeek V4 Pro는 평가 이력이 더 길고 실무자 기반도 훨씬 크며, 공개된 서빙 스택과 서드파티 처리량 관련 작업까지 포함한다. 셀프 호스팅 배포에서는 그런 자료가 인덱스 행보다 더 가치가 있다. 벤치마크가 아니라 자신의 하드웨어에서 모델이 이상하게 동작할 때 참고하는 것이 바로 그것이기 때문이다.

4배 더 저렴한 계량기가 잘못된 계량기일 때

저렴한 모델이 모든 면에서 단순히 더 나쁘다면, 이 글은 짧았을 것이다. 난처한 사실은 두 모델이 동일한 작업에서 태스크당 7% 차이 나고, 거기에 도달하기 위해 쓰는 양은 2.4배 차이 난다는 점이다. 즉, 4배라고 말하는 혼합 토큰 미터는 당신이 대부분 지불하지 않는 차이를 측정하고 있다. 왜냐하면 당신이 결코 보내지 않을 수도 있는 토큰 구성을 가격에 반영하기 때문이다. 그리고 16포인트라고 말하는 인덱스 미터는 두 피어 그룹에 걸쳐 측정하므로 서로 뺄 수 없다.

따라서 실질적인 구분은 "어려운 작업에는 최전선 모델, 쉬운 작업에는 저렴한 모델"이 아닙니다. 그것은 모달리티 구분이자 볼륨 구분입니다. 이미지가 들어간 것은 무엇이든 GPT-6.1 Sol로 가고, 답변은 짧지만 추론이 비용이 많이 드는 부분인 경우도 마찬가지입니다. 이 모델의 다섯 가지 노력 수준(낮음부터 최대까지, 기본값은 중간)을 활용하면 장문을 사지 않고도 추론을 살 수 있으며, $0.10의 캐시된 입력 덕분에 길게 반복되는 프롬프트가 저렴해집니다. 텍스트 전용이고, 볼륨이 크며, 더 긴 답변을 허용하는 모든 것 — 분류, 추출, 요약, 384,000토큰 출력 예산에 맞춘 대량 생성 — 은 DeepSeek V4 Pro로 가며, 이상적으로는 두 UTC 윈도우 밖에서 처리하는 것이 좋습니다.

둘 다 키 하나에 있고, 분할은 설정 한 줄입니다

두 모델 모두 OrcaRouter에서 각 제공업체가 공개한 자체 요율로 제공되며, 추가 비용은 없습니다: GPT-6.1 Sol은 $2.00 / $10.00, 272,000 프롬프트 토큰 초과 시 $4.00 / $15.00으로 인상되며, DeepSeek V4 Pro는 $0.66 / $1.98에 나열된 대로 두 개의 시간대가 적용됩니다. 하나의 키, 하나의 청구서, 둘 다를 위한 하나의 OpenAI 호환 엔드포인트.

그것이 바로 위의 분할을 두고 논쟁하기보다 기록해 둘 가치가 있는 이유입니다. 모달리티 분할은 라우팅 규칙으로 표현할 수 있으므로, 이미지가 포함된 요청은 비전 모델로 가고 대량 텍스트는 애플리케이션 변경 없이 저렴한 모델로 갑니다. 경로가 저하되면 호출을 실패시키는 대신 페일오버가 호출을 이동시킵니다. 그리고 둘 다 같은 엔드포인트에 있기 때문에, 실제로 중요한 가격 비교 — 여러분의 트래픽에서, 여러분의 토큰 구성으로 — 는 벤치마크 스위트의 평균이 아니라 여러분 자신의 청구서에서 산출할 수 있습니다.

A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window, 128,000 max output tokens, an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.A generated scoreboard titled 'GPT-6.1 Sol vs DeepSeek V4 Pro — the scoreboard' showing two columns on six shared rows: input price $2.00 against $0.66 per million tokens; output price $10.00 against $1.98; cache read $0.10 against $0.022; cost per index task $0.72 against $0.67; maximum output 128,000 against 384,000 tokens; modalities text, image and file against text only. A footer reads 'Prices per OpenAI and DeepSeek as listed on OrcaRouter; cost-per-task figures per Artificial Analysis, whose index compares open-weights and proprietary models in different peer groups.'

한 줄로 말하자면, 판정은 네 배 더 저렴하다는 해석은 불신해야 할 쪽이고 7퍼센트라는 해석은 확인해야 할 쪽이라는 것이다. 네 배는 당신이 보내지 않을 수도 있는 토큰 구성에 대해 혼합 측정기가 말하는 값이다. 7퍼센트는 동일한 평가가 둘 모두에서 치른 비용이며, 여기에는 2.4배의 장황함 차이가 이미 내재되어 있다. 16포인트는 실제다. 다만 그것은 두 피어 그룹에 걸쳐 있고, 이 조합의 대부분 배포를 실제로 결정하는 제약은 숫자가 전혀 아니다. 이 모델들 중 하나는 스크린샷을 읽을 수 있고 다른 하나는 읽지 못한다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트