
Grok 4.7 vs DeepSeek V4 Pro: 하나는 새롭고, 다른 하나는 당신 몰래 교체되고 있다
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026년 9월 10일에 게시된 한 노트가 이 비교의 초점을 바꾼다. "우리는 V4-Pro를 단계적으로 폐지하고 있습니다"라고 그 글은 말하며, 2026년 9월 14일 04:00 UTC부터 deepseek-v4-pro 모델 문자열로 들어오는 모든 요청은 V4.1-Flash 요금으로 DeepSeek-V4.1-Flash에 라우팅된다 — 게시물에 따르면 이 상황은 "V4.1-Pro가 출시될 때까지" 계속된다. 모델 문자열은 여전히 응답한다. 그 뒤에 있는 모델은 당신이 벤치마크한 모델이 아니다. 그로 인해 벤더가 2026년 9월 21일, 이 글이 작성되기 하루 전에 출시한 Grok 4.7과의 정면 비교는 한쪽에 만료일이 붙은 비교가 된다. 존재하는 수치상으로는 Grok 4.7이 더 강력한 모델이고 DeepSeek V4 Pro가 더 저렴한 쪽이다. 실제로 통합을 결정하는 문제에 관해서는, 둘 중 하나만이 여전히 자신이 말하는 바로 그 모델이다.
점수 전에 각 모델이 무엇인지
DeepSeek V4 Pro는 4월 24일 프리뷰를 거쳐 2026년 8월 13일 DeepSeek-V4-Pro-0813 체크포인트로 정식 출시되었습니다. MIT 라이선스의 오픈 웨이트로 — 이 라이선스는 매출 임계값이나 지역별 예외 조항 없이 상업적 사용, 수정 및 재배포를 허용합니다 — GA 모델 카드상 총 1.7조 개 파라미터, 100만 토큰 컨텍스트 윈도우, 384K 최대 출력을 갖추고 있으며, 이는 이번 비교에서 가장 큰 출력 상한입니다. 텍스트 전용입니다: DeepSeek 자체 가격 페이지에 따르면 v4-pro에서는 비전이 지원되지 않으며, 이는 스크린샷이나 PDF를 입력하는 사람에게 실질적인 제한입니다. low, high, max의 추론 노력 다이얼을 제공하며, 계정당 동시 요청 500개로 제한되고 요청 시 확장이 가능합니다.
Grok 4.7은 가중치가 비공개이며 출시된 지 하루밖에 되지 않았다. 500k 토큰 컨텍스트 — DeepSeek의 절반 — 를 갖추고, 텍스트와 이미지를 입력받으며, 자체적인 노력 조절 다이얼을 돌린다. 정가는 200k 프롬프트 토큰 미만에서 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $6.00이며, 해당 임계값 이상에서는 $4.00와 $12.00로 두 배가 된다. 캐시 읽기 요금은 $0.50와 $1.00이다. xAI는 또한 출력 속도가 약 두 배이고 가격도 두 배인 더 빠른 변형을 기재한다. 여기에서 확인한 문서에는 어느 공급업체도 Grok 4.7의 최대 출력 수치를 공개하지 않으므로, 그 차원은 동일한 것으로 보지 말고 알 수 없는 것으로 취급해야 한다.
공유 인덱스에서는 격차가 한 방향으로 치우쳐 있습니다.
두 모델 모두 Artificial Analysis Intelligence Index v4.3.2에서 채점되었으며, 이는 2026년 9월 19일에 게시된 개정판입니다. Grok 4.7의 열은 xhigh effort에서 측정되었고, DeepSeek의 열은 max effort에서의 0813 체크포인트입니다. 두 결과를 함께 놓고 보면, 종합 격차는 이 두 모델이 얼마나 서로 다르게 형성되어 있는지를 제대로 드러내지 못합니다.
• 종합 — Grok 4.7: Artificial Analysis Intelligence Index v4.3.2에서 46점. DeepSeek V4 Pro 0813: 동일 버전에서 36점.
• 터미널 에이전트 — Grok 4.7: Terminal-Bench 4.0 26. DeepSeek V4 Pro: 14. 자율 소프트웨어 작업에 가장 근접한 평가에서 거의 두 배에 달합니다.
• 자동화 — Grok 4.7: AutomationBench-AA 66%. DeepSeek V4 Pro: 57%. 둘 다 신뢰할 만한 수치이며, Grok이 9%p 앞선다.
• 지식과 환각 — Grok 4.7: AA-Omniscience 32. DeepSeek V4 Pro: 1. 이것은 이 보드에서 이상치이며, 반올림 오류가 아닙니다 — 이 지수는 모델이 아는 것과 모델이 알지 못할 때 얼마나 자주 답을 지어내는지를 모두 평가합니다.
• 긴 컨텍스트 — Grok 4.7: AA-LCR v1.1 77%, 윈도우 500k. DeepSeek V4 Pro: 80%, 윈도우 1M. DeepSeek이 확실히 앞서는 단 하나의 지점이며, 바로 1M 윈도우가 겨냥해 만들어진 축이다.
• 고난도 추론 — Grok 4.7: HLE 43, CritPt 18. DeepSeek V4 Pro: HLE 41, CritPt 18. 물리 벤치마크에서는 동점이며 HLE에서는 Grok이 2점 앞선다.
• 장황함 — Grok 4.7: 인덱스를 실행하는 데 2억 4천만 출력 토큰이 필요하며, 비정상적으로 장황하다고 플래그 지정되었습니다. DeepSeek V4 Pro: 1억 6,300만. 둘 다 말이 많지만, Grok이 더 말이 많습니다.

가격 이야기는 하나의 숫자가 아니라 일정표입니다.
DeepSeek의 가격 책정은 그것의 가장 공격적인 부분이자, 견적을 내기에 가장 불안정한 부분이다. deepseek-v4-pro의 정가 요율은 오프피크 시간대에 캐시 미스 기준 입력 토큰 100만 개당 $0.66, 출력 토큰 100만 개당 $1.98이다. 피크 시간대에는 이들이 두 배로 올라 $1.32와 $3.96이 된다. 피크 시간은 DeepSeek 자체 문서에 따르면 UTC 기준 월요일부터 금요일까지 01:00–04:00 및 06:00–10:00이며, 중국 공휴일은 제외된다. 그 외 모든 시간은 주말 전체를 포함해 정확히 절반 가격의 오프피크이다. 캐시된 입력 읽기가 진짜 핵심이다. 오프피크 $0.022, 피크 $0.044로, 캐시 미스보다 30배 저렴하며, 이는 캐시가 잘 된 DeepSeek 워크로드를 요율표가 암시하는 것보다 훨씬 저렴하게 만든다.
그에 반해 Grok 4.7의 $2.00과 $6.00은 비싸 보입니다 — 대략 DeepSeek의 오프피크 입력 요금의 3배, 오프피크 출력 요금의 3배입니다. 비교 격차는 알아둘 만한 방식으로 좁아집니다. Grok 4.7의 가격은 시간대에 따라 달라지기보다 해당 가격대 내에서 일정하므로, 09:00 UTC 프로덕션 스파이크가 일요일 밤 배치와 같은 비용이 듭니다; DeepSeek은 그렇지 않습니다. 그리고 200k 프롬프트 토큰을 넘으면 Grok 4.7은 두 배가 되는데, 이때 DeepSeek의 오프피크 요금의 3배가 아니라 4~6배가 됩니다. 깔끔하게 말하자면: DeepSeek V4 Pro는 모든 축에서 더 저렴한 모델이고, 할인 폭은 언제 실행하느냐와 얼마나 잘 캐시하느냐에 달려 있습니다.
9월 14일이 바꾼 것
이 부분이 가격 논거를 더욱 굳히기 어렵게 만드는 대목입니다. 2026년 9월 14일부터 DeepSeek는 deepseek-v4-pro 요청을 DeepSeek-V4.1-Flash로 라우팅하고 Flash 요금으로 청구합니다. 이는 훨씬 더 낮은 요금입니다. DeepSeek의 변경 로그와 가격 페이지는 9월 10일 뉴스 게시물과는 조금 다른 이야기를 전합니다. 가격 표에는 여전히 deepseek-v4-pro가 자체 요금과 지원 종료 태그 없이 활성 항목으로 올라 있고, 변경 로그 항목에는 V4 Pro의 API 서비스가 9월 14일 이후에도 계속되며 청구는 변경되지 않는다고 적혀 있습니다. 이견이 없는 것은 나아가는 방향입니다. V4.1-Pro는 개발 중인 것으로 확인되었지만 공개된 날짜는 없으며, 9월 10일 출시된 V4.1-Flash는 DeepSeek 자체 발표에 따르면 "성능, 비용, 속도 및 총 런타임"에서 V4 Pro를 능가한다고 합니다. 이는 그 정도 범위로 독립적으로 재현된 적이 없는 공급업체 주장입니다.
따라서 실질적인 질문은 "Grok 4.7이냐 DeepSeek V4 Pro냐"가 아니라 "Grok 4.7이냐, 다음 분기에 그 문자열이 가리키게 될 DeepSeek 모델이냐"입니다. 8월에 V4 Pro를 벤치마크하고 1M 윈도와 384K 출력 상한을 기준으로 컨텍스트 예산을 책정했다면, 11월에 호출하는 모델은 측정했던 그 모델이 아닐 수 있으며, 후속 모델의 컨텍스트 및 출력 한도는 당신이 설계 기준으로 삼았던 값이 아닙니다. Grok 4.7은 위험 프로필이 정반대입니다. 출시된 지 하루 된 모델로서 수치는 벤더가 보고한 것이고 대체로 재현되지 않았지만, 그 정체성은 의심의 여지가 없습니다.

라우터가 적합한 경우와 그렇지 않은 경우
OrcaRouter는 DeepSeek V4 Pro를 제공합니다 그리고 모델 페이지에는 제공사 자체 요금, 즉 1M 컨텍스트 윈도우와 384k 최대 출력에 입력 $0.66, 출력 $1.98로 표시되어 있습니다. 저희가 제공사 정가를 0% 마진으로 그대로 전달하기 때문입니다. 이는 요금이 피크/오프피크 일정에 따라 움직이고 9월 10일 발표에 가격 인하가 함께 있었던 벤더의 경우 평소보다 더 중요합니다. DeepSeek의 가격 변경은 재가격 책정 지연도, 별도 계약도 없이 같은 날 같은 키에 그대로 적용됩니다. 벤더가 자기 쪽에서 모델 문자열을 다른 곳으로 라우팅하면, 변경 사항은 여러분 쪽에서 재통합할 필요 없이 동일한 엔드포인트를 통해 들어옵니다 그리고 자동 페일오버가 속도 제한이나 제공사 측 용량 문제가 장애로 번지는 것을 막아줍니다. 스택의 한쪽이 동시 요청 500개로 제한되어 있을 때 유용하죠. 이 글을 쓰는 시점에 Grok 4.7은 OrcaRouter 카탈로그에 없습니다. 이를 호출하려면 xAI 자체 API와 이를 제공하는 서드파티 플랫폼을 거쳐야 합니다.
이것이 시사하는 구분은 화려하지는 않지만 방어 가능하다: 캐시 적중 가격과 1M 윈도우가 일을 해내는 워크로드에는 DeepSeek V4 Pro를 유지하고, 기대치는 8월 체크포인트가 아니라 V4.1-Flash에 고정하라. 모델이 자신이 모르는 것을 알아야 하는 작업에는 Grok 4.7을 투입하라 — AA-Omniscience 지수 1은 모델이 자신 있게 그리고 틀리게 답하려는 성향에 관한 강력한 신호이며, 다운스트림 소비자가 조작된 답변을 신뢰하는 상황에서는 어떤 가격 우위도 살아남지 못한다.
전화
여기서는 Grok 4.7이 더 나은 모델이며, 그 차이는 그다지 근소하지도 않습니다: 종합 점수 10점 리드, Terminal-Bench 점수 두 배, 자동화 우위, 그리고 범주 차이라고 할 만큼 큰 지식 정직성 격차입니다. DeepSeek V4 Pro는 오프피크 기준 대략 3배 더 저렴하고 컨텍스트 창은 두 배로 크며, 이는 그것을 유지할 실질적이고 방어 가능한 이유입니다 — 하지만 당신은 벤치마크한 모델을 사는 것이 아니라, DeepSeek이 이미 다른 모델을 가리키도록 재지정하겠다고 발표한 모델 문자열을, 시간마다 바뀌는 요금으로, 자체 호스팅을 진정한 세 번째 선택지로 만들어 주는 라이선스와 가중치 세트 위에서 사는 것입니다. 워크로드가 긴 컨텍스트, 대용량, 캐시 가능이라면 DeepSeek의 경제성은 따라잡기 어렵고, 당신은 체크포인트가 아니라 후속 모델을 염두에 두고 설계해야 합니다. 틀리는 것이 비싼 일이라면, 3배를 지불하고 불확실성을 인정하는 모델을 택하십시오.

이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
