
Grok 4.6 vs DeepSeek V4 Pro: 24시간 간격으로 벌어진 최전선 가격 전쟁
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B Uncensored (Aggressive)2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
프런티어 모델 두 개가 24시간 간격으로 출시됐고, 두 제품의 가격표 사이 격차는 이번 세대에서 가장 크다. Grok 4.6은 2026년 8월 12일에 출시되었으며 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러다. DeepSeek V4 Pro — DeepSeek의 플래그십 정식 프로덕션 릴리스인 버전 DeepSeek-V4-Pro-0813 — 은 2026년 8월 13일에 출시되었으며 캐시 미스 입력 토큰 100만 개당 3위안, 출력 토큰 100만 개당 6위안으로, 이는 대략 0.42달러와 0.85달러에 해당한다. 같은 카테고리, 같은 에이전틱 야망, 가격은 한 자릿수 차이다. 이는 두 사양의 비교가 아니라, 에이전트 형태의 모델이 어떤 가격이어야 하는지에 대한 두 전략의 비교이며, 둘 다 이번 주에 출시됐다.
이 글은 두 가격표를 나란히 놓고, 각 공급업체의 벤치마크 주장을 해당 업체 라벨을 붙인 채로 읽은 다음, 실제 워크로드에서 그 격차가 실제로 얼마의 비용이 되는지 계산한다. 종이상으로는 이 모델들이 철학보다는 기능 면에서 더 가깝고, 작업당 가격 차이가 바로 결정이 갈리는 지점이기 때문이다.
타이밍이 바로 핵심이다
두 모델이 같은 48시간 창에 등장한 것은 달력의 우연이 아니다. Grok 4.6은 SpaceXAI가 자사의 1.5T 파운데이션 모델을 에이전트형으로 개조한 것이다. 코딩, 커널 작업, CAD 전반에 걸친 강화 학습에 중점을 둔 사후 훈련 리프레시이며, 이 회사가 소유한 Cursor 및 Grok Bot 제품의 연료로 가격이 책정됐다. DeepSeek V4 Pro는 훨씬 낮은 가격에 '에이전트'의 의미를 조용히 재정의한 프리뷰의 공식 버전으로, 이제 에이전트 경제를 위해 강화됐다: DeepSeek의 0813 빌드 릴리스 노트는 크게 개선된 에이전트 기능을 맨 앞에 내세우고, Responses API와 Codex 통합 지원을 추가했으며, 사고(기본값) 및 비사고 모드, JSON 출력, 도구 호출, Anthropic API 형식을 모두 유지한다. 매우 다른 두 회사가 2026년 후반에 중요한 시장이 에이전트라는 결론을 동시에 내렸고, 매우 다른 지갑을 겨냥해 각자의 제품 가격을 책정했다.
두 가격표, 나란히
• Grok 4.6 — 백만 토큰당 $2.00 / $6.00 / $0.50(캐시된 입력)이며, 500K 컨텍스트를 지원합니다. 약 200K 입력 토큰을 초과하면 $4 / $12 / $1이 추가되고, 기본 요금의 두 배인 더 빠른 버전도 제공됩니다.
• DeepSeek V4 Pro — 캐시 미스 입력 ¥3.00(≈$0.42), 캐시된 입력 ¥0.025(≈$0.0035), 백만 토큰당 출력 ¥6.00(≈$0.85), 1백만 토큰 컨텍스트 창과 최대 384K 출력 토큰을 제공합니다. 더 저렴한 형제 모델인 V4 Flash는 ¥1 / ¥2입니다.
이미 해당 세대에서 가장 저렴한 프런티어 API인 Grok 4.6과 비교해도, DeepSeek V4 Pro는 캐시 미스 입력에서 약 5배, 출력에서 7배 더 저렴하며, 동일한 가격대에서 2배 더 큰 컨텍스트 창과 훨씬 더 큰 최대 출력을 제공합니다. 둘은 가격으로 경쟁하는 것이 아닙니다. DeepSeek이 일방적으로 새로운 최저선을 설정했으며, 이제 Grok은 같은 문장에서 프리미엄 옵션이 되었습니다. 이러한 프레이밍이 중요한 이유는 이전의 프레이밍, 즉 "Grok 4.6이 저렴한 프런티어 모델이다"라는 말이 정확히 하루 동안만 사실이었기 때문입니다.

DeepSeek V4 Pro가 실제로 개선한 점
DeepSeek의 출시 수치는 자체 프리뷰와 비교하여 측정되기 때문에 가장 극적이며, 프리뷰에서 출시로의 점프가 엄청납니다. 벤더 자체 평가에서는:
• DeepSWE — 릴리스 빌드에서 62.7%로, 프리뷰의 12.8%에서 상승 — 공급업체가 Opus 4.8의 58.0%와 Claude Fable 5의 70.0% 사이에 둔 소프트웨어 엔지니어링 장기 과제(long-horizon) 점수입니다.
• Cybergym — 83.3%로, 52.7%에서 상승하여 Fable 5의 83.1%를 근소하게 앞지르고 Opus 4.8의 78.3%를 이겼습니다.
• Terminal Bench 2.1 — 87.9%로, Fable 5의 88.0%와 1포인트 차이이며 Opus 4.8의 85.0%보다 앞섭니다.
• AutomationBench(공개) — 12.8%에서 31.8%로 상승했으며, Fable 5(29.1%)와 Opus 4.8(27.2%)을 모두 앞섰습니다.
• Toolathlon-Verified, NL2Repo, DSBench-FullStack 및 DSBench-Hard — 각각 74.1%, 61.5%, 71.1% 및 67.2%로, Opus 4.8 / Fable 5 수준에 해당하거나 그에 근접합니다.
{{1}}그 모든 것은 DeepSeek가 자체 평가 스위트에서 보고한 결과입니다.{{/1}} {{2}}방향성은 명백합니다 — 프리뷰는 프로덕션 에이전트 루프에 적합하지 않았고, 릴리스 빌드는 그에 적합하다고 주장합니다 — 하지만 정직한 평가는, 아직 어떤 독립 연구소도 DeepSeek V4 Pro를 채점하지 않았으며,{{/2}} {{3}}벤치마크 비교 대상 모델들도 외부 기관에 의해 명명된 것이 아니라는 점입니다.{{/3}}
Grok 4.6이 답변하는 내용
Grok 4.6의 대항마는 본질적으로 다른 모델입니다. 두 모델 중 유일하게 독립적인 스코어보드를 갖춘 모델이기 때문입니다. Artificial Analysis는 DeepSeek V4 Pro가 출시되기도 전에 이 모델을 Intelligence Index에서 61점으로 측정했는데, 이는 GPT-5.6 Sol과 동률이며 Kimi K3(60점)보다 앞선 수치입니다. Grok 4.6의 공급업체 표는 DeepSWE v1.1에서 선두인 65.9%, CursorBench v3.2에서 69.9%를 주장하며, Terminal-Bench v3.0에서는 26%의 약점을 공개적으로 인정했습니다. 이 수치들은 모두 xAI가 보고한 것으로, 8월 13일 기준 독립적으로 재현된 것은 없습니다.
버전 불일치는 둘을 직접 비교하려 할 때 중요해집니다. DeepSeek의 87.9는 Terminal Bench 2.1 기준이고, Grok의 26%는 더 어려운 v3.0 기준입니다 — 서로 다른 시험이므로, "DeepSeek이 터미널에서 Grok을 압도한다"는 정직한 표현이 아니며, 두 공급업체가 서로 다른 평가 버전을 실행했고 어느 숫자도 제3자 검증이 아니라는 점을 언급하지 않은 채 "Grok이 DeepSWE에서 앞선다"고 말하는 것도 마찬가지입니다. 비교 가능한 것은 독립적인 차원입니다: Grok 4.6은 검증된 스코어카드가 하나 있는 반면, DeepSeek V4 Pro는 아직 없으며, 프로덕션 결정에 있어 그 비대칭성 자체가 정보입니다.

긴 에이전트 실행의 총 비용
두 모델의 윈도우 안에 들어가는 현실적인 에이전트 작업을 하나 예로 들어 보겠습니다. 500K 토큰의 컨텍스트를 읽고 추론하며 100K 토큰의 출력을 작성하는 작업, 즉 중간 규모의 리팩터링이나 긴 문서 파이프라인입니다:
• Grok 4.6 — 0.5M 입력에 $2 = $1.00, 그리고 0.1M 출력에 $6 = $0.60. 총액: $1.60.
• DeepSeek V4 Pro — 0.5M 캐시 미스 입력(¥3) = ¥1.50, 그리고 0.1M 출력(¥6) = ¥0.60. 합계: ¥2.10, 약 $0.29.
동일한 명목상 작업에서 캐싱 이점을 고려하기 전에 이미 5.5배 차이가 납니다. 그리고 DeepSeek의 1M 윈도우와 384K 최대 출력은 작업이 단일 패스에 들어간다는 것을 의미하는 반면, Grok 4.6의 500K 윈도우는 두 번의 패스가 필요할 수 있습니다. 이것이 한 줄 답변이 되지 못하게 하는 문제는 추론 비용과 위험입니다: DeepSeek의 사고 모드는 기본적으로 켜져 있어서 원하지 않을 때에도 모든 요청이 전체 추론 추적 비용을 지불하며, 공급업체 자체의 벤치마크 신뢰성은 독립적인 누구에게도 검증되지 않았습니다. 항상 켜진 추론으로 인한 토큰당 저렴함은 이러한 요금에서 여전히 작업당 저렴하지만, "저렴함"과 "검증됨"은 다른 주장이며, 두 모델 중 하나만 두 번째 주장을 갖고 있습니다.
누가 어떤 것을 골라야 하나요
결정은 '어느 것이 더 나은가'라기보다는 '어떤 위험 프로필이 워크로드에 맞는가'의 문제다:
• 대용량, 비용에 묶여 있으며, 검증되지 않은 수치를 감수할 의향이 있는 — DeepSeek V4 Pro는 가격 최저선을 노리는 선택지입니다. 1M 컨텍스트와 384K 출력 덕분에 긴 컨텍스트 및 배치 처리에 더 적합한 후보이고, ¥0.025의 캐시 입력 요금 덕분에 검색 중심 파이프라인은 거의 무료 수준입니다. 독립적인 평가가 없었으므로, 직접 평가를 수행하세요.
• OpenAI 호환 생태계에서 독립적인 스코어카드를 갖춘 에이전틱 깊이 — Grok 4.6의 61점은 검증되었고, 코딩 및 에이전틱 벤치마크 방향도 일관되며, 터미널의 약점도 사전에 파악할 수 있습니다. 검증된 품질을 위해 치르는 대가는 첫 토큰까지 42초가 걸린다는 점입니다.

• 혼합 트래픽 — 이는 선택이 아닌 라우팅이 필요한 경우입니다. OrcaRouter에서는 두 모델 모두 단일 키 하나로 공급자 목록 패스스루 가격에 제공되므로, DeepSeek의 ¥3/¥6은 청구서에 그대로 ¥3/¥6으로 남고 Grok 4.6은 $2/$6으로 유지되며 어느 쪽에도 마크업이 없습니다. 라우팅 규칙을 사용하면 긴 컨텍스트와 비용에 민감한 작업은 DeepSeek V4 Pro로, 검증된 에이전틱 작업은 Grok 4.6으로 보낼 수 있고, 자체 평가가 분산 비율을 확정할 때까지 요청 단위로 트래픽을 분산하며, 어느 한 공급업체의 첫 주 동작이 출시 수치와 어긋나면 자동 장애 조치에 의존할 수 있습니다. 가격 전쟁의 양극단에 있는, 출시된 지 하루 된 두 모델의 경우, 자체 워크로드에서 두 모델을 비교하고 코드 변경 없이 분산 비율을 바꿀 수 있는 능력은 편의가 아닙니다. 이는 어느 쪽을 채택하든 유일하게 방어 가능한 방법입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
