기사 히어로 카드에는 'OpenAI o3 vs DeepSeek V4 Pro'라는 제목과 '모델 비교' 배지, 그리고 '프리미엄 추론 시대는 가격 격차가 벌어지는 곳에서 끝난다'는 부제가 표시됩니다. 왼쪽에는 프리미엄 태그 아이콘, 오른쪽에는 동전 아이콘이 있으며, 오른쪽 하단에는 OrcaRouter 로고가 있습니다.
Guides & Insights

OpenAI o3 대 DeepSeek V4 Pro: 프리미엄 추론 시대는 가격 격차가 벌어지는 곳에서 끝난다

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

OpenAI o3와 DeepSeek V4 Pro의 맞대결은 정말로 두 숫자의 충돌이다. 2025년 4월 16일에 출시된 OpenAI o3는 프리미엄 추론의 기준점이었다. 즉, 잘못된 답변의 비용이 토큰 비용보다 높을 때 기꺼이 비용을 지불하게 만드는 모델이었다. DeepSeek V4 Pro는 조용한 저녁 릴리스와 철회된 발표 및 재업로드된 가중치를 포함한 롤아웃을 거쳐 2026년 8월 13일에 빌드 0813으로 GA(일반 공급)에 도달했는데, 이 모델은 그 프리미엄이 카테고리 오류처럼 보이게 만들었다. o3보다 높은 독립 지수, 약 5분의 1의 가격, 그리고 그 위에 공개 가중치를 갖춘 모델이다. 그리고 이 충돌에는 타임스탬프가 찍혀 있다. OpenAI o3는 2026년 8월 26일에 ChatGPT에서 퇴장하고, API 스냅샷은 12월 11일에 이어지기 때문이며, 비교의 매 순간은 어디로도 사라지지 않는 모델에게 유리하다.

철학적으로 1년 간격을 두고 출시된 두 모델

o3는 순수 추론 플래그십이다. 답변 전에 오랫동안 생각하도록 훈련된 폐쇄형 모델로, 200K 컨텍스트 창, 최대 100K 출력, 그리고 추론 사슬(chain of thought)에 통합되는 이미지 입력을 갖추고 있다. Ope​nAI 자체 수치에 따르면 이 모델은 2025년의 기준을 세웠다. AIME 2024에서 96.7%, GPQA Diamond에서 87.7%, 스캐폴딩 없는 SWE-bench Verified에서 69.1%, Codeforces Elo 2727을 기록했으며, Ope​nAI는 이후 토큰 100만 개당 가격을 $10/$40에서 $2/$8로 인하했고, 이 가격이 지금까지 유지되고 있다. DeepSeek V4 Pro는 경제성이 완전히 다르다. 총 1.6조 개의 파라미터를 가진 mixture-of-experts 모델로, 토큰당 약 490억 개의 파라미터가 활성화되며, 100만 토큰 컨텍스트 창, 최대 384K 출력, 텍스트 전용 입력을 지원한다. 여기에 0813 GA 빌드에서 새로 도입된 재구축된 포스트트레이닝 스택과 네이티브 Responses-API 및 Codex 통합이 더해져, DeepSWE에서 에이전트 점수가 프리뷰의 12.8에서 62.7로 뛰어올랐다. 이 모델은 오픈 웨이트(open-weights) 모델이기도 하다. DeepSeek-V4-Pro-0813 체크포인트는 MIT 라이선스로 Hugging Face에서 다운로드할 수 있으며, 출시 직후 첫 24시간은 혼란스러웠다. 릴리스 배너가 내려갔고 웨이트가 잠시 404 상태를 보인 후에야 수정된 config로 재게시되었다.

실제 수치로 본 비용 격차

요금표가 대부분의 설득을 스스로 해냅니다:

• OpenAI o3 — 입력 100만 토큰당 $2.00, 출력 100만 토큰당 $8.00, 캐시된 입력 $0.50. 추론 토큰은 출력으로 청구되므로, 어려운 질문은 답변 전에 추론 토큰을 소모한다.

• DeepSeek V4 Pro — 입력 100만 건당 $0.435 (캐시 미스), 캐시 히트 시 $0.003625, 출력 100만 건당 $0.87 (오늘 기준). 출력은 o3보다 대략 4.6배 저렴하며, 캐시 히트 입력은 사실상 무료입니다.

• 날짜가 명시된 주의사항 — DeepSeek의 예정된 8월 17일 가격 인상으로 V4 Pro 출력 가격은 피크 시간 기준 백만 개당 6위안에서 27위안으로(비피크 시 13.5위안), 캐시 미스 입력은 3위안에서 9위안으로 오릅니다. 새로운 피크 요금에서도 출력 가격은 o3의 $8의 아주 일부에 불과합니다. 오늘의 요금을 기준으로 구축할 수 있는 기간은 며칠에 불과하며, 이것 자체가 마이그레이션 계산의 일부입니다.

정답당 경제학은 그 점을 더욱 분명하게 한다. o3의 숨은 추론 토큰은 어려운 답변 하나당 실제 비용이 출력 요금의 몇 배에 달함을 의미한다. DeepSeek V4 Pro도 추론을 수행하며, 그 사고 과정도 출력으로 청구되지만, $0.87이라는 절대 지출은 1분 30초를 생각하는 o3 세션 옆에서는 반올림 오류에 불과하다. DeepSeek이 출시 때 사용한 에이전트 비용 프레임 — 비공개 프런티어 대비 작업당 가격 격차가 약 45배 — 은 o3에 한정하면 과장된 측면이 있지만, 방향 자체는 논쟁의 여지가 없다: 워크로드에 따라 실효 비용은 4~10배 차이가 난다.

품질 격차가 실제로 어디에 있는가

가장 중요한 점수는 독립적인 점수입니다. Artificial Analysis의 Intelligence Index에서 DeepSeek V4 Pro는 53점을 기록하며 현재 해당 지수가 나열한 104개 모델 중 2위를 차지했습니다. o3는 약 30점으로 같은 테스트 환경에서 20점 이상의 격차가 있습니다. 이것이 2년간의 발전이 프리미엄 추론 플래그십을 어디에 남겼는지에 대한 가장 명확한 요약입니다. 더 이상 단순히 가격에서만 밀리는 것이 아니라 독립적인 종합 지표에서도 패배하고 있습니다.

벤치마크별로 보면 상황은 더 지저분하며 정직한 평가가 필요하다. DeepSeek V4 Pro의 대표 에이전트 수치(Terminal-Bench 2.1 87.9, CyberGym 83.3, DeepSWE 62.7, 폐쇄형 프런티어를 앞선 AutomationBench)는 DeepSeek가 0813 출시 때 내놓은 자체 주장으로, 이 글을 쓰는 현재까지 독립적으로 재현되지 않았다. 게다가 출시 과정에서 잘못된 설정이 있었던 사건 때문에, 초기 서드파티 수치가 수집될 당시 API가 최종 수정된 가중치를 실제로 서비스하고 있었는지 누구도 확신할 수 없다. o3의 출시 벤치마크 역시 공급업체 보고 수치이지만, 2025년에 독립적 재검증을 통해 일부 검증됐으며 그때 o3는 실제로 추론 차트를 주도했다. 수학과 순수 추론에서 o3의 공개 기록은 여전히 DeepSeek V4 Pro보다 우수해 보인다. DeepSeek의 강점은 에이전트형 도구 사용, 코딩, 장기 과제이며, 이는 o3가 지배했던 수학 올림피아드와는 다른 테스트 모음이다.

A two-column scoreboard for OpenAI o3 vs DeepSeek V4 Pro: left column o3 shows $2/$8 pricing, 200K context, closed weights, Artificial Analysis Index around 30, math-and-reasoning strength, retiring August 26 2026; right column DeepSeek V4 Pro shows $0.44/$0.87 pricing today, 1M context, MIT open weights, Artificial Analysis Index 53 (#2 of 104), agentic-and-coding strength, GA August 13 2026. Footer: o3 figures partly independent; DeepSeek agent benchmarks vendor-reported. OrcaRouter logo bottom-right.

o3가 여전히 더 잘하는 점

비교에서 온전히 살아남는 두 가지가 있다. 첫째, 수학과 신중한 추론: o3의 AIME 96.7%와 GPQA 87.7%는 DeepSeek V4 Pro가 공개한 어떤 것보다도 높은 수치이며, 작업이 어려운 증명이나 경쟁 문제라면 o3는——아직 실행되는 동안에는——더 안전한 답이다. 둘째, 이미지 추론: o3는 사고 사슬 안에서 스크린샷이나 다이어그램을 고려할 수 있지만, DeepSeek V4 Pro는 텍스트 전용이다. 0813 빌드는 비전 인코더를 추가하지 않았으며, 모델이 이미지를 읽어야 하는 작업이라면 그 부분에서 DeepSeek V4 Pro는 o3를 대신할 수 없다. 어느 장점도 곧 퇴역하는 모델에 머물러야 할 이유는 아니지만, 두 장점 모두 이번 전환이 순수한 업그레이드가 아니라는 점을 솔직히 인정해야 할 이유는 된다.

또 한 가지 주목할 점은 오픈 가중치의 차이인데, 이는 결코 벤치마크가 아닙니다. o3는 폐쇄형이었고, 이제는 통합 과정에서 사라져 가고 있습니다. 여러분이 직접 하드웨어에서 계속 실행할 수 없습니다. DeepSeek V4 Pro의 0813 체크포인트는 MIT 라이선스로 영구히 여러분의 것입니다. 동일한 가중치, 동일한 1.6조 매개변수 모델로서, 약 1.5테라바이트의 하드웨어만 있다면 자체 호스팅할 수 있습니다. 폐쇄형 모델에 의존했다가 공급업체가 그 모델을 폐기할 수 있는 문제로 피해를 본 팀들에게는, 이것이 o3의 폐기가 제기하는 바로 그 문제에 대한 구조적 해답입니다.

워크로드 마이그레이션 중

API 팀이 o3에서 넘어온다면, DeepSeek V4 Pro는 가장 저렴하게 안착할 수 있는 곳이고, 실제 API 사용의 대부분을 차지하는 에이전트 및 코딩 작업에서는 거의 다운그레이드가 아닙니다. 진짜 함정은 품질이 아니라 운영에 있습니다. V4 Pro는 공식 API에서 동시 요청 500개로 제한되는데, 에이전트 플릿을 운영한다면 이 상한선에 도달하게 됩니다. 또한 가격은 8월 17일에 변경됩니다. 이 두 가지 모두 정확히 라우팅 계층이 있어야 하는 이유입니다.

OrcaRouter에서 DeepSeek V4 Pro는 공급업체 정가에 0% 마크업을 적용한 가격으로 제공됩니다. 따라서 오늘의 $0.44/$0.87 가격은 DeepSeek에 적용된 날과 같은 날 여기서도 적용됩니다. 또한 8월 17일 피크/오프피크 요금제가 시행되면 같은 날 여기에도 반영됩니다. 하나의 키로 이 o3 대체 모델 그룹의 나머지에도 접근할 수 있고, 자동 장애 조치는 500동시성 상한에 대한 깔끔한 해결책입니다. 즉, 프로덕션 경로를 V4 Pro와 동일한 키의 두 번째 모델에 지정하고 라우터가 상한을 흡수하게 하면 됩니다. Ope​nAI o3 자체는 해당 키에 포함되지 않습니다 — 12월 11일 스냅샷 마감까지 Ope​nAI 자체 API와 여러 타사 플랫폼을 통해 계속 사용할 수 있습니다.

Screenshot of the Artificial Analysis model page for o3 showing its rank of #107/182 on the Intelligence Index, a score of 31 (below the median of 35), a 200K-token context window, $2.00 per 1M input and $8.00 per 1M output pricing, and a 118 tokens-per-second speed reading.

수학이 누구에게 유리한가

o3 워크로드가 코딩, 에이전트 루프, 또는 긴 컨텍스트 처리라면, 계산 결과는 가깝지 않습니다: DeepSeek V4 Pro는 독립 지표에서 o3를 능가하고, 비용은 극히 일부에 불과하며, 오픈 가중치 덕분에 이 특정 의존성이 여러분 몰래 사라져 버릴 일도 없습니다. 지금 당장 o3를 유지할 진짜 이유가 있는 팀은 좁은 영역에 한정됩니다 — 순수 수학 추론과 o3의 이미지 사고 기능 위에 구축된 것들 — 그리고 그 팀들조차 12월 이전에 실제 워크로드로 대체 모델을 테스트해야 합니다. 데드라인은 여러분의 예외 사례를 고려해 주지 않으니까요. o3가 정의했던 프리미엄 추론 시대는 o3의 은퇴 발표와 함께 끝났습니다. 우연히도 DeepSeek V4 Pro가 다음 시대에서 가장 저렴한 자리를 차지하고 있을 뿐입니다.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro showing a 1M-token context window, 384K max output, $0.44 per 1M input and $0.88 per 1M output tokens, and Tools/JSON/Reasoning capability chips.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube