Claude Sonnet 5.5 대 DeepSeek V4 Pro를 위한 히어로 타이틀 카드를 생성했으며, 부제는 '20 인덱스 포인트와 $0.022 캐시 읽기'이고, 백만 토큰당 $2.00와 $10.00를 $0.66와 $1.98과 대비하여 보여주며, 오른쪽 아래 모서리에는 OrcaRouter 로고가 합성되어 있습니다.
Guides & Insights

Claude Sonnet 5.5 vs DeepSeek V4 Pro: 20 인덱스 포인트, 그리고 $0.022의 캐시 읽기

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

두 개의 요금표를 나란히 놓으면 비교는 시작하기도 전에 끝난 것처럼 보입니다. 2026년 9월 28일부터 일반 제공된 Claude Sonnet 5.5는 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $10.00입니다. 2026년 4월 24일 출시된 DeepSeek V4 Pro는 $0.66와 $1.98입니다. 에이전트 작업에서 중요한 항목은 출력이며, $10.00 대 $1.98은 5대 1의 격차입니다 — 십만 토큰당 1달러 대 20센트입니다. 그런 다음 능력 측면을 보면, Artificial Analysis는 Claude Sonnet 5.5를 Intelligence Index v4.3에서 56으로, DeepSeek V4 Pro를 36으로 평가하며, 동일한 하네스에서 20점 차이입니다. 이것이 전체적인 긴장입니다: DeepSeek의 모델은 출력 가격의 5분의 1에 측정된 능력의 약 3분의 2에 위치하며, 두 사실은 워크로드가 토큰을 실제로 어떻게 사용하는지 알지 못하면 단일 권장 사항으로 귀결되지 않습니다.

각 모델이 정확히 무엇인지

이 비교에서 가장 먼저 어긋나는 부분은 명칭이므로, 여기서 바로잡으세요. 우리가 표기하는 DeepSeek V4 Pro는 deepseek/deepseek-v4-pro이며, 2026년 4월 24일 출시된 1,048,576토큰 컨텍스트 모델로 최대 출력 384,000토큰과 텍스트 전용 입력을 갖습니다. Artificial Analysis는 DeepSeek V4 Pro 0813이라고 표기한 스냅샷 — 8월 13일 빌드 — 을 추적하며, 아래에 인용된 수치는 그 행에서 나옵니다. Sonnet 쪽은 Anthropic의 anthropic/claude-sonnet-5.5로, 텍스트, 이미지 및 파일 입력, 1M 컨텍스트, 최대 출력 128K를 지원합니다. 벤더 페이지와 평가자 페이지를 비교하는데 수치가 맞지 않는다면, 둘 중 하나가 틀렸다고 결론 내리기 전에 빌드 접미사를 확인하세요.

DeepSeek V4 Pro는 텍스트 입력만 지원합니다. Claude Sonnet 5.5는 이미지와 파일도 입력으로 받습니다. 이것이 첫 번째 구조적 차이이며, 결코 사소한 차이가 아닙니다. 스크린샷, PDF 또는 다이어그램을 입력으로 처리하는 파이프라인은 둘 중 하나를 단순히 다른 것으로 바꿀 수 없습니다. 왜냐하면 그중 하나는 볼 수 없기 때문입니다.

요금표, 한 줄씩

• 입력 — DeepSeek V4 Pro는 백만 개당 $0.66, Claude Sonnet 5.5는 $2.00; DeepSeek가 67% 더 저렴합니다.

• 출력 — 백만당 $1.98 대 $10.00; DeepSeek은 80% 더 저렴하며, 이 비교에서 가장 큰 단일 격차입니다

• 캐시 읽기 — 백만 토큰당 $0.20 대비 $0.022; DeepSeek은 긴 에이전트 루프를 지배하는 항목에서 89% 더 저렴합니다

• 캐시 쓰기 — Claude Sonnet 5.5의 5분 윈도우 기준 백만 토큰당 $2.50; DeepSeek V4 Pro의 카탈로그 항목에는 별도의 캐시 쓰기 라인이 없습니다

• 컨텍스트 — 1,048,576 토큰 대 1,000,000; DeepSeek이 약간 더 길며, 실질적 영향이 없는 차이

• 최대 출력 — 128,000 대비 384,000 토큰; DeepSeek은 대량 생성에 제약이 되는 상한에서 세 배 차이로 앞선다

• 입력 모달리티 — 텍스트 전용 vs 텍스트, 이미지, 파일

• 추론 — 둘 다 고정된 사고 예산이 아니라 구성 가능한 reasoning effort를 사용하므로, 깊이는 각 요청의 매개변수입니다

DeepSeek 쪽에는 요금표 비교로는 드러나지 않을 스케줄링 세부 사항이 있습니다. 우리 카탈로그 항목에는 시간대별 요금 구간이 있습니다. UTC 01:00~04:00과 다시 UTC 06:00~10:00 사이에는 표시된 요율이 두 배가 됩니다. 해당 시간대에 V4 Pro는 입력 $1.32, 출력 $3.96으로, Claude Sonnet 5.5보다 각각 34%, 60% 더 저렴합니다. 하지만 더 이상 헤드라인 숫자가 시사하는 만큼의 차이는 아닙니다. 스케줄링할 수 있는 배치 워크로드는 스케줄링할 가치가 있고, 그럴 수 없는 워크로드는 평균 요율이 아니라 피크 요율로 가격을 책정하는 편이 낫습니다. 이는 또한 마케팅 페이지가 아니라 카탈로그를 읽어야만 드러나는 종류의 내용이며, 모든 후보 모델을 세 개의 벤더 계정 대신 하나의 엔드포인트 뒤에 두어야 한다는 근거이기도 합니다.

두 개의 능력 수치, 그중 하나는 독립적이지 않음

제3자 측면에서 보면 순위는 명확하다. Artificial Analysis는 최대 추론 노력 구성에서 Claude Sonnet 5.5에 Intelligence Index v4.3 기준 56점을, DeepSeek V4 Pro에 36점을 부여한다. 같은 평가자는 Claude Opus 5에 51점, Gemini 3.1 Pro Preview에 30점을 준다. 따라서 V4 Pro의 36점은 이전 Anthropic 플래그십 아래, Google의 Pro 등급 위에 위치한다 — 가격이 5분의 1인 모델로서는 괜찮은 위치이며, 정상과는 거리가 멀다.

과제당 비용 역전 현상은 여기서도 나타나며, 이번 대결에서는 지난번과 반대 방향으로 전개된다. DeepSeek V4 Pro는 인덱스 스위트에서 평가하는 데 0.67달러가 든다. Claude Sonnet 5.5는 7.60달러가 든다. 이는 오타도, 반올림 부산물도 아니다. 더 새로운 Anthropic 모델은 스위트 전반에서 4억 1,000만 토큰을 출력하는 반면 중앙값은 8,800만 토큰이며, DeepSeek 모델의 장황함으로는 그 정도 규모의 가격 격차를 좁히기에는 턱없이 부족하다. 제약 없는 개방형 과제에서 더 저렴한 모델은 요금표상에서만이 아니라 실제로도 10배 더 저렴하다.

벤더 수치는 더 신중하게 다뤄야 한다. DeepSeek는 V4 Pro에 대해 τ²-Bench 수치 96.2를 발표하는데, 이는 강력한 숫자이긴 하지만 벤더가 보고한 것이고, τ²-Bench는 이후 Artificial Analysis 인덱스의 v4.3 개정판에서 제거되었다 — 따라서 이는 Anthropic이 발표하는 어떤 수치와도 같은 척도에 독립적으로 놓을 수 없는 값이다. Claude Sonnet 5.5에 대한 Anthropic 자체의 출시 표에도 나름의 단서가 붙어 있는데, Max effort 설정이 FrontierCode에서 Xhigh보다 낮은 점수를 받는다는 각주와, 벤치마크 중 두 개가 구조화 출력 버그가 있는 사전 출시 배포판에서 실행되었다는 주석이 포함된다. 두 벤더의 표를 나란히 놓으면 순위가 아니라 두 개의 마케팅 문서가 된다. 이 기사에서 하나의 축에 놓을 수 있는 수치는 두 인덱스 점수와 두 작업당 비용뿐이다. 왜냐하면 한 평가자가 네 가지를 모두 산출했기 때문이다.

왜 출력 상한이 가격보다 더 중요한가

이 비교에서 가장 주목을 덜 받는 숫자는 아키텍처를 바꾸는 숫자입니다: 출력 토큰 384,000 대 128,000.

출력 상한은 편의 기능이 아니다. 그것은 작업이 한 번의 호출로 끝나는지, 아니면 연쇄로 이어지는지를 결정한다. 큰 소스 파일을 생성하거나, 완전한 문서를 산출하거나, 긴 구조화 보고서를 만들거나, 책의 한 챕터를 번역하는 일 — 결과물이 128,000 토큰보다 큰 모든 작업 — 은 Claude Sonnet 5.5에 대한 단일 호출로는 수행할 수 없으며, 호출 사이에 상태를 이어 가는 일련의 단계로 분해해야 한다. 분해는 매 단계마다 다시 전송되는 더 많은 입력 토큰, 더 많은 캐시 읽기, 더 많은 오케스트레이션 코드, 그리고 청크 사이의 이음새가 바로 오류가 도사리는 곳이라는 새로운 종류의 실패를 의미한다. 가격이 다섯 배인 모델이 전체 오케스트레이션 계층을 제거해 준다면, 토큰 비용에서 더 저렴해지기 전에 엔지니어링 시간에서 더 저렴할 수 있으며, 반대로 한 번의 호출에 들어가는 작업은 상한이 계산에 전혀 들어오지 않는 작업이다.

그러므로 상한 문제는 가격 문제보다 앞선다. 가장 긴 아티팩트가 128,000 토큰 미만에 들어간다면, 이 섹션은 무시하고 완료된 작업당 비용으로 비교하라. 그렇지 않다면, 토큰만이 아니라 구축해야 할 파이프라인의 비용까지 산정하라.

전환 비용과 폴백 문제

어느 방향으로의 마이그레이션이든 대부분은 코드보다는 프롬프트에 관한 것이며, 예산을 배정할 만한 한 가지 예외가 있습니다.

두 모델 모두 effort 매개변수를 통해 추론을 구성하지만, 이들은 서로 다른 벤더의 매개변수이며 수준과 기본값도 다릅니다. 높은 effort의 Anthropic 설정에 맞춰 조정된 프롬프트는 DeepSeek effort 설정으로 동등한 교체처럼 이전되지 않습니다. 그것은 재측정으로 이전됩니다. 이전 방향이 어느 쪽이든, 비용 예측을 신뢰하기 전에 워크로드당 하루를 품질 재확립에 쓸 각오를 하세요.

예외는 비전입니다. Claude Sonnet 5.5는 이미지와 파일을 읽지만, DeepSeek V4 Pro는 텍스트만 읽습니다. 모델에 스크린샷, 스캔한 페이지 또는 렌더링된 차트를 넘기는 파이프라인의 어떤 부분도 DeepSeek에 대응하는 기능이 없으므로, 전면 마이그레이션은 트래픽 중 텍스트 형태의 하위 집합에만 가능합니다. 이는 일찍 그어야 할 경계선입니다. 보통 답은 하나의 모델이 아니라 분할된 구성이라는 뜻이기 때문입니다.

두 모델 모두 오늘 OrcaRouter에서 라우팅할 수 있습니다 — deepseek/deepseek-v4-pro와 anthropic/claude-sonnet-5는 둘 다 라이브 카탈로그 항목이며, 제공자 정가에 0% 마크업으로, 하나의 자격 증명으로 제공됩니다. 이는 바로 이런 종류의 비교에서 가장 중요합니다. 여기서 결정적인 요인은 추상적으로 어느 모델이 더 나은가가 아니라, 주어진 요청이 어느 모델로 가야 하는가이기 때문입니다. 텍스트 전용 대량 작업은 저렴한 모델로, 비전 작업은 비싼 모델로 보내는 분리는 하나의 라우팅 규칙이며, 그것은 두 엔드포인트가 동일한 키와 동일한 페일오버 정책을 따를 때 훨씬 표현하기 쉽습니다. Claude Sonnet 5.5 자체는 아직 우리 플랫폼의 라우트가 아니므로, 오늘날 그 분리는 Anthropic 모델을 DeepSeek V4 Pro와 짝지을 뿐, 그것을 대체하지는 않습니다.

규칙으로 제시된 결정

작업에서 이미지, PDF, 스크린샷, 렌더링된 출력을 봐야 할 때, 산출물이 한 페이지 분량의 산문보다 길고 프런티어 모델이 그것을 작성하기를 원할 때, 또는 20포인트 지수 격차가 사람이 다시 써야 하는 초안과 바로 출시할 수 있는 초안을 가르는 차이일 때 Claude Sonnet 5.5로 보내세요.

워크로드가 텍스트 입력, 텍스트 출력, 대량 처리이고 추론 품질의 상한이 다소 낮아도 괜찮은 경우에는 DeepSeek V4 Pro로 보내세요. 분류, 추출, 요약, 대량 재작성, 명확한 사양이 있는 코드 변환, 그리고 그렇지 않으면 백만 출력 토큰당 10달러를 내고 단어를 옮기는 데 쓰게 될 모든 작업이 여기에 해당합니다. 89% 캐시 읽기 할인 덕분에 이 모델에서의 장문 컨텍스트 에이전트 루프는 비교 대상 중 그 무엇도 갖지 못한 방식으로 구조적으로 저렴합니다.

솔직한 결론: 이것은 DeepSeek가 지고 있는 역량 경쟁이 아니라, 대부분의 팀이 쓰지도 않는 역량을 사는 쪽으로 잘못 내리는 자원 배분 결정이다. 트래픽이 텍스트이고 품질 기준이 "읽지 않고도 출시할 만큼 좋음"이 아니라 "검토할 만큼 좋음"이라면, 출력 가격의 20%와 $0.022 캐시 읽기로 제공되는 V4 Pro가 올바른 기본값이며, 그 20 지수 포인트는 당신이 현재 자발적으로 내고 있는 세금이다.

A two-column scoreboard for Claude Sonnet 5.5 and DeepSeek V4 Pro across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50 for the five-minute window, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column DeepSeek V4 Pro: input $0.66, output $1.98, cache read $0.022, no separate cache-write line, 1,048,576-token context with 384K max output, input modality text only, AA Intelligence Index v4.3 score 36, $0.67 per task on the index run. The card heading reads "Twenty index points against an 89% cache-read discount", and a footer line notes that a timed-pricing window multiplies the DeepSeek rates by two between 01:00-04:00 and 06:00-10:00 UTC.Screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro), showing the model header, the 1,048,576-token context window with 384,000 maximum output tokens, text-only input, the Tools, JSON and Reasoning capability tags with no Vision tag, a 1.86-second p50 time to first token, a "Public benchmarks by DeepSeek · 2026-04-24" line, and the $0.66 input and $1.98 output prices per million tokens.Screenshot of Artificial Analysis's model page for "DeepSeek V4 Pro 0813 (Reasoning, Max Effort)", marked an open-weights model and released August 2026, showing In $1.32 and Out $3.96 with a 97% cache discount, the Intelligence Index score of 36, an output rate of 96.6 tokens per second, the $0.67 average cost per task, and 160M output tokens described as somewhat verbose against a median of 140M.

이 글에서 비교한 모델3

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트