
Claude Sonnet 5.5 vs Gemini 3.1 Pro: 토큰당 더 저렴하지만, 작업당 11배 더 비싸다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 984 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 195 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
요금표에서 Claude Sonnet 5.5는 더 저렴한 모델이며, 성능 면에서는 차이가 큽니다. 이 모델은 2026년 9월 28일 정식 출시되었으며, 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $10.00입니다. 2026년 2월 19일 발표되었고 여전히 프리뷰 엔드포인트에서 제공되는 Gemini 3.1 Pro는 $2.00 및 $12.00입니다. 또한 Sonnet 5.5는 Artificial Analysis의 Intelligence Index v4.3에서 56점을 기록한 반면, Gemini 3.1 Pro Preview는 30점을 기록했습니다. 단일 하네스에서 26점 차이입니다. Gemini의 1,048,576 토큰 컨텍스트는 Gemini가 확실히 앞서는 유일한 핵심 수치입니다. 그러나 동일한 평가자는 하나의 개방형 작업을 완료하는 데 Google 모델은 $0.67, Anthropic 모델은 $7.60이 든다고 보고합니다. 이는 반대 방향으로 11배 차이입니다. 두 수치 모두 정확하며, 이들이 공존하는 이유 — 한쪽의 65,536 토큰 출력 상한과 다른 쪽의 장황함 문제 — 가 이 비교의 전부입니다.
각 엔드포인트가 실제로 무엇인지
계산에 앞서 정체를 바로잡으세요. 여기서 주체는 anthropic/claude-sonnet-5.5, 2026년 9월 28일 출시, 텍스트, 이미지 및 파일 입력, 1,000,000토큰 컨텍스트, 최대 출력 128,000토큰, Claude Platform에서 effort 매개변수의 기본값이 high인 적응형 사고. 상대는 google/gemini-3.1-pro-preview, 2026년 2월 19일 출시, 텍스트, 이미지, 비디오, 오디오 및 파일 입력, 1,048,576토큰 컨텍스트, 최대 출력 65,536토큰. 그 두 이름 중 하나에는 다른 하나에는 없는 단어가 들어 있으며, 그것은 장식이 아니다.
프리뷰 접미사가 붙은 지 7개월이 지났습니다. 그 기간에 Google은 여러 Flash 릴리스를 출시했고 Pro 등급의 후속 모델은 내놓지 않았으며, 3.1 Pro가 대체한 모델은 종료된 것으로 표시되어 있습니다. 그중 어느 것도 모델 자체의 결함은 아닙니다. 이 모델은 그동안 계속 실서비스 중이었고 안정적이었으며 가격도 올바르게 책정되어 있었습니다. 하지만 이는 여러분이 통합하고 있는 엔드포인트가 일반 제공(GA) 수명 주기 약정의 적용을 받지 않는다는 뜻이며, 이 제품군은 이미 Pro 모델 하나를 은퇴시킨 바 있습니다. 이를 각주가 아니라 상시 반영할 항목으로 취급하십시오. 잘못 판단할 경우 다년 아키텍처 결정의 비용이 달라지기 때문입니다.
반대 방향을 가리키는 두 수
토큰당 비교를 먼저 살펴보겠습니다. 누구나 실행하는 비교이고, 더 새로운 모델에 유리하기 때문입니다.
• 입력 — 양쪽 모두 백만 개당 $2.00; 대표 요금에서 정확히 동률
• 출력 — Claude Sonnet 5.5는 $10.00, Gemini 3.1 Pro는 $12.00; Anthropic 모델이 17% 더 저렴합니다.
• 캐시 읽기 — 티어 경계 미만 구간에서 둘 다 백만당 $0.20
• 캐시 쓰기 — Claude Sonnet 5.5의 5분 창에서는 백만 개당 $2.50인 반면, Gemini 3.1 Pro는 $0.375입니다. Google을 사용하면 캐시 항목을 작성하는 비용이 약 7배 더 저렴합니다
• 맥락 — 1,000,000 대 1,048,576; 실질적인 결과가 없는 차이
• 최대 출력 — 65,536 대비 128,000 토큰; Anthropic 모델은 한도가 거의 두 배
• 입력 모달리티 — 텍스트, 이미지 및 파일 대 텍스트, 이미지, 비디오, 오디오 및 파일
그다음, 동일한 평가자가 같은 주에 양쪽 모두 최대 노력 구성으로 수행한 작업별 비교: Claude Sonnet 5.5에는 $7.60, Gemini 3.1 Pro에는 $0.67. 11배다. 이 메커니즘은 추론된 것이 아니라 같은 페이지에 문서화되어 있다 — Sonnet 5.5는 인덱스 스위트 전반에서 4억 1천만 토큰을 생성했으며, 이 분야의 중앙값은 8,800만 토큰이었는데, 평가자는 이를 매우 장황하다고 설명한다. 반면 Gemini 3.1 Pro는 상당히 간결하다고 설명된다. 한 모델이 다른 모델보다 몇 배나 더 많이 작성할 때, 출력 단가에서의 17% 우위는 청구서 앞에서 살아남지 못한다.
이 교훈은 이 두 모델을 넘어 일반화된다: 요금표는 토큰에 가격을 매기지만, 청구는 완성된 결과에 대해 이루어진다. 가격표에서 멈추는 모든 비교는 잘못된 양을 측정하는 것이다.
200,000 토큰에서의 티어 경계
Gemini 3.1 Pro의 가격은 일률적이지 않으며, 그 단계는 위 비교의 일부를 뒤집을 만큼 충분히 큽니다. 200,000토큰 미만의 프롬프트에서는 요금이 입력 $2.00, 출력 $12.00, 캐시 읽기 $0.20입니다. 그 기준을 초과하면 전체 호출의 가격이 입력 $4.00, 출력 $18.00, 캐시 읽기 $0.40로 재책정됩니다 — 입력 요금은 두 배로 올라 정확히 Claude Sonnet 5.5의 두 배가 되고, 출력은 Anthropic 측에서 17% 더 저렴한 것에서 Google 측에서 80% 더 비싼 것으로 바뀝니다.
이 경계는 이례적이지 않다. 200,000토큰 프롬프트는 작은 코드베이스, 긴 계약서 묶음, 몇 시간 분량의 녹취록, 또는 한동안 작업해 온 에이전트에 해당한다. 장문 컨텍스트 작업은 바로 1M 토큰 창이 판매되는 용도이므로, 그 창이 가장 큰 가치를 발휘하는 등급은 동시에 가격 우위가 사라지는 등급이기도 하다. 프롬프트가 정기적으로 200,000토큰을 넘는다면, 랜딩 페이지의 요율이 아니라 $4.00 및 $18.00 기준으로 Gemini 3.1 Pro를 평가하십시오.
캐시 쓰기는 별도의 문장으로 다룰 가치가 있다. 왜냐하면 캐시 쓰기는 반대 방향으로 역전되며 티어 변경에서도 살아남기 때문이다. 100만 개당 $0.375 대 $2.50의 조건에서 Gemini는 캐시를 채우는 비용이 훨씬 저렴하며, 그 요금은 경계를 넘어갈 때도 변하지 않는다. 매 턴마다 큰 프리픽스를 재사용하는 대신 새로 구축하는 에이전트에게는, 그 한 줄이 입력 요금보다 더 큰 구조적 이점일 수 있다 — 그리고 이 비교에서 어떤 티어 경계도 건드리지 않는 유일한 줄이다.
65,536 토큰 상한, 그리고 그것이 아키텍처를 결정하는 이유
당신이 만들 수 있는 것을 가장 크게 바꾸는 수치는 최대 출력입니다. Gemini 3.1 Pro의 65,536 토큰 대 Claude Sonnet 5.5의 128,000 토큰입니다. 상한은 성능 지표가 아니라, 작업이 한 번의 호출에 들어갈 수 있는지에 대한 제약입니다.
대규모 아티팩트, 즉 완전한 소스 파일, 긴 보고서, 전체 문서, 구조화된 데이터셋을 출력하는 모든 작업은 Gemini의 경우 65,536토큰을 넘으면 상태를 주고받는 일련의 호출 체인으로 분해해야 합니다. 분해는 매 단계마다 더 많은 입력 토큰과 더 많은 오케스트레이션 코드를 요구하며, 한 청크가 끝나고 다음 청크가 시작되는 이음새에서 새로운 실패 모드를 낳습니다. 두 번째 제약이 이를 심화합니다: Anthropic 자체 자료에 따르면 Sonnet 5.5의 안정적인 장시간 작업을 위한 실질적 임계값은 상당히 더 높으며, Gemini의 상한은 둘 중 두 배 더 빡빡한 쪽입니다. 가장 긴 아티팩트가 40,000토큰이라면 이 섹션은 무관하며 작업별 비용으로 비교해야 합니다. 100,000이라면 상한이 이미 당신을 대신해 결정을 내린 셈입니다.
모달리티, Gemini가 완전히 장악한 단 하나의 축
Gemini 3.1 Pro는 동영상과 오디오를 입력으로 받습니다. Claude Sonnet 5.5는 텍스트, 이미지, 파일을 입력으로 받으며 동영상과 오디오는 둘 다 받을 수 없습니다. 통화 녹음, 화면 캡처, 제품 동영상, 회의 오디오 등 미디어를 중심으로 구성된 워크로드의 경우, 이 조합에서는 대체할 수 있는 방법이 없으며, 두 엔드포인트 중 하나만 해당 입력을 받을 수 있으므로 가격 비교는 무의미합니다. 텍스트 및 이미지 워크로드의 경우에는 기능 집합이 겹치므로 위의 가격 계산이 적용됩니다.
Gemini의 또 다른 운영 수치는 언급할 가치가 있습니다. 지능을 앞세운 페이지에서는 놓치기 쉽기 때문입니다. 우리 카탈로그는 p50에서 첫 토큰 지연 시간 중앙값 10,000ms, 초당 약 1,283토큰의 출력 속도, 그리고 7일 오류율 56.8%를 측정합니다. 이는 매우 빠른 모델이면서 관측된 실패율이 매우 높은 모델로, 넉넉한 재시도 예산이 있는 배치 작업에는 훨씬 잘 맞지만 사용자가 기다리는 어떤 작업에도 그만큼 잘 맞지는 않습니다. Claude Sonnet 5.5는 비교하자면 더 느리고 더 안정적인 프로필입니다. 오류율은 두 공급업체 어느 쪽의 랜딩 페이지에도 나타나지 않습니다. 이는 후보들이 이들을 측정하는 단일 엔드포인트 뒤에 있을 때에만 드러나는 종류의 수치이며, 두 개의 대시보드가 아니라 한 곳에서 둘 모두를 평가해야 하는 한 가지 이유입니다.
무엇을 어디로 라우팅할지
작업이 텍스트나 이미지일 때, 26포인트 지수 격차가 중요할 만큼 품질 기준이 높을 때, 출력 아티팩트가 128,000토큰 상한이 필요할 정도로 길 때, 또는 워크로드가 인터랙티브하고 56.8% 오류율이 용납될 수 없을 때에는 Claude Sonnet 5.5로 보내세요. 구조화되고 범위가 정해진 작업에서는 $7.60이라는 수치를 만들어내는 장황성 페널티가 대부분 사라지고, 토큰당 이점이 실제 금전적 이익으로 이어집니다.
입력에 비디오나 오디오가 포함되어 있을 때, 프롬프트가 200,000 토큰 미만으로 유지되면서 볼륨이 클 때, 대규모 캐시를 자주 작성하고 $0.375의 캐시 쓰기 비용이 누적될 때, 또는 작업이 배치 형태이고 작업당 비용이 유일하게 중요한 열일 때 Gemini 3.1 Pro로 보내세요 — 작업당 $0.67 대 $7.60이라면 재시도를 아주 많이 감당할 수 있습니다.
두 모델 모두 오늘 OrcaRouter에서 라우팅할 수 있습니다. google/gemini-3.1-pro-preview와 anthropic/claude-sonnet-5 둘 다 하나의 자격 증명으로 제공자의 정가에 0% 마크업으로 라이브 카탈로그에 등재되어 있습니다, 즉 위의 분할은 두 개의 통합이 아니라 하나의 라우팅 규칙으로 표현할 수 있습니다 — 미디어 형태의 요청은 한 엔드포인트로, 텍스트와 이미지 요청은 다른 엔드포인트로 보내고, 둘 중 하나가 오류를 내기 시작하면 페일오버하면 됩니다. Claude Sonnet 5.5는 아직 우리 플랫폼의 라우트가 아닙니다. 등재되면 동일한 규칙이 새 키 없이 이를 처리합니다.
이 맞대결에 대한 솔직한 평결: Claude Sonnet 5.5는 훨씬 더 나은 모델이며 토큰당 더 저렴하고, Gemini 3.1 Pro는 개방형 작업에서 완료된 작업당 대략 11배 더 저렴하며, 캐시를 작성하는 데 6배 더 저렴하고, 둘 중 유일하게 비디오를 볼 수 있는 모델이다. 당신에게 요금표를 들이대는 사람은 존재하지 않는 비교를 이야기하고 있는 것이다; 실제로 존재하는 비교는 당신이 어떤 요청을 한정할 수 있는지에 관한 것이다.



이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
