Claude Sonnet 5.5 대 Gemini 3.1 Pro를 위한 히어로 타이틀 카드를 생성했습니다. 부제는 '토큰당 더 저렴하지만, 작업당 11배 더 비쌈'이며, 백만 토큰당 $2.00와 $10.00을 $2.00와 $12.00과 대비해 보여주고, 오른쪽에는 65,536토큰 출력 상한이 표시되어 있으며, 오른쪽 아래 모서리에는 OrcaRouter 로고가 합성되어 있습니다.
Guides & Insights

Claude Sonnet 5.5 vs Gemini 3.1 Pro: 토큰당 더 저렴하지만, 작업당 11배 더 비싸다

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

요금표에서 Claude Sonnet 5.5는 더 저렴한 모델이며, 성능 면에서는 차이가 큽니다. 이 모델은 2026년 9월 28일 정식 출시되었으며, 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $10.00입니다. 2026년 2월 19일 발표되었고 여전히 프리뷰 엔드포인트에서 제공되는 Gemini 3.1 Pro는 $2.00 및 $12.00입니다. 또한 Sonnet 5.5는 Artificial Analysis의 Intelligence Index v4.3에서 56점을 기록한 반면, Gemini 3.1 Pro Preview는 30점을 기록했습니다. 단일 하네스에서 26점 차이입니다. Gem​ini의 1,048,576 토큰 컨텍스트는 Gemini가 확실히 앞서는 유일한 핵심 수치입니다. 그러나 동일한 평가자는 하나의 개방형 작업을 완료하는 데 Goog​le 모델은 $0.67, Anthro​pic 모델은 $7.60이 든다고 보고합니다. 이는 반대 방향으로 11배 차이입니다. 두 수치 모두 정확하며, 이들이 공존하는 이유 — 한쪽의 65,536 토큰 출력 상한과 다른 쪽의 장황함 문제 — 가 이 비교의 전부입니다.

각 엔드포인트가 실제로 무엇인지

계산에 앞서 정체를 바로잡으세요. 여기서 주체는 anthropic/claude-sonnet-5.5, 2026년 9월 28일 출시, 텍스트, 이미지 및 파일 입력, 1,000,000토큰 컨텍스트, 최대 출력 128,000토큰, Claude Platform에서 effort 매개변수의 기본값이 high인 적응형 사고. 상대는 google/gemini-3.1-pro-preview, 2026년 2월 19일 출시, 텍스트, 이미지, 비디오, 오디오 및 파일 입력, 1,048,576토큰 컨텍스트, 최대 출력 65,536토큰. 그 두 이름 중 하나에는 다른 하나에는 없는 단어가 들어 있으며, 그것은 장식이 아니다.

프리뷰 접미사가 붙은 지 7개월이 지났습니다. 그 기간에 Google은 여러 Flash 릴리스를 출시했고 Pro 등급의 후속 모델은 내놓지 않았으며, 3.1 Pro가 대체한 모델은 종료된 것으로 표시되어 있습니다. 그중 어느 것도 모델 자체의 결함은 아닙니다. 이 모델은 그동안 계속 실서비스 중이었고 안정적이었으며 가격도 올바르게 책정되어 있었습니다. 하지만 이는 여러분이 통합하고 있는 엔드포인트가 일반 제공(GA) 수명 주기 약정의 적용을 받지 않는다는 뜻이며, 이 제품군은 이미 Pro 모델 하나를 은퇴시킨 바 있습니다. 이를 각주가 아니라 상시 반영할 항목으로 취급하십시오. 잘못 판단할 경우 다년 아키텍처 결정의 비용이 달라지기 때문입니다.

반대 방향을 가리키는 두 수

토큰당 비교를 먼저 살펴보겠습니다. 누구나 실행하는 비교이고, 더 새로운 모델에 유리하기 때문입니다.

• 입력 — 양쪽 모두 백만 개당 $2.00; 대표 요금에서 정확히 동률

• 출력 — Claude Sonnet 5.5는 $10.00, Gemini 3.1 Pro는 $12.00; Anthropic 모델이 17% 더 저렴합니다.

• 캐시 읽기 — 티어 경계 미만 구간에서 둘 다 백만당 $0.20

• 캐시 쓰기 — Claude Sonnet 5.5의 5분 창에서는 백만 개당 $2.50인 반면, Gemini 3.1 Pro는 $0.375입니다. Google을 사용하면 캐시 항목을 작성하는 비용이 약 7배 더 저렴합니다

• 맥락 — 1,000,000 대 1,048,576; 실질적인 결과가 없는 차이

• 최대 출력 — 65,536 대비 128,000 토큰; Anthropic 모델은 한도가 거의 두 배

• 입력 모달리티 — 텍스트, 이미지 및 파일 대 텍스트, 이미지, 비디오, 오디오 및 파일

그다음, 동일한 평가자가 같은 주에 양쪽 모두 최대 노력 구성으로 수행한 작업별 비교: Claude Sonnet 5.5에는 $7.60, Gemini 3.1 Pro에는 $0.67. 11배다. 이 메커니즘은 추론된 것이 아니라 같은 페이지에 문서화되어 있다 — Sonnet 5.5는 인덱스 스위트 전반에서 4억 1천만 토큰을 생성했으며, 이 분야의 중앙값은 8,800만 토큰이었는데, 평가자는 이를 매우 장황하다고 설명한다. 반면 Gemini 3.1 Pro는 상당히 간결하다고 설명된다. 한 모델이 다른 모델보다 몇 배나 더 많이 작성할 때, 출력 단가에서의 17% 우위는 청구서 앞에서 살아남지 못한다.

이 교훈은 이 두 모델을 넘어 일반화된다: 요금표는 토큰에 가격을 매기지만, 청구는 완성된 결과에 대해 이루어진다. 가격표에서 멈추는 모든 비교는 잘못된 양을 측정하는 것이다.

200,000 토큰에서의 티어 경계

Gemini 3.1 Pro의 가격은 일률적이지 않으며, 그 단계는 위 비교의 일부를 뒤집을 만큼 충분히 큽니다. 200,000토큰 미만의 프롬프트에서는 요금이 입력 $2.00, 출력 $12.00, 캐시 읽기 $0.20입니다. 그 기준을 초과하면 전체 호출의 가격이 입력 $4.00, 출력 $18.00, 캐시 읽기 $0.40로 재책정됩니다 — 입력 요금은 두 배로 올라 정확히 Claude Sonnet 5.5의 두 배가 되고, 출력은 Anthropic 측에서 17% 더 저렴한 것에서 Google 측에서 80% 더 비싼 것으로 바뀝니다.

이 경계는 이례적이지 않다. 200,000토큰 프롬프트는 작은 코드베이스, 긴 계약서 묶음, 몇 시간 분량의 녹취록, 또는 한동안 작업해 온 에이전트에 해당한다. 장문 컨텍스트 작업은 바로 1M 토큰 창이 판매되는 용도이므로, 그 창이 가장 큰 가치를 발휘하는 등급은 동시에 가격 우위가 사라지는 등급이기도 하다. 프롬프트가 정기적으로 200,000토큰을 넘는다면, 랜딩 페이지의 요율이 아니라 $4.00 및 $18.00 기준으로 Gemini 3.1 Pro를 평가하십시오.

캐시 쓰기는 별도의 문장으로 다룰 가치가 있다. 왜냐하면 캐시 쓰기는 반대 방향으로 역전되며 티어 변경에서도 살아남기 때문이다. 100만 개당 $0.375 대 $2.50의 조건에서 Gemini는 캐시를 채우는 비용이 훨씬 저렴하며, 그 요금은 경계를 넘어갈 때도 변하지 않는다. 매 턴마다 큰 프리픽스를 재사용하는 대신 새로 구축하는 에이전트에게는, 그 한 줄이 입력 요금보다 더 큰 구조적 이점일 수 있다 — 그리고 이 비교에서 어떤 티어 경계도 건드리지 않는 유일한 줄이다.

65,536 토큰 상한, 그리고 그것이 아키텍처를 결정하는 이유

당신이 만들 수 있는 것을 가장 크게 바꾸는 수치는 최대 출력입니다. Gemini 3.1 Pro의 65,536 토큰 대 Claude Sonnet 5.5의 128,000 토큰입니다. 상한은 성능 지표가 아니라, 작업이 한 번의 호출에 들어갈 수 있는지에 대한 제약입니다.

대규모 아티팩트, 즉 완전한 소스 파일, 긴 보고서, 전체 문서, 구조화된 데이터셋을 출력하는 모든 작업은 Gemini의 경우 65,536토큰을 넘으면 상태를 주고받는 일련의 호출 체인으로 분해해야 합니다. 분해는 매 단계마다 더 많은 입력 토큰과 더 많은 오케스트레이션 코드를 요구하며, 한 청크가 끝나고 다음 청크가 시작되는 이음새에서 새로운 실패 모드를 낳습니다. 두 번째 제약이 이를 심화합니다: Anthropic 자체 자료에 따르면 Sonnet 5.5의 안정적인 장시간 작업을 위한 실질적 임계값은 상당히 더 높으며, Gemini의 상한은 둘 중 두 배 더 빡빡한 쪽입니다. 가장 긴 아티팩트가 40,000토큰이라면 이 섹션은 무관하며 작업별 비용으로 비교해야 합니다. 100,000이라면 상한이 이미 당신을 대신해 결정을 내린 셈입니다.

모달리티, Gemini가 완전히 장악한 단 하나의 축

Gemini 3.1 Pro는 동영상과 오디오를 입력으로 받습니다. Claude Sonnet 5.5는 텍스트, 이미지, 파일을 입력으로 받으며 동영상과 오디오는 둘 다 받을 수 없습니다. 통화 녹음, 화면 캡처, 제품 동영상, 회의 오디오 등 미디어를 중심으로 구성된 워크로드의 경우, 이 조합에서는 대체할 수 있는 방법이 없으며, 두 엔드포인트 중 하나만 해당 입력을 받을 수 있으므로 가격 비교는 무의미합니다. 텍스트 및 이미지 워크로드의 경우에는 기능 집합이 겹치므로 위의 가격 계산이 적용됩니다.

Gemini의 또 다른 운영 수치는 언급할 가치가 있습니다. 지능을 앞세운 페이지에서는 놓치기 쉽기 때문입니다. 우리 카탈로그는 p50에서 첫 토큰 지연 시간 중앙값 10,000ms, 초당 약 1,283토큰의 출력 속도, 그리고 7일 오류율 56.8%를 측정합니다. 이는 매우 빠른 모델이면서 관측된 실패율이 매우 높은 모델로, 넉넉한 재시도 예산이 있는 배치 작업에는 훨씬 잘 맞지만 사용자가 기다리는 어떤 작업에도 그만큼 잘 맞지는 않습니다. Claude Sonnet 5.5는 비교하자면 더 느리고 더 안정적인 프로필입니다. 오류율은 두 공급업체 어느 쪽의 랜딩 페이지에도 나타나지 않습니다. 이는 후보들이 이들을 측정하는 단일 엔드포인트 뒤에 있을 때에만 드러나는 종류의 수치이며, 두 개의 대시보드가 아니라 한 곳에서 둘 모두를 평가해야 하는 한 가지 이유입니다.

무엇을 어디로 라우팅할지

작업이 텍스트나 이미지일 때, 26포인트 지수 격차가 중요할 만큼 품질 기준이 높을 때, 출력 아티팩트가 128,000토큰 상한이 필요할 정도로 길 때, 또는 워크로드가 인터랙티브하고 56.8% 오류율이 용납될 수 없을 때에는 Claude Sonnet 5.5로 보내세요. 구조화되고 범위가 정해진 작업에서는 $7.60이라는 수치를 만들어내는 장황성 페널티가 대부분 사라지고, 토큰당 이점이 실제 금전적 이익으로 이어집니다.

입력에 비디오나 오디오가 포함되어 있을 때, 프롬프트가 200,000 토큰 미만으로 유지되면서 볼륨이 클 때, 대규모 캐시를 자주 작성하고 $0.375의 캐시 쓰기 비용이 누적될 때, 또는 작업이 배치 형태이고 작업당 비용이 유일하게 중요한 열일 때 Gemini 3.1 Pro로 보내세요 — 작업당 $0.67 대 $7.60이라면 재시도를 아주 많이 감당할 수 있습니다.

두 모델 모두 오늘 OrcaRouter에서 라우팅할 수 있습니다. google/gemini-3.1-pro-preview와 anthropic/claude-sonnet-5 둘 다 하나의 자격 증명으로 제공자의 정가에 0% 마크업으로 라이브 카탈로그에 등재되어 있습니다, 즉 위의 분할은 두 개의 통합이 아니라 하나의 라우팅 규칙으로 표현할 수 있습니다 — 미디어 형태의 요청은 한 엔드포인트로, 텍스트와 이미지 요청은 다른 엔드포인트로 보내고, 둘 중 하나가 오류를 내기 시작하면 페일오버하면 됩니다. Claude Sonnet 5.5는 아직 우리 플랫폼의 라우트가 아닙니다. 등재되면 동일한 규칙이 새 키 없이 이를 처리합니다.

이 맞대결에 대한 솔직한 평결: Claude Sonnet 5.5는 훨씬 더 나은 모델이며 토큰당 더 저렴하고, Gemini 3.1 Pro는 개방형 작업에서 완료된 작업당 대략 11배 더 저렴하며, 캐시를 작성하는 데 6배 더 저렴하고, 둘 중 유일하게 비디오를 볼 수 있는 모델이다. 당신에게 요금표를 들이대는 사람은 존재하지 않는 비교를 이야기하고 있는 것이다; 실제로 존재하는 비교는 당신이 어떤 요청을 한정할 수 있는지에 관한 것이다.

A two-column scoreboard for Claude Sonnet 5.5 and Gemini 3.1 Pro Preview across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column Gemini 3.1 Pro Preview: input $2.00 rising to $4.00 over 200K tokens, output $12.00 rising to $18.00, cache read $0.20, cache write $0.375, 1,048,576-token context with a 65,536-token max output, input modality text, image, video, audio and file, AA Intelligence Index v4.3 score 30, $0.67 per task on the index run. The card heading reads "Cheaper per token, eleven times dearer per finished task", and a footer line notes that Gemini 3.1 Pro remains a preview endpoint seven months after its February 19, 2026 announcement.Screenshot of the OrcaRouter model page for Google Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), showing the model header, the 1,048,576-token context window, the 65,536-token maximum output, audio, file, image, text and video input, the Vision, Audio, Tools, JSON and Reasoning capability tags, a 10.00-second p50 time to first token, a "Public benchmarks by Google · 2026-02-19" line, and the $2.00 input and $12.00 output prices per million tokens.Screenshot of Artificial Analysis's model page for Gemini 3.1 Pro Preview, marked a proprietary model and released February 2026, showing In $2.00 and Out $12.00 with a 90% cache discount, the Intelligence Index score of 30, an output rate of 114 tokens per second, the $0.67 average cost per task, and 67M output tokens described as fairly concise against a median of 88M.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트