
Gemini 3.7 Flash vs Claude Opus 5: 6분의 1 가격으로 얻는 일꾼의 가치
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 221 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
이 비교를 가치 있게 만드는 숫자가 있습니다: Anthropic의 플래그십인 Claude Opus 5는 Artificial Analysis Intelligence Index에서 61점을 기록한 반면, 2026년 8월 13일에 출시된 Google의 워크호스인 Gemini 3.7 Flash는 56점입니다. 5점 차이입니다. 그리고 Google이 연말까지 진행하는 프로모션 요금으로 Gemini 3.7 Flash는 입력 토큰 100만 개당 $0.75, 출력 토큰 100만 개당 $3.75입니다 — 이는 Claude Opus 5의 $5.00 / $25.00의 약 6분의 1입니다. 과거에 "워크호스"와 "플래그십"을 구분하던 격차는 좁혀져서, 이제 정직한 질문은 저렴한 모델이 좋은지가 아니라, 비싼 모델이 저렴한 모델이 할 수 없는 무엇을 여전히 할 수 있는지입니다.
비교의 구도가 중요합니다. 이는 동급끼리의 비교가 아니며, 동급이라고 가장하는 것은 당신을 오도할 수 있기 때문입니다. 2026년 7월 24일에 출시된 Claude Opus 5는 Anthropic의 일반 공개 모델 중 가장 강력한 모델로, 1M 토큰 컨텍스트 추론 모델이자 128K 출력 상한을 갖추고 있으며, 가장 어려운 엔지니어링·연구·컴퓨터 사용 작업을 위해 설계되었습니다. Gemini 3.7 Flash는 Google의 대량 트래픽 처리 주력 모델입니다. 1M 컨텍스트, 64K 출력, 텍스트/이미지/오디오/비디오 입력을 지원하며, 설계 방향이 Opus와 정반대입니다. 즉, 일상적인 트래픽의 95%를 위해 최대한 많은 토큰을 최대한 저렴하게 스트리밍하는 것입니다. 이 둘을 단일 수치로 비교하면 잘못된 답을 얻게 됩니다. 실제로 실행하는 작업의 형태를 기준으로 비교해야 유용한 답을 얻을 수 있습니다.

5가지 포인트, 자세히 풀어보기
Intelligence Index는 선형 척도가 아니므로, 56과 61 사이의 격차는 어떤 과업에서는 다른 과업보다 더 큰 의미를 갖는다. Opus 5의 61점은 복합 지수에서 가장 어려운 구성 요소들에서 선두를 차지한 결과다. ARC-AGI-3에서 30.2, FrontierBench에서 43.3, SWE-bench Pro에서 79.2는 모두 벤더가 보고한 수치지만, Flash급 모델은 범접하지 못하는 최첨단 추론 성과다. Gemini 3.7 Flash의 56점은 다른 방식으로 얻어졌다. Google이 보고한 수치(DeepSWE v1.1에서 65.3, WebDev Arena에서 1588 Elo, AutomationBench에서 30.4)는 이 모델이 경계가 분명하고 대량 처리되는 엔지니어링과 에이전트 작업에 탁월하지만, 참신한 개방형 추론에는 강하지 않다는 것을 보여준다. 따라서 다섯 지수 포인트는 표면상의 거리가 작아 보여도 실제로는 뚜렷한 능력 절벽을 의미한다.
• Intelligence Index — Artificial Analysis에 따르면 Gemini 3.7 Flash는 56, Claude Opus 5(최대 노력)는 61입니다.
• 출력 속도 — Gemini 3.7 Flash는 초당 약 340토큰, Claude Opus 5는 초당 약 53토큰(Artificial Analysis 기준). 6.4배 차이입니다.
• 컨텍스트 창 — 둘 다 1M 토큰을 지원하지만, Claude Opus 5의 출력 상한은 128K인 반면 Gemini 3.7 Flash는 64K입니다.
• 입력 가격 — $0.75 (프로모션 가격, 2026년까지) 대비 $5.00 — 6.7배 격차.
• 산출 가격 — $3.75(프로모션) 대비 $25.00 — 6.7배 격차.
• 멀티모달 입력 — Gemini 3.7 Flash는 텍스트, 이미지, 오디오, 비디오를 지원하며, Claude Opus 5는 텍스트와 이미지만 지원합니다.

Claude Opus 5가 여전히 제 값을 하는 곳
플래그십의 사례는 향수가 아니라 작업 분포의 꼬리입니다. 장기 지평 자율 엔지니어링 — 모델이 한 시간 동안 코드베이스만 두고 계획, 편집, 테스트, 반복 작업을 수행하는 것 — 이 바로 Opus 5가 보고된 우위가 가장 큰 영역이며, 컴퓨터 사용 결과(OSWorld 71점, 공급업체 보고)는 Gemini 3.7 Flash가 진입하지 못하는 등급에 Opus 5를 위치시킵니다. Claude Opus 4.8에서 마이그레이션하는 팀은 Opus 5가 재보정된 노력 수준과 함께 적응형 사고를 기본으로 활성화한 채 출시되며, 사고 비활성화가 높은 노력 수준으로 제한된다는 점 — 기존 파이프라인을 깨뜨릴 수 있는 동작 변경 — 도 알아야 합니다. 그 어느 것도 Opus 5를 어려운 작업에 잘못된 선택으로 만들지는 않습니다. 다만 가격이 시사하는 것보다 더 좁은 작업 범위에 적합한 선택이 되게 할 뿐입니다.
Opus 5가 내세우는 또 다른 측면은 Anthropic의 플랫폼 경제성입니다. 프롬프트 캐싱은 캐시 적중 시 유효 입력 비용을 최대 90%까지 절감할 수 있고, 배치 티어는 비동기 트래픽에 대한 가격을 절반으로 낮춥니다. 따라서 캐시 적중률과 배치 비중이 높은 워크로드의 경우 Opus 5의 실제 청구액은 표면 가격인 $5/$25가 암시하는 것보다 스티커 가격의 그림자에 훨씬 가까워집니다. 플래그십의 실제 가격은 워크로드에 따라 달라지지만, 워크호스의 실제 가격은 그렇지 않습니다.
Gemini 3.7 Flash가 더 현명한 선택인 경우
스트리밍, 배치, 또는 긴 컨텍스트를 처리하는 모든 작업에 있어 이 워크호스는 단순히 더 저렴할 뿐만 아니라 구조적으로 더 유리한 위치에 있습니다. 6.4배의 출력 속도 우위는 무엇을 구축할 수 있는지를 바꿉니다: 대화형 코딩 완성, 전체 저장소의 실시간 요약, 분당 많은 호출이 필요한 에이전트 루프 — 이 모든 것은 품질 한계에 도달하기 훨씬 전에 53토큰/초 모델에서 처리량 한계에 부딪힙니다. Gemini 3.7 Flash는 또한 오디오 및 비디오 입력을 지원하므로, 어떤 Claude 모델도 해당 입력 축에서 제공하지 못하는 사용 사례(회의 전사, 비디오 프레임 이해)를 열어줍니다. 또한 조정 가능한 사고 수준 덕분에 값싼 일상 작업은 낮은 노력으로 실행하고, 더 어려운 작업은 높은 노력으로 실행하여 사용한 추론 비용만 지불할 수 있습니다.
페어링 플레이북
현장 실무자들은 이제 대부분 이 문제를 더 이상 이분법(하나 아니면 다른 하나)으로 접근하지 않습니다. 반복적으로 등장하는 패턴은 분할 정복(divide-and-conquer) 루프입니다. Claude Opus 5가 계획과 설계를 담당하고, Gemini 3.7 Flash가 대량 구현을 처리하며, Opus 5가 검토를 맡습니다. 각 모델은 품질 대비 비용 비율이 가장 우수한 지점에 배치되며, 결합된 파이프라인은 둘 중 하나만 단독 운영할 때보다 비용이 저렴하고 속도도 더 빠릅니다. 라우팅 계층은 이 패턴을 아키텍처적 구조가 아닌 실용적인 방식으로 구현합니다. Claude Opus 5는 OrcaRouter에서 Anthropic 공시 가격 그대로 마크업 0%로 제공되며, 라우팅 DSL을 사용하면 플래너는 Opus 5로 보내고 실행기는 Flash급 모델군에 분산시키는 단일 호출을 하나의 OpenAI 호환 엔드포인트 뒤에서 구성할 수 있습니다. 여기에 한 단계 더 나아가 모델 융합(model fusion)에서는 두 모델이 동일한 질문에 각각 응답하고, 심사자(judge)가 두 판정을 조정합니다.

법안 나란히 보기
실제 숫자를 대입해 보자. 하루에 입력 토큰 1,000만 개와 출력 토큰 100만 개를 처리하는 — 무겁지만 흔한 에이전틱 파이프라인 — 경우, Claude Opus 5의 표준 요금으로 $75 + $375 = $450이 청구된다. 같은 트래픽을 Gemini 3.7 Flash의 프로모션 요금으로 처리하면 $7.50 + $37.50 = $45, 정확히 10분의 1이다. Opus의 입력 측 캐시 할인을 고려해도 그 격차는 10배 수준이며, 이것이 "대량 작업은 flash로, 어려운 꼬리 부분은 opus로"라는 방식이 이례적인 구성이 아니라 기본 프로덕션 형태가 된 이유다. 프로모션이 끝나면 Gemini 3.7 Flash의 입력 요금은 두 배가 되어 $1.50가 된다. 그래도 여전히 Opus 요금의 3분의 1이고, 이 조합의 계산이 성립할 만큼 충분히 저렴하다.
솔직한 해석
5포인트 격차는 실재하며, 정확히 예상되는 지점, 즉 가장 어렵고 가장 긴 호라이즌을 가진 작업에서 나타납니다. 워크로드가 그러한 꼬리 부분(프런티어 연구, 수 시간에 걸친 자율 엔지니어링, 컴퓨터 사용)에 의해 지배된다면, Claude Opus 5는 그 가격을 정당화하므로 지나치게 고민할 필요가 없습니다. 워크로드가 볼륨, 지연 시간, 또는 긴 컨텍스트에 의해 지배된다면, 프로모션 요금의 Gemini 3.7 Flash가 한 차원 더 나은 구매이며, 플래그십과의 격차는 벤치마크 한 단계이지 심연이 아닙니다. 모델들은 수렴하고 있으며, 대부분의 팀에게 실용적인 답은 더 이상 "어느 것"이 아니라 "작업의 어느 부분을 각각에 맡길 것인가"입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
