
Claude Haiku 5.5 vs Gemini 3.6 Flash: 답변당 비용 7.5배, 모델 점수는 9점 낮음
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Claude Haiku 5.5와 Gemini 3.6 Flash는 각자의 라인업에서 같은 등급, 즉 작고 빠르고 저렴한 모델에 속하지만, 닮은 점은 거기까지입니다. Artificial Analysis Intelligence Index v4.3.2에서 Claude Haiku 5.5는 Max 구성으로 43.40점을 기록한 반면, Gemini 3.6 Flash는 High 구성으로 33.98점을 기록했습니다. 같은 실행에서 Index 작업 하나를 완료하는 데 드는 비용은 Claude Haiku 5.5가 $0.21, Gemini 3.6 Flash가 $1.60입니다.
그 두 수치는 함께 읽어야 합니다. 어느 하나만 보면 오해를 낳기 때문입니다. 더 저렴한 모델은 소폭 저렴한 게 아닙니다. 완성된 작업 한 건당 7.5배 더 저렴합니다. 그리고 그것이 앞서는 모델도 소폭 약한 게 아닙니다. 지수 9.42점만큼 약한데, 이는 182개 모델 순위표에서 상위 사분위와 중간 사이의 거리에 해당합니다.
두 사실 모두 동일한 독립 실행에서 나온 것이며, 이는 여기 있는 벤더 카드가 둘 중 어느 것도 알려주지 않기 때문에 중요하다. Anthropic은 2026년 10월 7일에 Claude Haiku 5.5를 출시했고, Google은 2026년 7월 21일에 Gemini 3.6 Flash를 내놓았다. 그 사이의 석 달이 흥미로운 부분이다.
두 장의 카드, 나란히
백만 토큰당 미국 달러 기준. Anthropic과 Google의 요금은 각자의 가격 책정 문서에서 가져왔습니다. 공유 행은 Artificial Analysis Intelligence Index v4.3.2입니다. 캐시됨 2026-10-08.

• 입력 — Claude Haiku 5.5: 최대 100,000 토큰까지 $0.10, 초과 시 $0.50; Gemini 3.6 Flash: 오늘 기준 $0.75 정액, 1월 1일에 $1.00로 인상.
• 출력 — Claude Haiku 5.5는 최대 100,000 토큰까지 $0.50, 초과분은 $2.50; Gemini 3.6 Flash는 오늘 $3.75 정액이며, 같은 날짜에 $7.50로 인상됩니다.
• 캐시된 입력 — Claude Haiku 5.5 $0.01 및 $0.05; Gemini 3.6 Flash $0.075, 여기에 시간당 100만 토큰당 $0.50의 저장 요금이 추가됩니다.
• 컨텍스트 및 출력 상한 — 둘 다 1M 토큰. Claude Haiku 5.5는 응답을 128,000 토큰으로, Gemini 3.6 Flash는 65,536 토큰으로 제한합니다.
• 모달리티 — Claude Haiku 5.5는 텍스트와 이미지를 입력으로 받습니다. Gemini 3.6 Flash는 텍스트, 이미지, 비디오, 오디오 및 파일을 입력으로 받습니다. 이 항목은 Google 쪽이 확실히 앞서는 유일한 항목이며, 미디어 이해 파이프라인에서는 전체 판단을 좌우할 수 있습니다.
• 독립 점수 — Claude Haiku 5.5 (Max) 43.40점 대 Gemini 3.6 Flash (High) 33.98점.
• 완료된 작업당 비용 — 동일한 평가 실행에서 $0.21 대 $1.60.

왜 토큰당이 아니라 작업당 수치를 사용해야 하는가
요율표 배수는 이미 입력에서 7.5, 출력에서 7.5로 보이므로, 작업당 수치는 여기서 놀랄 일이 아니다 — 하지만 두 모델이 한 측정에서는 같은 지점에 도달하고 다른 측정에서는 그토록 멀리 벌어지는 이유를 보여줄 가치는 있다. 같은 산술이 이 배치의 다른 맞대결에서는 반대 방향으로 작용하기 때문이다.
Gemini 3.6 Flash는 둘 중 덜 장황한 쪽입니다. Intelligence Index 작업당 41,606개의 출력 토큰을 생성합니다 — 추론 20,061개, 답변 21,545개 — 반면 Claude Haiku 5.5는 162,164개로, 추론 129,047개와 답변 33,118개로 나뉩니다. Anthropic의 모델은 같은 작업을 수행하는 데 거의 네 배나 많은 토큰을 소비하며, 출력 속도마저 Google의 7분의 1이므로 토큰 격차와 속도 격차는 상쇄되지 않고 곱해집니다.
저렴한 단가에 대량 사용을 곱한 그 조합은 Claude Haiku 5.5의 경제성을 솔직하게 설명하는 표현이며, Anthropic 자체 출시 게시물도 그 이면을 인정합니다: 이 모델은 "최대 100,000토큰의 프롬프트가 있는 작업에 사용할 때 특히 가성비가 뛰어나며, 이런 작업은 이전 Haiku 모델에 대한 요청의 약 90%를 차지합니다." 100,000토큰을 넘으면 입력 요금은 $0.50, 출력 요금은 $2.50이 되고, 이때 Gemini 3.6 Flash 대비 배수는 약 1.5배로 좁혀집니다.
이 비교가 멈춰 있는 동안 Google 자체 티어가 한 일
여기서부터 이 글은 두 모델 비교를 멈추고, 당신이 실제로 어떤 Gemini와 비교하고 있는지에 대한 경고가 된다.
Google은 세 세대에 걸쳐 Flash 가격을 고정해 왔습니다. Gemini 3.6 Flash, Gemini 3.7 Flash, Gemini 3.8 Flash는 모두 Google 자체 가격 문서에서 입력 $0.75, 출력 $3.75로 책정되어 있으며, 캐시 요금도 동일한 $0.075이고, 2027년 1월 1일에 $1.50 및 $7.50로 인상되는 것도 동일합니다. 3.6 라인에 대한 Google의 카드는 이를 "우리의 이전 세대 Flash 모델"이라고 설명하는데, 이는 해당 공급업체가 직접 사용한 표현입니다.
움직인 것은 점수였지, 가격이 아니었다. 독립 리더보드에서 Gemini 3.6 Flash는 33.98점, Gemini 3.7 Flash는 39.06점, Gemini 3.8 Flash는 40.93점을 기록했다 — 모두 공개된 최고 강도 구성에서다. 6주 만에 Google의 플래시 등급 안에서 9개의 지수 점수가 올랐고, 요금은 변하지 않았다.
평가 도중인 사람에게 미치는 결과는 구체적입니다: 3주 전에 이 맞대결을 Gemini 3.7 Flash와 벤치마크했다면 그 결과는 이미 낡았고, Gemini 3.8 Flash와 벤치마크하면 Claude Haiku 5.5와의 격차는 2.47점으로 좁혀집니다. Gemini 3.6 Flash는 이 비교에서 Anthropic을 가장 유리하게 보이게 하는 버전이며, 동시에 Google이 실제로 판매하기에는 가장 거리가 먼 버전이기도 합니다.
Artificial Analysis는 3.6 항목을 사용 중단됨으로 표시합니다. Google의 가격 문서는 여전히 해당 요율을 공개하고 있으며, 모델 목록도 여전히 3.6 섹션으로 연결됩니다. 따라서 정직한 해석은 '사라졌다'가 아니라 '자기 패밀리 안에서 10주 만에 두 번 대체되었다'는 것이며 — 이는 이 등급이 얼마나 빠르게 움직이는지에 관한 사실이지, 비교를 건너뛸 이유는 아닙니다.
이것이 실제로 누구를 위해 결정하는가
Gemini 3.6 Flash에 대한 실질적인 근거가 있다. 그리고 그것은 점수가 아니다.
프롬프트에 오디오나 비디오가 필요하다면 Claude Haiku 5.5는 아예 처리할 수 없습니다 — 텍스트와 이미지만 읽고 그 외에는 아무것도 못 합니다. Gemini 3.6 Flash는 텍스트, 이미지, 비디오, 오디오, 파일을 읽으며, 저희 자체 카탈로그에는 지난 한 주 동안 측정된 초당 582 출력 토큰과 첫 토큰까지의 중앙값 4.1초로 기록되어 있는데, 이는 Flash 기준으로도 빠른 모델입니다. 미디어 이해 파이프라인에서는 모달리티 목록이 결정의 전부이고, 인덱스 격차는 각주에 불과합니다.
당신의 작업이 텍스트와 이미지라면, 계산상 차이는 논쟁할 여지가 없을 만큼 벌어져 있습니다. 입력이 많은 7:2:1 혼합 — 대부분의 프로덕션 트래픽이 갖는 형태 — 에서 Claude Haiku 5.5는 백만 토큰당 $0.077인 반면 Gemini 3.6 Flash는 $0.63입니다. 하루 백만 개의 혼합 토큰 기준으로 77센트 대 $6.30이며, 2027년 1월 1일에는 두 번째 숫자는 더 나빠지지만 첫 번째 숫자는 움직이지 않습니다.
100,000토큰 절벽은 그것을 뒤집는 단 하나의 조건이다. 일상적으로 150,000토큰 프롬프트를 구성하는 검색 또는 장문 문서 파이프라인은 전체 요청에 대해 Anthropic의 $0.50/$2.50 티어를 지불하며, 그 시점에서 두 모델은 가격에서 서로 1.5배 이내에 들어오는 반면 Gemini 3.6 Flash는 모달리티와 128k 평균에서 멀티 니들 검색에 대해 Google이 발표한 91.8% 수치에서 여전히 우위를 점한다. 그것은 벤더가 보고한 것이며 재현되지 않았고, 정확히 그런 프레이밍에 놓여야 한다.

둘 다 호출하기, 또는 하나만 호출하기
Gemini 3.6 Flash는 오늘 OrcaRouter 카탈로그에 있습니다 google/gemini-3.6-flash에서, Google의 정가에 0% 마크업으로 — $0.75 및 $3.75, 캐시 읽기 $0.075, 제공업체가 청구하는 그대로 적용됩니다. 이는 이 특정 모델에 중요한데, Google의 1월 1일 인상은 요율 변경이고, 패스스루 카탈로그는 다음 계약 갱신 때가 아니라 그것이 일어나는 날 바로 반영하기 때문입니다. API 키 하나와 SDK 호출 하나로 이 모델 또는 카탈로그의 200개가 넘는 다른 모델 중 어느 것이든 사용할 수 있으므로, Google 레그와 Anthropic 레그 사이의 A/B는 두 번째 통합이 아니라 자동 페일오버가 그 아래에 있는 모델 문자열 변경입니다.
Claude Haiku 5.5는 카탈로그에 없습니다. Anthropic의 모델은 Anthropic 자체 API와 AWS, Google Cloud, Microsoft Azure를 통해 접근할 수 있으며, 그것이 정직한 답의 전부입니다. 그 라인업에서 저희가 실제로 취급하는 것은 Claude Sonnet 5.5와 Claude Opus 5.5 — 이것이 저렴한 분류 호출에서 중간 계층 에이전트 호출로 올라가는 에스컬레이션 경로를 프로젝트가 아니라 라우팅 결정으로 만들어 줍니다.
그러므로 결론은 아주 간단명료하게 말할 수 있다. 짧은 프롬프트 길이의 텍스트 및 이미지 작업에서는 Claude Haiku 5.5가 응답 상한을 제외한 모든 축에서 이긴다. 오디오나 비디오가 들어간 작업이라면 Gemini 3.6 Flash가 둘 중 유일하게 답할 수 있는 모델이다 — 그리고 그 기능을 위해 Google의 요금을 지불할 생각이라면, 어느 Gemini에 대해 그 요금을 내는 것인지 물어보라. 왜냐하면 이 등급에서는 같은 돈으로 더 새로운 형제 모델에서 지수 점수 9점을 더 얻을 수 있기 때문이다.
200개 이상의 모델을 위한 하나의 API, 하나의 키, 자동 장애 조치가 그 밑에서 이루어지므로, Google 레그와 Anthropic 레그 간의 A/B는 두 번째 통합이 아니라 모델 문자열 변경에 불과합니다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
