
Claude Haiku 5.5 vs Gemini 3.7 Flash: 이 둘 중 하나는 이미 은퇴했습니다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
오늘 작성된 Claude Haiku 5.5 대 Gemini 3.7 Flash 비교라면 어떤 것이든 그 밑에는 어색한 사실이 하나 깔려 있습니다: Gemini 3.7 Flash는 지원 중단되었습니다. 공급업체는 2026년 8월 13일에 이를 출시했고, 9월 2일에 Gemini 3.8 Flash로 대체했으며, Artificial Analysis는 이제 3.7 페이지에 지원 중단 플래그를 달아 두고 있습니다. 이와 대조적으로 Claude Haiku 5.5는 2026년 10월 7일에 출시되었고, 2027년 10월 이전에는 지원을 종료하지 않겠다는 약속을 갖고 있습니다.
그렇다고 해서 그 비교가 쓸모없어지는 것은 아니다. 그것은 질문을 바꾼다. 이제 이것은 "이 둘 중 어느 것을 호출해야 하나"가 아니다 — 대부분의 팀에게 그 답은 어느 쪽도 아니다. 왜냐하면 3.7 라인은 자체 패밀리 내에서 대체되었기 때문이다. 이것이 유용한 점은 더 미묘하고, 어쩌면 더 쓸모 있는 것이다: Google의 Flash 등급이 3주 동안 얼마나 빠르게 움직였는지, 그리고 Flash 등급 모델의 스펙 시트 중 어떤 부분이 실제로 사용 여부를 결정하는지에 대한 명확한 파악이다.
여전히 측정할 수 있는 것
두 모델 모두 동일한 독립 평가 보드에서 실행되었는데, 이 보드는 두 모델을 나란히 비교할 수 있는 유일한 곳이다. Artificial Analysis Intelligence Index v4.3.2에서 Claude Haiku 5.5는 Max 구성으로 43.40점을 기록했고, Gemini 3.7 Flash는 High 구성으로 39.06점을 기록해 4.33점 차이를 보였다.
두 공급업체는 자체 평가 세트도 공개하는데, 이 둘은 직접 비교가 가능할 만큼 겹치지 않습니다. 공유되는 독립적인 행은 Artificial Analysis가 둘 모두에서 실행한 네 가지입니다:
• Terminal Bench 4.0 — Claude Haiku 5.5는 0.3283, Gemini 3.7 Flash는 0.1364. 19포인트의 절대 격차이며, 이 세트에서 가장 큰 비대칭성이다.
• SciCode — 0.5498 대 0.5718. Gemini 3.7 Flash가 2.2점 차로 앞선다.
• 인류 최후의 시험 — 0.4439 대 0.4787. Gemini 3.7 Flash가 3.5점 차로 앞선다.
• AutomationBench, 부분 점수 — 0.3541 대 0.6203. Gemini 3.7 Flash를 27점 차로 앞섰습니다.
그 세트를 주의 깊게 읽어 보세요. 흥미로운 결과가 들어 있으니까요. Gemini 3.7 Flash는 공통 벤치마크 네 개 중 세 개에서 이기고도 종합 지수에서는 4.3점 차로 뒤처집니다. 지수는 가중 혼합이며, 그 가중치는 터미널 및 코드 행 — 여기서는 격차가 훨씬 더 큰 폭으로 반대 방향으로 벌어집니다 — 을 다른 항목들의 집계보다 앞세웁니다. 그것은 점수 산정의 부산물이라기보다 지수가 무엇을 위한 것인지에 대한 진술에 가깝습니다. 지수는 모델이 작업을 끝까지 해낼 수 있는지 예측하려고 하며, 그 질문에서 3.7 라인은 나름 괜찮은 과학 벤치마크 점수로도 감출 수 없는 약점을 드러냈습니다.

3.7 라인이 실제로 잘 못했던 점
두 행이 인덱스보다 이야기를 더 잘 전달합니다.
Terminal Bench 4.0의 0.1364는 낮은 수치이며, 같은 모델의 이전 Terminal Bench 세대에서 나온 0.8577 바로 옆에 놓입니다. 그것은 모델이 나빠진 것이 아니라, 측정하는 대상을 바꾼 벤치마크이며, Gemini 3.7 Flash는 그 전환을 해내지 못했습니다. 동일한 개정 벤치마크에서 Claude Haiku 5.5는 0.3283점을 기록합니다 — 절대적인 기준으로는 눈에 띄지 않지만, 3.7 Flash 수치의 거의 2.5배이며, 에이전트 코딩 성능을 가장 직접적으로 예측하는 행에 해당합니다.
두 번째 행은 Tau-Bench Banking으로, 여기서 Gemini 3.7 Flash는 0.3278점을 기록합니다. 구조화된 도메인에서의 도구 사용 신뢰성은 바로 저렴한 모델이 배포되는 이유이므로, 0.33 미만의 점수는 파일럿을 조용히 끝장내는 유형의 수치입니다. Claude Haiku 5.5는 같은 표에 공개된 Tau-Bench 수치가 없어서 그 부분에서는 비교가 불가능합니다. 이럴 때 정직한 태도는 추측으로 메우는 것이 아니라 그렇다고 말하는 것입니다.
Gemini 3.7 Flash가 강점을 유지한 부분은 언제나 강점이었던 부분이다. GPQA 0.9455와 MMMU-Pro 0.8549는 둘 다 진짜 강점이며, 멀티모달 입력은 의심할 여지가 없었다. 실패는 에이전트 루프의 작동 여부를 결정하는 스펙 시트의 부분에 있었지, 리더보드의 한 줄을 차지하게 만드는 부분에 있지 않았다.
그 후 3주 동안 무엇이 바뀌었나요
Gemini 3.8 Flash는 2026년 9월 2일에 등장했으며, 2027년 파이프라인을 계획하는 사람이라면 누구에게나 구글 자체 플래시 티어 내부의 변화가 더 유용한 비교 대상이다.
동일한 지표에서 Gemini 3.8 Flash는 40.93을 기록해 3.7 라인의 39.06과 대비된다 — 3주 만에 1.87점 상승이다. Terminal Bench 4.0은 0.1364에서 0.1970으로 올랐다. Tau-Bench Banking은 0.3278에서 0.4495로 올랐다. 이들은 3.7 모델이 가장 취약했던 바로 그 항목들이며, 이는 후속 모델이 전반적인 역량 향상보다 바로 이 약점을 겨냥했음을 시사한다.
가격은 전혀 움직이지 않았다. Gemini 3.7 Flash는 백만 토큰당 입력 $0.75, 출력 $3.75에 책정되었고, Gemini 3.8 Flash도 동일한 $0.75와 $3.75로 출시되었다 — 완전히 똑같은 요금표가, 에이전트에 중요한 항목들에서 지수가 2포인트 더 나은 모델에 붙은 것이다.

이 비교의 승부가 정말로 갈리는 지점은 요금표입니다.
Claude Haiku 5.5와 비교하면, 구글은 가격이 전부이며 그 격차는 크다.
• 입력 — Claude Haiku 5.5는 최대 100,000까지 백만 토큰당 $0.10, 그 이상은 $0.50; Gemini 3.7 Flash는 $0.75 정액, 또는 첫 번째 구간 내에서 Anthropic 요율의 7.5배.
• 출력 — 첫 번째 티어 내에서는 Claude Haiku 5.5에 $0.50, 그 이상은 $2.50; Gemini 3.7 Flash는 $3.75.
• 캐시된 입력 — Claude Haiku 5.5의 경우 $0.01 및 $0.125; Gemini 3.7 Flash의 경우 읽기 $0.075, 쓰기 $0.75.
• 컨텍스트 — 두 모델 모두 100만 토큰. 최대 출력 — Claude Haiku 5.5는 128,000 토큰, Gemini 3.7 Flash는 65,536 토큰.
• 입력 모달리티 — Claude Haiku 5.5의 경우 텍스트와 이미지, Gemini 3.7 Flash의 경우 텍스트, 이미지, 음성 및 동영상. 이는 Google의 사양이 엄격히 더 긴 유일한 항목으로 남아 있으며, 3.8로의 계승에서도 변경 없이 유지되었습니다.
• 완료된 Index 작업당 독립 비용 — Claude Haiku 5.5는 $0.21, Gemini 3.7 Flash는 $0.93. 7.5:1의 입력 비율이 시사하는 것보다 더 큰 4.4배 격차인데, 여기서는 Anthropic의 모델이 더 장황하기 때문이다. Index 작업당 출력 토큰이 162,164개로 Gemini 3.7 Flash의 58,387개보다 많다. Anthropic은 또한 Claude 4.7 이후 버전과 공유하는 토크나이저를 문서화하고 있는데, 이는 동일한 텍스트에 대해 토큰을 약 30% 더 많이 계산하며, 이 역시 같은 방향으로 작용한다.
• 속도 — Gemini 3.7 Flash의 Index 작업당 212.3초, Claude Haiku 5.5의 경우 424.6초. Google의 모델은 둘 중 두 배 더 빠른데, 이는 이 섹션에서 더 저렴한 모델이 더 나은 모델이 아닌 유일한 항목이다.
오늘 선택한다면 이것이 의미하는 바
실질적인 해석은 이 둘 중 어느 것도 서로 다른 이유로 정답이 아니라는 것이다.
Gemini 3.7 Flash는 더 이상 지원되지 않고, 후속 모델과 동일한 요금으로 책정되어 있으며, 저렴한 프로덕션 모델이 필요로 하는 바로 그 항목들에서 후속 모델보다 성능이 떨어집니다. 이 모델을 추천하는 것은 후속 모델로 대체된 모델에 붙은 요금표를 추천하는 것과 같습니다 — 후속 모델은 같은 값에 더 많은 일을 해냅니다. 2026년 10월에 이 둘 중에서 고르는 사람이라면 누구도 3.7 라인을 선택해서는 안 되며, 그 요금표가 그대로 유지되고 있다는 사실이 바로 그 결론을 못 박습니다.
Claude Haiku 5.5는 라이브 모델이며, 텍스트 입력 및 텍스트 출력 작업에서 모든 면에서 더 저렴하고, 종합 점수에서 더 높으며, 에이전트 성공을 예측하는 두 항목에서 훨씬 더 뛰어납니다. 또한 더 느린 모델이며 음성이나 영상을 받아들일 수 없습니다. 그것이 중요한지는 여러분의 파이프라인에 관한 질문이지 모델에 관한 질문이 아닙니다.
세 번째 가능성은, 3.8과 3.7 사이의 지수 포인트 격차가 드러내주듯, Google의 플래시 티어가 너무 빠르게 움직여서 3주 된 비교조차 이미 역사가 되어버린다는 점이다. 모든 플래시 티어 맞대결은 유효 기간이 분기가 아니라 주 단위로 측정된다고 보라.
네가 어느 쪽에 서게 되든 실행하기
Gemini 3.8 Flash — 더 이상 지원되지 않는 3.7이 아닌 후속 모델 — 는 OrcaRouter 카탈로그에 Google의 정가로 0% 마크업으로 등록되어 있습니다따라서 Google이 공개한 요율이 곧 청구서에 반영되는 요율이며, Google 쪽 변경 사항은 같은 날 저희 쪽에도 적용됩니다. Claude Sonnet 5.5와 Claude Opus 5.5도 카탈로그에 있으므로, 두 공급업체 라우팅 테스트를 프로젝트가 아니라 구성으로 만들어 줍니다: 200개 이상의 모델을 위한 단일 API, 단일 키, 자동 장애 조치가 그 아래에 있으며, 에스컬레이션을 코드가 아닌 라우트에 두고 싶을 때는 라우팅 DSL을 사용할 수 있습니다.
Gemini 3.7 Flash 자체는 우리 카탈로그에 없으며, Claude Haiku 5.5도 마찬가지입니다. 둘 다 각 공급업체 자체의 API를 통해, 그리고 Google의 경우 여러 서드파티 플랫폼을 통해 여전히 접근할 수 있습니다. 이 점은 독자가 직접 알게 하기보다 분명히 밝혀둘 가치가 있습니다.

빼야 할 숫자
문제는 4.33점의 지수 격차가 아니다. 문제는 Gemini 3.7 Flash가 네 가지 공통 벤치마크 중 세 가지에서 이겼는데도 종합 점수에서는 4점 뒤졌다는 점이다. 지수가 가장 큰 비중을 두는 벤치마크가 바로 이 모델이 0.1364점을 기록한 벤치마크였기 때문이다. 플래시 등급 모델의 과학 점수는 좋아 보일 수 있지만, 값싼 모델을 사는 바로 그 목적에서는 실패한다.
그로부터 따라 나오는 결론은 후속 모델이 가격은 그대로 둔 채 3주 이내에 바로 그 행들을 고쳤다는 것이다. 이 증거에 비추어 보면, 이 등급에서의 경쟁 압력은 가격이 아니다. 그것은 모델이 다단계 작업을 끝낼 수 있는지 여부이며, 이제 그것은 요율표가 바뀌는 것보다 더 빠르게 움직이고 있다.
