
Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite: 토큰당 더 저렴, 답변당 더 비쌈
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Claude Haiku 5.5는 입력 토큰 100만 개당 $0.10, 출력 토큰 100만 개당 $0.50의 비용이 듭니다. Gemini 3.5 Flash-Lite는 같은 두 기준에서 각각 $0.30과 $2.50의 비용이 듭니다. Anthropic 모델은 입력 가격이 3분의 1, 출력 가격이 5분의 1이며, Artificial Analysis Intelligence Index v4.3.2에서 22.2 대비 43.40점을 기록합니다. 10점 차이도 세대 도약이라 불리는 분야에서 20점 이상의 격차입니다. 요금표에서도 이는 접전이 아니며, 성능에서도 접전이 아닙니다.
청구서상으로는 거의 비슷한 비교이고, 방향은 반대다. 두 모델을 동일한 독립 리더보드에 올리고 토큰이 아니라 완료된 작업에 대해 각각 비용을 청구하면, Gemini 3.5 Flash-Lite가 답변당 더 저렴하게 나온다. Artificial Analysis는 Claude Haiku 5.5를 Intelligence Index 작업당 $0.21, Gemini 3.5 Flash-Lite를 $0.1235로 책정한다 — 토큰을 내보낼 때마다 다섯 배 더 지불하는 모델이 1.7대 1로 우위다.
그 역전이 이 비교의 전부입니다. Claude Haiku 5.5는 Anthropic이 지금까지 출시한 가장 저렴한 티어를 대체하며, 공유 보드에서 그 근처의 모든 것을 앞섭니다. Gemini 3.5 Flash-Lite는 2026년 7월 21일에 출시되었고, 여름부터 이 구간에서 가성비 좋은 선택이었습니다. 구매자가 실제로 품는 질문은 어느 쪽이 더 나은가가 아닙니다. 그 답은 이미 정해져 있으니까요. 바로 저렴한 비용으로 응답해야 하는 요청에 어느 쪽을 투입할지입니다.
아래의 모든 수치는 백만 토큰당 미국 달러 기준입니다. 정가는 각 공급업체가 자체 공개한 요율입니다. Artificial Analysis에 귀속된 독립 점수, 작업당 비용 수치, 속도 측정치는 해당 평가자의 것입니다. Gemini 3.5 Flash-Lite의 지연 시간 수치는 우리 자체 계량 트래픽에서 나온 것입니다. 어떤 수치가 당일 평가자의 페이지에서 읽어온 것이 아니라 우리가 보유한 모델 레코드에 실려 있는 경우, 우리는 해당 평가자를 출처로 간주했으며 우리 자신을 출처로 간주하지 않았습니다.
스티커와 청구서가 일치하지 않습니다
작업당 비용 격차는 요율표로는 설명되지 않으며, 그 격차가 존재하는 이유는 두 모델 중 어느 하나라도 프로덕션에 투입되기 전에 알아둘 가치가 있습니다.
Claude Haiku 5.5는 장황하며, 평가자도 대놓고 그렇게 말한다. Intelligence Index를 실행한 Artificial Analysis는 이 모델에서 4억 4천만 개의 출력 토큰을 기록했는데, 이는 전반적인 중앙값 1억 개와 대비되며, 매우 장황하다고 지적했다. 사고는 출력으로 청구되고, 사고는 기본적으로 켜져 있으며 노력(effort)은 medium에서 시작한다. 저렴한 입력 요금은 청구서 대부분이 출력인 워크로드에 도움이 되지 않는다.
Gemini 3.5 Flash-Lite도 간결하지는 않지만, 작업당 비용은 측정 가능할 정도로 더 저렴하다. 동일한 보드에는 완료된 인덱스 작업당 17,507개의 출력 토큰이 기록된다 — 그중 10,405개는 추론이고 7,102개는 답변이다. 이를 Anthropic 모델의 토큰 볼륨과 대조하면 산술은 정리된다: 출력 속도에서의 5대 1 우위는 더 큰 응답을 내놓는 모델에 의해 부분적으로 소모되고, 작업 수준에서 살아남는 것은 큰 우위가 아니라 작은 불리함이다.
같은 방식으로 작동하는 두 번째의 더 조용한 효과가 있다. Anthropic의 문서에 따르면 Claude Haiku 5.5는 Claude 4.7 및 이후 버전과 공유되는 토크나이저를 사용하므로, 같은 텍스트가 이 모델이 대체하는 모델에서보다 약 30% 더 많은 토큰으로 계산된다. 요율은 Google의 등급 대비 3분의 1로 떨어졌다. 토큰 수는 줄지 않았고, 같은 텍스트에서는 오히려 늘었다.
두 모델 모두, 중요한 수치로
Anthropic 및 Google 자체 문서에서 가져온 캐시된 요율 및 정가; Artificial Analysis에 귀속된 독립 수치; 자체 7일 트래픽 기간에서 측정한 실시간 지연 시간. 2026-10-08에 캐시됨.

• 입력 — Claude Haiku 5.5: 최대 100,000 토큰까지 $0.10, 그 이상은 $0.50; Gemini 3.5 Flash-Lite: 1,048,576토큰 윈도우 전체에서 $0.30 정액.
• 출력 — Claude Haiku 5.5는 최대 100,000 토큰까지 $0.50, 그 이상은 $2.50; Gemini 3.5 Flash-Lite는 $2.50 정액.
• 캐시된 입력 — Claude Haiku 5.5는 최대 100,000토큰까지 $0.01, 그 이상은 $0.05; Gemini 3.5 Flash-Lite는 $0.03. 캐시 쓰기는 Claude Haiku 5.5의 경우 백만 토큰당 $0.125 및 $0.625입니다.
• 컨텍스트와 출력 — 각각 100만 토큰. 최대 출력은 Claude Haiku 5.5가 128,000 토큰인 반면 Gemini 3.5 Flash-Lite는 65,536 토큰이므로, Anthropic의 상한은 대략 두 배입니다.
• 입력 모달리티 — Claude Haiku 5.5의 경우 텍스트와 이미지; Gemini 3.5 Flash-Lite의 경우 텍스트, 이미지, 비디오, 오디오 및 파일. 둘 다 텍스트를 반환합니다.
• 독립 점수 — Claude Haiku 5.5 (Max)는 43.40으로 Intelligence Index v4.3.2에서 182개 모델 중 2위이며, Gemini 3.5 Flash-Lite의 22.2와 대비됩니다. Gemini 3.5 Flash-Lite는 147개 중 96위이자 해당 보드의 34번째 백분위에 해당합니다.
• 작업당 독립 비용 — 동일 보드에서 $0.21 대 $0.1235.
• 처리량 — Artificial Analysis가 Claude Haiku 5.5에 대해 측정한 초당 출력 토큰 241.9개로, 지난 7일 동안 우리 자체 플레이그라운드에서 측정한 Gemini 3.5 Flash-Lite의 280.0개와 대비됩니다. 이 둘은 하나가 아니라 서로 다른 두 개의 하네스이므로, 경주가 아니라 대략적인 규모 차이로 읽어 주세요.
스물한 개의 점, 그리고 그것들이 무엇으로 만들어졌는지
60점대에 달하는 지수에서 21점 격차는 여유가 아니다. 그것은 에이전트 루프를 감당할 수 있는 모델과, 잘 명세된 단일 호출을 맡겨야 하는 모델 사이의 차이다.
두 벤더는 서로의 하네스를 측정하지 않으므로, 각자의 스위트를 나란히 비교할 수 없다. Anthropic은 Claude Haiku 5.5에 대한 GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 및 FrontierCode 결과를 공개하고, Google은 Flash-Lite 등급에 대한 자체 결과 세트를 공개한다. 어느 쪽도 상대의 스위트를 실행하지 않았다. 동일 조건으로 비교할 수 있는 유일한 방법은 독립 리더보드이며, 그곳에서 Anthropic 모델은 결코 작지 않은 격차로 앞서 있다.
평가자가 매긴 Gemini 3.5 Flash-Lite의 세부 점수는 그 티어의 윤곽을 기록으로 남겼다. 이 모델은 GPQA Diamond에서 83.8%, SWE-Bench Pro에서 54.2%, Terminal-bench 2.1에서 54%, SciCode에서 41.3%, MLE-Bench에서 39.2%를 기록했고, Humanity's Last Exam에서는 18.8%를 기록했다. 이는 유능하고 저렴한 범용 티어의 숫자다 — 지식 질문에는 강하지만, 가장 어려운 추론 및 연구 평가에서는 눈에 띄게 뒤처진다. 종합 점수 43.40의 Claude Haiku 5.5는 완전히 다른 대역에 속하며, 실무적으로 해석하자면 장기간에 걸친 다단계 계획이 필요한 작업은 Google 티어가 맡을 일이 전혀 아니다.
백만 토큰의 윈도우, 그리고 65,536의 답변
두 컨텍스트 윈도우는 크기가 같지만 같은 제품은 아닙니다.
Gemini 3.5 Flash-Lite의 장문맥은 거리가 멀어질수록 저하되며, 이는 신뢰하기 전에 먼저 값을 매겨볼 가치가 있는 정도다. 8개 바늘 검색 평가인 GDM-MRCR v2에서 바늘이 128,000토큰 안에 있을 때는 평균 72.2%를 기록하고, 100만 토큰 포인트와이즈 변형에서는 21.3%를 기록한다. Long-Context Recall 수치는 76%이고, CharXiv Reasoning은 도구 없이 74.5%, 도구를 사용하면 76.5%다. 100만 토큰 창은 실제 역량이다. 그 먼 끝에서 안정적으로 검색해내는 것은 그보다 작은 역량이며, 위의 두 숫자는 그 둘 사이의 거리다. Claude 모델의 창은 같은 보드에서 같은 방식으로 측정된 적이 없으므로 이에 상응하는 수치는 제공되지 않으며, 이 글은 그것을 임의로 만들어 내지 않을 것이다.
출력 상한은 즉시 더 유용하게 체감되는 차이입니다. Claude Haiku 5.5는 한 번의 응답으로 128,000 토큰을 출력하지만, Gemini 3.5 Flash-Lite는 65,536에서 멈춥니다. 원하는 결과물이 긴 파일, 전체 마이그레이션, 생성된 테스트 스위트 또는 녹취록 규모의 재작성이라면, 이 두 모델 중 하나는 단일 호출로 만들어낼 수 있고 다른 하나는 그럴 수 없습니다. 그리고 작업을 두 번의 호출로 나누면 한 번의 호출보다 두 배 이상의 비용이 듭니다. 공유 접두사가 두 번 전송되기 때문입니다.

오디오와 비디오는 가격 문제가 아닙니다
Gemini 3.5 Flash-Lite는 비디오, 오디오, 파일을 텍스트와 동일한 요금으로 지원합니다. Claude Haiku 5.5는 텍스트와 이미지를 지원합니다.
녹음된 통화, 화면 캡처 또는 감시 영상을 입력으로 받는 파이프라인의 경우, 중요한 성능 차이는 21개의 지수 포인트가 아닙니다. 중요한 것은 이 모델 중 하나는 입력을 직접 처리하고, 다른 하나는 앞단에 전사 또는 프레임 추출 단계가 필요하다는 점입니다 — 두 번째 모델, 두 번째 비용, 그리고 소스와 답변 사이에 자리한 새로운 실패 모드입니다. 그런 상황에 놓인 팀들은 두 개의 저렴한 티어 중에서 선택하는 것이 아닙니다. 그들은 하나의 모델과 하나의 파이프라인 중에서 선택하는 것입니다.
이미지와 문서에는 그 반대가 성립한다. 두 모델 모두 이미지를 네이티브로 읽고, Claude Haiku 5.5는 종합 점수에서 43.40을 기록하므로, 오디오가 들어 있지 않은 페이지 이미지 추출이나 다이어그램 이해 워크로드는 모달리티 논쟁이 아니라 수치상 Anthropic 쪽에 속한다.
여기에서 둘 중 하나를 실행 중
Gemini 3.5 Flash-Lite는 Google 정가에 0% 마크업으로 OrcaRouter 카탈로그에 올라와 있습니다, 이는 제공업체의 요율이 혼합되지 않고 그대로 전달된다는 뜻이며, Google의 요금표가 변경되면 그들의 청구서에 도달하는 당일 귀하의 청구서에도 도달합니다. 즉 Google 티어를 위한 하나의 키와 하나의 SDK가 Claude Sonnet 5.5 및 Claude Opus 5.5와 나란히 제공되며, 이들 역시 카탈로그에 있습니다. 따라서 Google Flash-Lite 레그와 Anthropic 레그 간의 A/B는 이미 통합 프로젝트가 아니라 하나의 구성일 뿐입니다. 자동 장애 조치가 그 아래에 자리하고 있습니다, 따라서 어느 레그도 단일 장애 지점이 되지 않으며, 그리고 라우팅 DSL이 라우트 내에서 에스컬레이션을 표현할 것입니다 로직이 바로 거기에 속한다면.
해당 구간의 지연 시간 프로필은 공급업체가 아니라 저희 자체 측정을 기준으로 합니다. 지난 7일간의 실제 트래픽에서 Gemini 3.5 Flash-Lite는 초당 출력 토큰 280개 기준 p50 2,426밀리초, p95 8,600밀리초를 유지했으며, 오류율은 0.313%였습니다. 이는 약속이 아니라 이동 창으로 읽으세요. 트래픽과 제공자 상황이 변하면 함께 변하며, 특정 파이프라인에서 신뢰할 숫자는 일주일 후 직접 측정한 값입니다.

Claude Haiku 5.5는 카탈로그에 없습니다. 2026년 10월 7일 — 이 글이 작성되기 하루 전 — 에 출시되었고, 오늘날 우리 쪽에서 라우팅할 수 없으므로, 이 비교에서 Anthropic 쪽은 현재 Anthropic에서만 접근할 수 있습니다. 이 점을 분명히 말하는 편이 암시로 남기는 것보다 낫습니다. 모델이 출시되는 것과 모델이 우리를 통해 호출 가능해지는 것 사이의 간격은 정상이며, 그 간격이 언제 해소될지에 대한 약속이 아닙니다. 또한 마이그레이션을 계획하는 독자는 자신이 선호하는 일정이 아니라 자신이 볼 수 있는 일정을 기준으로 계획해야 합니다.
어느 것이며, 누구를 위한 건가요?
작업이 텍스트 입력 및 텍스트 출력이고, 프롬프트가 100,000토큰 이내에 들어가며, 작업에 다단계 계획 수립이나 장기적인 작업을 수행하는 에이전트가 필요하다면, Claude Haiku 5.5는 21점 더 강력한 모델이고 토큰당 비용은 3~5배 더 저렴합니다. 요금표가 아니라 작업당 비용을 기준으로 예산을 책정하고, 독립 위원회가 측정하는 유형의 작업에는 대략 $0.21를 예상하세요. 그리고 무엇이든 예측하기 전에 프롬프트를 다시 세어 보세요. 토크나이저 변경만으로도 토큰 수가 약 30퍼센트 달라지기 때문입니다.
작업이 짧고, 대량이며, 답변 형태라면 — 태그, 카테고리, 추출, 가드레일 결정 — 계산은 Gemini 3.5 Flash-Lite에 유리하며, 그 이유는 별로 화려하지 않다. 매우 적게 출력하는 호출의 비용은 입력이 대부분을 차지하는데, 두 입력 요금은 $0.30 대 $0.10이고, Google 모델의 훨씬 짧은 작업 풋프린트 덕분에 더 저렴한 요금이 가격표에서는 지더라도 완성된 작업에서는 이긴다. 비디오, 오디오 또는 파일 입력을 추가하면 선택은 더 이상 가격 문제가 아니게 된다.
이 조합이 실제로 확정하는 것은 “새 Haiku는 저렴하다”보다 더 좁은 범위입니다. 그것은 저렴한 등급의 대표 요금이 그 등급이 당신에게 얼마의 비용인지 판단하는 데 형편없는 지침이라는 점, 그리고 가격 페이지에서 세 배 더 비싸 보이는 모델이 더 적은 청구서를 보내줄 수 있다는 점을 확정합니다. 어느 쪽으로 결론을 내리든, 당신이 보내는 토큰이 아니라 내보내는 토큰을 측정하세요. 두 모델 모두에서 청구서가 실제로 매겨지는 기준은 바로 그 토큰이기 때문입니다.
