
GPT-5.6 Luna vs Claude Haiku 4.5: 저렴한 티어, 매우 다른 두 청구서
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
GPT-5.6 Luna와 Claude Haiku 4.5는 서로 다른 두 프런티어 계열의 저렴한 등급이며, 둘 사이의 격차는 전적으로 어떤 숫자를 보느냐에 달려 있습니다. 정가 기준으로는 이건 완승입니다: 입력 토큰 100만 개당 $0.20 대 $1.00. Artificial Analysis의 Intelligence Index 작업 완료당 비용 기준으로는 $0.18 대 $0.21, 약 14% 차이입니다. 같은 두 모델, 두 개의 정직한 답, 그리고 이들이 갈리는 이유는 하나를 고르기 전에 이해해야 할 가장 유용한 단 하나입니다.
짧게 말하면: Luna는 스펙상 더 강력한 모델이고 처리량도 더 빠르지만, 생각을 길게 하고 그에 대한 비용을 청구한다. Haiku 4.5는 출시된 지 더 오래됐고 범위도 더 작으며, 요청에 얼마가 들지 훨씬 더 예측 가능하다. 그중 어느 쪽이 더 중요한지는 모델의 속성이 아니라 여러분의 워크로드의 속성이다.
한눈에
• 공급업체 — OpenAI vs Anthhropic
• 출시 — 2026년 7월 9일 vs 2025년 10월 15일
• 컨텍스트 윈도우 — 1M 토큰 vs 200K 토큰
• 최대 출력 — 128K 토큰 vs 64K 토큰
• 입력 — 텍스트, 이미지 및 파일 vs 텍스트, 이미지 및 PDF
• 백만 토큰당 가격 — 입력 $0.20 / 출력 $1.20 vs 입력 $1.00 / 출력 $5.00
• Artificial Analysis Intelligence Index — 38, 177개 중 4위 vs 18, 200개 중 138위 (둘 다 추론 구성 기준)
• Intelligence Index 작업당 비용 — $0.18 vs $0.21
• 출력 속도 — 109.4토큰/초 대 84.7토큰/초
• 추론 제어 — none에서 max까지 조절하는 노력 다이얼 대 노력 파라미터 없이 수동으로 활성화하는 확장 사고
• 신뢰할 수 있는 지식 컷오프 — 2026년 2월 대 2025년 2월 (학습 데이터는 2025년 7월까지)
• 은퇴 약속 — 공개된 것 없음 vs 2026년 10월 15일보다 이르지 않음
GPT-5.6 Luna가 실제로 앞서는 부분

역량은, 큰 차이로. Intelligence Index 38 대 18은 근소한 차이가 아니다. Luna는 Artificial Analysis가 추론, 지식, 수학, 코딩 평가로 구성하는 종합 지표에서 Haiku를 앞서며, 토큰당 더 저렴한 모델이면서도 그렇게 한다. 이 두 모델군을 9월 이전 지수에서 마지막으로 비교한 사람이라면 — 당시 Luna는 51과 52를 보였다 — 2026년 9월에 전체 척도가 재채점되었고, Luna의 우위가 재채점 후에도 유지되었다는 점을 알아야 한다.
컨텍스트, 5배. 1M 토큰 윈도 대 200K는 그 자체로 한 가지 작업 범주를 결정합니다: 전체 저장소 패스, 긴 문서 세트, Haiku에서는 요약이 필요할 확장된 에이전트 트랜스크립트. 애플리케이션이 보유해야 하는 컨텍스트의 양으로 정의된다면, 비교는 여기서 끝입니다.
출력 여유분이 두 배로. 최대 출력 토큰이 64K가 아닌 128K라는 점은 장문 생성과, 한 줄짜리 답변이 아니라 구조화된 계획을 반환하는 에이전트 루프에서 중요합니다.
처리량. 초당 출력 토큰 109.4개 대 84.7개는 스트리밍 인터페이스에서 실질적인 차이이지만, 응답성과 같은 의미는 아닙니다 — 아래 지연 시간 섹션을 참조하세요.
가격은, 스티커에 적힌 그대로.입력에서 다섯 배 더 저렴하고 출력에서 대략 네 배 더 저렴한 것은 반올림 오차가 아니며, 짧은 출력 작업에서는 그것이 결정의 전부다.
Claude Haiku 4.5가 여전히 제 몫을 하는 곳
예측 가능한 비용. Haiku 4.5의 추론은 수동으로 켜는 확장 사고입니다. 꺼두면 직접 답하고 비용이 예측 가능하게 청구됩니다. GPT-5.6 Luna의 노력 다이얼은 최대까지 올라가며, 한 단계 올릴 때마다 출력 요율로 출력 토큰이 더 많이 소모됩니다. 미리 제시할 수 있는 비용 상한을 원하는 팀이라면 표시 가격이 더 높더라도 Haiku가 더 이해하기 쉽다고 느낄 것입니다.
비추론 구성은 실행 비용이 정말 저렴하다. Artificial Analysis는 Claude 4.5 Haiku의 비추론 구성을 지능 지수 15로 평가하면서 작업당 비용 수치는 공개하지 않았는데, 이는 기준이 단순히 "이걸 올바르게 파싱하라"에 불과한 작업, 즉 의도 분류, 필드 추출, 라우팅 결정, 모더레이션 트리아지에 합리적으로 적합하다. 그런 작업에서는 15와 38 사이의 지수 격차가 대부분 무의미한데, 두 모델 모두 사고를 요구받지 않기 때문이다.
캐싱과 배치 할인은 이미 성숙한 단계입니다. Haiku 4.5는 90%의 프롬프트 캐시 읽기 할인과 Batch API에 대한 50% 할인을 제공합니다. Luna는 이에 필적하는 캐시 경제성을 갖추고 있으므로, 이는 우위라기보다는 무승부에 가깝습니다. 하지만 여러분의 파이프라인이 이미 Anthropic의 도구를 통해 배치 처리를 하고 있다면, Haiku에서 벗어나는 데 드는 마이그레이션 비용은 실질적인 비용이며, 이는 어떤 벤치마크에도 나타나지 않을 것입니다.
운영 실적. Haiku 4.5는 2025년 10월부터 프로덕션 환경에서 사용되어 왔으며, 2026년 10월 15일 이전에는 서비스를 종료하지 않겠다는 공개된 약속을 가지고 있습니다. Luna는 출시된 지 두 달밖에 되지 않았습니다. 모델이 제품이라기보다 세부 요소에 불과한 워크로드에서는 11개월의 프로덕션 이력이 벤치마크로는 표현할 수 없는 가치를 지닙니다.
그것을 측정하는 단 하나의 축에서, 더 진실에 가까운 모델은 그쪽이다. Artificial Analysis의 일대일 비교에서는 거의 모든 역량 항목에서 Luna가 앞선다 — AA-Briefcase는 1,339 대 614, GDPval-AA v2는 1,489 대 854, AutomationBench-AA는 50% 대 3%, Humanity's Last Exam은 39% 대 10%, GDPpdf는 24% 대 4%다. 예외는 AA-Omniscience로, 이는 지식 질문에서 확신에 찬 오답에 페널티를 부여한다: Luna는 거기서 -10점을 받은 반면 Haiku는 -4점이다. 음수 점수는 환각 페널티가 정확도 가점을 능가한다는 뜻이며, Luna의 페널티가 더 크다. 더 높은 종합 지수가 더 신뢰할 수 있는 답변과 같은 것은 아니며, 그 둘을 구분하기 위해 만들어진 유일한 평가에서 더 오래된 모델이 더 나은 성적을 낸다.
실제 워크로드에서의 비용 계산
한 달에 1억 개의 입력 토큰을 소비하고 2,000만 개의 출력 토큰을 내보내는 파이프라인을 가정해 보겠습니다.
• GPT-5.6 Luna — 100 × $0.20 = $20, 여기에 20 × $1.20 = $24. 합계 월 $44.
• Claude Haiku 4.5 — 100 × $1.00 = $100, 여기에 20 × $5.00 = $100. 월 총 $200.
그 비율 기준으로 Luna는 약 4.5배 더 저렴하며, 이는 대부분의 비교 자료가 내놓는 계산이다. 이제 가정을 하나 바꿔 보자. Luna의 추론 강도를 높이면 출력 토큰이 늘어나고, 출력이 비싼 쪽이다 — $1.20에서는 입력 비용의 6배가 든다. Luna가 Artificial Analysis의 평가 세트에서 그러하듯, 동일한 작업량에 대해 150M 출력 토큰을 내보내는 지점까지 밀어붙이면, $44는 넉넉히 $180을 넘어선다. 4.5배라는 격차는 동등 수준을 향해 무너진다.
교훈은 Luna가 비싸다는 게 아니다. Luna의 가격 우위는 Luna가 얼마나 말하는지에 달려 있으며, 이는 당신이 조정할 수 있는 매개변수라는 점이다. 추출과 분류 작업에서는 추론을 낮추면 할인이 실제로 적용된다. 모든 작업에서 최대로 켜 두면, 더 이상 정가와 비슷하지도 않은 가격에 더 유능한 모델을 사들인 셈이다.
지연 시간, 그리고 믿어서는 안 되는 숫자
이 두 모델에 대해 공개된 첫 토큰까지의 시간(time-to-first-token) 수치는 거의 쓸모가 없으며, 그 이유를 이해할 가치가 있습니다. Artificial Analysis에서 두 모델의 추론 구성은 첫 토큰 지연 시간이 수십 초, 심지어 수백 초에 이르는 것으로 나타나는데, 이는 하네스가 모델이 추론을 마칠 때까지 토큰을 내보내지 않기 때문입니다. 그 수치는 모델의 응답성이 아니라 평가 설정을 측정한 것입니다.
라우팅 텔레메트리는 프로덕션에서 모델을 측정하기 때문에 더 나은 소스입니다. OrcaRouter 자체 수치에 따르면 GPT-5.6 Luna는 첫 토큰까지 중앙값 1.83초, 95번째 백분위수 10.00초인 반면, Claude Haiku 4.5는 중앙값 3.81초, 95번째 백분위수 9.47초입니다. 제대로 읽으면, 이는 두 모델이 리더보드가 시사하는 것보다 더 가깝다는 뜻입니다: Luna는 일반적인 요청에서 앞서고, 꼬리 지연은 서로 약 0.5초 이내에 있습니다. 평균이 아니라 최악의 경우가 걱정된다면, 둘 사이에는 거의 차이가 없습니다.
어느 걸 고를까?
GPT-5.6 Luna를 선택하세요 — 긴 컨텍스트를 유지하고 있거나, 작업이 실제 추론의 이점을 누리거나, 출력이 길거나 구조화되어 있거나, 또는 가격대 최저 구간에서 이용할 수 있는 가장 강력한 모델을 원하는 경우에 적합합니다. 또한 나머지 스택이 이미 OpenAI 계열 동작을 따르고 있다면 더 자연스러운 선택입니다.
Claude Haiku 4.5를 선택하세요 — 작업이 짧은 출력을 대량으로 처리하는 유형이라면, 요청이 실행되기 전에 제시할 수 있는 비용 상한이 필요하다면, 파이프라인이 이미 Anthropic의 배치 처리와 캐싱을 중심으로 구축되어 있다면, 또는 두 달밖에 되지 않은 모델보다 생산 실적과 공개된 수명 주기를 갖춘 모델을 더 중시한다면.
어느 쪽도 선택하지 마세요 소형 추론 모델이나 미세 조정된 분류기로 충분한 작업이라면요. 이 두 계층이 흡수하는 트래픽의 상당 부분은 더 좁은 무언가에서 더 저렴하게 실행될 분류와 추출입니다 — 그리고 가장 저렴한 모델은 언제나 필요하지 않았던 모델입니다.
하나의 키로 둘 다 실행

두 모델 모두 하나의 엔드포인트를 통해 접근할 수 있게 되는 순간, 이 비교는 더 이상 배타적이지 않습니다. OrcaRouter에서는 Claude Haiku 4.5와 GPT-5.6 Luna가 동일한 OpenAI 호환 base URL 뒤에 있습니다 — 200개 이상의 모델을 위한 하나의 API, 하나의 키, 하나의 청구 라인, 두 번째 계약도 없고, 모델 식별자 외에는 코드 변경도 없습니다. 아직 확신이 서지 않는 등급 결정이라면, 이는 마이그레이션을 설정 값 하나로 바꿔줍니다.
여기서 실제로 중요한 역할을 하는 기능이 두 가지 있습니다. 공급자 간 자동 페일오버 덕분에 저비용 티어가 단일 공급업체 의존 없이 프로덕션 트래픽을 처리할 수 있습니다. 이는 모델이 시간당 한 번의 중요한 호출이 아니라 수천 건의 호출을 보낼 만큼 저렴할 때 유용합니다. 그리고 라우팅 DSL을 사용하면 여러 모델로 하나의 호출을 구성할 수 있습니다. 단순한 대다수 요청은 Luna로 라우팅하고, 나머지는 GPT-5.6 Terra로 에스컬레이션하며, 재시도 대신 두 번째 공급업체의 답변을 원할 때를 대비해 Haiku 4.5를 풀에 폴백으로 유지할 수 있습니다.
GPT-5.6 Luna와 Claude Haiku 4.5의 실시간 토큰당 요금을 확인한 후 둘 중 하나를 프로덕션 경로에 반영하세요 — 두 요금 모두 0% 마크업으로 그대로 전달되므로 공급업체가 요금을 바꾸는 날 바로 바뀌며, 제3자 가격 추적 도구는 며칠에서 몇 주씩 뒤처집니다.
실제로 답할 가치가 있는 질문들
GPT-5.6 Luna는 정말 Claude Haiku 4.5보다 다섯 배 저렴한가? 입력 토큰 기준으로는 그렇다 — $0.20 대 $1.00. 동일한 평가 작업을 완료하는 비용 기준으로는 아니다: $0.18 대 $0.21. 이 두 진술 사이의 격차는 Luna의 장황함이다. 같은 작업을 완료하는 데 Haiku가 생성하는 대략 두 배의 출력 토큰을 만들어내며, 출력 토큰은 입력 토큰의 여섯 배 비용이 든다. 짧은 답변에서는 표시 가격이 대체로 정직하다. 추론이 많은 작업에서는 그렇지 않다.
두 모델 모두에서 같은 방식으로 비용을 조정할 수 있나요?아니요, 그리고 이것은 둘 사이에서 가장 덜 알려진 차이입니다. Luna는 none부터 max까지 설정이 있는 추론 노력 다이얼을 제공하므로 요청별로 비용과 품질이 명시적으로 트레이드오프됩니다. Haiku 4.5의 확장 사고는 토큰 예산과 함께 활성화되거나 비활성화될 뿐이며 — effort 파라미터는 없습니다. 요청별 비용 제어가 중요하다면, 이 둘 중 하나만이 그 레버를 제공합니다.
하루에 수백만 건의 호출을 처리하는 대용량 분류기는 어떨까요? 두 모델 모두 이 작업에는 추론이 필요하지 않습니다. Haiku 4.5는 확장 사고를 끄고 실행하거나, Luna는 effort를 none으로 설정해 실행한 뒤, 종합 지수가 아니라 지연 시간과 출력 길이를 기준으로 비교하세요. 그 시점에서 관련 질문은 첫 토큰이 얼마나 빨리 도착하는지와 답변이 몇 개의 토큰을 사용하는지이며, 지능 벤치마크는 더 이상 이 둘을 구분하지 못합니다.

1년 뒤에도 여전히 여기에 남아 있을 모델은 어느 쪽일까요? Claude Haiku 4.5에는 2026년 10월 15일 이전에는 종료하지 않겠다는 공개 약속이 있습니다. OpenAI는 GPT-5.6 Luna에 대해 이에 상응하는 날짜를 공개하지 않았고, GPT-5.6 라인 위에는 이미 GPT-6 Astra라는 더 새로운 세대가 있습니다. 어느 것도 Luna를 피해야 할 이유는 아니지만, 로드맵이 11개월의 계획 기간을 전제로 한다면 이는 모델 식별자를 하드코딩하지 않고 구성에 두어야 할 이유가 됩니다.
실시간 토큰당 요금: GPT-5.6 Luna는 동일한 키에서 0% 마크업으로 전달되며 별도의 청구 관계가 없습니다.
실시간 토큰당 요금Claude Haiku 4.5를 동일한 엔드포인트에서 확인할 수 있어, 별도의 계약 없이 두 티어를 비교할 수 있습니다.
