'동일한 요율, 세 배의 청구서'라는 제목의 생성된 히어로 카드로, 'SAME STICKER' 배지와 'TWO MODELS, $0.10 AND $0.50, ONE QUESTION'이라는 킥커, 그리고 'Claude Haiku 5.5 대 GPT-6 Luna: 같은 두 숫자, 그리고 매우 다른 임계값.'이라는 부제가 붙어 있습니다. 네 개의 칩은 '$0.10 / $0.50 둘 다', '100K vs 272K', '$0.21 vs $0.07', '43.40 vs 38.12'라고 표시되어 있습니다. 아래의 두 카드는 'THE SAME'('첫 번째 티어에서 입력 $0.10과 출력 $0.50, 그리고 둘 다 1M 토큰 윈도우')과 'NOT THE SAME'('그 단계는 100,000 토큰 대 272,000 토큰에 위치하며, 작업당 비용은 세 배 차이 납니다')으로 표시되어 있습니다. 하단에는 'Vendors' published list rates; independent measurements from Artificial Analysis, read October 8, 2026.'라고 적혀 있습니다. OrcaRouter 로고가 오른쪽 하단 모서리에 합성되어 있습니다.
Guides & Insights

Claude Haiku 5.5 vs GPT-6 Luna: 같은 표시 가격, 세 배의 청구서

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Claude Haiku 5.5와 GPT-6 Luna는 서류상으로는 동일한 가격입니다: 입력 토큰 100만 개당 $0.10, 출력 토큰 100만 개당 $0.50—센트 단위까지 똑같은 두 숫자를, 거의 어떤 것에도 의견이 일치하지 않는 두 공급업체가 내놓았습니다. Anthropic의 출시 게시물은 심지어 Luna의 점수를 자신의 점수 옆 칸에 실었는데, 이는 공급업체가 위협적이라고 여기지 않는 모델에 대해 하는 일이 아닙니다.

두 카드는 스티커가 가리는 모든 것에서 갈린다. Luna는 272,000 토큰까지 이 요율을 유지하다가 인상되고, Claude Haiku 5.5는 100,000에서 인상된다. Claude Haiku 5.5는 Artificial Analysis Intelligence Index v4.3.2에서 43.40점을 기록해 Luna의 38.12점을 앞선다. 그리고 완료된 Index 작업당 비용은 Luna의 $0.07에 맞서 $0.21이다. 같은 가격, 세 배의 청구서, 5점 더 높은 지능. 이것이 이 거래의 전부이며, 이 대역의 대부분의 맞대결보다 더 깔끔한 거래다.

카드 두 장, 나란히

미국 달러 기준 백만 토큰당 요금으로, 자체 카탈로그에 반영된 Anthropic 및 OpenAI의 공개 요율을 사용하며, 독립 측정치는 Artificial Analysis에 출처를 둡니다. 2026-10-08 기준 캐시됨.

A generated scoreboard titled 'Claude Haiku 5.5 vs GPT-6 Luna - two cards, side by side'. Claude Haiku 5.5 reads input $0.10 under the first tier and $0.50 past 100,000, output $0.50 and $2.50 past 100,000, maximum output 128,000 tokens, Intelligence Index v4.3.2 43.40, cost per task $0.21, output speed 241.9 tokens per second. GPT-6 Luna reads input $0.10 under the first tier and $0.20 past 272,000, output $0.50 and $0.75, maximum output 128,000 tokens, Intelligence Index v4.3.2 38.12, cost per task $0.07, output speed 129.4 tokens per second. A footer reads 'Vendors' published list rates; independent measurements from Artificial Analysis.'

• 입력 — Claude Haiku 5.5는 최대 100,000토큰까지 $0.10, 초과 시 $0.50. GPT-6 Luna는 최대 272,000토큰까지 $0.10, 초과 시 $0.20.

• 출력 — Claude Haiku 5.5: 최대 100,000 토큰까지 $0.50, 초과 시 $2.50. GPT-6 Luna: 최대 272,000 토큰까지 $0.50, 초과 시 $0.75.

• 캐시된 입력 및 쓰기 — 첫 번째 임계값 미만에서는 둘 다 $0.01과 $0.125이며, Claude Haiku 5.5는 100,000토큰을 초과하면 $0.05와 $0.625로, GPT-6 Luna는 272,000토큰을 초과하면 $0.02와 $0.25로 전환됩니다.

• 컨텍스트와 출력 — 둘 다 1M 토큰, 둘 다 최대 출력 128,000. 이 둘은 정말로 같은 형태입니다.

• Thinking — 두 모델 모두에서 적응형이며, 둘 다 effort 매개변수를 사용합니다. Claude Haiku 5.5의 기본 effort는 medium이며, 공개된 점수 모두가 그 설정에서 나온 것은 아닙니다.

• 독립 점수 — Claude Haiku 5.5 (Max) 43.40, 182개 모델 중 2위. GPT-6 Luna (Max) 38.12, 182개 모델 중 8위.

• 작업당 독립 비용 — $0.21 대 $0.07.

• 속도 — 동일한 평가자 측정 기준 초당 출력 토큰 241.9 대 129.4

임계점은 차이가 발생하는 지점이다

두 공급업체 모두 2단계 요율표를 만들었다. 하지만 그 기준을 설정한 지점은 매우 달랐고, 그 위치가 맨 위 숫자보다 훨씬 더 중요하다.

Anthropic의 구간은 100,000토큰에 설정되어 있다. 그 이하에서는 $0.10과 $0.50을 지불하고, 그 이상에서는 다섯 배, 다섯 배 — $0.50과 $2.50을 지불한다. Anthropic에 따르면 임계값 미만의 프롬프트는 이전 Haiku 모델에 대한 요청의 약 90%를 차지했는데, 이는 해당 벤더 자체의 트래픽 구성이며 일반적으로 짧은 호출 워크로드를 합리적으로 설명하는 수치다.

OpenAI의 단계는 272,000 토큰에 있습니다. 그 아래에는 $0.10과 $0.50이 있으며, 이는 Anthropic과 동일합니다. 그 위에는 $0.20과 $0.75로, 두 배와 50% 인상입니다. 이는 훨씬 완만한 단계이며, 거의 세 배 더 먼 지점에서 시작합니다.

20만 토큰짜리 프롬프트를 생각해 보자. 이는 장문 문서 파이프라인에서 충분히 그럴듯한 크기이고, 100만 토큰 윈도에서는 전혀 무리한 규모가 아니다. Claude Haiku 5.5에서는 그 요청이 두 번째 티어로 청구된다: 입력 $0.50, 출력 $2.50. GPT-6 Luna에서는 여전히 첫 번째 티어다: 입력 $0.10, 출력 $0.50. 같은 요청에, 같은 대표 가격을 내건 두 모델 사이에서 입력 요율은 다섯 배, 출력 요율도 다섯 배다. 이는 미묘한 차이가 아니다 — 장문 프롬프트 워크로드에서는 이것이 비교의 전부다.

같은 요율인데 청구서가 세 배로 나오는 이유

작업당 비용은 대량 파이프라인을 좌우해야 하는 수치이며, 여기서 두 모델은 요금표로는 설명할 수 없는 방식으로 갈라선다.

Artificial Analysis는 GPT-6 Luna (Max)를 Intelligence Index 작업당 $0.07, Claude Haiku 5.5 (Max)를 $0.21로 책정한다 — 점수 차이가 5.28점인데도 동일한 표시 요금에서 3배 차이다. 원인은 같은 페이지에 나와 있으며 결코 미묘하지 않다. Claude Haiku 5.5는 Index를 실행하는 동안 1억 개 중앙값과 비교하여 4억 4천만 개의 출력 토큰을 생성했으며, 평가자는 이를 매우 장황하다고 부른다. GPT-6 Luna는 동일한 1억 개 중앙값과 비교하여 1억 4천만 개를 생성했으며, 다소 장황하다고 묘사된다. 출력이 지배하는 척도일 때 출력 토큰이 3배면 청구서도 3배다.

Ant​hropic 자체의 수치도 같은 방향을 가리킨다. 이 공급업체의 비용 대 정확도 차트는 Haiku 5.5를 effort 범위 전반에 걸쳐 그려 놓았고, 출시 당시의 대표 인용구는 Sonnet 5.5와 Opus 5.5가 복잡한 에이전트형 코딩 작업에서는 여전히 더 나은 선택이며, Haiku 5.5는 대신 컴팩션, 요약, 서브에이전트를 위한 모델로 자리매김한다는 것이다. 작업이 작을수록 그 장황함 문제를 덜 사들이게 된다 — 이는 바로 이 모델이 만들어진 워크로드이며, 바로 3배의 비용 격차를 리더보드의 수치가 아니라 자신의 로그와 비교해 확인할 가치가 있는 워크로드다.

원장에 항목이 하나 더 있습니다. 평가자의 문서가 아니라 Anthropic의 문서에서 가져온 내용입니다: Claude Haiku 5.5는 Claude 4.7 및 이후 버전과 공유되는 더 새로운 토크나이저를 사용하므로, 같은 텍스트가 이전 Haiku보다 약 30% 더 많은 토큰으로 계산됩니다. 요금은 Luna와 같지만, 토크나이저는 다릅니다.

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 specifications row and the published pricing table, with the per-million-token input, output and cache rates and the 100,000-token threshold at which the second tier begins.

Ant​hropic의 자체 표가 Luna에 대해 말하는 것

Anthropic의 출시 페이지는 자사 벤치마크 표에서 GPT-6 Luna를 한 열로 다루고 있는데, 이를 정직하게 보고하는 방식은 출처 표기를 함께 붙이는 것입니다. 이는 Anthropic의 평가이며, Anthropic의 하네스에서 경쟁사 모델을 상대로 실행된 것입니다. 이는 벤더가 보고한 결과로 독립적으로 재현된 것이 아니며, 벤더가 자사 스위트를 경쟁사의 점수에 대해 실행한 것은 그대로 받아들이기보다 따져봐야 할 비교입니다.

• 지식 노동 — GDPval-AA v2.1에서 Claude Haiku 5.5는 1620, GPT-6 Luna는 1437입니다. AA-Briefcase v1.1은 1578 대 1336입니다.

• 컴퓨터 사용 — OSWorld 2.1 오프라인 부분집합에서 48.9% 대비 72.4%.

• 에이전틱 코딩 — Terminal-Bench 4.0은 39.2% 대 16.4%, FrontierCode 1.1(Main)은 46.4% 대 42.4%를 기록했습니다.

• 시각적 추론 — 도구 없이 Chartography 46.4% 대 29.1%.

공급업체 자체 하네스에서는 Claude Haiku 5.5가 모든 행에서 앞선다. 독립 보드에서는 더 작은 차이로 앞서는데 — 43.40 대 38.12 — 이는 벤더의 표와 제3자의 표 사이에서 흔히 나타나는 관계이며, 여기에 둘 다 실린 이유이기도 하다. 두 결과는 방향에는 일치하지만 크기에는 엇갈린다.

그 법안이 결정적인 표입니다

정말로 중요한 네 가지 사실을 서로 맞세워 보면, 대부분의 워크로드에서는 선택이 더 이상 팽팽하지 않게 된다.

GPT-6 Luna는 독립 측정에서 완료된 작업당 비용이 3분의 1로 더 저렴하고, 첫 번째 가격 티어는 컨텍스트 윈도우에서 18배 더 멀리까지 도달하며, 임계값 초과율은 두 측정기 모두에서 더 낮고, 두 모델 중 장문맥 패널티가 5배 상승이 아니라 2배 증가인 유일한 모델이다. Claude Haiku 5.5는 측정된 지능에서 실질적이지만 크지 않은 차이로 앞서고, 출력에서는 거의 2배 더 빠르며 — 격차가 가장 큰 벤더 자체 하네스에서 — 공개된 모든 벤치마크 항목에서 앞선다.

호출이 짧거나, 처리량이 제약 조건이거나, 품질 차이가 자체 평가에서 드러난다면 세 배를 지불하세요. 호출이 길거나, 기계가 생성하며 사람이 전혀 읽지 않거나, 하루에 백만 번 실행되는 분류 티어를 돌리고 있다면, 동일한 $0.10과 $0.50로 반대편에서는 3분의 1 크기의 청구서를 받게 되고, 포기하는 역량은 두 모델 모두 상위권에 올라 있는 리더보드에서 5점에 불과합니다.

한 곳에서 둘 중 하나를 호출하기

이렇게 근소한 비교에서 유용한 점은, 우리 것을 포함해 누구의 말도 그대로 믿을 필요가 없다는 것입니다. GPT-6 Luna는 오늘 OrcaRouter 카탈로그에 제공사 요율, 0% 마크업으로 올라와 있으며 — 위에 명시된 것과 동일한 요율 구조로, 혼합되지 않고 그대로 전달됩니다 — Claude Sonnet 5.5와 Claude Opus 5.5도 마찬가지입니다. 따라서 저렴한 레그에서 중간 티어로 올라가는 에스컬레이션 테스트는 프로젝트가 아니라 구성이 됩니다. 하나의 키, 하나의 SDK, 그 아래의 자동 페일오버, 그리고 에스컬레이션이 애플리케이션이 아니라 라우트에 속한다면 라우팅 DSL.

Claude Haiku 5.5는 아직 카탈로그에 없습니다. 그 점을 분명히 말하는 것이 그렇지 않은 듯 암시하는 것보다 더 유용합니다: 이 비교에서 Luna 쪽은 오늘 아침 우리가 호출할 수 있고, Ant​hropic 쪽은 그렇지 않게 되기 전까지는 Ant​hropic에서 접근해야 합니다.

A screenshot of the OrcaRouter catalogue page for GPT-6 Luna, showing the model identifier openai/gpt-6-Luna, the provider OpenAI, a 1M-token context window, 128,000 maximum output, the release date September 22 2026, the $0.10 per million input and $0.50 per million output rates and a p50 time to first token of 1.49 seconds.

답을 바꾸는 것은 무엇인가?

두 가지인데, 둘 다 추정하기보다 지켜볼 가치가 있습니다.

첫 번째는 장황함이 변하는지 여부입니다. Claude Haiku 5.5의 작업당 비용은 최대 effort에서 답변당 얼마나 많은 토큰을 소비하는지에 좌우되며, effort 파라미터가 이를 조절하는 레버입니다. effort를 더 낮게 고정하는 팀은 — 모델 자체의 기본값은 max가 아니라 medium입니다 — Luna에 더 가까운 작업당 비용 수치와 Luna에 더 가까운 점수를 보게 됩니다. 이 트레이드오프는 선택할 수 있습니다. 그것이 얼마만한 가치가 있는지는 모델이 아니라 여러분의 eval에 관한 질문입니다.

두 번째는 두 모델이 더 많은 측정 실행을 축적함에 따라 독립적인 작업당 비용 수치가 그대로 유지되는지 여부입니다. 단일 보드 배치는 하나의 스냅샷일 뿐이며, 한 스냅샷에서 나타난 세 배의 격차는 그것을 기준으로 파이프라인을 재구축하기 전에 자신의 청구서와 대조해 확인할 가치가 있습니다. 공유 엔드포인트가 바로 그런 용도입니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트