
Claude Haiku 5.5 vs Sakana Namazu: 둘 다 저렴하고 둘 다 빠르지만, 그 외에는 거의 공통점이 없다
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당 · 72 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 382 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
겉보기에는 이 둘이 동급처럼 보인다. Claude Haiku 5.5는 벤더의 작고 빠른 등급으로, 2026년 10월 7일에 출시되었으며 입력 토큰 100만 개당 $0.10, 출력 100만 개당 $0.50, 100만 토큰 컨텍스트 창을 제공하고, 분류, 추출, 라우팅 및 서브에이전트 작업을 위해 만들어졌다. Sakana Namazu는 Sakana AI의 일본어 특화 API 모델로, 2026년 8월 3일에 출시되었으며 입력 토큰 100만 개당 $0.95, 출력 100만 개당 $4.00, 캐시된 입력 요금 $0.15로 청구되고, 공개된 Kimi K2.6 베이스 위에 Sakana 자체의 포스트 트레이닝으로 정제되었으며, OpenAI 호환 엔드포인트를 통해 이용할 수 있다.
둘 다 각자의 라인업에서 저렴한 옵션으로 포지셔닝되어 있으며, 닮은 점은 거기까지다. Claude Haiku 5.5는 트래픽을 라우팅할 때 선택하게 되는 서구의 범용 모델이고, Sakana Namazu는 작업이 일본어로 이루어지는데 대안이 그 일을 서투르게 해내는 범용 모델일 때 선택하게 되는 국가 특화 모델이다. 흥미로운 질문은 어느 쪽이 더 나은가가 아니다. 그것은 전문 모델이 당신에게 무엇을 가져다주는지, 그 전문성의 경계가 실제로 어디에 놓이는지, 그리고 그 경계를 벗어나는 데 무엇이 드는지다.
Sakana AI가 실제로 만든 것
Sakana Namazu는 무엇과 비교하기 전에 먼저 이해할 가치가 있습니다. 그 구성 방식이 이례적이기 때문입니다. 이 모델은 처음부터 학습된 것이 아닙니다. 기존 오픈 가중치 모델인 Kimi K2.6을 개선한 것으로, Sakana가 추가로 사후 학습했으며, 이를 폐쇄형 API로 제공합니다. 계보가 중요합니다. 기본 모델의 일반 추론 및 코딩 능력은 계승되었고, Sakana가 더한 것은 일본 특화 계층입니다.
그 레이어는 문서화되어 있는데, 이는 대부분의 현지화 주장에 대해서는 할 수 없는 말이다. Sakana는 Namazu가 일반 평가인 AIME26, MMLU-Pro, LiveCodeBench v6에서 기본 모델의 성능을 유지하면서 일본어 및 일본 특화 세트 전반에서 이를 능가하며, FairPoliticsQA가 34.10%에서 56.30%로 상승했다고 보고한다. 자체 내부 일본어 번역 벤치마크인 JFBench를 운영하며, 그곳에서도 전반적인 개선을 보고한다. 별도의 사례 연구인 의사를 위한 근거 탐색 도구는 제119회 의사 국가시험에서 96.8%, 제120회에서 96.4%를 기록했다고 보고한다.
그것들은 Sakana의 벤치마크에서 나온 Sakana의 수치이며, JFBench는 다른 누구도 재현할 수 있는 공개 표준이 아니다. 그 단서에도 살아남는 주장은 좁지만 실질적이다: 그 모델은 이름이 붙은 베이스 모델에 문서화된 사후 학습 단계를 더한 것이고, 보고된 변화량은 해당 분야 전체가 아니라 자기 자신의 베이스 모델을 기준으로 한 것이다.
API와 상업적 조건은 대부분의 비즈니스 사례를 결정할 부분입니다. Namazu는 OpenAI 호환 — 엔드포인트 변경과 sakana-namazu 모델명만이 Sakana 자체 문서에 따르면 유일한 코드 변경입니다. 미국 달러로 청구하며 Enterprise 플랜에서는 엔화 결제를 제공합니다. 또한 토큰당 비교로는 결코 드러나지 않을 도구 비용도 수반합니다: 웹 검색 1,000회당 $7.00, 코드 실행 1시간당 $0.12이며, Sakana는 이를 제품에 묶어 제공합니다.
요금표의 어떤 숫자보다 더 중요한 두 가지 제약이 있습니다. Sakana의 자체 페이지에 따르면, GDPR 관련 컴플라이언스 작업이 완료될 때까지 Namazu는 EU, EEA, 영국 또는 스위스에서 사용할 수 없습니다. 그리고 기본 데이터 처리 정책에 따르면 입력 데이터가 Sakana의 모델을 훈련하고 개선하는 데 사용될 수 있으며, 콘솔 설정에서 옵트아웃할 수 있습니다. 회사는 현재 처리가 전적으로 일본 내에서 이루어진다고 보장할 수 없다고 말합니다. 유럽이나 영국 팀에게 첫 번째는 자격 미달 사유이고, 두 번째는 첫 통화 전에 답해야 할 질문입니다.
그 경계를, 솔직히 말하자면
이 부분은 스펙 시트 비교가 여러분을 속일 수 있는 섹션이므로, 실제로 비교할 수 있는 것은 다음과 같습니다:
• 가격 — Claude Haiku 5.5는 백만 토큰당 입력 $0.10, 출력 $0.50이며, 프롬프트 100,000토큰까지 적용되고, 그 이후에는 $0.50와 $2.50입니다. Sakana Namazu는 $0.95와 $4.00이며, 캐시된 입력 요금은 $0.15입니다. Namazu는 첫 번째 구간에서 입력 기준 약 9.5배, 출력 기준 8배 더 비쌉니다.
• 캐싱 — Claude Haiku 5.5의 캐시 읽기는 티어에 따라 백만 건당 $0.01 및 $0.05입니다. Sakana Namazu는 $0.15 고정입니다. 절대 수치는 최상위 티어에서는 비슷하고 최하위 티어에서는 29배 차이가 납니다.
• 도구 — 둘 다 순수한 텍스트 모델이 아니며, 요금 부과 방식도 같지 않습니다. Claude Haiku 5.5는 Low에서 Max까지 조절 가능한 노력 다이얼이 있는 적응형 사고와 서버 측 도구 지원을 제공합니다. Sakana Namazu는 웹 검색을 1,000회 호출당 $7.00, 코드 실행을 시간당 $0.12에 묶음으로 제공합니다.
• 컨텍스트 — Claude Haiku 5.5의 경우 100만 토큰. Sakana는 Namazu의 컨텍스트 창을 공개하지 않으며, 이에 대해 인용된 수치는 사양이 아니라 Kimi K2.6 기반에 대한 가정이다.
• 독립적 평가 — Claude Haiku 5.5는 Artificial Analysis Intelligence Index에서 43점을 기록했으며, 해당 순위표에서 동급 182개 모델 중 2위이고, Intelligence Index 과제당 비용은 $0.21입니다. Sakana Namazu는 Artificial Analysis 등재 항목이 없고, 제가 찾아볼 수 있었던 어떤 종류의 제3자 평가도 존재하지 않습니다. 공개된 수치는 자체 발표치입니다.
• 제공 현황 — Claude Haiku 5.5는 Claude API, Amazon Bedrock, Vertex AI, Microsoft Foundry 및 AWS의 Claude Platform에서 제공되며, 서비스 종료 시점을 2027년 10월 7일 이전으로는 앞당기지 않겠다고 공식 발표했습니다. Sakana Namazu는 Sakana 자체 API, Sakana Chat 및 Sakana Translate 제품에서 제공되며, EU, EEA, 영국 및 스위스에서는 사용할 수 없습니다.
• 데이터 처리 — 공급업체의 약관은 엔터프라이즈 표준을 따르며, 모델의 사고 블록은 이를 생성한 계정으로 범위가 한정됩니다. Sakana Namazu의 기본값은 입력이 학습에 사용될 수 있도록 하되, 옵트아웃할 수 있다는 것입니다.
• 모달리티 — Claude Haiku 5.5는 텍스트와 이미지를 입력으로 받습니다. Sakana Namazu의 모달리티 지원 범위는 텍스트 우선 포지셔닝 외에는 공개되지 않았습니다.
• 라이선스와 계보 — Claude Haiku 5.5는 독점 모델이며 API 전용입니다. Sakana Namazu는 독점이지만 공개된 Kimi K2.6 가중치를 기반으로 구축되었습니다. 즉, 기반은 검사할 수 있지만 튜닝된 모델은 그렇지 않습니다.
정직한 채점 문제
그 목록을 읽고 무엇이 빠져 있는지 주목하세요: 어떤 모델이 더 나은 일본어 출력을 내는지 말해 주는 항목입니다. 그것은 간과가 아닙니다. 그것을 판가름할 공통 벤치마크가 두 모델 사이에 존재하지 않습니다. Claude Haiku 5.5의 뛰어난 일본어 성능은 벤더가 대표적인 주장으로 광고하는 사항이 아니며, Sakana의 JFBench 수치는 자체 도구입니다. 강력한 다국어 능력을 갖춘 벤더의 범용 최전선급 소형 모델을 일본어에 특화해 후속 학습된 Kimi 기반 모델과 비교 평가하는 것은 실제로 아무도 실행해 공개하지 않은 비교입니다.
말할 수 있는 것은 경험적이라기보다 구조적이다. Namazu의 상업적 정체성 전체는 범용 모델이 일본어 작업에는 충분하지 않다는 주장, 즉 국가별 언어, 문화적 추론, 국내 맥락이 9배의 가격 프리미엄을 붙인 특화 모델을 정당화하는 별개의 역량이라는 주장에 있다. 그 주장을 믿는다면 Namazu가 답이고, 그 가격은 그 답에 드는 비용이다. 믿지 않는다면 백만 토큰당 $0.10의 범용 모델을 쓰면 되고, 문제는 자신의 트래픽에서 그 차이를 측정할 수 있느냐이다.
그 주장에서 측정 가능한 형태는 Sakana가 제시하는 것이다: FairPoliticsQA가 튜닝의 기반이 된 기본 모델 대비 34.10%에서 56.30%로 향상된다는 것. 이는 실제 벤치마크에서의 실제 개선이지만, Claude Haiku 5.5가 아니라 Kimi K2.6과의 비교이며, 일본 특정 정치적 맥락을 위한 사후 학습이 그 과제에서 유의미한 변화를 만들어 낸다는 것을 알려 준다. 이는 '일본어를 더 잘한다'는 말보다 더 좁고 더 방어하기 쉬운 진술이다.

대량 생산 시 비용 격차가 어떻게 보이는지
두 가지 모두를 통해 하루 입력 1000만 토큰, 출력 200만 토큰 규모의 적당한 파이프라인을 실행해 보세요.
• 일일 입력 비용 — Claude Haiku 5.5에서는 $1.00, Sakana Namazu에서는 $9.50.
• 일일 출력 비용 — Claude Haiku 5.5에서 $1.00, Sakana Namazu에서 $8.00
• 일일 합계 — $2.00 대 $17.50, 월 약 $60 대 $525.
그 525달러는 웹 검색 호출을 한 번 하거나 코드를 한 시간 실행하기도 전의 금액이다. 하루에 검색 호출 500건을 추가하면 Namazu에는 하루 3.50달러가 더 들어 21.00달러 대 2.00달러가 된다 — 이는 어떤 토큰 효율성으로도 좁힐 수 없는 10대 1이 넘는 비율이다.
그게 많은 돈인지는 전적으로 대안이 무엇이냐에 달려 있습니다. 선택지가 Namazu이거나, 검토자가 손으로 고쳐야 하는 평범한 일본어 출력을 내는 범용 모델이라면, 그 $525는 검토자의 시간을 되사는 것이며, 비교는 토큰 대 토큰이 아니라 토큰 대 인건비입니다. 일본어 트래픽이 일상적이고 이미 범용 모델로 충분히 좋다면, 프리미엄은 측정 가능한 무엇도 사 주지 않으며, 같은 금액이면 다른 곳에서 열 배의 볼륨을 살 수 있습니다.
일본어 제품에서 세 번째 선택지는 흥미로운 것입니다: 전문 모델이 그 강점을 발휘하는 영역 — 번역, 국내 맥락, 규제 및 정치 텍스트 — 에서는 전문 모델을 사용하고, 그 주변의 대량 작업에는 범용 모델을 사용하는 것입니다. 그것은 타협이 아닙니다. 그것은 가격 책정이 실제로 함의하는 아키텍처입니다. 왜냐하면 Namazu의 프리미엄은 토큰당 지불되고, 분류 작업에 그것을 지불할 이유가 없기 때문입니다.

두 모델 모두 저희 카탈로그에 없습니다.
우리는 이 점을 분명히 해야 한다. 이는 가용성 문단을 몰래 끼워 넣기 쉬운 종류의 비교이기 때문이다: OrcaRouter는 Claude Haiku 5.5도 Sakana Namazu도 제공하지 않는다. Namazu는 Sakana 자체 API를 통해 이용할 수 있고, Claude Haiku 5.5는 공급업체의 API와 주요 클라우드를 통해 이용할 수 있다. 두 사실 모두 이 비교를 바꾸지 않는다. 이 비교는 공개된 요금, 공개된 기능, 공개된 제한에 근거한다.
이런 경우 하나의 엔드포인트가 맡는 역할은 플러그보다 더 좁고 더 정직합니다. 그것은 하이브리드의 범용 모델 축으로, 전문 모델이 필요 없는 비일본어 분류 및 추출 트래픽을 라우팅할 자리이며, 그러자고 별도의 벤더 관계를 새로 세울 필요는 없습니다. 200개 이상의 모델을 위한 단일 API, 공급자 정가를 0% 마크업으로 그대로 전달, 공급자 간 자동 페일오버, 그리고 요청의 언어가 애플리케이션이 아니라 라우트를 결정해야 할 때 쓰는 라우팅 DSL까지. 일본어 제품을 영어 제품과 함께 운영하고 있다면, 그것이 바로 직접 손으로 만들어야 했을 이음매입니다.
어느 것, 누구를 위한 것인가
일본어가 단순한 로케일이 아니라 제품 그 자체일 때 Sakana Namazu를 선택하십시오 — 리뷰어가 출력을 교정하고 있을 때, 도메인이 국내법, 의학, 정치 또는 고객 서비스일 때, 9배의 토큰 프리미엄이 그것이 제거해 주는 교정 비용보다 작을 때, 그리고 사용자가 EU, EEA, 영국, 스위스 밖에 있거나 데이터 처리 문제를 검토하여 승인한 법률 자문이 있을 때입니다.
작업이 일반적이고, 볼륨이 높으며, 공급업체 벤치마크가 아닌 독립적으로 측정된 점수를 원할 때 Claude Haiku 5.5를 선택하세요 — 100만 토큰당 $0.10과 $0.50이 계산을 대신 해줄 때, 긴 문서에서 100만 토큰 창이 필요할 때, 또는 "일본어에 더 뛰어난 것은 무엇인가"에 대한 답이 어느 공급업체의 평가가 아니라 여러분 자신의 평가에서 나와야 할 때.
두 모델은 사실 경쟁 관계가 아니다. 하나는 끊임없이 쓰이도록 가격이 책정된 범용 모델이고, 다른 하나는 신중하게 쓰이도록 가격이 책정된 특화 모델이다. 실수는 범용 모델이 이미 잘하는 일에 특화 모델을 사는 것이고, 그 반대의 실수—범용 모델이 특정 국가의 언어와 맥락을 그에 맞춰 훈련된 모델만큼 잘 처리한다고 가정하는 것—는 Sakana의 사업 전체가 사람들이 저지르는 바로 그 실수 위에 세워져 있다.

