
Claude Haiku 5.5 vs Qwen3.8 27B: API에서의 완승, 그리고 오픈 웨이트가 여전히 존재하는 이유
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
이 시리즈의 대부분의 비교는 결국 하나의 트레이드오프로 귀결된다. 이번 비교는 그렇지 않으며, 트레이드오프가 없다는 사실 자체가 곧 이번 결과다. Claude Haiku 5.5는 2026년 10월 7일 출시되어, Qwen3.8 27B즉 2026년 8월 14일 공개된 오픈 가중치 27B 덴스 모델을 종합 지능 점수, 토큰당 비용, 완료된 작업당 비용, 컨텍스트 윈도우, 응답 상한, 에이전트 코딩, 과학 추론 항목에서 앞선다. 게다가 하드웨어가 전혀 필요 없는 단일 독점 API만으로 이를 해낸다. Qwen3.8 27B가 완전히 승리하는 항목은 비디오 입력 하나이며, 나머지 하나는 라이선스다.
그것은 그 모델을 무시할 이유가 아니다. Apache-2.0 라이선스와 비디오 모달리티는 위로상이 아니기 때문이다. 그것은 누구든 왜 오픈 웨이트 진영을 선택하는지 정확히 따져야 할 이유이며, 논쟁이 벤치마크에 관한 것인 척하는 것을 그만둘 이유다.
두 모델이 실제로 실행된 숫자들
백만 토큰당 미국 달러 기준. 벤더의 요율은 자체 가격 문서에서 가져온 것입니다; 공유된 측정값은 Artificial Analysis Intelligence Index v4.3.2이며, 2026-10-08에 확인했고, 둘 모두 공개된 최고 노력 구성입니다.

• 입력 — Claude Haiku 5.5는 최대 100,000토큰까지 $0.10, 그 이상은 $0.50; Qwen3.8 27B는 보드에 기록된 제3자 요율로 $0.50.
• 출력 — Claude Haiku 5.5는 100,000 토큰까지 $0.50, 초과 시 $2.50; Qwen3.8 27B는 $3.00.
• 캐시된 입력 — Claude Haiku 5.5 $0.01 및 $0.05, 90% 할인; Qwen3.8 27B $0.10, 80% 할인.
• 독립 점수 — Claude Haiku 5.5 (Max) 43.40 대 Qwen3.8 27B (Xhigh) 33.70. 9.70점 차이로, 이번 배치에서 가장 큰 격차입니다.
• 완료된 작업당 비용 — 동일한 평가 실행에서 $0.21 대 $1.01. 4.7배 격차로, 여기서 가장 큰 차이이기도 합니다.
• 컨텍스트 및 출력 — Claude Haiku 5.5의 경우 1M 토큰과 128,000토큰 응답 상한; Qwen3.8 27B의 경우 256K 토큰 컨텍스트.
• 모달리티 — 둘 다 텍스트와 이미지를 입력받아 텍스트를 반환합니다. Qwen3.8 27B는 비디오 입력을 추가로 지원하지만, Claude Haiku 5.5는 지원하지 않습니다.
• 가중치 — Qwen3.8 27B는 Apache 2.0 라이선스 하에 27B dense 파라미터로 제공되며 다운로드할 수 있습니다. Claude Haiku 5.5는 독점 모델이며 API 전용입니다.

작업당 격차가 토큰당 격차의 네 배인 이유
요율표에는 이미 공급업체에 유리한 입력 격차 5배와 출력 격차 6배가 나타나 있으므로, 방향성은 의문의 여지가 없습니다. 주목할 만한 점은 작업당 수치가 더 작다는 것입니다 — 토큰당 수치보다. 이는 이 배치의 다른 대결에서 일어난 일과 반대이며, 그 이유는 시사하는 바가 큽니다.
Claude Haiku 5.5는 Intelligence Index 태스크당 162,164개의 출력 토큰을 생성합니다 — 추론 129,047개, 답변 33,118개입니다. Qwen3.8 27B는 66,797개를 생성하며, 추론 47,711개와 답변 19,087개로 나뉩니다. 해당 벤더의 모델은 태스크당 2.4배 더 많은 토큰을 소비하므로, 6배의 출력 속도 우위는 태스크당 4.7배 우위로 압축됩니다. 여전히 어마어마한 수치입니다. 다만 요금표가 광고하는 숫자는 아닙니다.
블렌드 계산은 그 형태를 더 명확하게 볼 수 있는 방법이다. 입력이 많은 7:2:1 블렌드 — 대부분의 프로덕션 트래픽이 실제로 지니는 가중치 — 에서 Claude Haiku 5.5는 백만 토큰당 $0.077인 반면 Qwen3.8 27B는 $0.470이다. 균형 잡힌 1:1 블렌드에서는 $0.30 대 $1.75이다. 벤더의 100,000토큰 절벽이 이 격차를 좁히는 유일한 요인이다. 그걸 넘어서면 Claude Haiku 5.5의 요금은 전체 요청에 대해 $0.50과 $2.50이 되고, 두 모델은 거의 같은 가격에서 만난다 — 그 지점에서는 9.7포인트의 점수 프리미엄을 아무것도 아닌 것에 지불하고 있는 셈이다.
공급업체 카드와 독립 보드가 일치하지 않는 경우
이 행 세트는 속도를 늦춰 살펴볼 가치가 있습니다. Qwen3.8 27B의 자체 모델 카드는 독립적인 측정치보다 상당히 더 강하게 읽히며, 그 차이가 바로 "훨씬 더 큰 모델들과 맞먹는 27B 모델"이라는 주장에 두 번째 출처가 필요한 이유 전부입니다.
해당 모델에 대해 우리 카탈로그 페이지에 기록된 대로, 공급업체가 자체적으로 공개한 수치에는 LiveCodeBench v6에서 90.3, GPQA Diamond에서 89.2, OSWorld-Verified에서 84.3, QwenSWEBench에서 79.0이 포함됩니다. 이는 공급업체가 보고한 수치이며 재현되지 않은 것이고, 자기 체급을 훨씬 뛰어넘는 경쟁력을 갖춘 모델을 설명합니다.
Artificial Analysis의 독립 실행에서 Qwen3.8 27B는Terminal-Bench 4.0에서 0.0556점을, SciCode에서 0.4664점, Humanity's Last Exam에서 0.3392점, GDPval-AA v2.1에서 1423.21점을 기록합니다. 0.0556을 벤더 카드가 OSWorld에서 보고한 84.3 옆에 놓아 보면 불일치의 윤곽은 분명해집니다. 컴퓨터 및 터미널 에이전트 작업에서 독립 평가 기관은 이 모델을 27B 덴스 모델이 마땅히 있어야 할 위치에 대략 놓는 반면, 벤더 카드는 그렇지 않습니다.
두 행은 반대 방향으로 작용하며, 같은 이유로 언급할 가치가 있다. Qwen3.8 27B가 기록한 점수는 AutomationBench에서 Claude Haiku 5.5의 0.3541에 맞선 0.4824이다 — 이는 각 보드가 비즈니스 자동화 벤치마크에 가장 가깝게 갖춘 항목에서의 12.8점 차 독립적 승리다. 이는 동일한 실행에서 나온 실제 수치이며, 사람들이 실제로 소형 모델을 배포하는 대상에 가장 인접한 행에 관한 것이다.
솔직한 해석은 "벤더가 모든 것을 부풀렸다"가 아니다. 그것은 모델 카드는 그 작성자들이 선택한 과제를 측정하고, 독립적인 위원회는 고정된 세트를 측정하며, Qwen3.8 27B의 강점은 벤더의 목록에는 있지만 위원회의 목록에는 없다는 것이다.
하드웨어를 직접 소유하면 경제성이 달라진다
위에 제시된 모든 요금은 API 가격이며, Qwen3.8 27B의 경우 그것은 잘못된 기준입니다.
이것은 Apache 2.0 라이선스의 27B 덴스 모델입니다. 대부분의 팀이 수용할 만한 양자화에서 최신 가속기 한 대에 들어가므로, 토큰의 한계 비용은 더 이상 벤더의 계량기가 아니라 여러분 자신의 활용률이 됩니다. 그래서 이 모델을 호출하는 가격은 이 비교에 포함된 어느 독점 모델도 결코 그럴 수 없는 방식으로 호스트별로 다릅니다. 보드에는 제3자 요금으로 입력 $0.50, 출력 $3.00이 기록되어 있고, OrcaRouter 카탈로그는 그것을 입력 $0.33, 출력 $2.40 가격에 캐시 읽기 라인이 전혀 없이 제공합니다. 왜냐하면 우리는 다른 사람의 엔드포인트를 재판매하는 대신 자체 인프라에서 가중치를 실행하기 때문입니다.
이미 GPU 비용을 지불하고 있는 팀에게 작업당 $0.21 대 $1.01이라는 비교는 의미가 없습니다. 비교 대상은 벤더가 청구하는 요율과 자체 하드웨어에서 요청을 처리할 때 드는 증분 비용이며, 이 둘은 서로 다른 숫자입니다. 이것이 오픈 웨이트 진영을 위한 논거이며, 벤치마크 표와 맞닥뜨려도 살아남는 유일한 논거입니다.
라이선스가 Apache 2.0이라는 점에는 두 번째의, 덜 명백한 결과가 있습니다. 바로 모델을 제품 안에 탑재해 출시할 수 있고, 자체 트래픽으로 미세 조정할 수 있으며, 특정 리비전에 고정할 수 있고, 가중치까지 감사할 수 있다는 것입니다. 이 중 어느 것도 독점 API 전용 모델에서는 어떤 가격을 지불하더라도 이용할 수 없으며, 규제가 적용되는 워크로드의 경우 이는 선호 사항이라기보다 흔히 결정적인 제약 조건입니다.

그들 중 누구에게든 전화하기
Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.
Claude Haiku 5.5는 카탈로그에 없습니다. 이 모델은 공급업체의 API를 통해 직접, 그리고 AWS, Azure 및 주요 클라우드 플랫폼을 통해 접근할 수 있으며, 이것이 정확한 설명입니다. 카탈로그가 공급업체 라인업에서 실제로 제공하는 것은 Claude Sonnet 5.5와 Claude Opus 5.5이며, 이는 자체 호스팅 소형 모델에서 호스팅된 중간 계층 에이전트형 모델로의 에스컬레이션 경로를 두 번째 통합이 아니라 라우팅 변경으로 만듭니다 — 자동 장애 조치가 어느 쪽이든 그 아래에 있습니다.
이례적으로 한쪽으로 치우친 평결
텍스트나 이미지에 대한 API 호출로서, Claude Haiku 5.5는 라이선싱에 관한 행이 아닌 모든 행에서 이 비교에서 이깁니다. 9.7 인덱스 포인트, 완료된 작업당 4.7배 더 저렴, 컨텍스트 윈도는 네 배, 응답 상한은 두 배, 그리고 짧은 프롬프트 영역에서 5~6배 더 낮은 가격표입니다. 가격 면에서 Qwen3.8 27B를 구제할 워크로드 형태 논거는 없습니다. 왜냐하면 해당 벤더의 단점인 많은 출력 토큰 사용은 단가 이점보다 훨씬 가치가 낮기 때문입니다.
이를 구제하는 것은 API 가격이 포착하지 못하는 모든 것입니다: 재배포를 허용하는 라이선스, 보유하고 고정할 수 있는 가중치, 비디오 입력, 그리고 토큰당 비용이 벤더의 카드가 아니라 자체 하드웨어인 셀프 호스팅 경로입니다. 텍스트를 분류하고 추출하고 요약하고 라우팅하는 가장 저렴한 방법을 찾고 있다면 Claude Haiku 5.5가 답이며 격차는 큽니다. 자신의 제품 안에, 자신의 장비 위에, 자신의 감사 아래에 넣을 수 있는 모델을 찾고 있다면, 벤치마크 격차는 이미 몇 문단 전부터 더 이상 쟁점이 아니게 되었습니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
