
Claude Haiku 5.5 vs Qwen3.8-Flash-Next: 오픈 웨이트 모델이 저렴한 모델은 아니다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
직관은 알리바바의 플래시 티어에서 나온 오픈 웨이트 모델이 Anthropic의 폐쇄형 소형 모델보다 가격을 밑돌 것이라는 것이고, 두 개의 표시 가격 숫자만 보면 실제로 그렇습니다: Qwen3.8-Flash-Next는 알리바바 자체 API에서 100만 입력 토큰당 $0.15, 100만 출력 토큰당 $0.47에 제공되는 반면, $0.10과 $0.50은 Claude Haiku 5.5의 가격입니다. 하지만 둘 다 같은 벤치마크 스위트에 돌려 보면 순위가 뒤집힙니다. Artificial Analysis는 Claude Haiku 5.5를 Max effort에서 완료된 Intelligence Index 작업당 $0.21로 측정합니다. Qwen3.8-Flash-Next는 같은 측정에서 $0.37이 들고, 점수는 3점 더 낮습니다. 더 싼 표시 가격은 더 큰 청구서를 받는 모델의 것이며, 그 이유는 이런 비교 대부분을 결정하는 것과 같습니다: 요금표는 가격이 아니고, 오픈 웨이트 모델은 관리형 API 청구서가 아닌 다른 곳에서 제값을 합니다. 그 "다른 곳"이 바로 이번 맞대결의 실제 주제입니다.
각각이 무엇인지
그 둘은 6주 간격을 두고 등장했으며, 같은 종류의 결과물이 아니다.
• Claude Haiku 5.5 — 2026년 10월 7일 Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry 및 Claude Platform on AWS에서 출시된 클로즈드 웨이트 모델입니다. 100만 토큰 컨텍스트, 동기 Messages API에서 최대 128,000 출력 토큰, Low에서 Max까지의 노력 수준 다이얼과 기본값이 medium인 적응형 사고, 2026년 6월 지식 컷오프, 그리고 100,000 토큰에서 구간이 나뉘는 요금표를 제공합니다.
• Qwen3.8-Flash-Next — 2026년 8월 26일 qwen-community-1.0 라이선스로 공개된 오픈 웨이트 전문가 혼합(mixture-of-experts) 모델로, 알리바바는 Qwen4를 뒷받침할 아키텍처의 실험적 프리뷰라고 설명했습니다. 주 모델 파라미터 125B에 별도의 51B n-gram 임베딩 테이블을 저장하며 — 4B 멀티 토큰 예측 모듈을 더하기 전 기준 약 176B — 토큰당 6B를 활성화하고, 512개의 전문가, top-10 라우팅, 48개 레이어를 갖추고 있습니다. 네이티브 컨텍스트는 262,144 토큰이며 YaRN을 사용하면 1M까지 확장할 수 있고, 텍스트, 이미지, 비디오 입력을 받습니다.
• Qwen3.8-Flash — 서비스 중인 상용 대응 버전으로, 이 역시 2026년 8월 26일부터 알리바바의 QwenCloud에서 입력 100만 토큰당 $0.16, 출력 100만 토큰당 $0.47에 기본 1M 토큰 컨텍스트로 제공됩니다. Flash-Next와는 따로 두는 것이 좋습니다. 하나는 다운로드하여 검사할 수 있는 체크포인트이고, 다른 하나는 가격이 책정된 관리형 엔드포인트입니다.
마지막 두 모델의 차이가 바로 이 비교가 흥미로운 이유의 전부입니다. Claude Haiku 5.5와 Qwen3.8-Flash-Next는 거의 겹치는 부분에서 경쟁하지 않습니다. 둘 중 하나만 자체 하드웨어에서 실행할 수 있기 때문입니다.
반대 방향을 가리키는, 신중하게 마련된 법안
다음의 모든 독립적인 수치는 Artificial Analysis의 Intelligence Index v4.3.2에서 가져온 것입니다. Anthropic과 Alibaba의 요금표는 각 업체가 공개한 자체 가격입니다.
• 인텔리전스 지수 — Claude Haiku 5.5는 Max effort에서 43점으로 182개 모델 중 2위입니다. Qwen3.8-Flash-Next는 40점으로 동급 117개 중 6위입니다. 3점 차이로 Anthropic이 앞서 있습니다.
• 작업당 비용 — $0.21 대 $0.37. 토큰당 더 비싼 모델이 완료된 작업당 43% 더 저렴합니다.
• Index 실행 시 출력 토큰 — Claude Haiku 5.5는 4억 4천만 개, Qwen3.8-Flash-Next는 2억 4천만 개로, 둘 다 1억 개라는 중앙값과 비교됩니다. Qwen 모델이 더 효율적인 작성자인데도 여전히 더 비용이 많이 드는 작업이라는 점은, 격차가 단순한 토큰 양이 아니라 평가자가 적용하는 입력 구성과 가치 평가의 문제임을 보여줍니다.
• 출력 속도 — 241.9 토큰/초 대 56.0. Claude Haiku 5.5는 같은 측정에서 네 배 이상 빠르며, 해당 실행에서 첫 토큰까지 걸린 295초는 네트워크 수치가 아니라 Max effort로 사고한 데 따른 부산물입니다. Qwen3.8-Flash-Next의 첫 토큰까지 걸린 시간은 2.53초입니다.
• 요금표 구조 — Claude Haiku 5.5는 100,000 토큰에서 $0.10과 $0.50에서 $0.50과 $2.50로 올라간다. Qwen3.8-Flash는 길이와 무관하게 $0.16과 $0.47로 고정되어 있는데, 이는 긴 프롬프트에서 진정한 이점이며 가격표 논거가 긴 문서와 실제로 맞닥뜨려도 살아남는 유일한 지점이다.
• 토크나이저 — Claude Haiku 5.5는 Claude 4.7 이후 버전과 공유하는 더 새로운 토크나이저를 사용하므로, 같은 텍스트가 이전 Haiku보다 약 30% 더 많은 토큰으로 집계됩니다. 이 때문에 프롬프트가 100,000토큰 구간 쪽으로 부풀려지는데, 이는 Anthropic 자체 문서에 나온 내용이며, Qwen의 정액 요금이 가장 유리해 보이는 바로 그 장문 프롬프트 상황에서 이 모델에 불리하게 작용합니다.
그래서 이 트레이드오프의 구조는 이렇습니다. 토큰당 더 많이 지불하면 더 빠르고 약간 더 똑똑한 답변을 얻고 완료된 작업당 비용은 더 낮아지지만, 긴 입력에서는 요율 절벽을 주의해야 합니다. 또는 토큰당 더 적게 지불하고 더 느린 모델을 사용하면 완료된 작업당 비용은 더 높아지지만, 요율이 일정하고 262,144토큰 네이티브 윈도우를 제공합니다.


오픈 웨이트가 실제로 셈법을 바꾸는 지점
위의 모든 내용은 두 개의 관리형 API를 비교한 것이며, 그것은 Qwen3.8-Flash-Next가 이기도록 설계된 비교가 아닙니다. 이 모델의 주장은 임대할 필요가 없다는 것입니다.
• 출시 첫날부터의 서빙 지원. SGLang은 쿡북 페이지와 전용 이미지를 제공했고, vLLM은 아키텍처 지원 풀 리퀘스트가 아직 열려 있는 가운데 이에 대한 빌드를 갖추고 있습니다. NVIDIA는 GB300 NVL72 랙에서 두 가지 모두와 TensorRT LLM을 검증했으며, NeMo는 파인튜닝을 지원합니다.
• 176B 체크포인트치고는 하드웨어 진입 장벽이 낮습니다. 51B n-gram 임베딩 테이블은 조회 주소를 미리 알 수 있고 프리페치할 수 있기 때문에 VRAM이 아니라 호스트 메모리에 둘 수 있습니다. 덕분에 이 모델은 DGX Spark 클러스터와 4×RTX PRO 6000 워크스테이션에서 실행되며, 당일 나오는 커뮤니티 양자화 — 75GB RAM에 들어가면서 전체 정확도의 약 80%를 내는 1비트 빌드 — 덕분에 소규모 팀이 보유한 하드웨어에서도 돌릴 수 있습니다.
• 파인튜닝을 사용할 수 있습니다. 호스팅된 튜닝 API라는 의미는 아닙니다: 가중치는 여러분의 것이며, 일반적인 조건이 붙은 커뮤니티 라이선스 하에 있고, 아키텍처는 절제 실험과 부정적 결과를 공개하는 기술 보고서에 문서화되어 있습니다.
• 윈도는 보기보다 작습니다. 네이티브 262,144 토큰, YaRN으로 1M까지 확장 가능 — 반면 Claude Haiku 5.5는 네이티브 1M이며, rope 스케일링이라는 단서도 없습니다. Qwen의 균일 요금이 가장 매력적으로 보이는 장문 문서 워크로드에서는, 실제로 그 문서를 감당할 수 있는 모델은 다른 쪽입니다.
• 벤치마크는 공급업체가 보고한 수치입니다. 알리바바 자체 표에서는 Flash-Next가 DeepSWE 1.1(58.7 대 54.4), SWE-bench Pro(62.5 대 56.0), GPQA Diamond(91.7 대 90.8)에서 DeepSeek-V4-Flash-0731보다 앞서고, NL2Repo-Bench(48.1 대 54.2)에서는 뒤처집니다 — 저장소 수준 코드 생성, 더 작은 모델이 따라가지 못하는 유일한 에이전트형 차원입니다. 이 중 어느 것도 제3자에 의해 재현되지 않았으며, 이 모델은 출시된 지 6주밖에 되지 않았습니다.
그것이 둘 사이의 정직한 경계다. Claude Haiku 5.5는 고정된 품질 상한과 운영 표면이 없는 종량제 서비스다. Qwen3.8-Flash-Next는 비용 곡선이 전기 요금 수준을 향해 아래로 휘고 품질 상한이 여러분이 서빙할 수 있는 만큼인 아티팩트이며, 여기에 재현되지 않은 벤치마크 표와 런타임이 아직 흡수 중인 아키텍처라는 위험이 더해진다.
결정하는 현실적인 방법
세 가지 질문이면 결론이 난다. 그리고 그중 첫 번째만 벤치마크에 관한 것이다.
GPU가 있나요, 아니면 원하나요? 그렇지 않다면 셀프 호스팅 시나리오는 이론에 불과하며, 위의 매니지드 비교가 전부입니다 — 그리고 작업당 비용, 속도, 점수 모두에서 Claude Haiku 5.5가 앞서는데, 다만 100,000토큰 단계가 긴 프롬프트에 불리하다는 단서가 붙습니다. 반대로 활용률 목표에 못 미치고 노는 가속기를 보유하고 있다면, Qwen3.8-Flash-Next는 6B 활성 파라미터 디코딩을 대량으로 돌려도 정말 저렴한 몇 안 되는 오픈 모델 중 하나이며, 작업당 $0.37이라는 수치는 더 이상 관련 있는 숫자가 아닙니다.
평균 프롬프트 길이는 얼마인가요? 이 지점이 바로 스티커 논쟁이 성립하는 유일한 곳입니다. 토크나이저가 대략 30% 부풀린 후 기준으로 100,000토큰 미만에서는 Claude Haiku 5.5가 모든 미터에서 더 저렴합니다. 그 이상에서는 고정 $0.16과 $0.47이 더 나은 카드이며, 262,144토큰 윈도까지 길이가 늘어날수록 그 우위는 더 벌어집니다. 그 이상은 YaRN 확장이라는 별개의 엔지니어링 문제입니다.
워크로드는 지연 시간 변동을 어느 정도까지 감내할 수 있습니까? 초당 출력 토큰 241.9개 대 56.0개는 큰 격차이며, 자체 호스팅 배포는 여기에 대기열까지 더합니다. Anthropic이 이 등급의 워크로드로 언급한 실시간 지원 또는 브라우저 구동 에이전트는 그 차이를 체감하게 될 것입니다.
두 번째와 세 번째 질문에 대해 추론하기보다는 답을 얻고자 하는 사람에게 가장 저렴한 도구는 공유 엔드포인트. Qwen3.8-Flash-Next는 아직 OrcaRouter의 카탈로그에 없으며, Claude Haiku 5.5도 마찬가지입니다. 우리가 라우팅하는 Qwen 형제 모델은 Qwen3.8-Flash이며제공업체의 정가에 0% 마크업으로 전달되는, 이는 이 비교에서 해당 모델에 가장 근접하게 제공되는 등가물이며 장문 프롬프트 비용 테스트에 적합한 기준입니다. Anthropic 측에서는 Claude Haiku 4.5, Claude Sonnet 5.5, Claude Opus 5.5가 모두 오늘날 동일한 키로 호출 가능하므로, 2세대 가격 실험은 두 번째 계약이 아니라 구성입니다 — 그리고 가격이 혼합이 아니라 패스스루이기 때문에, 어느 쪽이든 공급업체의 인하가 발표되는 당일 우리 쪽에 나타납니다. 자동 장애 조치는 실험을 실제 트래픽에서 안전하게 실행할 수 있게 하는 요소입니다: 프리뷰 모델이나 재현되지 않은 벤치마크 표는 신뢰할 수 있는 모델이 뒤에 있는 동안 경로를 새로운 무언가로 지정하는 바로 그 사례입니다.
답을 바꾸는 것은 무엇인가?
두 가지가 있는데, 둘 다 확인 가능하다. 첫 번째는 Claude Haiku 5.5도 실행하는 하네스에서 Qwen3.8-Flash-Next를 독립적으로 평가한 것이다 — 벤더 표는 DeepSeek를 상대로 한 것이고, 독립 보드의 40은 단일 배치다. 저장소 수준 코딩 점수가 주목해야 할 행인데, NL2Repo는 그 모델이 이미 뒤처진다는 것이 입증된 곳이기 때문이다. 두 번째는 런타임 작업이 실제로 적용되는지 여부다: vLLM 지원은 아직 열린 풀 리퀘스트를 통해 병합되고 있으며, 그게 완료되기 전까지 이 아키텍처를 셀프 호스팅하는 것은 지원되는 경로라기보다 그런 일을 즐기는 팀을 위한 작업이다.
그때까지는 요약이 짧습니다. Qwen3.8-Flash-Next는 소유하기에는 더 흥미로운 모델이고, 임대하기에는 더 비싼 모델입니다. Claude Haiku 5.5는 더 저렴하고, 더 빠르고, 더 높은 점수를 받는 관리형 엔드포인트이며, 긴 것에는 불리한 요금표를 가지고 있습니다. 토큰을 사는지 체크포인트를 사는지에 따라 선택하세요. 그리고 토큰을 산다면, 오픈 웨이트 모델이 당신이 가정한 만큼의 할인은 아니라는 점을 유의하세요.

