
Qwen 3.8 vs Claude Fable 5: 0902 빌드, 코딩 선두를 차지하다
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Alibaba가 Qwen3.8-Max를 2026년 7월 19일 상하이에서 공개했을 때, 다른 어떤 주장보다도 크게 강조한 것은 이 2.4조 매개변수 모델이 프런티어 수준에 근접하며 오직 Claude Fable 5에만 뒤처진다는 점이었습니다. 당시에는 이를 평가할 수 없었습니다. 요금표도, 벤치마크 표도, 라이선스도 없었습니다 — 단지 포지셔닝 성명뿐이었습니다.
2026년 8월 3일, Qwen3.8-Max가 정식 출시되었다. 실제 요금표는 토큰 100만 개당 2달러/6달러, 수치가 적힌 벤치마크 표, OpenAI 및 DashScope 호환 엔드포인트를 갖췄다. 9월 2일, 알리바바는 버전 번호를 바꾸지 않은 채 다음 단계를 선보였다. 코딩과 에이전트 작업에 초점을 맞춘 사후 학습 리프레시인 Qwen3.8-Max-0902가 Code Arena: WebDev 리더보드에서 1,691 Elo로 1위에 데뷔한 것이다. 알리바바가 7월 내내 자사 모델을 직접 그 뒤에 포지셔닝했던 Claude Fable 5는 같은 리더보드에서 1,628을 기록 중이다. 7월의 질문은 더 날카로워졌다. Qwen 3.8이 여전히 "Fable 5에 이은 2위"인가, 아니면 코딩 축이 이미 뒤집힌 것인가?
빌더를 위한 참고 사항 — 이런 주장을 검증하는 가장 빠른 방법은 두 모델을 여러분의 프롬프트로 직접 실행해 보는 것입니다. OrcaRouter는 하나의 OpenAI 호환 엔드포인트로 200개 이상의 모델을 제공하므로, SDK 두 개를 연결할 필요 없이 동일한 작업에서 Qwen 3.8 Max와 Fable 5를 겨룰 수 있습니다.
TL;DR 결론.Qwen3.8-Max-0902는 현재까지 알리바바의 2.4T 플래그십 중 가장 강력한 빌드이며, 새로 추가된 근거는 더 이상 자체 보고가 아닙니다. 독립 벤치마크인 Code Arena: WebDev 보드에서 1,691 Elo로 #1에 데뷔하며 같은 보드의 Claude Fable 5(1,628, #8)를 앞섰습니다. 가격은 변함이 없고 여전히 결정적입니다. 1M 토큰당 $2/$6 균일 요금으로, Qwen은 입력 약 5배, 출력 약 8배 Fable 5의 $10/$50보다 저렴합니다. 여전히 좁혀지지 않은 격차는 범용 성능입니다. Artificial Analysis의 Intelligence Index에서 Qwen3.8-Max는 56점인 반면 Claude Fable 5는 62점이며, 일반 Arena 보드의 가장 최근 공개 주(8월 24~30일)에서는 Fable 5가 #1(1,508 Elo)을 지키는 동안 Qwen3.8-Max는 #20(1,479)에 머무릅니다. 따라서 결론은 두 가지입니다. 코딩에서는 Qwen의 0902 리프레시가 이제 독립 심판 아래 승리를 거머쥐었고, 광범위하고 검증된 추론에서는 Claude Fable 5 — 그리고 AA 지수에서 66점으로 선두인 Anthropic의 최신 Claude Fable 5.1 — 이 여전히 자리를 지키고 있습니다.
주요 시사점
• Qwen3.8-Max는 2026년 8월 3일에 GA(일반 공급)에 도달했으며, 0902 리프레시는 9월 2일에 이어졌습니다 — 버전 번호 변경 없이 동일한 $2 / $6 요금 체계와 1M-토큰 컨텍스트를 유지합니다.
• 가격 격차는 엄청납니다: Qwen은 1M당 $2 / $6이며, Fable 5는 $10 / $50입니다. 이는 입력에서 약 5배, 출력에서 약 8배이며, Qwen의 요율은 전체 1M 토큰 컨텍스트에 걸쳐 균일하고, 긴 프롬프트에 대한 추가 요금이 없습니다.
• 이제 양측 모두 독립적인 점수를 갖게 되었으며, 그 점수들은 서로 다른 방향을 가리키고 있습니다. Qwen3.8-Max는 Artificial Analysis Intelligence Index에서 56을 기록했고(Claude Fable 5는 62), 0902 빌드는 Code Arena: WebDev에서 1,691 Elo로 Fable 5의 1,628을 제치고 1위를 차지했습니다.
• Qwen 자체 벤치마크 표는 여전히 강력하며, 여전히 공급업체가 제작한 것입니다. GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 — 그러나 9월 2일 리프레시는 독립 아레나가 1위로 평가한 최초의 Qwen 결과입니다.
• 사양 시트의 아키텍처 공백이 해소되었습니다. Qwen3.8-2.4T-A95B는 총 2.4T 파라미터 중 약 95B의 활성 파라미터와 512개 전문가(expert) 구성을 지녔으며, 이 정보는 8월 12일 오픈 웨이트 릴리스와 함께 공개되었습니다. Fable 5의 아키텍처는 여전히 미공개 상태입니다.
• 오픈 웨이트가 출시되었습니다. 약속만 한 것이 아닙니다. Qwen3.8-2.4T-A95B(BF16 및 FP8)는 8월 12일 커스텀 Qwen3.8-Max 라이선스에 따라 Hugging Face와 ModelScope에 공개되었으며, Qwen3.8-27B는 8월 14일 Apache 2.0 라이선스로 뒤이어 공개되었습니다. Fable 5는 폐쇄형이며, API 전용으로 영구 제공됩니다.
정확성 참고: Alibaba 자체 벤치마크 표의 수치는 벤더 보고 수치이며 독립적으로 재현되지 않았습니다. 여기에 인용된 독립 수치는 타임스탬프가 기록된 제3자 데이터입니다: Artificial Analysis Intelligence Index(Qwen3.8-Max 56, Claude Fable 5 62, Claude Fable 5.1 66), Code Arena: WebDev Elo 목록, 그리고 일반 Arena 주간 보드 — 아레나 점수는 투표가 누적됨에 따라 유동적이며, 0902 빌드의 #1은 특정 시점의 순위 목록을 기준으로 한 Alibaba의 발표에 따른 것입니다. Fable 5의 95.0% SWE-bench Verified는 Anthropic 보고 수치이며, Qwen의 가격은 Alibaba Model Studio의 GA 요금표 기준입니다.
사양과 가격, 나란히
여기 확실한 데이터가 있습니다. 각 수치에는 출처가 표기되어 있습니다.
• 제조사/상태 — Qwen3.8-Max: Alibaba; 2026년 8월 3일 GA; 2026년 9월 2일 0902 리프레시. Claude Fable 5: Anthropic; GA 플래그십.
• 아키텍처 — Qwen3.8-Max: 총 2.4T / 활성 ~95B, 희소 MoE, 전문가 512명(8월 12일 공개); Fable 5: 비공개
• 컨텍스트 창 — Qwen3.8-Max: 1M 토큰 (thinking 포함 983,616; 최대 출력 131,072); Fable 5: 롱컨텍스트 플래그십
• AA Intelligence Index — Qwen3.8-Max: 56; Claude Fable 5: 62; Claude Fable 5.1 (9월 1일): 66, 선두
• SWE-bench Verified — Qwen3.8-Max: 보고되지 않음 (Alibaba는 대신 FrontierSWE 73.5를 보고함); Fable 5: 95.0% (Anthropic / buildfastwithai)
독립 평가 + 공급업체 보고 강점 — Qwen3.8-Max: Code Arena WebDev 1위 1,691 (0902, 독립); 공급업체 보고: GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6. Claude Fable 5: AA 62; SWE-bench Verified 95.0%
• 가격 (입력 / 출력) — Qwen3.8-Max: $2.00 / $6.00 1M당, 1M 컨텍스트 전체에 걸쳐 균일, 캐시된 입력 $0.25; Fable 5: $10 / $50 1M당
• 오픈 가중치 — Qwen3.8-Max: 2026년 8월 12일 출시(커스텀 라이선스, Apache 아님); Qwen3.8-27B는 8월 14일 Apache 2.0으로 공개. Fable 5: 해당 없음 — 비공개 / API 전용
• 멀티모달 — Qwen3.8-Max: 텍스트, 이미지, 비디오 입력 → 텍스트 출력; Fable 5: 멀티모달 플래그십
두 가지가 전체 비교의 틀을 만든다. 첫 번째는 8월 3일에 바뀌었고 여전히 유효하며, 두 번째는 9월 2일에 다시 바뀌었다.
먼저, 가격 열이 이제 페이지에서 가장 눈에 띄는 요소입니다.7월에 Qwen의 비용 우위는 크레딧 90% 할인이라는 일시적인 할인 쿠폰이었고, 계획의 기준이 될 토큰당 요금도 없었습니다. 이제는 요금표(rate card)이며, 그 격차는 프로모션성이라기보다 구조적입니다. Fable의 출력 가격이 50달러인 반면 Qwen은 6달러이므로, Fable 호출 1회 가격으로 Qwen 호출을 약 8회 실행할 수 있습니다. 가장 어려운 단일 답변 하나가 아니라 볼륨에 비용을 지불하는 워크로드라면, 이 비율은 여러분이 구축하는 아키텍처를 바꿉니다.
둘째, 벤치마크 지표는 더 이상 한쪽으로 치우치지 않게 되었다. 8월의 대부분 기간 동안 솔직하게 보면 불충분했다. 알리바바는 FrontierSWE 73.5와 자체 실행 결과 표를 보고했고, 앤트로픽은 제3자 검증을 거친 SWE-bench Verified 95.0%를 보고했다. 그리고 Qwen을 채점한 독립 평가자는 없었다. 0902 빌드가 그 상황을 끝냈다. Code Arena: WebDev는 이전에 WebDev Arena로 알려졌고 알리바바 소속 누구도 운영하지 않는 블라인드 쌍체 인간 투표 아레나인데, Qwen3.8-Max-0902가 Elo 1,691로 #1에 진입하여 Claude Opus 5(1,688), Kimi K3(1,674), Claude Fable 5(1,628, #8)보다 위에 올랐다. 이 결과를 정직하게 유지하는 두 가지 단서가 있다. 첫째, 이는 일반 역량이 아닌 에이전트형 프런트엔드 개발을 측정하는 단일 보드다. 둘째, '1위 데뷔'는 특정 시점의 순위를 기준으로 한 알리바바의 발표일 뿐이다. 하지만 Qwen에게는 심판이 전혀 없다는 주장은 더 이상 사실이 아니며, 이는 그 보드 위의 어떤 단일 숫자보다도 비교 양상을 크게 바꾼다.

가격 차이가 실제로 가져다주는 것
추상적인 배수 개념은 실제 예제보다 덜 유용하므로, 여기에 예제를 하나 제시한다. 호출당 150,000개의 토큰으로 구성된 저장소 컨텍스트를 보내고 6,000개의 토큰으로 구성된 리뷰를 생성하는 코드 리뷰 에이전트를 예로 들어 보자.
• Qwen3.8-Max: 0.15M × $2 = $0.30, 더하기 0.006M × $6 = $0.036. ≈ $0.34 호출당.
• Claude Fable 5: 0.15M × $10 = $1.50, 더하기 0.006M × $50 = $0.30. ≈ 호출당 $1.80.
• 하루 2,000콜 기준: Qwen ≈ $672/일; Fable ≈ $3,600/일. 한 달로 치면 대략 $20,000 대 $108,000입니다.
• 안정적인 repo 컨텍스트에서 프롬프트 캐싱을 적용하면, $0.25/1M의 Qwen 캐시 입력으로 입력 측 비용이 $0.30에서 $0.04 미만으로 낮아져, 호출 비용은 약 $0.08 — Fable보다 호출당 약 22배 저렴합니다.
그것은 사소한 절감이 아닙니다. 모든 풀 리퀘스트에 리뷰어를 돌리는 것과 위험한 것에만 돌리는 것의 차이입니다. 그리고 Qwen의 균일 요금 컨텍스트는 프롬프트가 커질수록 그 효과를 더 강하게 만듭니다. Alibaba는 긴 프롬프트 추가 요금을 부과하지 않기 때문에 900,000토큰 컨텍스트를 처리하는 비용은 5,000토큰 컨텍스트와 토큰당 동일합니다.
당 가격이 토큰당 가격과 같지 않다는 점이 정직한 균형추입니다해결된 작업. 만약 Fable 5가 더 저렴한 모델이 세 번의 시도와 사람의 교정이 필요한 문제를 한 번에 해결한다면, 그 저렴한 모델은 총체적으로 더 많은 비용이 들 수 있습니다. 그리고 가장 어려운 추론 작업에서 Fable의 검증된 1위 순위는 한 번에 더 많은 문제를 해결한다는 가장 확실한 증거입니다. Qwen의 비용 논거는 대량의 오류 허용 작업 부하에서 가장 강력하고, 소량의 고위험 작업에서는 가장 약합니다.
0902 명명: 성능은 도약했지만 버전 번호는 그렇지 않았다
9월 2일의 주목할 만한 점은 알리바바가 하지 않은 일, 즉 Qwen 3.9를 출시하지 않은 것이다. 개선 사항은 동일한 모델명에 날짜가 찍힌 체크포인트로 배포되었고 — Qwen3.8-Max-0902 — API도 동일한 이름과 동일한 가격으로 이를 서비스했다. 이것이 업계가 흘러가는 방향이다. 성능 도약이 더 이상 새 버전 번호를 보장하지 않게 되면, "어떤 모델을 써야 하나"라는 질문은 단순한 제품군 이름이 아닌 빌드와 날짜에 관한 문제가 된다.
또한 “Qwen3.8-Max”에 붙은 벤치마크 점수에는 유효기간이 있습니다. 7월 또는 8월 빌드를 기준으로 측정된 점수는 오늘 API가 반환하는 모델을 설명하지 못할 수도 있습니다. 실제로 호출하는 엔드포인트의 빌드 식별자를 확인하세요. 0902라는 숫자는 Code Arena: WebDev에서 Claude Fable 5에 뒤처졌던 모델과 앞서는 모델을 가르는 차이입니다.
증명, 그리고 왜 그것이 여전히 이 매치업을 결정하는지
Qwen3.8-Max에 대해 가장 많이 인용되는 실전 증거는 프리뷰 시절 리뷰(thomas-wiegold.com)에서 나왔으며, 이 리뷰는 모델을 네 가지 실제 빌드에 투입했습니다. 결과는 정말 인상적이었습니다. Qwen은 Go 포커 시뮬레이션을 단번에 해결했고 — 한 번의 패스로 해당 프롬프트를 통과한 세 번째 모델에 불과하며, Fable 5 및 Grok 4.5와 어깨를 나란히 했습니다 — 그리고 커피 로스터 웹사이트 프롬프트에서는 리뷰어가 그 테스트에서 본 것 중 최고의 출력을 만들어냈고, 철저함의 극치를 보여주며 요청하지 않은 쇼핑 카트, 도매 섹션, Instagram 통합까지 추가했습니다.
문제는 속도였습니다: 웹사이트에서는 30분 이상, 포커 시뮬레이션에서는 1시간 20분이 걸려, 그 리뷰어가 사용해 본 모델 중 가장 느린 모델이었습니다. 그 발견에는 7월에는 필요하지 않았던 주의 사항이 이제 필요합니다. 이는 프리뷰 인프라에서 한 명의 리뷰어가 비정상적으로 긴 에이전틱 실행에 대해 측정한 것입니다. GA 서빙은 다른 시스템입니다. 참고로 OrcaRouter 자체의 7일 텔레메트리는 현재 다음을 보여줍니다: p50 첫 토큰 도달 시간 1.64초 (Qwen3.8-Max 기준) — 자체 측정값이지만, TTFT와 1시간 길이 빌드에서의 종단 간 처리량은 서로 다른 수치입니다. 솔직히 말하면, 프리뷰 속도 저하 발견은 현재의 사실로 반복 인용되기보다 재테스트되어야 합니다.
0902 업데이트 이후에도 살아남는 것은, 양측의 가장 강력한 증거가 여전히 서로 다른 곳에서 나온다는 점입니다. Qwen3.8-Max-0902의 Code Arena: WebDev 1위는 독립적인 블라인드 투표 결과이지만, 단 하나의 보드만 측정하며, 알리바바 자체 벤치마크 표는 여전히 공급업체의 산출물입니다. 랩들은 어떤 벤치마크를 보고할지 선택하며, 알리바바가 보고한 가장 약한 수치(IFBench 82.8, 지시 수행)는 여전히 프리뷰에서 제기된 "모델이 과잉 응답하고 범위를 무시한다"는 불만과 일치합니다. Claude Fable 5의 증거는 더 광범위하고 대부분 제3자 출처입니다: AA Intelligence Index에서 62점, 일반 Arena 보드에서 1위, SWE-bench Verified 95.0% — 그리고 Anthropic 자체의 최신 Claude Fable 5.1은 9월 1일부터 AA 지수에서 66으로 선두를 유지하고 있습니다. "내가 잘못될 여유가 없는 작업을 처리할 모델"이라는 질문에 대한 일반적인 답변은 변하지 않았습니다. "10분의 1 가격으로 최고의 프런트엔드를 제공하는 모델"이라는 질문에 대한 답변은 9월 2일에 뒤집혔습니다.

개방성: Qwen이 이미 승리한 축
Fable 5는 결코 자체 호스팅이 가능하지 않을 것입니다. Qwen3.8-Max는 이미 가능합니다: 8월 12일에 Qwen3.8-2.4T-A95B의 가중치 — BF16 및 공식 FP8 변형 — 가 Hugging Face와 ModelScope에 공개되어, 누구나 다운로드할 수 있는 최초의 Max급 Qwen이 되었습니다. 두 가지 주의사항은 동등한 비중으로 다뤄야 합니다.
첫 번째는 법적 문제다. 이번 릴리스는 Apache 2.0이 아닌 맞춤형 “Qwen3.8-Max” 라이선스로 배포된다. 최근 매출 5천만 달러를 초과하는 모델 서비스(MaaS) 또는 AI 업무 보조 사업을 운영하는 제공업체는 Qwen과 별도의 라이선스를 협상해야 하며, 월간 활성 사용자 1억 명 또는 월 매출 2천만 달러를 넘는 상용 제품은 모델 이름을 표시해야 한다. 내부용이거나 스타트업이라면 이 기준이 적용될 일은 거의 없다. 그러나 이것이 완전한 자유 이용을 뜻하지는 않는다.
두 번째는 물리적인 측면이다. 총 2.4T 규모의 MoE는 BF16 기준 약 4.9TB(공식 FP8 체크포인트에서는 약 절반)이며, H200당 약 141GB 메모리와 비교된다. 즉 플래그십을 자체 호스팅하려면 토큰 하나를 서빙하기도 전에 가속기 랙이 필요하다는 뜻이다. 공개된 약 95B 활성 매개변수는 그 랙이 어떤 성능을 제공할지 적어도 가늠하게 해준다. 거의 모든 팀에게는 $2/$6의 호스팅 API가 현실적인 경로다.
그래서 8월 14일에 Apache-2.0 가중치가 공개되었고 약 17GB의 VRAM에서 구동되는 것으로 알려진 Qwen3.8-27B가 실질적으로 중요한 자체 호스팅 릴리스로 남는다. Qwen을 Fable 5보다 선호하는 이유가 순수한 성능이 아니라 데이터 상주성이나 온프레미스 통제 때문이라면, 그 요구를 실제로 충족하는 모델은 27B다. 그리고 양쪽 모두에서 개방성 비교는 더 이상 이론적이지 않다.
자주 묻는 질문
죄송합니다. 아직 "Qwen 3.8" 또는 "Claude Fable 5"라는 모델에 대한 비교 정보를 가지고 있지 않습니다. 일반적으로 AI 모델을 비교할 때는 다음 요소를 고려합니다: - **벤치마크 점수** (언어 이해, 추론, 코딩 등) - **컨텍스트 길이** (한 번에 처리 가능한 텍스트 양) - **비용 및 속도** - **특화 분야** (코딩, 창작, 다국어 등) 구체적인 비교가 필요하시다면, 각 모델의 공식 문서나 최신 리뷰를 확인하시거나 사용하려는 구체적인 작업(예: 문장 번역, 코드 작성, 창작 글쓰기)을 알려주시면 더 도움이 될 수 있습니다.
이제는 평가 축(axis)에 따라 결과가 달라집니다. 이는 8월과 비교할 때 분명한 변화입니다. 코딩 부문에서는 Qwen3.8-Max-0902가 앞섭니다. Code Arena의 WebDev에서 Elo 1,691로 1위를 기록해 Claude Fable 5의 1,628을 제쳤고, 가격도 $2/$6로 Fable 5의 $10/$50보다 저렴합니다. 광범위하고 외부 감사를 거친 품질 부문에서는 Fable 5가 여전히 선두입니다. AA Intelligence Index에서 Qwen의 56 대비 62를 기록했고, SWE-bench Verified 95.0%, 종합 Arena 리더보드에서 1위를 차지했습니다. 오답의 비용이 큰 작업에는 Fable 5가 문서화가 더 충실한 선택지입니다. 반면 대량 코딩과 에이전트형 웹 작업에서는 최신 Qwen이 더 저렴하면서도 아레나 순위에서도 앞섭니다.
"'오직 Fable 5만 뒤에 있다'는 주장이 사실인가요?"
알리바바의 포지셔닝은 독립적인 수치 없이 이루어졌으며, 이후 0902 빌드가 그 형태를 바꾸었다. Qwen3.8-Max-0902는 Code Arena: WebDev에서 Claude Fable 5보다 앞서지만(1,691 대 1,628), AA Intelligence Index(56 대 62)와 일반 Arena 보드(Qwen #20, Elo 1,479; Fable 5 #1, 1,508)에서는 그 뒤에 있다. 그래서 “Fable 5에 이어 2위”라는 말은 “이번 리프레시가 목표로 한 코딩 보드에서는 Fable 5보다 앞서지만, 광범위한 범용 보드에서는 그 뒤에 있다”는 말로 바뀌었다.
Qwen 3.8이 Fable 5보다 얼마나 더 저렴한가요?
상당히 그렇습니다. 그리고 이제는 할인이 아니라 실제 요금입니다. Qwen3.8-Max는 100만 토큰당 $2/$6인 반면, Fable 5는 $10/$50입니다. 입력 기준 약 5배, 출력 기준 8배 더 저렴합니다. Qwen의 요금은 전체 100만 컨텍스트에 걸쳐 동일하며, 캐시된 입력이 $0.25/100만이므로 반복 컨텍스트 워크로드는 더욱 저렴해집니다.
Qwen 3.8 Max가 프리뷰를 벗어났나요?
네. 2026년 8월 3일에 공개된 요금표와 OpenAI 및 DashScope 호환 엔드포인트를 갖춘 정식 출시(GA)에 도달했습니다. 7월에 유포된 Qoder 크레딧 캠페인과 90% 할인 미리보기 프레임은 더 이상 이 모델의 판매 방식을 설명하지 않습니다.
초기 리뷰에서 말했듯이, Qwen 3.8은 여전히 가장 느린 모델인가요?
해당 결과는 {{1}}프리뷰 인프라에서 한 시간짜리 에이전틱 빌드를 실행한 리뷰어 한 명에게서 나온 것이며, 현재의 사실로 취급하기보다 GA 서빙을 대상으로 다시 테스트해야 합니다{{/1}}. OrcaRouter의 7일 텔레메트리에 따르면 {{2}}p50 첫 토큰까지의 시간은 1.64초로 나타나지만, 이는 매우 긴 빌드의 처리량이 아닌 첫 토큰 지연 시간을 측정한 것입니다{{/2}}.
Fable 5에 비용을 지불하는 대신 Qwen 3.8을 자체 호스팅할 수 있나요?
예, Qwen에 대해서는 조건이 따릅니다. Qwen3.8-2.4T-A95B는 8월 12일부터 맞춤 라이선스(Apache 2.0 아님)로 다운로드할 수 있으며, Qwen3.8-27B는 8월 14일부터 Apache 2.0으로 제공됩니다. 실질적인 장벽은 하드웨어입니다. 총 2.4T의 MoE는 BF16 기준 약 4.9TB가 필요합니다 — 가속기 랙 한 대 분량이죠. 따라서 대부분의 팀은 플래그십 모델을 직접 서빙하기보다 $2/$6 호스팅 API를 호출할 것입니다. Fable 5는 영구적으로 공개가 중단되었습니다.
오늘은 어떤 걸 사용해야 할까요?
잘못된 답의 비용이 큰 일반 작업(어려운 추론, 고위험 프로덕션 경로)에서는 Claude Fable 5가 여전히 더 잘 문서화된 선택지이며, Anthropic의 Claude Fable 5.1이 그 우위를 더욱 확장합니다. 대량 코딩과 에이전트 기반 웹 개발에서는 Qwen3.8-Max-0902가 이제 독립 아레나에서 우위를 점하고, 출력 가격도 약 8분의 1 수준으로 낮습니다. 즉, 대량 코드 리뷰, 프런트엔드 생성, 장문 문서 분석에 적합합니다. 많은 팀이 두 모델을 모두 운영하고 작업(task)별로 라우팅해야 합니다.
결론
Qwen 3.8과 Claude Fable 5의 비교는 한 달 전과는 다른 양상이고, 일주일 전과도 또 다릅니다. Qwen3.8-Max는 일반 공개된 모델로, Fable 5보다 입력은 5배, 출력은 8배 저렴한 요금표를 갖추고 있으며 백만 토큰 기준으로 동일한 요율이 적용됩니다. 또한 9월 2일부터는 동일한 이름으로 0902 빌드를 서비스하며, 이 빌드는 독립 아레나에서 에이전트형 웹 개발 부문 1위로 평가받아 해당 순위표에서 Fable 5를 앞섰습니다.
이제 어느 모델도 전체 비교를 장악하지 못한다. Claude Fable 5와, AA Intelligence Index에서 9월 1일부터 66점으로 1위를 지키고 있는 Anthropic의 Claude Fable 5.1은 광범위하고 외부 검증을 거친 범용 영역을 차지하며, Alibaba 자체의 벤치마크 표는 여전히 공급업체가 만든 산출물에 불과하다. 하지만 7월에 이 맞대결이 한쪽으로 기울었던 이유, 즉 Qwen에게는 독립적인 검증자가 전혀 없었다는 점은 9월 2일자로 유효하지 않게 되었다. Qwen3.8-Max-0902는 Code Arena: WebDev에서 1위 모델이다. 현명한 해결책은 여전히 중요도와 작업 유형에 따라 나누는 것이다. 즉, 오답의 대가가 큰 일반 추론에는 Fable 5를, 가격 격차와 아레나에서의 우위가 모두 유리하게 작용하는 대량 코딩에는 Qwen3.8-Max를 쓰고, 두 모델 모두 자신의 프롬프트로 직접 테스트하는 것이다.

이 글에서 비교한 모델3
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
