
무료 Qwen 3.8 27B API: 아직 없음 — 대신 실행할 것
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
아니요 — 2026년 8월 12일 기준으로 무료 Qwen3.8-27B API는 없고, 유료 API도 없습니다. 이 모델은 8월 3일에 발표되었으며, 8월 10일 주에 Hugging Face와 ModelScope에 오픈 가중치를 공개하겠다고 약속했지만, 공식 Qwen 조직에는 아직 Qwen3.8 저장소가 없습니다. 가중치가 공개될 때까지 아무도 Qwen3.8-27B를 호스팅할 수 없으므로 '무료'라는 말은 무의미합니다. 가중치가 공개되면 무료로 가는 세 가지 경로(그리고 각각의 실제 비용)와 오늘 로컬에서 무료로 실행할 수 있는 모델들을 소개합니다.
아직 무료 API는 없다 — 가중치가 관문이다
알리바바는 2026년 8월 3일에 Qwen3.8 제품군을 발표했습니다: 2.4조 개의 파라미터를 가진 Qwen3.8-Max(약 950억 개의 활성 파라미터, 100만 토큰 컨텍스트, 알리바바 클라우드 모델 스튜디오에서 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러에 책정)와 밀집형 단일 머신 Qwen3.8-27B입니다. 두 모델 모두 같은 주에 Hugging Face와 ModelScope에 오픈 가중치로 공개될 예정이라고 약속되었습니다.
그 약속은 이제 이틀째 기한이 지났습니다. 저는 8월 12일에 Hugging Face를 직접 확인했습니다: 공식 Qwen 조직에는 어떤 종류의 Qwen3.8 저장소도 없습니다. 모델 검색에 나타나는 Qwen3.8-27B-GGUF, -FP8, -NVFP4A16 및 -NInfer 저장소는 자리 표시자 카드입니다 — 가중치 파일이 전혀 없고, 다운로드 수가 한 자릿수이며, 모델 카드에는 말 그대로 "Qwen/Qwen3.8-27B 출시에 앞서 예약됨"이라고 적혀 있습니다. 그것들을 모델이 존재한다는 증거로 취급하지 마세요. 그것들은 주차 자리를 예약하는 사람들로 취급하세요.
당신이 가정할 수 없는 두 가지가 있다. 첫째, 라이선스: Qwen3.8-27B에 대해 명시된 라이선스가 없다. 최근 Qwen 오픈 가중치는 Tongyi Qianwen 라이선스로 배포되었는데, 이 라이선스의 월간 활성 사용자 1억 명 조항은 대규모 사용 시 상업용 라이선스 협의를 촉발한다 — Apache 2.0은 안전한 기본값이 아니다. 둘째, 사양: Alibaba는 27B에 대한 벤치마크 표, 컨텍스트 창, 또는 확인된 하드웨어 요구 사항을 발표하지 않았다. 오늘 그것에 대해 반복되고 있는 모든 것은 추측에 불과하다.
Pre-drop 체크리스트(확정된 사항, 루머, 다운로드 전 확인할 것)는 Qwen3.8-27B Open Weights: What We Know Before the Drop에서 다뤘습니다. 이 글은 그 글에서 다루지 않은 부분, 즉 모델이 출시된 후 "무료"가 실제로 어떻게 작동하는지에 대한 것입니다.
무게가 떨어진 후: 자유로 가는 세 가지 길과 각각의 실질적인 비용
"무료"는 결코 무료가 아니다. 무료 Qwen3.8-27B에 이르는 세 가지 경로 모두 비용을 어딘가로 옮길 뿐이며, 차이는 그 비용이 어디에 부과되느냐입니다. 27B는 덴스(dense) 모델입니다. 즉, 약 270억 개의 파라미터 각각이 모든 토큰에 대해 활성화됩니다. 따라서 아래의 비용은 마케팅이 아닌 실제 하드웨어에 관한 것입니다.

경로 1: 직접 실행 — 현금은 무료, 하드웨어가 비용이다
하드웨어를 구매한 후에야 "무료"가 문자 그대로 성립하는 유일한 경로. Unsloth 공동 창업자 Daniel Han은 27B가 출시 시 약 17GB의 VRAM에서 실행될 것으로 예상한다 — 목표치일 뿐, 출시 사양은 아니다. 측정된 Qwen3.6-27B의 양자화 단계를 대리 지표로 사용하면: Q4_K_M은 약 16GB, Q6_K는 약 21GB, FP8은 약 27GB, 풀 BF16은 약 54–56GB. 현실적인 최소 사양은 Q4 기준 24GB 카드 — RTX 3090, RTX 4090 또는 A6000급 —이다.
시점이 중요합니다: vLLM 또는 SGLang을 사용한 공식 가중치는 출시 후 며칠 내에 작동하는 경우가 많지만, 커뮤니티의 GGUF 및 AWQ 양자화는 1~2주가량 뒤처지므로, Ollama 스타일의 "pull and run"은 출시 당일에는 존재하지 않을 것입니다. 숨은 비용은 전력, 조용한 머신, 그리고 당신의 시간입니다. 얻는 것은 프라이버시입니다 — 아무것도 당신의 컴퓨터 밖으로 나가지 않는다는 것 — 그리고 다른 모델에도 GPU를 사용한다면 복리 효과를 내는 한계 비용 제로입니다.
방법 2: 호스팅 무료 티어 — 현금은 무료, 제한이 대가
모델 가중치가 공개되면 Alibaba Cloud에서 평가 할당량을, 그리고 흔한 서버리스 호스트들에서는 무료 티어를 기대할 수 있습니다. 기대할 패턴은 Alibaba가 이미 Qwen3.8-Max에 적용하고 있는 방식입니다: 신규 사용자 1M 토큰 할당량, 싱가포르 리전 전용, 90일 유효, 이월 없음 — 그리고 추론 토큰은 출력으로 청구되므로, 기본적으로 추론하는 모델은 프로토타이핑 주말 하나 만에 전체 허용량을 소진할 수 있습니다. 실제로 지불하는 것은 속도 제한, 지역 잠금, 만료일, 그리고 프롬프트가 제3자에게 전달된다는 점입니다. 무료 티어는 모델을 평가하기 위한 진입점이지, 배포할 장소가 아닙니다.
경로 3: OrcaRouter 무료 티어 — 계획 중, 아직 미출시
검색 쿼리가 말 그대로 "무료"이기 때문에, 우리는 명확히 말하겠습니다: OrcaRouter는 가중치가 공개되는 대로 Qwen3.8-27B용 무료 티어를 계획하고 있습니다. 아직 라이브 상태가 아닙니다. 호출할 엔드포인트도 없고, 제가 예시용 플레이스홀더를 붙여 넣지도 않겠습니다. 발표할 것이 생기면 그때 알려드리겠습니다. 현재 저희가 호스팅하는 것은 Qwen3.8-Max로, 1M 토큰당 $2/$6에 마크업이 없습니다. 그리고 27B는 아직 아무도 서빙할 수 없기 때문에 플랫폼에 올라와 있지 않습니다.
지금 무료로 사용할 수 있는 것
"돈을 내지 않고 실행할 수 있는 27B급 오픈 모델"이 필요하다면, 기다릴 필요가 없습니다. 정직하게 같은 수준의 답은 여러분이 기다리는 모델의 직계 전작인 Qwen3.6-27B입니다.

Qwen3.6-27B는 Apache 2.0 라이선스이며, 262K 컨텍스트와 텍스트·이미지·비디오 입력을 기본 지원하는 27.8B 규모의 dense 모델입니다. Q4_K_M GGUF는 약 16.5GB이며, 24GB 소비자용 GPU에서 초당 약 25토큰(M4 Max에서는 초당 16~18토큰)으로 실행됩니다. 모델 카드에 공개된 공급업체 보고 수치는 SWE-Bench Verified 77.2, MMLU-Pro 86.2, AIME 2026 94.1, GPQA Diamond 87.8, MMMU 82.9입니다. Qwen3.8-27B가 "27B"라면, 이 모델이 오늘 실제로 사용할 수 있는 27B입니다. 같은 계열, 같은 dense 설계, 그리고 이미 오픈되어 있습니다.
Nemotron 3.5 Lightning 30B A3B는 다른 형태로, 역시 무료입니다: 2026년 8월 11일에 NVIDIA의 OpenMDW 1.1 라이선스로 출시되었습니다. 총 30B 파라미터 중 약 3B만 활성화되는 Mixture-of-Experts 모델로, 하이브리드 Mamba-2 아키텍처와 최대 1M 컨텍스트를 갖추고 있습니다. NVFP4 체크포인트는 약 21.6GB, Q4 GGUF는 약 25GB입니다. 토큰당 약 3B만 활성화되지만 30B의 모든 파라미터가 메모리에 상주해야 하므로 24GB 이상의 그래픽 카드가 필요합니다. 첫 보고에 따르면 단일 GPU에서 초당 약 45토큰을 처리합니다. 이 모델은 에이전트 실행 계층(도구 호출, 검증, 형식화)을 위해 만들어졌으며, 최첨단 추론용이 아닙니다. 대규모 에이전트의 단순 반복 작업을 처리해야 한다면 실제 작업에서 밀집형 27B 모델을 능가할 수 있습니다.
그리고 지금 당장 로컬 설치 대신 무료 호스팅 API를 원한다면, 솔직히 '무료'라고 할 수 있는 것은 Alibaba의 Qwen3.8-Max 할당량뿐입니다: 1M 토큰, 싱가포르 리전, 90일. 이것은 27B 모델이 아니며, 서비스가 아닌 평가용 허용량입니다 — 지금 Qwen3.8의 동작을 시험해 보는 데 사용한 다음, 이전하세요.
이 조언이 틀릴 때
이미 24GB+ GPU를 보유하고 있다면, '무료 티어를 기다리라'는 프레이밍은 당신에게 맞지 않습니다. 가중치가 공개되는 날, 공식 가중치에 vLLM을 돌리는 것이 바로 당신의 무료 티어입니다. 당신은 필요하지도 않은 편의를 기다리고 있는 셈입니다. 정교한 GGUF 양자화 사다리를 특별히 원하는 경우에만 약 2주간 기다리세요.
API 계약을 대상으로 프로토타입을 만드는 중이라면, 호스팅된 무료 할당량(27B에 해당 기능이 생기면)은 시간 비용보다 더 저렴할 수 있습니다. 90일 만료와 지역 제한이 있더라도, 일주일간 프로토타입을 위해 GPU 박스를 대여하는 것이 보통 더 비싼 방법입니다.
라이선스가 Apache가 아니라 Tongyi Qianwen인 것으로 밝혀지면,"무료 가중치"는 1억 MAU 임계값을 초과하는 상업화가 자유롭다는 의미가 아닙니다. 그것을 기반으로 무엇이든 구축하기 전에 실제 저장소의 LICENSE 파일을 읽으세요 — 그것이 "무료 공개 가중치"가 청구서가 되는 가장 흔한 경로입니다.
그리고 알리바바가 날짜를 또 미루면 — 이미 약속된 기간을 이틀이나 넘겼고 — 한 주가 지날 때마다 Qwen3.6-27B가 임시방편이 아닌 올바른 선택이 된다.

결론
무료 Qwen3.8-27B API는 없습니다. 어디에도 Qwen3.8-27B가 존재하지 않기 때문입니다. 가중치가 공개되면, 세 가지 무료 경로는 자체 호스팅(하드웨어 비용), 호스팅 무료 티어(제한 비용), 그리고 OrcaRouter의 예정된 무료 티어입니다 — 아직 운영 중이 아니며, 운영을 시작하면 저희가 알려드리겠습니다. 현재 가장 가까운 무료 옵션은 자체 하드웨어에서 실행하는 Qwen3.6-27B입니다. 기다리는 데 드는 비용은 27B뿐입니다. 이전 버전을 실행하는 데 드는 비용은 그동안 다른 모든 작업에 활용할 수 있는 GPU뿐입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
