
免費 Qwen 3.8 27B API:尚未推出——該改跑什麼
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
不——截至2026年8月12日,沒有免費的Qwen3.8-27B API,付費的也沒有。該模型於8月3日發布,承諾「8月10日當週」在Hugging Face和ModelScope開放權重,但官方Qwen組織至今仍無Qwen3.8儲存庫。在權重釋出之前,沒人能託管Qwen3.8-27B,因此「免費」根本無從談起。以下是權重落地後取得免費權限的三條途徑(以及每條途徑的真正成本),外加你目前即可在本地免費執行的模型。
目前還沒有免費的 API — 權重就是入口。
阿里巴巴於2026年8月3日發布了Qwen3.8系列:2.4兆參數的Qwen3.8-Max(約950億活躍參數,1M token上下文,在阿里雲Model Studio上定價為每百萬輸入token 2美元、每百萬輸出token 6美元)以及稠密、單機的Qwen3.8-27B。兩者均承諾於同一週在Hugging Face和ModelScope上以開放權重發布。
這個承諾現在已經逾期兩天。我在8月12日直接查看Hugging Face:官方的Qwen組織沒有任何形式的Qwen3.8倉庫。模型搜尋中出現的Qwen3.8-27B-GGUF、-FP8、-NVFP4A16和-NInfer儲存庫都是佔位卡片——零權重檔案、個位數下載次數、模型卡片上直接寫著「保留以待Qwen/Qwen3.8-27B發布」。不要把那些當作模型存在的證據;把它們當作人們在預留停車位。
有兩件事你不能預設。{{1}}第一,授權:Qwen3.8-27B 尚未公布採用何種授權。{{2}}近期 Qwen 開源權重皆以 Tongyi Qianwen 授權發布,其「一億月活躍用戶」條款會在規模化使用時觸發商業授權討論——Apache 2.0 並非安全的預設。{{/2}} {{3}}第二,規格:阿里巴巴尚未公布 27B 的評測基準表、上下文窗口或確認的硬體需求。目前關於它的所有說法都只是推測。{{/3}}{{/1}}
我們在《Qwen3.8-27B Open Weights: What We Know Before the Drop》中已涵蓋了發布前的檢查清單——哪些已確認、哪些是傳聞、下載前該檢查什麼。本文要探討的是那篇文章未涵蓋的部分:一旦模型正式發布,「免費」實際上會如何運作。
在體重下降之後:通往自由的三條路徑,以及每一條的真正代價
「免費」從來就不是免費的。通往免費 Qwen3.8-27B 的三條途徑,都會把成本轉移到某處;差別在於落在哪裡。27B 是密集模型——其約 270 億個參數,每一個在每個 token 上都是活躍的——因此上述成本關乎真實硬體,而非行銷話術。

路線1:自行運行——現金免費,硬體計價
這是唯一一條在硬體購入後,{{KEEP}}free{{/KEEP}} 才真正名副其實的路線。{{1}}Unsloth 共同創辦人 Daniel Han 預期 27B 在發佈時約需 17GB VRAM 即可運行——這是目標,而非出貨規格。{{/1}}{{2}}以 Qwen3.6-27B 的實測量化階梯作為參考:Q4_K_M 約落在 16GB,Q6_K 約 21GB,FP8 約 27GB,而完整 BF16 約 54–56GB。{{/2}}{{3}}現階段實際可行的最低門檻是 24GB 顯示卡——RTX 3090、RTX 4090 或 A6000 等級——搭配 Q4。{{/3}}
時機很重要:使用vLLM或SGLang的官方權重通常會在發布後幾天內即可運作,但社群的GGUF和AWQ量化則會落後一到兩週,因此在發布當天不會有Ollama風格的「拉取即用」體驗。隱藏成本包括電力、一台安靜的機器,以及你的時間。好處是隱私——沒有任何事情會離開你的設備——以及零邊際成本,如果你也用GPU跑其他模型,這些效益還會持續累積。
路線2:代管免費方案——現金免費,以限制計價
一旦權重發布,預計 Alibaba Cloud 會提供評測配額,而常見的無伺服器主機也會有免費方案。預期會出現的模式,正是 Alibaba 已對 Qwen3.8-Max 實施的那套:100 萬 token 的新用戶配額,僅限新加坡區域,有效 90 天,不可累積——而且推理 token 以輸出計費,因此一個預設會推理的模型,可能一個週末的原型開發就把整個額度燒光。你實際上付出的是速率限制、區域鎖定、有效期限,以及你的提示詞會送往第三方。免費方案是評測模型的入門通道,不是部署模型的地方。
路線 3:OrcaRouter 的免費方案 — 規劃中,尚未上線
因為搜尋查詢字面上就是「免費」,我們要說清楚:OrcaRouter 計畫在 Qwen3.8-27B 的權重釋出後提供免費方案。它尚未上線。目前沒有可呼叫的端點,我也不會貼佔位範例。等到有消息可以宣布時,我們會宣布。我們今天實際託管的是 Qwen3.8-Max,每 1M tokens 收費 $2/$6,無任何加價——而 27B 並不在平台上,因為目前還沒有人能提供這項服務。
你現在可以免費使用的功能
如果你需要的是「一個我能免費運行的27B級開源模型」,你不必等待。誠實而言,同級別的答案就是 Qwen3.6-27B,也就是你正在等待的那個模型的直接前身。

Qwen3.6-27B採用 Apache 2.0 授權,是一款 278 億參數的密集(dense)架構模型,支援 262K 上下文長度,並原生支援文字、圖片與影片輸入。Q4_K_M GGUF 格式約 16.5GB,在 24GB 消費級 GPU 上約可達每秒 25 個 token(在 M4 Max 上為每秒 16–18 個 token)。廠商在模型卡上公佈的數據:SWE-Bench Verified 77.2、MMLU-Pro 86.2、AIME 2026 94.1、GPQA Diamond 87.8、MMMU 82.9。如果 Qwen3.8-27B 是「一款 27B」,那這個就是你今天真正能實際使用的 27B——同系列、相同密集架構,而且已經開源。
Nemotron 3.5 Lightning 30B A3B是另一種形態,同樣免費:於 2026 年 8 月 11 日以 NVIDIA 的 OpenMDW 1.1 授權發布。它是一個總參數 30B、啟動約 3B 的混合專家(Mixture-of-Experts)模型,採用混合 Mamba-2 架構,支援最高 1M 的上下文——NVFP4 檢查點約 21.6GB,Q4 GGUF 約 25GB。它需要 24GB 以上的顯示卡,因為即使每個 token 只啟動約 30 億個參數,全部 300 億個參數仍會佔據記憶體。初步報告顯示它在單一 GPU 上可達到每秒約 45 個 token。它是為代理執行層設計的——工具呼叫、驗證、格式化——而非前沿推理。如果你的負載是高流量的代理庶務工作,它在你的實際任務上可以勝過密集的 27B 模型。
如果你今天想要的具體是一個免費的託管 API,而不是本地安裝,那麼唯一名副其實的「免費」是阿里巴巴的 Qwen3.8-Max 配額:100 萬個 token、新加坡地區、90 天。它不是 27B 版本,而且這是評估用額度,不是正式服務——用它來現在試試 Qwen3.8 的行為,然後再轉移。
當此建議有誤時
如果你已經擁有一張24GB以上的GPU,那麼「等待免費方案」的心態對你來說是錯的。權重發布的那天,官方權重搭配vLLM就是你的免費方案;你只是在等待一個你根本不需要的便利。只有當你特別想要那套精緻的GGUF量化階梯時,才需要再等大約兩週。
如果你正在針對 API 契約進行原型開發,託管的免費配額(一旦 27B 提供這些配額)可能比你的時間成本更低——即使有 90 天到期期限和地區限制,租用 GPU 機器進行一週的原型開發通常反而是更昂貴的途徑。
若最終的許可證是通義千問(Tongyi Qianwen)而非 Apache,「免費權重」並不代表在 1 億 MAU 門檻以上便可以免費商用。在基於它建構任何東西之前,請先閱讀實際儲存庫中的 LICENSE 檔案——這正是「免費開放權重」變成帳單最常見的原因。
而且如果 Alibaba 再次推遲日期——已經超過承諾的窗口兩天了——每過一週,Qwen3.6-27B 就會成為正確的選擇,而不是權宜之計。

底線
沒有免費的 Qwen3.8-27B API,因為目前根本不存在 Qwen3.8-27B 這個模型。當權重發布時,三條免費途徑分別是:自行託管(以硬體為代價)、託管免費方案(以限制為代價),以及 OrcaRouter 計畫中的免費方案——該方案尚未上線,一旦上線我們會對外公布。目前最接近免費的選擇,是在你自己的硬體上運行 Qwen3.6-27B。等待的代價只是沒有 27B 可用;運行前一版本的代價,也只不過是一張 GPU,而這段期間你還能用這張 GPU 處理其他所有工作。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
