
Qwen3.8-27B 評測:開源權重 27B,人稱「居家 Opus」——實測對決 hype
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 144 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Qwen3.8 27B是現今最適合自行架設的開放權重 27B 模型,而且差距相當明顯。權重已於 2026 年 8 月 14 日以 Apache 2.0 授權釋出:一個密集 27B(含視覺編碼器為 28B)的模型,具備 262K 原生上下文、原生影像與視訊輸入,以及供應商宣稱達到或超越 Claude Opus 4.6 Max 的代理式編碼評測成績——SWE-bench Pro 61.7、DeepSWE 1.1 42.2、LiveCodeBench v6 90.3。最亮眼的價格是零:下載 55.6 GB 就能執行。但需要注意的地方也確實存在——獨立測試發現它比前代慢了約三倍,且更耗 token;規格卡上的每一項基準仍是 Alibaba 單方面宣稱的數據;1M 上下文僅限託管版使用。結論:如果你有 24 GB 以上的 GPU,想要接近前沿的效能,又不想收到按用量計費的帳單,那就自行架設吧——但請先確切了解哪些數字是虛的。
先說結論:你應該使用 Qwen3.8 27B 嗎?
簡短回答 — 對於本地和私人工作負載,是的;在做出採購決定前,請等待第三方數據。 Qwen3.8 27B是罕見的模型,其開放權重就是產品本身,而 API 只是便利性。由於採用 Apache 2.0 授權,一旦你擁有硬體,每個 token 的價格就永久為零,而且你在其上建構的任何東西都不能被重新授權或事後追收費用。你所放棄的是速度、驗證和便利性。
如果您已經在運行 Qwen3.6-27B 並且對它感到滿意,那麼升級確實是真的,但以實際時間而言並非免費。如果您是從 Qwen3.8-Max 發布活動來到這裡的,那麼這是同一世代的較小、可自行託管的成員——一種用於不同工作的不同工具。
重點摘要,2026年8月15日核實
• 發布權重於2026年8月14日上線,位於Qwen/Qwen3.8-27B的 Hugging Face 上,並在 ModelScope 同步;因時區差異,部分報導另提及8月13日,且此次發布約在 Qwen3.8 系列公布後一週。
• 授權 — Apache 2.0:可下載、修改、重新發布、商業使用,並附有明確的專利授權。永久有效。
• 參數 — 27B 密集(含視覺編碼器為 28B),64 層,隱藏維度 5,120,詞彙量 248,320。
• 架構 — 混合注意力:48 個 Gated DeltaNet 線性注意力層對比 16 個完整 Gated Attention 層(比例為 3:1)。這就是為什麼一個 27B 密集模型能承載 262K tokens 的原生上下文。
• 上下文 — 原生支援 262,144 個 token;可透過託管版本的 YaRN 擴展至 1,000,000。
• 輸入 — 原生影像與影片及文字輸入;回傳文字。參數數量之所以是 28B,是因為視覺編碼器。
• 思考 — 推理模式預設開啟,可依需求停用; reasoning_effort(低/中/高)與 preserve_thinking 用於長時間的 agent 執行。
• 權重 — 55.6 GB 的 BF16 safetensors,分為 18 個分片;FP8 與社群 GGUFs 也一同提供。
上述規格來自 Hugging Face 模型卡和配置,適用於 Qwen3.8 27B,今日讀取。基準測試的宣稱是由 Alibaba 自行報告的;截至目前,尚無獨立實驗室重現這些結果。
Qwen3.8 27B 真正擅長什麼
最有力的案例是代理式軟體工程。阿里巴巴在 DeepSWE 1.1 上相較於先前的 27B 提升了 3 倍(42.2 對 13.3),並在 SWE-bench Pro 上取得高於 Claude Opus 4.6 Max 的分數(61.7 對 53.4)。正是這些數字為它贏得了「Opus at home」的綽號——一個稠密的 27B 模型,能在一般人實際能擁有的硬體上執行接近前沿的程式設計工作。

除了原始數據之外,還有三件事讓它成為一個站得住腳的買入標的:
• 原生多模態。 圖片和影片輸入、文字輸出——帶有圖表的文件或影片導覽,並非另一種獨立模型。視覺推理分數(啟用鏈式思考功能時為85.6,視覺數學為94.6,兩者皆為廠商宣稱)正是視覺編碼器展現其價值之處。
• 262K 原生上下文。長時程代理任務、大型程式碼庫,以及長達數小時的轉錄稿都能容納在單一視窗中。混合線性注意力設計讓該上下文的 KV 成本低於同規模的純全注意力模型。
• 免費、永久的權重。這正是這類別的重點:封閉式 API 模型是租用的;Qwen3.8 27B是擁有的。以 4-bit 執行時,可在 24 GB 顯示卡(RTX 3090/4090 等級)上運行;AMD 提供 Day-0 支援(根據 AMD 自家部落格,Ryzen AI Max+ 395 上可達 24.5 tokens/s,Radeon AI PRO R9700 上可達 51.8 tokens/s)。
評測的棘手之處:速度、令牌與驗證
到目前為止的獨立測試只是一名測試者的測試工具,而非實驗室——但這是我們擁有的最佳訊號。將Qwen3.8 27B與Qwen3.6-27B在十項實際任務上進行比較(由GPT-5.5透過llmcompare框架評判),3.8贏得十項中的九項,平均得分為8.838對6.862——測試者稱這是「他所見過最令人印象深刻的情報提升之一」。它還使用了幾乎三倍的token數量,且速度明顯較慢;其中一項任務的耗時約增加了600%。因此,品質的提升是真實的,而牆鐘時間的代價同樣真實。
還有四件事可以用來反對它:
• 尚無第三方基準測試。 本文中的每項主要數據均為 Alibaba 截至8月15日所報告的。廠商資料卡很詳細,但尚未由獨立實驗室複現結果。如果你的決定取決於經過驗證的數字,請等待它們——權重仍會在那裡。
• VRAM 下限是真實存在的。BF16 需要 80 GB 等級的 GPU。要在 24 GB 的顯示卡上運行,就必須使用 4-bit 量化;而社群回報(dev.to 留言串,發布後數日)指出量化版本「在長上下文後會失去焦點」。有足夠 VRAM 就用官方權重;沒有的話就用量化版本。
• 1M 上下文僅限託管。開放權重上限為 262K。可擴展至 1M 的數字是 Qwen Cloud 的託管功能,並非本地副本開箱即用。
• 「Beats Opus」需要附加條件。Agentic 基準測試會獎勵特定於測試框架的行為,而 dev.to 發布貼文上的熱門評論說得很直白:「在實際使用中,它們並沒有擊敗 Opus。」請把這份排行榜視為狀況良好時的上限,而非承諾。
它在 Qwen 3.8 系列中的定位
• vs Qwen3.6-27B — 相同的硬體等級與 262K 上下文規模,但在速度與 token 效率上付出代價,換來能力的大幅躍升。如果你已經在跑 3.6 且受吞吐量所限,繼續沿用是合理的選擇。
• 對比 Qwen3-Coder-30B-A3B——Coder 是一個 MoE,擁有約 33 億個活躍參數,運行速度快得多(約 90–110 tokens/s)。稠密型 27B 每個 token 的處理速度較慢,但繼承了這世代的 agentic 增益;如果 27B 的軟體工程評分在獨立測試中依然成立,那麼 Coder-30B 的角色就會縮小。
• 對比 Qwen3.8-Max — 2.4T MoE 旗艦是資料中心模型(僅提供 API,公開報導中約每百萬 tokens 收費 $2/$6),支援 1M 上下文和影片。27B 是可部署的那個。它們回答的是不同的問題。
成本:本地與API之爭,塵埃落定
對於閉源模型,你會比較每個 token 的價格。對於Qwen3.8 27B,在自己硬體上,邊際 token 的成本為零——真正的價格是前期 GPU 的投入和你的時間。在 4-bit 量化下,需要一張 24 GB 的顯示卡;在 BF16 下,則需要 80 GB 等級的機器。如果你只需要評估模型,或缺乏硬體,還有託管方案:OrcaRouter 現在列出了Qwen3.8 27B,提供一個免費但有限速的層級,收費 $0,超過上限時回傳 HTTP 429;另有付費層級,每百萬輸入 token 收費 $0.33,每百萬輸出 token 收費 $2.40(8 月 15 日查詢)。Qwen Cloud 的託管版本,具備 1M context,標示為「即將推出」。

坦白的說法:對於開放權重模型而言,提供者是一種便利,而不是一種依賴。免費方案是判斷 55.6 GB 下載是否值得的最便宜方式。但一旦你下定決心,權重才是重點——而且它們是免費的。
如何實際嘗試
• 最快的評估 — 使用免費且受速率限制的託管層級;如果它能回答你所需的內容,那就完成了,而且完全不花費成本。
• 在您的硬體上進行實際測試 — 下載社群版 GGUF(Q4_K_M 版本約 17 GB,可放入 24 GB 的顯示卡),並在 llama.cpp 或 Ollama 中執行。傳入 Jinja 聊天範本,否則模型會以思考標籤回覆你。若要使用 GGUF 的視覺功能,你另外還需要 mmproj 檔案。我們的操作手冊涵蓋執行Qwen3.8 27B 的本地逐步說明。
• 完整精度 — 使用 huggingface-cli 將 Qwen/Qwen3.8-27B 下載至 80 GB 級 GPU。
• 驗證您下載的內容 — 檢查發布者是否為 Qwen 組織,並依據 crc32.txt 驗證分片;發布前曾有相似的儲存庫出現。
當這篇評論有誤時(以及誰應該跳過 Qwen3.8 27B)
• 你沒有 GPU,也不會去租用。 免費方案有速率限制,付費方案為每百萬 $0.33/$2.40 — 小型 API 模型可能會更便宜、更可靠地為你服務。此模型是為想要自行掌握推論的人而設計。
• 您需要一份 SLA。託管層級才推出數天;今天查看 OrcaRouter 模型頁面,顯示過去七天錯誤率為 33.3%,p50 首個 token 延遲為 225 毫秒。這是承受早期負載的全新模型,並非生產級合約。自行託管者應鎖定其下載的 commit,並保留備援方案。
• 您需要經過驗證的基準測試來做出購買決策。供應商報告的數據僅具方向性參考價值,並非採購級別。請等待獨立復現的結果。
• 262K 開放權重的上下文還不夠。 目前 1M 擴展僅限託管版本。
• 吞吐量是您的瓶頸。大量摘要或大批次處理會造成影響:這是一個密集的 27B 模型,token 消耗量約為前代的 3 倍。對於低成本批量任務,較小或較快的模型更勝任。
• 你使用的是 12 GB 顯示卡。 2-bit GGUF 勉強能塞進去,但品質損失明顯;這款模型不適合你。

最重要的是
Qwen3.8 27B是當今最強大的開放權重 27B 模型,且在 Apache 2.0 授權下永久免費。如果你擁有 24 GB 以上的 GPU,想要代理式編碼、262K 上下文,以及原生圖像/影片輸入,而且不想按用量付費,那麼這就是你的選擇。暫緩入手的原因也同樣明確:你需要獨立基準測試的確認、SLA、超過 262K 的開放權重上下文,或是比稠密 27B 模型更高的吞吐量。模型已發布,權重真實,數據亮眼——只是要記得這些數據是從哪裡來的。
