
Qwen3.8-27B 評測:這款開放權重的 27B 模型就是「居家 Opus」——實測對照炒作
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 每百萬 tokens · 22 tok/s
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
- tencentTencent: Hy32026-07-0642智能59程式
Qwen3.8 27B是目前可以自行託管的最佳開放權重 27B 模型,而且差距相當明顯。權重於 2026 年 8 月 14 日以 Apache 2.0 授權釋出:一個具 262K 原生上下文、原生影像與影片輸入的密集 27B(含視覺編碼器為 28B)模型,以及廠商宣稱達到或超越 Claude Opus 4.6 Max 的代理式編碼分數——SWE-bench Pro 61.7、DeepSWE 1.1 42.2、LiveCodeBench v6 90.3。最引人注目的價格是零:下載 55.6 GB 即可執行。但需要注意的事項也確實存在——獨立測試發現它比前代慢了約三倍,且更耗 token;規格表上的每項基準依然是 Alibaba 自行宣稱的數據;而 1M 上下文僅限託管版本使用。結論:如果你有 24 GB 以上的 GPU,並希望在不按量計費的情況下獲得接近前沿的能力,那就自行託管吧——但請務必清楚了解哪些數據不夠扎實。
先說結論:你應該使用 Qwen3.8 27B 嗎?
簡短回答 — 對於本地和私有工作負載,答案是肯定的;在做出採購決定之前,請等待第三方數據。 Qwen3.8 27B 是一個罕見的模型,其開放權重本身就是產品,而 API 只是便利性。由於採用 Apache 2.0 授權,一旦你擁有硬體,每個 token 的價格就永久為零,而且你在此基礎上建構的任何東西都不能被重新授權或追溯收費。你所放棄的是速度、驗證和便利性。
如果你已經在使用 Qwen3.6-27B 而且對它感到滿意,升級確實是真的,但在實際時間成本上並非免費。如果你是從 Qwen3.8-Max 的發表來到這裡,這是同一世代中較小、可自行架設的成員——為不同工作而生的不同工具。
快速事實,2026年8月15日核實
• 已發佈 — 權重於 2026 年 8 月 14 日在 Qwen/Qwen3.8-27B 於 Hugging Face 上架,並在 ModelScope 同步鏡像;因時區差異,部分報導亦標註 8 月 13 日,此次發佈約在 Qwen3.8 系列公佈一週後推出。
• 授權 — Apache 2.0:可下載、修改、再散布、商業使用,並附有明確的專利授權。永久有效。
• 參數 — 27B 稠密(含視覺編碼器為 28B)、64 層、隱藏層大小 5,120、詞彙量 248,320。
• 架構 — 混合注意力:48 個 Gated DeltaNet 線性注意力層對比 16 個完整 Gated Attention 層(比例 3:1)。這就是為什麼一個 27B 稠密模型可以承載 262K 個 token 的原生上下文。
• 上下文 — 原生支援 262,144 個 tokens,可透過託管版本上的 YaRN 擴展至 1,000,000。
• 輸入 — 原生影像與影片可與文字一同輸入;回傳文字。視覺編碼器正是參數數量達到28B的原因。
• 思考——推理模式預設開啟,且可依請求停用;reasoning_effort(低/中/高)和 preserve_thinking 用於長時間的代理執行。
• 權重 — 55.6 GB 的 BF16 safetensors,共 18 個分片;另提供 FP8 及社群版 GGUFs。
以上規格來自 Hugging Face 的模型卡和配置,適用於Qwen3.8 27B,於今日讀取。基準測試的宣稱由 Alibaba 所回報;截至目前,尚無獨立實驗室重現這些結果。
Qwen3.8 27B 真正擅長的事
最有力的案例是代理式軟體工程。阿里巴巴回報 DeepSWE 1.1 較先前 27B 提升了 3 倍(42.2 對 13.3),並在 SWE-bench Pro 上取得高於 Claude Opus 4.6 Max 的分數(61.7 對 53.4)。正是這些數字讓它贏得「Opus at home」的綽號——一個密集的 27B 模型,在一般人實際能擁有的硬體上執行接近前沿的編碼工作。

除了原始數字之外,還有三件事讓它成為一個合理的買入選擇:
• 原生多模態。圖片與影片輸入、文字輸出——含圖表的文件或影片講解並不需要另立一個模型。視覺推理分數(啟用思維鏈功能時為85.6,視覺數學94.6,皆由廠商自報)正是視覺編碼器發揮價值之處。
• 262K 原生上下文。長時程代理任務、大型程式碼庫及長達數小時的轉錄內容,皆可在單一視窗中處理。混合線性注意力設計可讓該上下文的 KV 成本低於同等規模的純全注意力模型。
• 免費且永久的權重。這就是此類別的重點:封閉的 API 模型是用租的;Qwen3.8 27B則為自有。以 4-bit 精度可在 24 GB 顯示卡(RTX 3090/4090 等級)上運行,AMD 亦提供 Day-0 支援(根據 AMD 官方部落格,Ryzen AI Max+ 395 可達每秒 24.5 tokens,Radeon AI PRO R9700 可達每秒 51.8 tokens)。
評論變難看之處:速度、代幣與驗證
到目前為止的獨立測試僅是單一測試者的測試框架,而非正式實驗室——但這已是我們手上最佳的訊號。將 Qwen3.8 27B 與 Qwen3.6-27B 在十項真實世界任務上進行比較(由 GPT-5.5 透過 llmcompare 測試框架評判),3.8 在十項中贏得九項,平均得分 8.838 對 6.862——測試者稱此為「他所見過最令人印象深刻的智慧提升之一」。但它也消耗了將近三倍的 token,且速度明顯較慢;其中一項任務耗時約增加 600%。因此品質的躍升是真實的,實際耗時上的代價也同樣真實。
還有四件事可以拿來指責它:
• 目前尚無第三方基準測試。本文中的每個標題數字都是 Alibaba 截至8月15日所報告的。供應商卡片內容詳細,但尚未由獨立實驗室進行復現。如果你的決策依賴於經過驗證的數字,請等待它們——權重仍然會在那裡。
• VRAM 下限是真實的。 BF16 需要 80 GB 等級的 GPU。要放進 24 GB 的顯示卡,你必須執行 4-bit,而社群回報(dev.to 留言串,發布後數天)表示量化版本「在長上下文後會失去焦點」。如果你有 VRAM,就用官方權重;如果沒有,就用量化版本。
• 1M context 僅限託管版。 開放權重上限為 262K。可擴展至 1M 的數據是 Qwen Cloud 託管功能,並非本地副本開箱即用即可實現。
• 「勝過 Opus」需要附帶條件。代理式基準測試獎勵的是特定測試框架(harness)的行為,而 dev.to 發布貼文上的熱門留言說得直接:「它們在真實世界使用中並未擊敗 Opus。」請把排行榜視為狀況好時的上限,而非保證。
它在 Qwen 3.8 家族中的定位
• 對比 Qwen3.6-27B — 同級硬體與 262K 上下文,但能力有大幅躍升,代價是速度與 token 效率。如果你已在運行 3.6 且受吞吐量限制,維持現狀是合理的。
• 對比 Qwen3-Coder-30B-A3B — Coder 是 MoE 架構,活躍參數約 3.3B,執行速度快得多(約 90–110 tokens/s)。dense 27B 每個 token 較慢,但繼承了這代模型的 agentic 優勢;若 27B 的軟體工程分數在獨立測試中依然成立,Coder-30B 的角色就會弱化。
• 對比 Qwen3.8-Max — 這款 2.4T MoE 旗艦是資料中心級模型(僅提供 API,公開報導中每百萬 tokens 收費約 $2/$6),支援 1M 上下文與影片。27B 才是可部署的版本。兩者解決的是不同問題。
成本:本地與API之爭,塵埃落定
對於封閉式模型,你比較的是每個 token 的價格。對於 Qwen3.8 27B 來說,在自己的硬體上,邊際 token 的成本為零——真正的代價是前期投入的 GPU 和你的時間。在 4-bit 下,這是一張 24 GB 的顯示卡;在 BF16 下,則是一台 80 GB 等級的機器。如果你只需要評估模型,或者沒有相應的硬體,也可以使用託管服務:OrcaRouter 現在列出了Qwen3.8 27B,提供一個免費但有限速的方案,費用為 $0,超過配額會回傳 HTTP 429;另有一個付費方案,每百萬輸入 token 收費 $0.33,每百萬輸出 token 收費 $2.40(查閱於 8 月 15 日)。Qwen Cloud 的託管版本則提供 1M 上下文,目前標示為「即將推出」。

老實說:對於開放權重模型,供應商是圖個方便,而非依賴。免費方案是判斷 55.6 GB 下載是否值得的最便宜方式。但一旦你下定決心,權重才是關鍵——而且它們是免費的。
如何實際試試看
• 最快的評估 — 使用免費且速率受限的託管層級;如果它能回答你需要的問題,那就完成了,而且不花任何成本。
• 在您的硬體上進行實際測試 — 下載社群版 GGUF(Q4_K_M 版本約 17 GB,可裝進 24 GB 的顯示卡),然後在 llama.cpp 或 Ollama 中執行。請傳入 Jinja 對話範本,否則模型會以 thought 標籤回覆您。若要用 GGUF 的視覺功能,還需要另外的 mmproj 檔案。我們的操作手冊提供如何執行Qwen3.8 27B 的本機逐步指南。
• 全精度 — 使用 huggingface-cli download Qwen/Qwen3.8-27B 下載到 80 GB 級別的 GPU 上。
• 驗證您下載的內容 — 確認發布者為 Qwen 組織,並根據 crc32.txt 驗證分片;發布前已出現仿冒的儲存庫。
這篇評論何時會出錯(以及誰應該跳過 Qwen3.8 27B)
• 你沒有 GPU,也不會租用。 免費方案有速率限制,付費方案為每百萬個 token 0.33/2.40 美元——一個小型 API 模型可能更便宜、更可靠。此模型適合想要自行掌控推論的人。
• 您需要一份服務等級協議(SLA)。託管層級才上線數天;今天讀取的 OrcaRouter 模型頁面顯示,過去七天錯誤率為 33.3%,p50 首個 token 延遲為 225 毫秒。這是處於早期負載下的全新模型,並非生產級合約。自架者應固定其下載的提交版本,並保留備援方案。
• 您需要經過驗證的基準測試數據才能做出採購決定。供應商回報的數字僅具方向性參考價值,不足以作為採購依據。請等待獨立重現驗證。
• 262K 開放權重的上下文還不夠。 1M 擴展目前僅限於託管服務。
• 吞吐量是你的瓶頸。 批量摘要或大型批次會造成效能損失:這是一個密集的27B模型,同時也大約消耗其前代模型3倍的token數。若需要大量低成本處理,選擇較小或較快的模型會更為合適。
• 你用的是 12 GB 顯示卡。 2-bit GGUF 雖然硬塞得進去,但品質損失明顯;這款模型不適合你。

底線
Qwen3.8 27B 是當今最強大的開放權重 27B 模型,且在 Apache 2.0 許可下永久免費。如果你有 24 GB 以上的 GPU,並需要智能體編程、262K 上下文,以及原生圖像/視頻輸入而無需按量付費,這款就是該買的。暫緩的理由同樣具體:你需要獨立的基準測試驗證、SLA、超過 262K 的開放權重上下文,或比稠密 27B 更高的吞吐量。模型已發布,權重真實,數字漂亮——只要記得這些數字是誰的就好。
