Qwen3.8-27B 的主視覺標題卡,這是阿里巴巴 Qwen3.8 產品陣容中擁有 270 億參數的稠密視覺語言模型,副標題為「27B dense - native vision-language - Apache 2.0」,並有三個功能標籤,分別寫著「262,144-token context」、「text + image + video in」和「text out」,右下角則有 OrcaRouter 標誌。
Guides & Insights

Qwen3.8-27B:阿里巴巴 Qwen3.8 系列中的精巧多模態模型

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Qwen3.8-27B 是阿里巴巴 Qwen3.8 世代中的稠密、單節點成員:一個 270 億參數的原生視覺語言模型,以 Apache 2.0 發布於 Hugging Face,可接受文字、圖像與影片,並回傳文字,上下文視窗為 262,144 個 token。本頁即是該模型的參考頁面——關於它是什麼、呼叫它要花多少成本、以及它能做什麼的權威說明——而值得開宗明義地說清楚:為什麼一個權重最早出現於 2026 年 8 月、而非過去七天的模型,會擁有一頁專屬頁面。我們不是在報導一場發布。我們是在回答一個長期存在的問題:每個月有數千次讀者因為「Qwen3.8-27B」這個名字找上我們,而在此之前,我們沒有任何一頁能承擔這個答案。該模型自身的發布——日期標在 Qwen 的模型卡上,並由 Artificial Analysis 記錄為 2026-08-14——是這頁用來為模型標定日期的事實,而不是它報導的事件。

把它讀成它本來就是的例外:若嚴格按七日時效來看,2026 年 8 月中旬的模型並不算近期,而這則項目會在新聞篩選中被略過。這裡的依據不同。這是一個參考頁面,其數字已於 2026-09-28 對照 Qwe​n 自家的模型卡、該儲存庫的授權檔案、Qwe​n Cloud 的價目表與 Artificial Analysis 驗證過;而它存在的理由,是我們在同一天以第一方數據測得的搜尋需求。它不是第二則公告,任何人也不該把它當成那樣來讀。

27B 在 Qwen3.8 系列中的定位

Qwen3.8 這一代並非單一模型,而尺寸後綴正是這個名稱的關鍵所在。Qwen 自家在整個系列中的儲存庫註記,讓這項區分顯而易見:

• Qwen3.8-27B — 27B 稠密參數、原生圖片與影片輸入、Apache 2.0。部署友善的一員:專為能在單張 GPU 或小型節點上運行而設計的模型,也正是本頁的主題。

• Qwen3.8-Max,以 Qwen3.8-2.4T-A95B 為基礎打造——總參數達 2.4 兆,其中 95B 為啟用參數,是阿里巴巴在本世代首次開源的 Qwen-Max 級模型。其儲存庫採用客製化的 qwen3.8-max 授權條款,而非 Apache 2.0。

• Qwen3.8-Flash-Next——Qwen 表示將作為 Qwen4 基礎的實驗架構預覽版,依 qwen-community-1.0 授權條款發布。託管版的 Qwen3.8-Flash 即建立於其上。

所以「27B」並不是 Max 模型的一個規格等級;它是單一團隊真正有能力服務的規模級別。阿里巴巴聲稱它繼承的是訓練配方:模型卡將 Qwen3.8-27B 描述為把這一代在程式設計、專業工作、研究以及長時程代理任務上的進展,壓縮成一個稠密檢查點。

Scoreboard infographic titled 'Qwen3.8-27B - the scoreboard' with six rows: Parameters 27B dense (27.8B with vision), Context 262,144 native and 1M with YaRN, Modalities text + image + video in and text out, Licence Apache 2.0 with commercial use, Terminal Bench 2.1 of 73.0 marked vendor-reported, and AA Intelligence Index 33.7 marked independent, with a footer reading 'Qwen figures vendor-reported and unreproduced; AA figures per Artificial Analysis.' and the OrcaRouter logo in the bottom-right corner.

Qwen 所發佈的架構

以下每一個數字都來自 Qwen/Qwen3.8-27B 的模型卡,那是廠商自己的文件:

• 參數——如宣傳所述的 27B。該儲存庫自身的 safetensors 中繼資料顯示,BF16 格式、分佈於 18 個分片的參數總計為 27,781,427,952 個,因此若把視覺塔也計算在內,大約是 27.8B。這裡沒有專家混合架構:所有參數在每個 token 上都會啟用。

• 形狀 — 64 層、隱藏維度 5,120、前饋網路中間維度 17,408、詞元嵌入與語言模型輸出 248,320(已填充)。

• 混合注意力 — Qwe​n 列印出的配置是 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)):每個完整注意力區塊對應三個線性注意力區塊,比例為 3:1。Gated DeltaNet 在頭維度 128 下,為 V 執行 48 個線性注意力頭,為 QK 執行 16 個;Gated Attention 則在頭維度 256 下,以 24 個查詢頭對上 4 個 KV 頭,旋轉維度為 64。正是這個比例,讓 262K 視窗在 27B 模型上變得可行,而這也是 Qwen3.8-Flash-Next 以稀疏注意力延伸的同一系譜。

• 多詞元預測 — 卡片指出該模型以 MTP 在多個步驟上進行訓練,這項草擬技巧可在支援 MTP 的推論服務堆疊中加速生成。

• 思考控制——思考模式預設為開啟,且可依請求關閉。reasoning_effort可設為xhigh(預設值)、medium或low,而preserve_thinking預設為開啟,因此推理軌跡會跨回合保留,而非重新產生。

上下文視窗與輸出上限

模型卡指出,原生支援 262,144 個 token,並可透過 RoPE 縮放(YaRN)擴展至 1,000,000。Qwen 本身針對長時間代理式執行的服務指引,在那 1M 範圍內,建議允許推理內容最多 262,144 個 token,最終回應最多 131,072 個 token——這個上限是服務配置,而非檢查點的固定屬性。

有兩個上下文視窗值得分開看待,因為它們很容易被混為一談。開放權重原生以 262,144 運行;託管版本在 Qwe​n Cloud 上,模型卡描述為尚未推出(「服務即將推出」),而在 Qwe​n Cloud 模型頁面上列出的是 1M 上下文、991K 最大輸入、131K 最大輸出,以及 262K 最大推理預算。託管產品的規格表並非檢查點的規格表。

模態:輸入什麼,輸出什麼

輸入為文字、圖像與影片;輸出僅為文字。這張模型卡稱 Qwen3.8-27B 是「原生視覺語言模型,能理解圖像與影片」,其範例程式碼也傳入全部三種輸入類型。它沒有音訊輸入、沒有圖像生成,也沒有語音輸出。Artificial Analysis 對同一個檢查點的模型紀錄在範圍界定上看法一致——圖像、影片與文字進,文字出——這是一項有用的第二方佐證,因為它並非阿里巴巴自家的頁面。

Apache 2.0 發行版實際上允許什麼

The licence is not a summary on a blog post; the repository carries the Apache License, Version 2.0 text itself, and the card's metadata declares license: apache-2.0. What that grants, read from the licence text: a perpetual, worldwide, royalty-free copyright licence to reproduce, prepare derivative works of, publicly display, sublicense and distribute the work and its derivatives, and a patent licence from contributors — with commercial use among the permitted purposes and no field-of-use restriction, no user-count threshold and no separate commercial agreement. Apache 2.0 is also permissive in the sense that matters for shipping products: derivative weights may be redistributed under different terms, provided you keep the licence and attribution notices and state what you changed (Sections 4a–4c). Section 6 grants no rights to the Qwe​n name or trademarks, so an Apache-2.0 fork cannot market itself as Qwe​n.

家族內部的比較很有啟發性,而且從儲存庫而非報導就能看出:2.4T-A95B 檢查點自稱為其他,並採用qwen3.8-max 授權條款,而 Qwen3.8-Flash-Next 則使用 qwen-community-1.0。27B 是三者中唯一以純 Apache 2.0 授權推出的型號。

獨立基準位置

Artificial Analysis 已經運行過這個模型,而它的紀錄值得與 Alibaba 自家的表格分開來看,因為兩者回答的是不同問題。這項獨立指數是在 xhigh 配置上測得的:

• 智能 33.7 — Artificial Analysis 所儲存的值,其模型頁面顯示時會四捨五入為 34。頁面上公布了兩個排名,而兩者衡量的群體不同:該頁面本身的摘要方塊將此模型排在其 尺寸級別的 142 個模型中第 1 名,即該頁面工具提示所描述的同級比較;而我們目錄中取自 Artificial Analysis 的資料列則記錄為 145 個中的第 45 名,約第 67 百分位。兩者並不是同一個欄位的排名,因此不要把兩者解讀成同一數字的兩種格式。

• 程式設計指數 68.1 — 收錄於我們的目錄中,並以 artificialanalysis.ai 為具名來源,在該指數的 138 個模型中排名第 35。此模型在程式設計方面的表現高於一般智慧,這與供應商自家表格的樣態相符。

• 投入階梯,相同測試框架 —— 降低推理投入會讓指標大幅移動:xhigh 時為 33.7,medium 時為 27.6,low 時為 26.2,完全關閉推理則為 20.2。這是實測達 13.5 點的差距,也是依工作負載而非依模型調整投入的最具體論據。

• 兩個來源在哪些地方一致、哪些地方不一致——在 GPQA Diamond 上,Aliba​ba 的模型卡回報 89.2,而 Artificial Analysis 測得 90.5。在 Humanity's Last Exam 上,模型卡回報 30.8,Artificial Analysis 則是 33.9。數字接近,但並不相同,而這很正常:不同的測試框架、不同的執行批次。有一點提醒應該放在文章正文,而不是腳註——沒有任何第三方曾發表 Qwen3.8-27B 與 Aliba​ba 比較表中任何模型在相同測試框架上以相同推理投入運行的正面對決,因此本頁上的每一項跨模型比較,都是各自獨立測量之間的比較,而不是同一項結果。

Screenshot of the Artificial Analysis model page for Qwen3.8 27B in its xhigh configuration showing a same-class comparison rank of 1 of 142 next to an Intelligence tile, 46.6 output tokens per second at rank 55 of 142, $0.50 per million input tokens and $3.00 per million output tokens, a 256k-token context window, 27B total parameters, an Apache 2.0 licence, an open-weights marker and a release month of August 2026, with the summary text reporting a score of 34 on the Artificial Analysis Intelligence Index.

Qwen 所報告的內容,以及如何解讀

模型卡載有約二十多個分數,並附上 Qwen3.6-27B、Qwen3.7-Plus、Muse Glimmer-30B 與 Opus4.6 Max 的比較欄。這些全都是廠商自行提報且未經重現的——由阿里巴巴自家評估、由阿里巴巴印出——而且其中數列使用由 GPT-5.4 建構版本評判的 Claude Code 測試框架,模型卡的註腳如此說明。根據此一基礎,廠商的主要數字如下:

• 代理式終端機程式編寫 — Terminal Bench 2.1(Terminus)73.0,相較於它所取代的 Qwen3.6-27B 的 63.4,而 Opus4.6 Max 以 78.2 在該列中領先。

• 代理式編程 — SWE-bench Pro 61.7、QwenSWEBench 79.0、DeepSWE 1.1 42.2、NL2Repo-Bench 42.3、LiveCodeBench v6 90.3。

• 代理與辦公室工作 — 依分數計,CoWorkBench 70.7、JobBench 33.4、Agents' Last Exam 42.9(Pass@1 20.4)。

• 一般推理 — GPQA Diamond 89.2、HLE 30.8、IFBench 79.5。Opus4.6 Max 在廠商自家表格的兩行推理數據中皆居首,分別為 91.3 與 40.0。

• 視覺與電腦操作 — OSWorld-Verified 84.3、AndroidWorld 81.9、WebArena-Verified 64.8、OmniDocBench 1.5 91.1、RealWorldQA 85.9。

那張表誠實的總結,比那張表表面上看來更狹窄。相較於它的直接前代,增益既大且一致——QwenSWEBench 79.0 對 49.3,DeepSWE 42.2 對 13.3——而這是關於一代配方變更的宣稱。與相鄰欄位中的前沿模型相比,依阿里巴巴自家的數字、自家選擇的測試框架,它在某些列勝出,在另一些列落敗。

運行中

權重為 Transformers 格式的 18 個 BF16 分片,而模型卡將 Hugging Face Transformers、vLLM、SGLang 與 TokenSpeed 列為支援的技術堆疊。我們已分別撰寫本機部署與量化路徑的說明,那些細節適合放在那裡:Ollama 上的 Qwen3.8-27B適用於本機守護程式,而基準測試導覽則提供完整評分表,包括與 Qwen3.6-27B 相比有哪些變更。本頁則聚焦於模型本身。

Qwen3.8-27B 在我們的目錄上

今天 OrcaRouter 上有兩張模型卡同時上線,並列展示,而且在這段文字撰寫之前,兩者都已於 2026-09-28 重新讀取過。qwen/qwen3.8-27b定價為每百萬輸入 token $0.33、每百萬輸出 token $2.40,具備完整的 262,144-token 上下文視窗,支援文字、圖像與影片輸入,並將推理、工具、結構化輸出與 JSON 介面以參數形式開放。它的同系列模型 obsidian/Qwen3.8-27B——相同權重以 block-FP8 提供服務,視覺塔維持全精度,而且用卡片自己的話來說,「旨在針對廣泛的提示提供直接、完整的回應」——定價為輸入 $0.40、輸出 $4.21。兩者都支援 chat completions 與 Responses API,因此文件解析或螢幕截圖工作可以在同一把金鑰與同一個端點下指向任一模型,無需第二份合約,也無需修改程式碼。

就規模而言,我們自家的 playground 在過去七天內已讓 1.051 億個 token 通過 qwen/qwen3.8-27b,首位元組時間中位數為 3.8 秒,而同一段期間的錯誤率為 3.3%。那些是我們的服務數據,並非對該模型的評價。

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing a 262K-token context window, text, image and video input, text output, the vision, tools, JSON and reasoning badges, a 3.80-second p50 time to first token, 105.1M tokens served in seven days, and list pricing of $0.33 per million input tokens and $2.40 per million output tokens.

引導至此的搜尋

這個頁面背後的搜尋需求既分散又薄弱,而且正好落在點擊之外。截至 2026-09-25 的 28 天內,我們的資源共取得 8,931 次曝光與 273 次點擊,涵蓋該模型名稱的 69 種不同確切拼法——「qwen3.8 27b」、「qwen3.8-27b」、「qwen 3.8 27b」,以及數十種其他寫法,寫的都是同樣三個詞元。在最大宗的拼法上,我們的最佳排名落在 9.0 到 10.6 之間。那些排名是我們靠其他頁面意外取得的,而這正是標準頁面(canonical page)能解決的問題:排在第 9 名,你確實上了第一頁,卻沒有人點擊。唯一能帶來轉換的流量來自非英語——某個俄語拼法的名稱對我們而言排在第 1.8 位,轉換率達 14.4%。

那一切都不是關於模型的證據。它是關於人們輸入什麼的證據,而這正是這個頁面存在的原因。

這一切加總起來意味著:一個 27B 的稠密檢查點,搭配真正非比尋常的注意力配置、寬鬆的授權條款、原生影片理解能力、可讓你發布衍生作品的 Apache-2.0 條款、在 Artificial Analysis 所衡量的項目中位居前四分之一的獨立程式能力排名,以及一張相較於前代表現強勁、相較於前沿模型則好壞參半的廠商表格。尚未有解答的問題,是阿里巴巴以外目前無人能回答的那一個——100 萬 token 的託管路徑在實際生產環境中表現如何,以及 Flash-Next 架構是否會落實在這個規模的模型上。

Qwen3.8-Max 背後的 2.4T-A95B 核心已在同一個目錄上線:qwen/qwen3.8-max,每百萬個詞元 $2.00 / $6.00,如果你需要的規模不是 27B 的話。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新