
Solar Mini 4 對決 Qwen3.8-Max:最後這二十分指標,真正的代價是什麼
- openai新OpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 每百萬 tokens
- anthropic新Anthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 每百萬 tokens · 159 tok/s
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 220 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Solar Mini 4 每百萬個輸入 Token 的費用為 $0.10,每百萬個輸出 Token 為 $0.40。Qwen3.8-Max——大多數人在輸入「Qwen 3.8」並要求 API 時所指的模型——則要價 $2.00 和 $6.00。在價目表上,這讀起來是輸入價格的二十倍差距。在兩款模型如今都已接受的獨立評估中,老實說,實際數字是 Qwen3.8-Max 在 Artificial Analysis Intelligence Index 上得分 45.4,而 Solar Mini 4 為 24.1——測得能力約為兩倍——但每完成一項任務的成本卻約為十五倍。關於這組搭配,值得知道的一切都在這兩個比率之間的落差裡,也在於 Upstage 的模型以每秒 204 個 Token 的速度運行,而阿里巴巴的旗艦模型則為 39。
在數字之前,先做一點命名上的說明,因為這會改變你實際買到的是什麼。Qwen 3.8 是一個世代,而不是單一模型:託管的旗艦是 Qwen3.8-Max,以標註日期 0902 的快照形式更新;而同世代中可下載的成員是 Qwen3.8-2.4T-A95B,即阿里巴巴於 2026 年 8 月 12 日發布的 2.4 兆參數權重。Solar Mini 4 於 2026 年 9 月 22 日發布,是 Upstage 的 350 億參數稀疏專家混合模型,每個 token 約有 30 億參數處於啟用狀態,且無論出價多高都不開放權重。
這兩欄,在決定採購的維度上
• 智慧指數 — Qwen3.8-Max(0902)為 45.4,Solar Mini 4 則為 24.1,兩者皆採用智慧指數 v4.3.2。
• 每完成一項任務的成本——Qwen3.8-Max 為 5.41 美元,Solar Mini 4 為 0.36 美元。大約十五比一,而這個比例沒有人引用。
• 價格表 — 每百萬個 token 為 $2.00 / $6.00,快取輸入 $0.25,適用於 Qwen3.8-Max;相較之下,Solar Mini 4 為 $0.10 / $0.40,快取輸入 $0.01。
• 上下文 — 兩者皆為 1,000,000 tokens,這是便宜模型唯一毫不讓步的維度。Artificial Analysis 列出 Qwen3.8-Max 為 983,616、Solar Mini 4 為 1,048,576;Upstage 自家文件則寫 512K,因此兩者之中,小模型的上限較不確定。
• 權重 — Qwen3.8-Max 為專有且僅提供託管服務的模型;其開放的同系列模型 Qwen3.8-2.4T-A95B 可依自訂授權下載,並在 262,000 個詞元的上下文下,於同一指標上取得 39.9 分。Solar Mini 4 為專有模型,沒有開放的同系列模型。
• 吞吐量 — 根據同一間實驗室的測量,Solar Mini 4 每秒輸出 204 個 token,而 Qwen3.8-Max 為 39.5 個。每項任務成本只有十五分之一的模型,執行速度卻快上五倍。
二十一點指數能買到什麼

他們專攻的是分布中最難的一端。在 Humanity's Last Exam 上,Qwen3.8-Max 答對 43.1% 的題目,而 Solar Mini 4 為 25.8%。在科學程式設計上,則是 52.1% 對 47.6%。在代理式知識工作上,差距擴大到另一個層級:Qwen3.8-Max 在 GDPval-AA 上達到 1663 Elo,而 Solar Mini 4 僅有 1072——將近六百 Elo 點,這不是四捨五入的差異,而是模型在無人監督下能被信任執行哪些任務的根本轉變。
小型模型唯一不只守住陣腳、還直接勝出的評估項目,就是長上下文推理。Solar Mini 4 在 AA-LCR v1.1 上得分 83.3%,Qwen3.8-Max 則拿到 80.3%。這是整份比較中支持 Solar Mini 4 最有力的論據:在專為測試「閱讀極長文件並跨全文推理」而打造的基準上,每項任務付出十五倍的價格,換來的結果卻還差了三點。
兩者都不是合適工具的地方,在於自主終端機工作。Solar Mini 4 在 Terminal-Bench 4.0 上得分 1%;Qwen3.8-Max 得分 38.9%。一個能在二十項艱難終端機任務中通過八項的模型,在那裡確實堪用,而另一個則不然;這是這項比較中最清楚的例子,顯示出這是本質上的差距,而非程度上的差距。
為什麼旗艦模型的每任務帳單遠比其 token 價格所暗示的還要糟得多?
Qwen3.8-Max 每項任務產生的輸出比 Solar Mini 4 更多——107,700 個 token 對上 88,300 個——而且它產生這些輸出的價格是每百萬 $6.00,而非 $0.40。在尚未考慮快取行為之前,這就已經是大部分的差距所在。阿里巴巴確實提供 $0.25 的快取輸入費率,相較於其 $2.00 的輸入價格是實質的折扣;而該家族的開放原始碼兄弟模型 Qwen3.8-2.4T-A95B,是一個 2.4 兆參數的稀疏模型,約有 950 億個參數處於啟用狀態,因此它產生的每一個 token 都是由一部規模大得多的機器所產生。這些都不是批評。這正是每項任務存在十五倍乘數的原因,也是這兩個模型之間按 token 價格比較會雙向誤導人的原因。
實務上的結果是:Solar Mini 4 並不是「平價版 Qwen 3.8」。它是一款專才,恰好便宜、快速,並且正好在單一軸線上很強——長文件——卻在出錯代價最高的軸線上很弱,也就是代理式可靠性。Qwen3.8-Max 則是通才,其優勢正好顯現在錯誤答案代價高昂的地方。
同時執行兩者,而不是在兩者之間做選擇
這是 Solar Mini 4 系列中不尋常的案例:比較的兩邊都是我們確實能賣給你的路徑。 Qwen3.8-Max 及其標註日期為 0902 的快照位於 OrcaRouter,採用供應商自家的 $2.00 / $6.00 定價,同時並列 Qwen3.8-Flash 的 $0.15 / $0.47以及 Qwen3.8-27B 的 $0.33 / $2.40——同一世代的三个層級、一把金鑰,不需第二份合約,除了模型字串之外也不必修改任何程式碼。截至 2026 年 10 月 1 日,我們自家 playground 的實測結果顯示,在過去七天內,Qwen3.8-Max 的 p50 為 2.5 秒,輸出速度為每秒 87.7 個 token;該時間窗會持續滾動,因此請以即時更新的模型卡為準,而非這句話。Upstage 的模型無法透過我們取得,而 Solar Mini 4 必須經由 Upstage 自家的 API 才能使用。

這使得這項比較所主張的分流得以實現:把長文件、韓語與結構化擷取的流量送到便宜的地方,將推理密集與使用工具的請求導向旗艦模型,並讓容錯移轉來涵蓋那個下午出狀況的供應商。這也是路由 DSL 展現價值之處——把模型組合成單一次呼叫,意味著便宜的第一輪處理與昂貴的驗證輪次可以是對單一端點的一個請求,而不是兩套必須保持同步的整合。
簡短版本

如果你的工作負載是長上下文、固定的輸出形式,以及可容忍的延遲預算,那麼 Solar Mini 4 能以十五分之一的任務成本、五倍的吞吐量,帶給你 83% 的長上下文結果,而那二十一個缺失的指標分數永遠不會出現在你的儀表板上。如果你的工作負載涉及工具、多步驟代理,或是一些「自信的錯誤答案比沒有答案更糟」的問題,那麼那些缺失的分數就是產品的全部,而 Qwen3.8-Max 值得那十五倍的價格。上述歸屬於 Artificial Analysis 的每一項數字,都是該組織的獨立測量結果;Qwen3.8 的命名與發布日期是阿里巴巴的,而 OrcaRouter 的服務數據則是我們自己在滾動的七天窗口內、於自家 playground 所做的測量。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
