
GPT-6.1 Sol 對上 Qwen3.8-Max:要看的是帳單,不是價目表
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
拿一項每晚的儲存庫維護工作,每晚執行一次、持續一個月,然後GPT-6.1 Sol與Qwen3.8-Max輪流執行這項工作。根據 Artificial Analysis v4.3.2 的逐項任務數據,在那三十個晚上,GPT-6.1 Sol 花費 21.72 美元,Qwen3.8-Max 則花費 162.27 美元——每月相差 140.55 美元,一年約 1,690 美元;而這項工作的每 token 價目表上寫的是輸入 2.00 美元、輸出 10.00 美元,對比輸入 2.00 美元、輸出 6.00 美元。每百萬 token 的費率在輸入端彼此的差距僅在捨入誤差之內,而這個中國模型在輸出上還便宜 40%,帳單卻相差 7.5 倍。廠商於 2026 年 9 月 29 日發布 GPT-6.1 Sol;Qwen3.8-Max 則自 2026 年 8 月 3 日起就已上線。
那個落差不是定價花招,也不是基準測試的假象——它就是這項比較所要說明的全部,而且它來自一個任何價目表都不會顯示給你看的數字。
每個模型是什麼
GPT-6.1 Sol 是 OpenAI 目前推理與程式編寫的旗艦模型,於其所取代的 GPT-6 Sol 推出一週後問世,維持相同的 $2.00 / $10.00 定價,快取輸入費用為 $0.10,並具備 1,050,000 token 的上下文視窗。它主打代理式工作:在我們自家的模型卡上,其「最適合」標籤標示為推理、程式編寫與代理式任務,並擁有最高等級的品質分數。
Qwen3.8-Max 是阿里巴巴的代理式旗艦——一款封閉、僅提供 API 的模型,可接受文字、圖像與影片輸入,並支援 1,000,000 個 token 的上下文。與較小的 Qwen 版本不同,這款並未公開權重。在 Artificial Analysis 上,它的 Intelligence Index 得分為 45.42,在 147 個模型中排名第 17,程式碼指數為 76.2,在該領域排名第 9。它不是個弱模型。只是讓它思考的代價太高。
那個不在價目表上的號碼

Artificial Analysis 記錄 Qwen3.8-Max 每項任務有 107,730 個輸出 token,其中 70,830 個是推理 token。GPT-6.1 Sol 產生 38,128 個輸出 token,其中 25,190 個是推理 token。這個中國模型回答同一個問題時,寫下的 token 數量是 2.8 倍,而每個 token 的成本便宜 40%。
• 每項任務的輸出 token 數 — 38,128 對比 107,730;Qwen 的輸出量多出 2.8 倍
• 其中推理 — 25,190 對比 70,830
• 每項任務成本 — $0.724 對比 $5.409;Qwen 的成本高出 7.5 倍
• 每項任務時間 — 640 秒對比 2,152 秒;約 11 分鐘對比約 36
• 首個回答 token 的耗時 — 332.0 秒 vs 55.1 秒
• 智慧指數 — 51.83 對 45.42
• 上下文視窗 — 1,050,000 對比 1,000,000 個詞元
• 接受的輸入 — 文字、圖像和檔案 vs 文字、圖像和影片
把乘法算一下,折扣就消失了。一個以低 40% 費率輸出接近三倍 token 的模型並不會更便宜——單就輸出而言,成本就約為 1.7 倍,而實測的每項任務數據顯示,一旦把輸入、快取讀取和有效答案的長度納入計算,真實倍數會達到 7.5。
注意第四行和第五行,因為它們指向相反的方向,而兩者合起來正好說明了 Qwen3.8-Max 是什麼樣的模型。它能在 55 秒內吐出第一個 token,而 GPT-6.1 Sol 要花上五分半鐘;接著它得花三十六分鐘才完成任務,而這個 OpenAI 模型十一分鐘就做完了。這是一個馬上就開口、卻思考得極其冗長的模型。對一個以串流回答呈現、讀起來像是反應靈敏的聊天介面而言,這是優點;但對無人看管的夜間批次工作來說,那就是你同樣得付錢的實際經過時間。
Qwen3.8-Max 真正領先的三個地方
在整個套件中,指數差距是 6.4 點,而這種數字常被引用得彷彿它是一致的。事實並非如此,而這種分歧很具啟發性:
• GPQA Diamond — Qwen3.8-Max 0.9283 對比 GPT-6.1 Sol 本次執行未公布
• GDPval — 1,671.4 對比 1,575.09
• Terminal-Bench 2.1 — 0.8876,相較之下本次執行未公布
• AutomationBench — 0.5619 對 0.6487
• SciCode— 本次執行中未發布,相較於 GPT-6.1 Sol 的 0.5417
• CritPT — 0.1771 對 0.3171
Qwen3.8-Max 在研究所程度的科學題目與職業任務樣本中勝出,這對其世代的模型而言是實實在在的成果,也是其程式設計指數在 138 個模型中排名第 9 的原因。它在更困難、與研究相關的評估中落敗——CritPT 輸了 14 分——而 AutomationBench 也輸了 8.7 分,後者是最接近無人值守電腦工作的一項。這兩者中你認為哪個對你的工作負載更重要,才是真正的決定;6.4 分的頭條數字是對分歧取平均,而非定論。
額外的 token 能換來什麼,以及換不來什麼
長推理軌跡按定義並非浪費。一個在困難任務上花費 70,830 個 token 進行深思的模型,正在做較短模型可能略過的事,而在 Qwen3.8-Max 領先的評測中,這種深思很可能就是原因。失敗模式在於,你會在每個任務上為此付出代價,不只是困難的任務。推理 token 數量是模型校準的特性,而非問題難度的特性,而一個對單行擷取過度思考的模型會為此向你收費。
找出你的各項任務分別是哪一項的方法,就是停止把模型選擇當成全域設定。這也帶我們來到屬於設定變更的那個部分。
我們自家的 GPT-6.1 Sol 模型卡載有該受測對象實際提供的數字:$2.00 / $10.00 的費率、1,050,000 詞元的上下文視窗、首個詞元的 p50 為 4.54 秒,以及一個已儲存的 Artificial Analysis 指數區塊,就位於應用程式實際會據以路由的定價同一頁面上。

一鍵,一錶,兩款
兩個模型都能透過單一的 OrcaRouter 端點存取——一個 API 對應 200 多個模型,供應商定價以 0% 加成原樣傳遞。Qwen3.8-Max 的 OrcaRouter 卡上,除了 1,000,000 個 token 的上下文視窗、文字/圖像/影片輸入模態,以及七天 1.014 億 token 的用量之外,也載明了實際計費費率——這些是應用程式據以路由的數字,就擺在文章爭論的那些數字旁邊。這種原樣傳遞對 Qwen3.8-Max 尤其重要,因為一個經濟效益主要由輸出 token 用量主導的模型,正是供應商隨時可能重新定價的模型;而原樣傳遞的計量意味著,這項變動會在阿里巴巴公布當天就反映到你的帳單上,而不是依照經銷商的時程。

這裡路由層更有趣的用法是路由 DSL,它讓你將多個模型組合成單一次呼叫,而不是為整個應用程式挑選一個模型。拆分夜間工作:便宜的模型負責分類與擷取,GPT-6.1 Sol 處理推理與驗證步驟,而 Qwen3.8-Max 則保留給那些其長時間深思與 GPQA 等級的科學能力確實能改變答案的任務。自動容錯移轉涵蓋其餘部分——如果供應商在執行中途效能下降,請求會轉移,而不是讓整批失敗。
這兩者都不是挑選模型的理由。它們恰恰是你不必一旦做出選擇就得與之長相廝守的原因。
通話,以及值得關注的事
只有在深思熟慮值得時,才支付那 7.5 倍。對於通用型夜間工作,GPT-6.1 Sol 每項任務 $0.724 是站得住腳的預設選擇,而一年 $1,690 確有其事。若任務是可檢驗答案的硬科學或職業推理,Qwen3.8-Max 在 GPQA Diamond 上的 0.9283 就值得那些 token——那正是它表現更好的特定強項。
值得關注的是,阿里巴巴是否會重新定價。一個 2.8 倍 token 的模型以 $2.00/$6.00 定價,彷彿 token 才是稀缺資源;但該模型自身的行為卻讓 token 變得充裕。如果輸出費率出現實質變動,本文的計算也會隨之改變,而轉嫁計量器會在同一天讓你看見這件事發生。
本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
