一張產生的主視覺卡片,標題為「GPT-6.1 Sol vs Qwen3.8-Max」,內含兩個圓角面板:左側「GPT-6.1 Sol」列出「OpenAI - 於 2026 年 9 月 29 日發布」、「每 1M 輸入 $2.00 / 輸出 $10.00」、「每項任務 $0.72」以及「AA 指數 51.8」;右側「Qwen3.8-Max」列出「Alibaba - 於 2026 年 8 月 3 日發布」、「每 1M 輸入 $2.00 / 輸出 $6.00」、「每項任務 $5.41」以及「AA 指數 45.4」;下方橫幅寫著「相同的輸入價格。7.5 倍的帳單。」;頁尾為「數據來源:Artificial Analysis v4.3.2。」,OrcaRouter 標誌位於右下角。
Guides & Insights

GPT-6.1 Sol 對上 Qwen3.8-Max:要看的是帳單,不是價目表

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

拿一項每晚的儲存庫維護工作,每晚執行一次、持續一個月,然後GPT-6.1 Sol與Qwen3.8-Max輪流執行這項工作。根據 Artificial Analysis v4.3.2 的逐項任務數據,在那三十個晚上,GPT-6.1 Sol 花費 21.72 美元,Qwen3.8-Max 則花費 162.27 美元——每月相差 140.55 美元,一年約 1,690 美元;而這項工作的每 token 價目表上寫的是輸入 2.00 美元、輸出 10.00 美元,對比輸入 2.00 美元、輸出 6.00 美元。每百萬 token 的費率在輸入端彼此的差距僅在捨入誤差之內,而這個中國模型在輸出上還便宜 40%,帳單卻相差 7.5 倍。廠商於 2026 年 9 月 29 日發布 GPT-6.1 Sol;Qwen3.8-Max 則自 2026 年 8 月 3 日起就已上線。

那個落差不是定價花招,也不是基準測試的假象——它就是這項比較所要說明的全部,而且它來自一個任何價目表都不會顯示給你看的數字。

每個模型是什麼

GPT-6.1 Sol 是 OpenAI 目前推理與程式編寫的旗艦模型,於其所取代的 GPT-6 Sol 推出一週後問世,維持相同的 $2.00 / $10.00 定價,快取輸入費用為 $0.10,並具備 1,050,000 token 的上下文視窗。它主打代理式工作:在我們自家的模型卡上,其「最適合」標籤標示為推理、程式編寫與代理式任務,並擁有最高等級的品質分數。

Qwen3.8-Max 是阿里巴巴的代理式旗艦——一款封閉、僅提供 API 的模型,可接受文字、圖像與影片輸入,並支援 1,000,000 個 token 的上下文。與較小的 Qwen 版本不同,這款並未公開權重。在 Artificial Analysis 上,它的 Intelligence Index 得分為 45.42,在 147 個模型中排名第 17,程式碼指數為 76.2,在該領域排名第 9。它不是個弱模型。只是讓它思考的代價太高。

那個不在價目表上的號碼

A generated two-column scoreboard titled 'GPT-6.1 Sol vs Qwen3.8-Max - the scoreboard'. Left column 'GPT-6.1 Sol': Output tokens 38,128, Reasoning tokens 25,190, Cost per task $0.72, AA Index 51.8, Time per task 640 s, Context 1.05M. Right column 'Qwen3.8-Max': Output tokens 107,730, Reasoning tokens 70,830, Cost per task $5.41, AA Index 45.4, Time per task 2,152 s, Context 1M. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Artificial Analysis 記錄 Qwen3.8-Max 每項任務有 107,730 個輸出 token,其中 70,830 個是推理 token。GPT-6.1 Sol 產生 38,128 個輸出 token,其中 25,190 個是推理 token。這個中國模型回答同一個問題時,寫下的 token 數量是 2.8 倍,而每個 token 的成本便宜 40%。

• 每項任務的輸出 token 數 — 38,128 對比 107,730;Qwen 的輸出量多出 2.8 倍

• 其中推理 — 25,190 對比 70,830

• 每項任務成本 — $0.724 對比 $5.409;Qwen 的成本高出 7.5 倍

• 每項任務時間 — 640 秒對比 2,152 秒;約 11 分鐘對比約 36

• 首個回答 token 的耗時 — 332.0 秒 vs 55.1 秒

• 智慧指數 — 51.83 對 45.42

• 上下文視窗 — 1,050,000 對比 1,000,000 個詞元

• 接受的輸入 — 文字、圖像和檔案 vs 文字、圖像和影片

把乘法算一下,折扣就消失了。一個以低 40% 費率輸出接近三倍 token 的模型並不會更便宜——單就輸出而言,成本就約為 1.7 倍,而實測的每項任務數據顯示,一旦把輸入、快取讀取和有效答案的長度納入計算,真實倍數會達到 7.5。

注意第四行和第五行,因為它們指向相反的方向,而兩者合起來正好說明了 Qwen3.8-Max 是什麼樣的模型。它能在 55 秒內吐出第一個 token,而 GPT-6.1 Sol 要花上五分半鐘;接著它得花三十六分鐘才完成任務,而這個 OpenAI 模型十一分鐘就做完了。這是一個馬上就開口、卻思考得極其冗長的模型。對一個以串流回答呈現、讀起來像是反應靈敏的聊天介面而言,這是優點;但對無人看管的夜間批次工作來說,那就是你同樣得付錢的實際經過時間。

Qwen3.8-Max 真正領先的三個地方

在整個套件中,指數差距是 6.4 點,而這種數字常被引用得彷彿它是一致的。事實並非如此,而這種分歧很具啟發性:

• GPQA Diamond — Qwen3.8-Max 0.9283 對比 GPT-6.1 Sol 本次執行未公布

• GDPval — 1,671.4 對比 1,575.09

• Terminal-Bench 2.1 — 0.8876,相較之下本次執行未公布

• AutomationBench — 0.5619 對 0.6487

• SciCode— 本次執行中未發布,相較於 GPT-6.1 Sol 的 0.5417

• CritPT — 0.1771 對 0.3171

Qwen3.8-Max 在研究所程度的科學題目與職業任務樣本中勝出,這對其世代的模型而言是實實在在的成果,也是其程式設計指數在 138 個模型中排名第 9 的原因。它在更困難、與研究相關的評估中落敗——CritPT 輸了 14 分——而 AutomationBench 也輸了 8.7 分,後者是最接近無人值守電腦工作的一項。這兩者中你認為哪個對你的工作負載更重要,才是真正的決定;6.4 分的頭條數字是對分歧取平均,而非定論。

額外的 token 能換來什麼,以及換不來什麼

長推理軌跡按定義並非浪費。一個在困難任務上花費 70,830 個 token 進行深思的模型,正在做較短模型可能略過的事,而在 Qwen3.8-Max 領先的評測中,這種深思很可能就是原因。失敗模式在於,你會在每個任務上為此付出代價,不只是困難的任務。推理 token 數量是模型校準的特性,而非問題難度的特性,而一個對單行擷取過度思考的模型會為此向你收費。

找出你的各項任務分別是哪一項的方法,就是停止把模型選擇當成全域設定。這也帶我們來到屬於設定變更的那個部分。

我們自家的 GPT-6.1 Sol 模型卡載有該受測對象實際提供的數字:$2.00 / $10.00 的費率、1,050,000 詞元的上下文視窗、首個詞元的 p50 為 4.54 秒,以及一個已儲存的 Artificial Analysis 指數區塊,就位於應用程式實際會據以路由的定價同一頁面上。

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

一鍵,一錶,兩款

兩個模型都能透過單一的 OrcaRouter 端點存取——一個 API 對應 200 多個模型,供應商定價以 0% 加成原樣傳遞。Qwen3.8-Max 的 OrcaRouter 卡上,除了 1,000,000 個 token 的上下文視窗、文字/圖像/影片輸入模態,以及七天 1.014 億 token 的用量之外,也載明了實際計費費率——這些是應用程式據以路由的數字,就擺在文章爭論的那些數字旁邊。這種原樣傳遞對 Qwen3.8-Max 尤其重要,因為一個經濟效益主要由輸出 token 用量主導的模型,正是供應商隨時可能重新定價的模型;而原樣傳遞的計量意味著,這項變動會在阿里巴巴公布當天就反映到你的帳單上,而不是依照經銷商的時程。

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the $2.00 input and $6.00 output per-million prices, a 5.66 s p50 time to first token, 101.4M tokens over seven days, a 1,000,000-token context window and text/image/video input, above the OpenAI- and Anthropic-compatible code samples.

這裡路由層更有趣的用法是路由 DSL,它讓你將多個模型組合成單一次呼叫,而不是為整個應用程式挑選一個模型。拆分夜間工作:便宜的模型負責分類與擷取,GPT-6.1 Sol 處理推理與驗證步驟,而 Qwen3.8-Max 則保留給那些其長時間深思與 GPQA 等級的科學能力確實能改變答案的任務。自動容錯移轉涵蓋其餘部分——如果供應商在執行中途效能下降,請求會轉移,而不是讓整批失敗。

這兩者都不是挑選模型的理由。它們恰恰是你不必一旦做出選擇就得與之長相廝守的原因。

通話,以及值得關注的事

只有在深思熟慮值得時,才支付那 7.5 倍。對於通用型夜間工作,GPT-6.1 Sol 每項任務 $0.724 是站得住腳的預設選擇,而一年 $1,690 確有其事。若任務是可檢驗答案的硬科學或職業推理,Qwen3.8-Max 在 GPQA Diamond 上的 0.9283 就值得那些 token——那正是它表現更好的特定強項。

值得關注的是,阿里巴巴是否會重新定價。一個 2.8 倍 token 的模型以 $2.00/$6.00 定價,彷彿 token 才是稀缺資源;但該模型自身的行為卻讓 token 變得充裕。如果輸出費率出現實質變動,本文的計算也會隨之改變,而轉嫁計量器會在同一天讓你看見這件事發生。

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新