
GPT-6 Astra vs Qwen3.8-Max:兩大 Agentic 旗艦模型與各自的細則條款
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
2026年9月有兩則關於「代理型旗艦」的報導,主角分別是 GPT-6 Astra 與 Qwen3.8-Max。OpenAI 於9月3日推出 GPT-6 Astra,宣稱它是全球電腦操作、軟體工程、科學與網路安全方面最強的模型;阿里巴巴的 Qwen3.8-Max 自8月3日起上市,是中國最強實驗室的代理型旗艦——這個模型被 Artificial Analysis 在代理指數中列為業界頂尖,同時也是開放生態系統裡最接近前沿自主工作宣稱的競爭對手。兩者都確實很強,但也都以亮眼的頭條數字行銷,而這些數字經不起檢視:當 ARC Prize 用自身中立的測試框架評測時,OpenAI 的 99.9% ARC-AGI-3 成績降至 62.7%;Qwen3.8-Max 的代理表現出色,卻伴隨獨立測得的幻覺退化,而且習慣於對前代只需14輪就能完成的任務,花上64輪、超過1美元。這是兩款模型的比較,也是兩種看待基準測試方式的比較。
這兩個標題
OpenAI 對 GPT-6 Astra 的賣點是廣度加上自主性:單一模型能驅動瀏覽器、撰寫與修復程式碼、執行科學分析,而且——獨特之處——能找出新穎的安全漏洞,而且程度足以讓 OpenAI 在「準備框架」(Preparedness Framework)下將整個模型評為「重大」,並將最強大的設定限制給經審核的合作夥伴。發表資料宣稱在 ExploitBench 上獲得完美的 100%,在 FrontierMath Tier 4 得到 97.6%,在 GPQA Diamond 得到 96.0%,並取得 ARC-AGI-3 的飽和分數。阿里巴巴對 Qwen3.8-Max 的賣點則較狹窄但明確:這是一個定價 $2/$6 的智能體主力,在獨立智能體評測中名列前茅或接近頂尖,而且底層權重以自訂授權公開,而非鎖在黑箱之中。
獨立記分板顯示的內容
Artificial Analysis 目前對 GPT-6 Astra(max)的 Intelligence 評分為 61——在其追蹤的 202 個模型中排名第 8——而 Qwen3.8-Max 的 Intelligence 為 58,排名第 24。這三分的差距比價格差距更小,也比兩家廠商各自的行銷宣稱更小;在 AA 另一套 agentic 指數中,Qwen3.8-Max 拿下 58 分,已與專有前沿模型中表現最佳者並駕齊驅,而 AA 迄今根本尚未發布 GPT-6 Astra 的 agentic 指數。誠實的解讀是:就純粹的實測智能而言,這兩者是近鄰;OpenAI 發表材料中「世上最智慧的模型」的說法,並非 AA 獨立評估所呈現的結果。
• 智能 — GPT-6 Astra (max):AA Intelligence 61,排名第 8/202。Qwen3.8-Max:AA Intelligence 58,排名第 24/202;AA Agentic 58。
• 定價 — GPT-6 Astra:每 1M 為 $10.00 / $50.00,快取讀取 $1.00,超過 272K tokens 的輸入以 2× 計費。Qwen3.8-Max:每 1M 為 $2.00 / $6.00,快取讀取 $0.25。
• 上下文 / 輸出 — GPT-6 Astra:1.05M 輸入 / 128K 輸出。Qwen3.8-Max:1M 輸入 / ~128K 輸出。
• 智能體證據 — GPT-6 Astra:ARC-AGI-3 99.9%(OpenAI 評測框架)對比 62.7%(ARC Prize 標準評測框架);WANDR 0.682 @ $11.98/任務(Perplexity 報告)。Qwen3.8-Max:AA GDPval 1,739 Elo(64 回合/任務,約 $1.14/任務);Code Arena WebDev 第 1 名,1,691 Elo。
• 獨立警示信號 — GPT-6 Astra:尚未出現在 ChatGPT 的模型選擇器中,API 採分階段釋出,且在可監控性上做出讓步。Qwen3.8-Max:與前一代相比,AA-Omniscience 的幻覺率從 23% 惡化至 40%。
• 權重 — GPT-6 Astra:專有。Qwen3.8-Max:Max 級檢查點(Qwen3.8-2.4T-A95B)自 8 月 12 日起以自定義許可證公開;AA 仍將其託管的旗艦模型列為專有。

註解版細則
先看 ARC-AGI-3 的數據,因為它是說明一個數字如何既真實又誤導人的最清晰例子。OpenAI 報告 GPT-6 Astra 在自己提供者適配器的測試框架上達到 99.9%——這是一個專為該模型調校的設定。維護該基準的 ARC Prize,在提供者中立的標準測試框架上運行 GPT-6 Astra,測得 62.7%。兩者都是當前最先進的成績;但沒有一項是 99.9%,而且都不是在模型製造商無法控制的框架上取得。同樣的謹慎態度也適用於 Perplexity 的 WANDR 分數 0.682——這是 Perplexity 記錄過的最高分,但測量它的公司同時也在將 GPT-6 Astra 整合到自己的產品中,因此帶有商業利害關係。這個模式值得點明:OpenAI 最驚人的數字,全部來自 OpenAI 或其合作夥伴控制的測試框架;而唯一完全獨立的數字——AA 的 Intelligence 61——只是優秀而已。
Qwen3.8-Max 的細則卻是另一回事:其優勢是獨立實測的,其弱點同樣也是獨立實測的。1,739 Elo 的 GDPval 分數貨真價實——但 Artificial Analysis 的測試顯示,Qwen3.8-Max 是靠每項任務耗費 64 個回合、約 1.14 美元才達到此分數;而前一代只需 14 個回合、0.53 美元。這是一筆「努力稅」:該模型用推理 token 換取其代理能力的天花板,對任何按 token 付費的人來說都事關重大。此外,AA 的 Omniscience 評估也測得,相較前一代 Qwen,幻覺率從 23% 惡化到 40%——這是一個真正的獨立警訊,而且恰好針對的正是自主、多步驟的工作負載;在這些負載中,一個講得信心滿滿的錯誤答案,代價最為高昂。一個會在 64 回合中把自己繞進錯誤的模型,放手部署時未必比另一個其製造商承認可監控性已然下降的模型更安全。

價格、部署,以及如何誠實地選擇
在價格上完全沒有懸念:Qwen3.8-Max 每百萬個 token 收費 $2.00 / $6.00,分別是 GPT-6 Astra 輸入價格的五分之一與輸出價格的八分之一,且配備 1M token 的上下文,沒有 Astra 的長提示詞附加費。在可部署性方面,Qwen3.8-Max 本週還多一項優勢——今天就能呼叫,並已以阿里巴巴的牌價在 OrcaRouter 上線,零加價直通、具備自動故障轉移。GPT-6 Astra 仍在逐步推出,截至 9 月 4 日大多數使用者尚無法在 ChatGPT 中選用,但可透過 OpenAI 自家 API 與主要雲端市集存取,開放範圍正逐步擴大。對於打造 agentic 管線的團隊,務實的做法是將工作負載放在今天就能呼叫的模型上,並把另一個當作值得觀察的基準。如果你想驗證「agentic」的宣稱,而不是照單全收,路由層正是適合的工具:Qwen3.8-Max、Kimi K3、Grok 4.6 及其他 200 多個模型,在 OrcaRouter 上都可透過單一金鑰存取,而且路由 DSL 能把其中數個模型組合成單一呼叫——如此一來,你可以用自己的任務套件與這些競爭者比試,親自判讀結果,而不必在兩家廠商的細則之間做取捨。
這場對戰持續提出的兩個問題
為什麼 OpenAI 對 ARC-AGI-3 回報 99.9%,而 ARC Prize 測得的是 62.7%?因為它們不是同一套測試。OpenAI 的 provider-adapter 測試框架是該基準的一個版本,針對 GPT-6 Astra 在生產環境中的呼叫方式所配置;ARC Prize 的標準測試框架則是中立的配置,目的是公平比較任何模型。62.7% 的結果才是能推廣到「如果我自己呼叫這個模型會怎樣」的那個數字,而且它仍然是 ARC Prize 在該測試框架上記錄到的最高分。
Qwen3.8-Max 是開放權重的嗎?部分是,但授權條款中有但書。阿里巴巴在 8 月 12 日以自訂授權發布了 Max 級別的檢查點 Qwen3.8-2.4T-A95B——權重可以下載,但它不像較小的 Qwen3.8-27B 那樣具備 Apache-2.0 風格的開放性,而且 Artificial Analysis 仍將所託管的旗艦模型列為專有。如果你的需求是「我能執行我所付費的那個確切模型」,那麼這個區別就很重要;如果你的需求是「我能檢視架構並自行託管一個相近的變體」,那麼 Qwen3.8-Max 符合條件,而 GPT-6 Astra 則不符合。
重點
若你需要只有 GPT-6 Astra 目前能獨自辦到的特定事項——攻擊性安全工作、前沿科學推理、最困難的自動化電腦使用任務——且你的組織能通過其准入門檻並負擔得起其價格,那就選擇 GPT-6 Astra。若你想要一個頂級的代理型模型、而且能在本週以 $2/$6 實際部署,以開放權重作為逃生門,並有如今你已知要測試的幻覺迴歸問題,那就選擇 Qwen3.8-Max。更廣泛的教訓正是那些小字細則:在 2026 年 9 月,兩大領先的「代理型」旗艦皆以雙方都無法完全掌控的標題數字銷售;理性的買家會研讀測試框架、計算回合數,並在選邊之前先執行自己的任務。

本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
