
GPT-6 Astra 對決 Solar Pro 4:十二個指數點,以及一個會在週日變動的價格比率
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
在這組模型共同擁有的兩項獨立執行的評測中,GPT-6 Astra在一般知識上以大幅差距領先Solar Pro 4,而在模型實際被投入使用的場景中,領先幅度則較小。Artificial Analysis 在其 Intelligence Index 上給 GPT-6 Astra 54.7 分,在 GPQA Diamond 上給 96.1 分;同一評測機構則給 Solar Pro 4 42 分與 86.8 分。在代理式工作上,差距在 Terminal-Bench 2.1 與 τ²-Banking 上分別壓縮到十一分與六分。與此同時,價格方面的消息帶著一個幾乎沒有人注意到的期限:Solar Pro 4 目前的促銷活動於 UTC 2026 年 10 月 11 日星期日 00:00 結束,屆時該模型的價格將從每百萬輸入 token 0.09 美元調升至 0.15 美元,並從每百萬輸出 token 0.36 美元調升至 0.60 美元。因此,這項比較必須回答的問題並不是哪個模型更好,而是大約十二點五分的能力差距,是否值得付出 42 到 139 倍的輸出價格,而這個答案取決於你的工作負載,而非任何一個模型。
費率卡,包括這週末會變動的那一張
Solar Pro 4 的定價為每百萬個 token 輸入 0.30 美元、快取輸入 0.06 美元、輸出 1.20 美元,而 Upstage 自推出以來一直以低於定價的價格提供。Upstage 自家定價頁面上的價目表已清楚載明,因此不需要猜測該以哪個數字來編列預算:
• Upstage 促銷至 2026 年 10 月 11 日 00:00 UTC — 每 1M tokens $0.09 輸入、$0.018 快取、$0.36 輸出br /> • Upstage 促銷自 2026 年 10 月 11 日起 — 每 1M tokens $0.15 輸入、$0.03 快取、$0.60 輸出,未列出結束日期,因此需據此編列預算br /> • Upstage 定價 — 每 1M tokens $0.30 輸入、$0.06 快取、$1.20 輸出br /> • GPT-6 Astra 最高 272,000 輸入 tokens — 每 1M tokens $10.00 輸入、$1.00 快取、$12.50 快取寫入、$50.00 輸出br /> • GPT-6 Astra 超過 272,000 輸入 tokens — 每 1M tokens $20.00 輸入、$2.00 快取、$25.00 快取寫入、$75.00 輸出,一旦超過門檻即套用至整筆請求
若以倍數解讀,在 Solar Pro 4 的促銷後費率下,輸入端是 11×、輸出端是 5.6×;對照其定價則是 33× 和 42×;若以兩款模型今日的促銷價格來衡量,則是 111× 和 139×。差距之所以這麼大,是因為這個分數的兩邊都在變動:Astra 的價目表位居市場最高端,而 Solar Pro 4 目前則接近市場最低端。
長上下文規則是另一條值得再讀一次的規則,因為它們並不對稱。Astra 的門檻位於 272,000 個 token,而其規則是整筆請求重新計價——長請求中的每一個 token 都以雙倍輸入與 1.5 倍輸出計費,而不只是超過界線的那些 token。Upstage 的價目卡沒有相應的級距,因此一筆 400,000 個 token 的 Solar Pro 4 請求,與一筆 4,000 個 token 的請求,每 token 費率完全相同。如果你的提示詞經常超過 25 萬個 token,Astra 的有效輸入費率會是 $20.00 而非 $10.00,而你付出的差距,會在 512K 上下文模型正好競逐的那類工作負載上進一步擴大。
十二個百分點的差距從何而來
兩款模型都有第三方數據,因此這次比較比這個層級中的大多數都更容易。它們之間的趨勢一致:Solar Pro 4 相較於自家前代的提升集中在代理型任務上,而這也是它最接近 Astra 的地方。
• 智慧指數 — GPT-6 Astra 54.7,Solar Pro 4 42br /> • GPQA Diamond,研究所程度的科學 — Astra 96.1,Solar Pro 4 86.8br /> • Terminal-Bench 2.1,操作真實終端機 — Astra 88.4,Solar Pro 4 75.1br /> • τ²-Banking,工具使用與政策遵循 — Astra 41.4,Solar Pro 4 35.0br /> • 長上下文召回,AA-LCR — Astra 80.7,Solar Pro 4 71br /> • 執行平均評估任務的成本 — Astra $0.0516,Solar Pro 4 介於 $0.0039 與 $0.0155 之間br /> • 每個評估任務的實際耗時 — Astra 約 8.6 分鐘,在每秒約回傳 70 個 token 的模型上
「單次任務成本」這條線,才是重新界定這場爭論的關鍵。在 Solar Pro 4 上執行單一高難度評估任務,依適用哪一級促銷方案而定,成本介於四到十三美分之間;相較之下,Astra 在標準費率下只要五美分。「輸出價格是四十二倍」和「每個任務成本是十三倍」這兩種說法,對同一組模型而言都成立,而後者才是會出現在帳單上的數字。差別在於:根據 Artificial Analysis 的測量,Astra 得出答案所需的 token 數比 Solar Pro 4 的前代更少——每個任務 43,000 個輸出 token——但用它完成一個任務仍然比較貴,只是遠遠不到 42 倍那麼多。
關於 Solar Pro 4 這一欄,有兩點但書。即使它使用的 token 較少,以每項任務的實際耗時來看,它仍比 Astra 慢;而且它公布的代理任務分數附帶一個值得留意的具體細節:在其前代產品的評估中,它的誠實分數之所以提升,主要來自拒絕作答——它只嘗試回答了 41% 的題目,而 Pro 3 為 92%。對於必須採取行動的代理而言,拒絕往往勝過自信的錯誤答案——但這會改變你解讀任何通過率比較的方式。

兩家廠商的顯示卡都無法給你的比較
上方這些基準測試列是相互對應的:雙方跑的是同一套評估。真正有意思的是那些缺席的列,因為這兩家廠商對於該公布什麼內容看法不一。
• 推理強度 — Astra 公開五個具名等級(low、medium、high、xhigh、max);Solar Pro 4 記載了一個 reasoning_effort 參數,至少具備 medium 設定,而 Upstage 關於這套等級階梯的資料相當單薄br /> • 架構 — Astra 的參數量未公開;Solar Pro 4 的參數量同樣未公開,因此雙方都未提供其較便宜的兄弟型號所具備的服務經濟性揭露資訊br /> • 負載下的長上下文行為 — Astra 公布了成本門檻與經記錄的召回分數;Upstage 公布了視窗大小,卻沒有自家的召回評估br /> • 輸入介面 — Astra 接受文字、圖像與檔案;Solar Pro 4 是文字模型br /> • 模態上限 — 雙方皆為最高 128,000 個輸出 token,這對便宜模型而言是罕見的持平之處,也是 Solar Pro 4 規格表中對長文本生成工作最有用的一項規格
推理強度這一項比表面上看起來更重要。一個讓你能調降思考預算的模型,其每個簡單請求的有效價格遠低於它的公告費率,因為你在不需要這些推理 token 的工作上支付了較少的推理 token。兩家供應商都公開這個參數;但兩者都沒有公布各級別在 token 上的成本,這意味著要找出這兩個模型之間真正的倍數,唯一的方法就是在你自己的流量上實測。

直白地說,損益兩平點
先暫時忽略指標分數,並將工作負載固定不變。如果你的應用是針對最多五十萬個 token 的文件進行擷取、分類、摘要或結構化輸出,Solar Pro 4 能以 Astra 無法企及的速率完成工作,而且它完全不需要推理階梯——在 JSON 擷取任務中,任何可能的品質差異都不值得在輸出上付出 42 倍的成本。如果你的應用是長時間跨度、會規劃、呼叫工具、從失敗步驟中復原並必須完成任務的代理,那麼 Terminal-Bench 的十一點差距和 τ²-Banking 的六點差距,就是預測它能否完成的數字,而一次失敗的代理執行,代價是該次執行的全額費用再加上重試。
真正困難的情況在中間:短、難、單次推理任務,其中 Astra 的 GPQA 優勢很大,而每項任務的成本仍只要幾美分。在那裡,決定因素不是價目表,而是 token 數量——而唯一能回答這個問題的測量方式,就是把你自己的提示跑過這兩個模型,並讀取用量。那也是降價衝擊最大的情況,因為被拿來與昂貴模型對測的正是較便宜的模型,而較便宜模型的費率出現 67% 的變動,會改變從週一到今天這場測試的計算。

為什麼這是路由決策而不是採購訂單
GPT-6 Astra 已收錄在 OrcaRouter 的型錄中,代號為 openai/gpt-6-astra,採用 OpenAI 自身的定價表,並以 0% 加價轉供,這正是這類比較最終會歸結為一條規則、而非一紙合約的根本原因。Upstage 的 Solar 系列則是另一種情況,而誠實的說法就是我們一向採用的那句:OrcaRouter 並未轉接任何 Upstage 模型,因此 Solar Pro 4 在此並不可用——它來自 Upstage 自家的 API 以及數個第三方平台,而上述的價格表是他們的,不是我們的。
在這種搭配中,路由器真正的用途在於分層。便宜的模型和昂貴的模型位於同一個相容 OpenAI 的端點之後,由路由規則把抽取流量導向適合它的層級,而自動容錯移轉會在較便宜的模型出錯、或傳回你的解析器拒絕的輸出時,把呼叫升級到更強大的模型。最後那個機制,正是對這項比較所帶來的錯誤路由風險的實際解答:代價高昂的失敗模式並不是選錯模型,而是選錯模型還為此付出雙倍代價。
星期日前要做什麼
如果 Solar Pro 4 是你技術堆疊的候選項目,這會是你測試它最便宜的一週。促銷價格維持到 10 月 11 日 00:00 UTC,促銷後的 $0.15 與 $0.60 價格已經比定價低三分之一,而該模型自己公布的證據——Terminal-Bench 與 τ²-Banking 的數字——描述的是你可以在一個下午內,用自己的任務集重現的工作。用相同提示詞跑這兩個模型,讓推理設定保持不變,並記錄每完成一項任務的 token 數,而不是每次呼叫的 token 數。跑出來的那個數字,才是唯一重要的倍數,而且它不會是 42×。然後再做決定,並要知道:如果較便宜的一方勝出,你測試它時的價格會在星期日到期——而如果較貴的一方勝出,那十二點五個指數點就是你正在付費購買的東西。
GPT-6 Astra 已收錄於 OrcaRouter 的目錄中,型號為 openai/gpt-6-astra,採用 OpenAI 本身的定價,以 0% 加成原樣提供。
