
Solar Mini 4 vs Solar Pro 4:相同的上下文視窗,價格卻是三倍
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
Upstage 目前這兩款 Solar 模型,在買家通常最先查看的每一個規格面向上,都共用同一份規格表。2026 年 9 月 22 日發布的 Solar Mini 4,以及 2026 年 8 月 6 日發布的 Solar Pro 4,兩者都接受 512,000 個詞元的上下文,都能輸出最多 128,000 個詞元,都涵蓋英語、韓語和日語,而且訓練資料都截至 2026 年 2 月。差別在於,Solar Pro 4 的定價是 Solar Mini 4 的三倍——每百萬輸入詞元 0.30 美元對上 0.10 美元——而且 Solar Pro 4 有公開的獨立基準測試分數,而才問世一天的 Solar Mini 4 則完全沒有。這意味著,這項比較所回答的問題並不是「哪一個更好」,而是你付了三倍價錢換來的東西,是否正是你的工作負載所欠缺的。
兩個折扣計時器同時運作
先談價格,再談能力——因為目前這兩款機型處於不同的促銷時程,而算下來的數字比標價所暗示的還要離奇。
Solar Mini 4 於 9 月 22 日推出,並提供五折優惠至 2026 年 10 月 22 日,這使其目前費率為每百萬個 token:輸入 $0.05、快取輸入 $0.005,以及輸出 $0.20。Upstage 自家的定價頁面載明,結構化優惠期間為 9 月 22 日 05:00 UTC 至 10 月 23 日 00:00 UTC。
Solar Pro 4 的優惠在 9 月 11 日有所變動,當時 Upstage 將折扣從 90% 調降至 70%——說白了就是漲價,不過該模型的價格仍遠低於牌價。這項優惠持續至 2026 年 10 月 9 日,10 月 10 日起則恢復標準定價。優惠期間,Solar Pro 4 的價格為輸入 $0.09、快取 $0.018、輸出 $0.36。
所以從現在到 10 月 9 日的大約兩週內,兩個模型之間的差距是 1.8 倍,而非 3 倍:輸入為 $0.09 對 $0.05,輸出為 $0.36 對 $0.20。10 月 9 日之後,Solar Pro 4 恢復為 $0.30 和 $1.20,而 Solar Mini 4 則維持折扣價直到 22 日。22 日之後,兩者都恢復原價,差距就是完整的 3 倍。

由此可得出三項結論。如果你要將兩者相互做基準測試,請在 10 月 9 日之前進行,因為那時較便宜機型的優勢最小,而且你衡量的是能力而非價格。如果你正在為 11 月開始的正式上線編列預算,請採用定價,因為屆時兩項促銷都已經結束。而如果你正規劃在兩者之間進行移轉,要知道交叉點是一個日期,而不是某種工作負載。
這兩個模型真正差距懸殊的唯一地方
獨立評估正是 Solar Pro 4 證明其等級之處,而 Solar Mini 4 尚無法回答這個問題。
Artificial Analysis 在 Intelligence Index 上給 Solar Pro 4 評了 42 分,比 Solar Pro 3 的 14 分躍升 27 分,而且這些進步正好集中在旗艦模型應該勝出的地方。Terminal-Bench v2.1 從 12% 提升到 57%。AA-LCR,這項長上下文推理評估,從 31% 提升到 71%。τ³-Banking 從 9% 提升到 23%。在 GDPval-AA v2 上,該評測以人類 Elo 基準 1000 衡量真實世界代理式任務,Solar Pro 3 得分 498,Solar Pro 4 得分 1277。這些都是第三方數據,由 Artificial Analysis 發布,不是廠商數字。

同一份評測也坦誠說明了這項改進的代價。Solar Pro 4 完成一項平均 Intelligence Index 任務需時 8.6 分鐘,而 Solar Pro 3 為 6.0 分鐘,儘管它使用的輸出 token 少了大約 17%——每項任務 43,000 個,對比 52,000 個。它的 token 效率更高,但以實際耗時而言更慢。而它的 AA-Omniscience 分數從 −53 提升到 −1,主要是靠拒答:它只嘗試回答 41% 的問題,而 Pro 3 為 92%;雖然它的幻覺率從 88% 降至 24%,準確率卻幾乎沒有變動,從約 17% 到 19%。一個透過拒絕回答來提升誠實分數的模型,對代理工作而言是真正的改進——自信的錯誤答案比拒答代價更高——但這並不等同於懂得更多。
Solar Mini 4 沒有對等評測。沒有 Intelligence Index,沒有 Agent Arena 排名,沒有第三方代理式評估,也沒有 Upstage 提供的基準測試表。唯一流通的數字,是某個社群封裝套件自我回報的 test400 跑分,並由另一個模型擔任評審;在該測試中,Solar Mini 4 拿下 98.4% 的欄位準確率,平均呼叫時間為 1.21 秒。那只是某位開發者用自己的實作架設的測試框架,可作為初步訊號,卻無法當成採購依據。
3B 活躍參數能換來什麼,以及換不來什麼
在這組配對中,參數揭露是最清楚的意圖表態。Solar Mini 4 總參數量為 35B,每個 token 啟用 3B。Solar Pro 4 的參數數量則未公開。
3B 的活躍比例是一項服務經濟學的決策,而非能力宣稱。這代表模型儲存了 35B 的權重,但每個 token 只進行 3B 的運算量,這正是 Upstage 能將 512K 上下文的模型定價為每百萬輸入 token 0.10 美元的原因。Solar Pro 4 定價 0.30 美元則告訴你,它每個 token 做了更多運算;Upstage 不公布這個數字,則告訴你它不希望這項比較以算術方式進行。
真正區隔兩者的,根據已公開的證據來看,是模型被要求完成的任務有多困難,而不是交給它的文件有多大。Solar Mini 4 發表時搭載 512K 上下文與最高 128K 輸出——與旗艦機種相同的數字——因此長文件情境並非分級界線所在。界線落在多步驟的代理式工作上:Terminal-Bench、τ³-Banking 與 GDPval 的數字,才是 Solar Pro 4 的價格所換得的東西,而它們衡量的任務需要在多輪對話中進行規劃、呼叫工具,並從錯誤中復原。
有個但書值得先說清楚,因為這種事往往會在專案進行到一半時讓人栽跟頭。Upstage 的模型歷史列出 Solar Pro 4 具備 512K 上下文與 128K 最大輸出。Artificial Analysis 對同一款模型的文章則列出 384K 上下文視窗與 256K 最大輸出——同樣的上限與下限,卻對調了。兩個來源都具公信力,但說法不一致。如果你要在接近上限的情況下調整提示詞大小,請以 API 回應為準來驗證,而不是任一份文件,因為這兩份已公布的數字無法調和。
在管線中,每一個各自所屬的位置
看待這兩個模型的實用方式,是把它們當成同一組層級搭配,而不是互為替代方案;這大致也是 Upstage 為它們所做的定位。Solar Mini 4 是預設選擇:擷取、分類、長文件的結構化輸出,以及百萬次低成本呼叫即為工作負載的高頻循環。Solar Pro 4 則是升級選項:必須規劃、使用工具、從失敗步驟中復原,並且仍然完成任務的代理執行。
只要便宜層級是正確選擇,這種拆分的經濟帳就毫不留情地偏向便宜層級。Solar Mini 4 在促銷期間以輸入 $0.05、輸出 $0.20 的價格,比 Solar Pro 4 的促銷價便宜五到六倍,按定價計也便宜三倍。如果你的用量有 90% 是擷取、10% 是代理式工作,把這 90% 導向較低層級所省下的成本,會比任何提示詞最佳化都多。失敗模式是錯誤路由——把代理式工作送給小型模型,結果要付兩次代價:一次是浪費掉的呼叫,一次是在昂貴模型上重試。
這種錯誤路由的風險,正是為什麼這首先是個量測問題、其次才是定價問題,而這也正是路由層派得上用場之處。把產品界線講明白:OrcaRouter 不路由任何 Upstage 模型,因此 Solar Mini 4 和 Solar Pro 4 都無法透過我們取得——兩者都來自 Upstage 自家的 API 以及幾個第三方平台。這個平台的用途,在於這組搭配所形成的模式:一個便宜層級與一個昂貴層級、一條決定哪些流量該往哪裡去的規則,以及自動容錯移轉,在較小的模型出錯、或回傳你的解析器拒收的內容時,把呼叫升級到較大的模型。在我們確實有路由的那 190 多個模型中,這種分層只需設定一次,而不必接線進每一個呼叫端。如果你同時運行兩個 Solar 層級,對應的邏輯存在於 Upstage 自家的主控台裡,而值得你仔細閱讀的部分,就是那些決定何時升級的環節。

該怎麼處理它們
如果你今天必須二選一,只有在你的工作屬於基準測試所衡量的那種特定意義上的代理式——多步驟、會使用工具、能自我修正——時,才選擇 Solar Pro 4。那正是那 3× 所換來的價值,也是已公開證據中唯一能清楚區分兩者的面向。至於其他一切,Solar Mini 4 提供相同的上下文視窗、相同的輸出上限、相同的三種語言,以及更低的價格;而對它最誠實的質疑,並非它不夠強,而是 Upstage 以外還沒有人實測過它。
最後那一點就是整個決定的核心,而且它還附帶一個期限。Solar Mini 4 的促銷活動持續到 10 月 22 日,Solar Pro 4 的則到 10 月 9 日,所以能用便宜價格比較兩者的時機就是接下來兩週。在任一期限截止之前,以促銷價格、用你自己的驗收標準,把兩者都跑在你的實際流量上。Solar Mini 4 的獨立基準測試終究會出現,而當它們出現時,只會告訴你它在別人的任務上表現如何,那是個不同且較不有用的答案,比不上你這個月花幾美元就能買到的答案。
