
Solar Mini 4:Upstage 的 3B 活躍參數 Agent 模型,以及它隨附推出的沉默模型
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
Upstage 在 2026 年 9 月 22 日發布了兩樣東西,而第二樣正是讓你值得繼續讀下去、而不只停在第一樣的原因。Solar Mini 4 是那款模型:一個 350 億參數的混合專家檢查點,每個詞元啟用 30 億參數,具備 512,000 詞元的上下文視窗,輸出上限達 128,000 詞元,定價為每百萬輸入詞元 $0.10、每百萬輸出詞元 $0.40。它已在 Upstage Console、Playground,以及地端部署形式上線,沒有預覽標籤,也沒有候補名單。那就是這次發布,而且相當合理。Upstage 同一天推出的另一樣東西是 Solar Jev,一個架構在 Solar Mini 4 之上的決策端點,它完全不生成任何文句——它在單次前向傳遞中回傳一個選擇、一個分數,或附帶機率的是/否答案,而 Upstage 將其輸出詞元的計費設為零。這兩項公告中,有一項是模型發布。另一項則是一個小小的押注:有一類有用的代理工作,並不希望語言模型開口說話。
9月22日實際上著陸的是什麼
Solar Mini 4 的更新日誌條目簡短,而且毫不含糊。新模型,現已推出。Upstage 自己的說法是,為代理式工作帶來成本效益,「當回應速度和成本至關重要」——這正是實驗室想讓你拿它跟價格貴三倍的東西比較、而不是跟前沿模型比較時,會寫下的那句話。

規格表,根據 Upstage 的模型歷史頁面:
• 參數 — 總計 35B,每個 token 啟用 3B。這是一種稀疏混合專家模型,因此你需付出儲存 35B 的成本,但運算時只用到 3B。Upstage 並未細分說明有多少個專家,或它們如何被路由。
• 脈絡 — 512,000 個 token,輸出 token 上限為 128,000 個。這兩個數字都與旗艦型號完全相同,而這是規格表上最耐人尋味的一行。
• 訓練資料截止時間——2026 年 2 月。發佈時已過時七個月,這對這種規模的模型來說很正常,而在你向它詢問任何近期的事情之前,這點值得留意。
• 語言 —— 英文、韓文和日文。Upstage 將其描述為「韓文流利,並具備強大的英文和日文能力」,這對韓國實驗室來說是正確的順序,而且很可能也是這個模型的正確順序。
• 功能——對話、推理、結構化輸出與工具呼叫。推理是與前一代的不同之處:較舊的 solar-mini 模型完全忽略 reasoning_effort 參數,而 Solar Mini 4 則不會。
• 模型 ID — solar-mini4 是別名,目前解析到帶日期的快照 solar-mini4-260922。solar-mini4-preview 這個識別碼也一直在第三方代理工具中流傳;若你正針對一個可能無法存續的預覽字串撰寫路由設定,這點值得留意。
• 可用性 — Upstage Console、Playground 與地端部署。沒有開放權重。Upstage 過去曾發布過開放權重(Solar Open 2 透過 Hugging Face 發布,其 API 服務已於 2026 年 8 月 12 日終止),但關於 Solar Mini 4 沒有任何跡象顯示這是本次的計畫。
Solar Jev 是沒有人會去寫的那個部分
Solar Jev 目前處於 beta 階段,推出一款新的 POST /v1/systemone 端點。你送出一段狀態——一份文件、一行日誌、一張支援單——再加上一串已標明型別的問題,然後會取回從你提供的選項集中挑出的選擇、依評分標準給出的分數,或是是/否的答案,每一項都帶有直接取自模型、經過校準的機率,而非以文字形式寫出。
設計上的結果就是沒有散文。沒有解釋、沒有思維鏈、沒有前言。Upstage 表示每個決策都是一次前向傳遞,而且輸出 token 免費。有了 512K 的上下文視窗,整個狀態——一整份合約、一整份逐字稿——都可以是輸入。
這是一款比初看之下更狹隘的產品,而這種狹隘正是重點。一個什麼都不寫的模型不可能寫出錯誤的東西。如果你的管線目前要求聊天模型回傳 JSON 判定,然後再解析它,而且你花過任何時間防範模型把那段 JSON 包在一句親切的句子裡,那麼 Solar Jev 正是衝著你來的。取捨在於你得到的是一個機率,而沒有推理軌跡,所以當它出錯時,你沒有東西可讀。
值得精確說明 Solar Jev 不是什麼:它不是更小的 Solar Mini 4,也不是你能下載的微調模型。它是架構在 Solar Mini 4 之上的服務端點,可在 Upstage Console 上以 beta 版使用。Beta 才是關鍵詞。
價格是多少,以及折扣的倒數計時
定價為每百萬個輸入 token $0.10、每百萬個快取輸入 token $0.01,以及每百萬個輸出 token $0.40。所有金額均不含 10% 加值稅。
那些標價並不是你今天實際支付的價格。Upstage 正在推出 50% 的首發折扣,其自家定價頁面標示為 2026 年 10 月 22 日(UTC)——該頁面底層的結構化資料則將該期間列為 9 月 22 日 05:00 UTC 至 10 月 23 日 00:00 UTC,這只是同一件事的兩種說法。在該期間內,費率為輸入 $0.05、快取 $0.005、輸出 $0.20。

接下來有兩點。第一,如果你要拿這個跟其他任何東西做成本比較,請用兩個數字來算,因為一個月後就失效的五折優惠不是價格,而是促銷。第二,關於定價水準的背景:前一代 Solar Mini 的定價是每百萬個 token 輸入與輸出皆為 $0.15,上下文為 32,768 個 token,而且完全沒有推理模式。Solar Mini 4 的輸入更便宜、輸出更貴,並提供十六倍的上下文視窗與推理模式。那不是小改款。那是披著同一個名字的另一款產品。
還沒有人測量過的事物
Solar Mini 4 問世才一天,尚無獨立評測。沒有 Artificial Analysis Intelligence Index,沒有 Agent Arena 排名,也沒有第三方代理式基準測試。Upstage 同樣未為它發布任何基準測試表——更新日誌僅列出規格,沒有任何分數。任何人向你引用這款模型的數字,引用的都是別的東西。
目前流通的資料中,恰好有一個帶有第三方性質的資料點,必須謹慎標示,因為它既不是表面上看似的那兩種東西。一個社群儲存庫 hunkim/solar-mini4-jev,將 Solar Mini 4 包裝在與 TypeSafe Jev 決策 API 相容的外觀之後,並發布了它自己的 test400 執行結果,該結果由另一個模型依據明確陳述的評分標準進行評判。在該次執行中,reasoning_effort=none 的 Solar Mini 4 在欄位準確率上得分 98.4%,而包裝器為 94.2%,在 447 個計分欄位中漏掉 7 個,而包裝器漏掉 26 個;它在韓語(98.8%)和英語(98.4%)上都領先;且平均每次呼叫耗時 1.21 秒,而包裝器為 0.38 秒。
就照它的實際情況來解讀。這不是廠商基準測試——Upstage 並沒有發布它。這也不是獨立評估——沒有中立機構執行它,測試框架是競爭對手自己的,而評審是一個模型。這只是一位開發者針對託管 API 與自家封裝層所做的自我報告比較,而誠實的總結是:它是目前唯一可得的訊號,不該單靠它來推動正式環境決策。它確實點出兩件值得你自己測試的事:該模型快到足以供互動使用,以及它的韓文至少和英文一樣強。
如何在不押上整條管線的情況下試用它
一個剛問世一天、又沒有獨立評分的模型,尷尬之處在於:想知道它到底合不合用,唯一的方法就是把真實流量導向它;而要安全地做到這點,唯一的方法就是當它不合用時,有地方可以讓那些流量去。
容錯移轉才是這裡最誠實的答案,而這正是路由層存在的意義。你把 Solar Mini 4 放在某個端點後面,把你已經在跑的模型留作備援,讓路由器在新模型出錯、逾時,或開始回傳你的解析器會拒收的結構化輸出時轉移流量。這樣一來,新模型的第一週就是一場有底線的實驗,而不是一次你得上場辯護的上線。
有一點更正值得直說,因為很容易讓人產生相反的暗示:OrcaRouter 目前並未路由任何 Upstage 模型。Solar Mini 4、Solar Pro 4 和 Solar Jev 可透過 Upstage 自家的 API 及多個第三方平台取得,如果你特別想要 Solar Mini 4,那裡才是你取得它的地方。我們提供的是一組 API 金鑰,適用於我們確實有路由的 190 多個模型;如果你真正想做的實驗是「精簡的代理模型能否勝過我現有的模型」,而不是「這個特定的韓國模型能否勝過我現有的模型」,那這就很有用。這些是不同的問題,而只有其中一個有錯誤答案。

未解決的問題
Upstage 現已在同一份 512K/128K 規格表上,推出了一款緊湊型模型與一款旗艦模型,兩者的定價級距相隔三週,而且它把決策端點放在小型模型上,而非大型模型上。這樣的排序是刻意的:Solar Jev 之所以在 Solar Mini 4 上提供服務,是因為不生成任何文句的決策不需要旗艦級的推理能力,也因為當你要做出上百萬個這種決策時,你會想要那個便宜的模型。
目前還不清楚的是,30 億活躍參數是否足以提供勝任代理式工作所需的推理能力——尤其是涉及的不只是抽取這類任務。Upstage 的行銷文案說它是代理式的。Upstage 的基準測試卻什麼都沒說。在獨立機構對它進行實測之前——而且考量到發布日期,那至少還要好幾週——正確的態度是:用促銷價格在自己的任務上測試它,並設定好備援方案,同時把任何關於其代理式品質的說法,包括廠商自己的說法,都當成一種假設來看待。
