一張為 Solar Mini 4 生成的主視覺標題卡,標題為「Solar Mini 4 — 獨立運行」,副標題為「智慧指數 24,且每項任務成本約為 GPT-6 Luna 的五倍」,並有兩個徽章寫著「2026年9月22日發佈」和「首次第三方評估,2026年9月30日」。
Guides & Insights

Solar Mini 4 在 Artificial Analysis Index 上獲得 24 分——但每項任務的成本是 GPT-6 Luna 的五倍

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Solar Mini 4 每個輸入 token 的收費與 GPT-6 Luna 相同,但實際完成一項工作的成本大約是其五倍。這就是 Upstage 新模型首次獨立評估的全部故事,而這並不是發布資料所講述的故事。Solar Mini 4 於 2026 年 9 月 22 日上線,是一個 350 億參數的稀疏混合專家模型,每個 token 啟用約 30 億個參數,定價為每百萬輸入 token 0.10 美元、每百萬輸出 token 0.40 美元。OpenAI 的效率層級 GPT-6 Luna 定價為 0.10 美元與 0.50 美元,而超過 272,000 token 的長上下文層級,兩者價格大約翻倍。在價目表上,它們看起來像是同一筆採購。在 Artificial Analysis 的 Intelligence Index 上,兩個模型都跑過同一套十項評估,Solar Mini 4 每完成一項任務花費 0.36 美元,而 GPT-6 Luna(max)為 0.07 美元——相差 5.4 倍,這完全來自兩個模型在任務過程中的行為方式,而不是它們對 token 的收費。

2026 年 9 月 30 日,Artificial Analysis 發表了對該機型的評測文章,該機型在 Intelligence Index v4.3.2 上獲得 24 分。本文中所有歸屬於 Artificial Analysis 的內容,都是該機構自身的量測結果;所有歸屬於 Upstage 的內容,則是供應商的主張。這個區別在這裡比平時更為重要,因為這兩組數字並不總是相符。

獨立運行實際上是怎麼說的

A scoreboard titled 'Solar Mini 4 — the scoreboard' with the rows: Intelligence Index 24.05 against a median of 12; Cost per index task $0.36 against GPT-6 Luna (max) at $0.07; Rate card $0.10 in / $0.01 cached / $0.40 out per 1M; Output per index task 88,300 tokens, 71,600 of them reasoning; Output speed 204 tokens per second and 430 seconds per index task; Context Upstage says 512K while Artificial Analysis lists 1.05M; Weakest result Terminal-Bench 4.0 at 1%.

Solar Mini 4 在 Intelligence Index 上拿下 24.05,而同價位推理模型的中位數為 12。這使其在同量級中遠高於平均,而 Upstage 自家的說法——「在 Artificial Analysis Intelligence Index 比較中,3B 活躍參數模型裡總分最高」——在這一點上經得起獨立測試的驗證。同樣啟用 3B 參數的 Qwen3.6 35B A3B,在同一指數上得分 18.2。活躍參數為 4B 的 K2 Horizon MoVA 36B A4B 得分 25.3——而且是在更短的上下文下達成,524K tokens,對比 Solar Mini 4 的 1.05M。面對七月發布、擁有 9750 億參數的開放權重 MoE 模型 Inkling,Solar Mini 4 拿下 24.1,對上 25.0——與一個規模將近其三十倍、每百萬 tokens 收費 $1.00/$4.00 的模型僅相差一分。

那個分數裡的輪廓並不均勻,而不均勻正是有用的部分:

• 長上下文推理是其相對優勢。Solar Mini 4 在 AA-LCR v1.1 上獲得 83%,與 MiniMax-M3 和 GPT-6 Luna(max)持平,並領先同為 81% 的 Gemini 3.8 Flash(high)與 GPT-6 Astra(max)。

• 科學程式編寫表現依然出色。 在 SciCode 上達到 48%,領先 MiniMax-M3 與 Inkling(xhigh)一分。

•代理式編碼徹底崩潰。 在 Terminal-Bench 4.0 上僅 1%。不是「偏弱」——就是 1%。而在 AutomationBench-AA 上,該測試跨越真實 SaaS 應用執行多步驟工作流程,成績為 22.3%。

• 知識準確度偏低,但模型知道自己在猜測。AA-Omniscience 回傳 −11,準確率 18%;面對提問時,該模型對其中一半的問題選擇不作答。其非幻覺率為 64%,大幅領先 Inkling(xhigh)的 32% 與 GPT-6(max)的 23%。一個有一半時間說「我不知道」、而實際作答時有三分之二機率答對的模型,與一個自信地胡編亂造的模型,是截然不同的工具。

在代理式知識工作上,GDPval-AA 的成績為 1072 Elo,AA-Briefcase 則為 872 Elo,兩者皆接近 Inkling(xhigh)。

五倍數,拆解開來

Artificial Analysis 的每項任務成本數據,將會決定大多數採購會談的走向,而這個數字值得被當作細部拆解來解讀,而非被當作一句頭條標語來引用。背後有兩項因素在推動它。

首先,用量。Solar Mini 4 在每個 Intelligence Index 任務中約輸出 88,300 個輸出 token;其中 71,600 個是推理 token。以每百萬個輸出 token 0.40 美元計算,這大約是帳單中的 0.035 美元——便宜,因為輸出本身很便宜。它反而付出的是時間成本:在實測每秒 204 個 token 下,Artificial Analysis 記錄到平均每個 index 任務需花 430 秒,約 7.2 分鐘。GPT-6 Luna(max)每任務輸出 50,000 個 token,速度為每秒 127 個 token,耗時 396 秒。Inkling(xhigh)是一個有 9,750 億個參數的開放權重模型,輸出 34,700 個 token,並在 169 秒內完成。Solar Mini 4 比兩者都慢,但這個差距與五倍的成本落差毫無關係。

第二——而這就是整個關鍵——快取寫入輸入。Artificial Analysis 的成本拆解把 Solar Mini 4 每項任務 $0.36 中的約 $0.30 歸因於寫入提示快取的 token,相較之下快取讀取為 $0.03、輸出為 $0.035,而真正未經快取的輸入則只是個捨入誤差。對 GPT-6 Luna(max)而言,快取寫入是 $0.068 中的 $0.012——約占帳單的 17%,而 Solar Mini 4 則占 82%。快取輸入是 Upstage 價目表上最便宜的一項,每百萬 $0.01,而 Artificial Analysis 的模型確實會用到它;問題在於在能被讀取之前,必須先寫入多少。一個每一輪都重新傳送不斷增長對話的代理,支付寫入成本的頻率遠高於一個以簡短、封閉的一輪來回答的模型。

那是值得帶進正式環境的發現:對這樣的模型而言,每個 token 的價格幾乎無法預測每項任務的帳單。快取行為則能。

Upstage 自身數據有差異之處

A screenshot of Upstage's Console documentation page for Solar Mini 4, showing the Intelligence, Speed and Price gauges, the '$0.10 / 1M tokens' input rate, the description of a cost-efficient compact language model at 35B total and 3B active parameters built for agentic use cases, English, Japanese and Korean language support, tool calling, a 128K max output, the platforms Upstage Console and on-premises, and the version string solar-mini4-260922 with a training data cut-off of February 2026.

Upstage 於 2026 年 10 月 1 日發布、標題為「Solar Mini 4: Built for High-Volume Agent Workloads」的發布文章,指出其在 Artificial Analysis Intelligence Index 上取得 24.1 分——數字實際上並無二致——並提出若干說法,而這些說法只是與獨立數據並列,而非凌駕於其上。

廠商在 AutomationBench-AA 上引用 22.3%,與 Artificial Analysis 完全吻合;在 τ³-Banking 上則引用 47.2,該基準測試評估政策與工具使用,後來已遭該指標套件移除。其報告在 AA-LCR 上為 83.3%,在 SciCode 上為 47.6%,兩者與獨立數據的差距都在四捨五入誤差範圍內。在 Humanity's Last Exam 上,其報告為 19.6%,而 Artificial Analysis 頁面則對同一模型列出 25.8%;在一個以波動劇烈著稱的評測中,這兩者都是合理的讀數,但它們並非相同數字,也不應將其一當作另一者來呈現。

兩條規格項目也互相矛盾。Upstage 的文件記載的是 512K 個 token 的上下文視窗,輸出 token 最多可達 128K。Artificial Analysis 則列出 1.0M 個 token 的上下文視窗,以及 262K 的最大輸出。Upstage 的部落格明確表示,512K 這個數字是實際出貨時所承諾的規格;這種差異正是值得先拿 API 回應來釐清的那類問題,之後才有人會據此建立檢索管線。

供應商也做了唯一一項它能以自己的標準進行的比較:一項內部測試,涵蓋三項韓語代理任務,每個模型各執行三次;在其中,完成 1,000 組三任務套件,使用 Solar Mini 4 的預估成本為 $1.25,使用 MiMo-V2.5 則為 $2.20。那是供應商自行執行、以供應商自選任務進行的測試,且排除了延遲,而其結果指向與 Artificial Analysis 結果相反的方向。它並沒有錯——不同任務會考驗不同的 token 預算——但它是行銷數字,而該模型公布的上市折扣,則是另一個讓你重新跑自己的數字、而非採用任何人數字的理由。

定價,根據 Upstage 即時主控台文件:每百萬輸入 token 為 $0.10,每百萬快取輸入 token 為 $0.01,每百萬輸出 token 為 $0.40,目前宣傳的上市優惠為 50% 折扣,至 2026 年 10 月 22 日 UTC 止,這使得有效費率在那之前為輸入 $0.05、快取輸入 $0.005 與輸出 $0.20。

如果你是付款的一方,這代表什麼意思

Solar Mini 4 有趣的地方不在於它是個糟糕的模型。而在於它是一個真正優秀的小型模型,其經濟效益主要由費率表無法呈現的行為所主導。在三個活躍參數下於指數上拿到 24 分,是一項實實在在的工程成果,而韓語工作負載——該模型宣稱的強項之一,與英語和日語並列——正是這項成果最可能值回票價的地方。

麻煩的地方在於第一次呼叫之後的所有下游環節。冗長的助理回覆、低落的快取重用率,再加上每跑一次索引就要花七分鐘解碼的任務,加總起來的數字跟 $0.10/$0.40 完全不像。如果你正在評估它,誠實的實驗應該是針對你自己的實際工作負載,做每完成一項工作的成本測試,並以你的正式環境技術堆疊實際會採用的方式啟用提示快取——而不是比較 token 價格。

這也是路由器之所以存在要解決的一類問題,也是 OrcaRouter 以 0% 加成將供應商定價原樣傳遞的原因,因此廠商價格一有變動,當天就會反映到你的帳單上。我們不路由 Upstage 的模型,所以 Solar Mini 4 和 Solar Pro 4 都無法透過我們取得——它們來自 Upstage 自家的 API 與第三方平台。我們路由的是這項比較的另一半:GPT-6 Luna、Qwen3.8-Max、Qwen3.8-27B、Qwen3.8-Flash,以及單一金鑰背後的 200 多個其他模型,這正是讓同一項任務同時保留一個便宜模型和一個昂貴模型變得實際可行的原因,並交由自動容錯移轉與逐請求路由來決定由哪一個來回答。當兩個模型之間的差異是任何價目表都無法揭示的五倍每任務成本差距時,能在單一請求之間切換的能力,比任何基準測試表格都更重要。

A screenshot of the Artificial Analysis article dated September 30, 2026, headlined 'Korean AI Lab Upstage has released Solar Mini 4 which scores 24 on the Artificial Analysis Intelligence Index, but costs ~5x as much per task as GPT-6 Luna (max) despite similar per-token prices'. The visible key-results text covers the 3B-active Pareto claim, the 6-point lead over Qwen3.6 35B A3B at the same active size, 83% on AA-LCR v1.1 matching MiniMax-M3 and GPT-6 Luna (max), 48% on SciCode, and fast output at 208 tokens per second with slow tasks.

長話短說:Solar Mini 4 是 Artificial Analysis 為活躍參數低於三十億的模型所標出的新帕雷托點,而它每完成一項任務的成本,大約是輸入標價相同之模型的五倍。這兩種說法都成立,而真正會出現在發票上的,是第二種。