
Solar Mini 4 對比 Gemma 4 12B:一個可下載的檢查點,以及一個可呼叫的模型
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
Solar Mini 4 與 Gemma 4 12B 最簡短而誠實的比較是:其中一個是檔案,另一個是端點。Upstage 的 Solar Mini 4 是擁有 350 億參數的專家混合模型,每個 token 啟用 30 億參數,具備 512,000 個 token 的上下文視窗,且沒有開放權重——你得透過 Upstage Console、Playground,或與供應商安排的本地部署來使用它。Gemma 4 12B 則是 Apache 2.0 授權下的 119.5 億參數稠密檢查點,今天就能下載,在筆電上約 16 GB 的統一記憶體中執行。兩者都是為代理式工作而打造,兩者都接受長文件作為輸入,而且它們不會在你的技術堆疊中爭奪同一個位置,因為其中一個有記憶體帳單,另一個則有 token 帳單。
這種區別之所以會被忽略,是因為這兩個模型在功能清單上看起來很相似。兩者都會推理,兩者都會呼叫工具,兩者都能產生結構化輸出,兩者都能處理英文、韓文與日文。真正決定這個問題的差異在別的地方:凌晨三點系統掛掉時會發生什麼事、你的法遵團隊對資料存放位置有什麼說法,以及你是按 token 計費還是按 GPU 小時計費。
規格對比,逐個維度
• 架構 —— Solar Mini 4 是稀疏的:總參數量 35B,每個 token 啟用 3B。Gemma 4 12B 是稠密的:其 11.95B 個參數每一個都會在每個 token 上運作。Solar 儲存十倍權重,卻只用其中四分之一來運算;Gemma 儲存四分之一,運算時則全部用上。
• 運行位置——Solar Mini 4 在 Upstage 的基礎設施(Console、Playground)上運行,或依地端部署方案,在你自己的環境中運行。Gemma 4 12B 則在你的硬體上運行:完整精度下約需 16 GB 統一記憶體,4 位元時則接近 8 GB,且可容納於單一消費級 GPU 或 M 系列筆電。
• 權重 — Gemma 4 12B 採用 Apache 2.0,意味著可商業使用、修改與再散布,且沒有營收門檻。Solar Mini 4 則為封閉式。Upstage 過去曾釋出開放權重,但這次發布並未顯示其打算在此這麼做。
• 上下文長度 — Solar Mini 4 為 512,000 個 token,輸出最多可達 128,000 個 token。Gemma 4 12B 為 256,000 個 token,而 Artificial Analysis 在其模型頁面上列出 260K。Solar 是兩者中較長的一個,而且差距並非微不足道。
• 模態——Gemma 4 12B 是無編碼器的多模態模型:圖像區塊與 16 kHz 音訊會直接投影到語言模型的嵌入空間,因此它能接收文字、圖像、音訊與影片,並輸出文字。Solar Mini 4 則是文字進、文字出。這是 Gemma 唯一徹底勝出、且大幅領先的一個面向。
• 價格 — Solar Mini 4 的定價為每百萬輸入 token $0.10、每百萬輸出 token $0.40,快取輸入為 $0.01;50% 的上市促銷活動持續至 2026 年 10 月 22 日。Gemma 4 12B 下載免費,而 Artificial Analysis 在 2026 年 9 月 22 日擷取其頁面時,列出託管推論價格為每百萬輸入 $0.10、輸出 $0.30。
• 知識截止日期——Solar Mini 4 為 2026 年 2 月;Gemma 4 12B 於 2026 年 6 月 3 日推出,知識截止日期為 2025 年 1 月。兩者的資料都已夠過時,因此檢索絕非可有可無。
• 獨立評分 — Solar Mini 4 在發布後僅一天,尚無任何分數。Gemma 4 12B 的 Artificial Analysis Intelligence Index 為 14,在其類別所追蹤的 142 個模型中排名第 22,輸出速度為每秒 112.7 個 token。
Gemma 4 12B 實際上是做什麼用的

Gemma 4 12B 的存在目的,是把一個能力強大的多模態模型放到你能掌控的地方。Google 在發表時的定位是:它以不到一半的記憶體用量,就能逼近該公司自家的 26B 混合專家模型,並且在推理、科學與文件任務上勝過前一代的 Gemma 3 27B。這項說法背後的廠商自報數據,以這個規模而言相當亮眼:MMLU-Pro 為 77.2%、GPQA Diamond 為 78.8%、DocVQA 為 94.9、InfoVQA 為 88.4,這些全都是 Google 自家的數字,並未經獨立重現。
有趣的工程決策是,Gemma 4 12B 沒有獨立的視覺或音訊編碼器。圖像區塊透過單一矩陣乘法投影到模型的嵌入空間;原始音訊也以同樣方式進入。這消除了在語言模型旁額外執行兩座塔所需的記憶體與延遲成本,也是多模態模型能塞進 16 GB 的原因。這也意味著語言模型吸收了編碼器原本會做的工作,而這對精細視覺細節而言是一項實實在在的取捨。
就代理工作而言,實際的結果是:在這兩個模型中,Gemma 4 12B 是唯一能在迴圈中讀取螢幕截圖、掃描頁面或語音備忘的模型。如果你的代理任務涉及「看」某樣東西,這場比較還沒開始就已經結束了。
Solar Mini 4 的真正用途是什麼
Solar Mini 4 鎖定的是相反的情境:高頻、成本敏感的工作,其中輸入是文字且資料量大。Upstage 自己的描述是「回應速度與成本很重要」,而 3B 的活躍參數數量就是其機制。以這種比例而言,稀疏模型在提供服務上的成本很低,這也是為什麼 Upstage 能為一款具備 512K 視窗的模型,標出每百萬輸入 Token 0.10 美元的價格。
512K 上下文是更鋒利的武器。這與 Upstage 在其旗艦 Solar Pro 4 上提供的數字相同,意味著這款緊湊型模型在文件容量上並未被低估——一份 400 頁的合約、一整套程式碼庫、一年的支援工單。Gemma 4 12B 的 256K 按任何正常標準都算慷慨,而按這個標準則只有 Solar 的一半。
推理功能是 Mini 系列的新增特色。前一代的 solar-mini 模型會直接忽略 reasoning_effort 參數;Solar Mini 4 則接受該參數,而第三方代理工具也已更新,將它視為具備推理能力,而不是將它列入拒絕清單。Upstage 也在同一天推出了 Solar Jev,這是一個在 Solar Mini 4 上提供的 beta 決策端點,會回傳選擇、分數或機率,完全沒有文字敘述——這是一項訊號,顯示 Upstage 認為這款模型是針對哪些工作負載而設計。
截至本文撰寫時,Solar Mini 4 所沒有的,是任何一個獨立的數字。沒有 Intelligence Index,沒有 Agent Arena 的排名,也沒有來自 Upstage 的基準測試表——更新日誌條目僅記載規格,而沒有分數。目前流通中唯一近似第三方的數據,是一個社群封裝器自行回報的 test400 執行結果,由另一個模型在所述評分標準下進行評判,其中 Solar Mini 4 在 reasoning_effort=none 下獲得 98.4% 的欄位準確率,且平均每次呼叫耗時 1.21 秒。那只是某位開發者對照自身測試框架所做的比較,並非改變生產決策的理由。
決定一切的比較

如果你有 GPU,而且有理由把資料留在內部,Gemma 4 12B 其實完全不是在跟 Solar Mini 4 競爭——它是在跟你的電費帳單競爭。你下載一次,就能永遠運行,每個 token 都不用付費,而且還能獲得 Solar Mini 4 無論出什麼價都無法提供的多模態輸入。之後才會浮現的成本是營運面的:必須有人負責服務堆疊,必須有人在 Google 推出下一代時處理升級,而你的吞吐量則受限於你買了什麼硬體。
如果你沒有 GPU,或者你有 GPU 但工作負載忽高忽低,Solar Mini 4 就是那個沒有資本支出的選擇。在上市推廣期間,每百萬個輸入 token 你付 $0.05,之後則是 $0.10;你能得到兩倍的上下文視窗,還能得到廠商 SLA,而不是一支傳呼機。你放棄的是權重、多模態輸入,以及用「資料從不離開這棟大樓」來回答「我的資料會怎樣」這個問題的任何能力。
價格比較比標題所暗示的更接近,值得仔細研究。以牌價計算,Solar Mini 4 與託管版 Gemma 4 12B 的輸入成本相同($0.10),而 Gemma 的輸出成本較低($0.30 對 $0.40)。在 Upstage 的促銷期間,Solar 在輸入與輸出上的價格都是前述的一半。如果你的工作負載偏重輸入——長文件、短答案——兩者在牌價上實質打平,而目前 Solar 較便宜。如果偏重輸出,除非促銷正在進行,否則 Gemma 較便宜。
執行任一項,無須重建您的堆疊
這個決定棘手的地方在於,它並非顯而易見地可逆。下載 Gemma 4 12B,就等於把自己綁定在某個服務堆疊上;採用 Solar Mini 4,則等於綁定在某種 API 形態上。無論你選哪一個,讓你在六個月後無法重新評估的,正是轉換成本;而把路由器留在考量範圍內的誠實理由,就是要讓這項成本維持在趨近於零。
有一點需要說清楚:OrcaRouter 並未路由任何 Upstage 模型,因此 Solar Mini 4 在這裡並不可用——它來自 Upstage 自家的 API 以及數個第三方平台。我們確實有路由 Google 較大尺寸的 Gemma 4 模型,也就是 26B-A4B 和 31B,但不包含本文所談的 12B 檢查點。這個平台在此脈絡下真正的作用,是你接著會做的那種比較:一旦你決定要選「精簡的代理模型、文字輸入」,有趣的問題就變成該選哪一款,而這個問題的答案,是靠把其中三個放在同一把金鑰後面,並以你自己的流量來衡量,而不是靠再讀一份規格表。一套能將數個模型組合成單一呼叫的路由 DSL,就是讓你不必寫三套整合就能執行那項測試的方式。

該選哪一個
如果你有硬體,就選 Gemma 4 12B;如果你的代理需要查看圖像或聆聽音訊,如果你需要權重來微調,或者如果「資料會去哪裡」的答案必須是「哪裡都不去」,就選它。如果你不想執行推論,如果你的輸入是長文本而輸出很短,如果 512K 上下文視窗很重要,或者如果你需要一個以韓文為優先、背後有廠商合約的模型,就選 Solar Mini 4。
如果你還無法決定,打破僵局的關鍵不是某個基準測試。而是你目前還無法回答、關於 Solar Mini 4 的那個問題:Upstage 以外沒有人實測過它。Gemma 4 12B 的 Intelligence Index 是 14,而且有公開排名;Solar Mini 4 則只有規格表、價格,以及一個 10 月 22 日到期的促銷方案。在那段期間測試它,只會花你幾美元。若把正式生產路徑押在它身上,一旦數字出爐時不理想,代價就是重寫。
