
Solar Mini 4 与 Gemma 4 12B:一个你下载的检查点,和一个你调用的模型
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
Solar Mini 4 与 Gemma 4 12B 最诚实的一句对比就是:一个是文件,另一个是端点。Upstage 的 Solar Mini 4 是一个拥有 350 亿参数的混合专家模型,每个 token 激活 30 亿参数,上下文窗口达 512,000 个 token,且不开放权重——你需要通过 Upstage Console、Playground,或与厂商协商的本地部署方式才能使用它。Gemma 4 12B 则是一个 119.5 亿参数的稠密检查点,采用 Apache 2.0 许可,今天就能下载,在笔记本电脑上大约 16 GB 的统一内存中即可运行。两者都是为智能体任务而打造的,都能接受长文档作为输入,而且它们并不争夺你技术栈中的同一个位置,因为一个带来的是内存账单,另一个带来的是 token 账单。
这种区别之所以会被忽略,是因为这两个模型在功能列表上看起来很像。两者都会推理,都会调用工具,都会输出结构化结果,都能处理英语、韩语和日语。真正决定这个问题的差异在别处:凌晨3点这套东西宕机时会发生什么,你的合规团队对数据存放在哪里怎么说,以及你是按 token 付费还是按 GPU 小时付费。
规格对比,逐维度进行
• 架构——Solar Mini 4 是稀疏的:总参数量为 35B,每个词元激活 3B。Gemma 4 12B 是稠密的:其 11.95B 参数中的每一个都会在每个词元上运行。Solar 存储的权重是其计算所用权重的十倍;Gemma 存储四分之一,却全部用于计算。
• 运行环境 — Solar Mini 4 在 Upstage 的基础设施(Console、Playground)上运行,或以本地部署方式在您自己的环境中运行。Gemma 4 12B 在您的硬件上运行:全精度下约需 16 GB 统一内存,4 位量化下接近 8 GB,并且可适配单张消费级 GPU 或 M 系列笔记本电脑。
• 权重 — Gemma 4 12B 采用 Apache 2.0,即允许商业使用、修改和再分发,且不设收入门槛。Solar Mini 4 则为闭源。Upstage 此前曾发布过开放权重,但此次发布没有任何信息表明它打算这样做。
• 背景 — Solar Mini 4 为 512,000 个 token,输出最高可达 128,000 个 token。Gemma 4 12B 为 256,000 个 token,Artificial Analysis 在其模型页面上列出的是 260K。两者中 Solar 更长,而且差距并不小。
• 模态 — Gemma 4 12B 是无编码器的多模态模型:图像块和 16 kHz 音频被直接投影到语言模型的嵌入空间中,因此它可以接受文本、图像、音频和视频,并返回文本。Solar Mini 4 是文本输入、文本输出。这是 Gemma 唯一一个彻底胜出且优势巨大的维度。
• 价格 — Solar Mini 4 的标价为每百万输入 token 0.10 美元、每百万输出 token 0.40 美元,缓存输入为 0.01 美元;一项 50% 的发布促销活动将持续至 2026 年 10 月 22 日。Gemma 4 12B 可免费下载,而 Artificial Analysis 在 2026 年 9 月 22 日抓取其页面时,列出的托管推理价格为每百万输入 0.10 美元、输出 0.30 美元。
• 知识截止时间——Solar Mini 4 为 2026 年 2 月;Gemma 4 12B 于 2026 年 6 月 3 日发布,其知识截止时间为 2025 年 1 月。两者的知识都已足够陈旧,因此检索并非可有可无。
• 独立评分——Solar Mini 4 发布一天后仍无评分。Gemma 4 12B 的 Artificial Analysis 智能指数为 14,在其类别追踪的 142 个模型中位列第 22,输出速度为每秒 112.7 个 token。
Gemma 4 12B 实际上是用来做什么的

Gemma 4 12B 的存在,是为了把一个能力强大的多模态模型放到你能掌控的地方。Google 在发布时的定位是:它以不到一半的内存,接近该公司自家的 26B 专家混合模型;并且在推理、科学和文档任务上,胜过了上一代的 Gemma 3 27B。支撑这一说法的厂商报告数据对这样的规模来说很亮眼:MMLU-Pro 77.2%,GPQA Diamond 78.8%,DocVQA 94.9,InfoVQA 88.4——全部来自 Google 自家数据,并未经过独立复现。
有趣的工程决策在于,Gemma 4 12B 没有独立的视觉或音频编码器。图像块通过一次矩阵乘法就被投影到模型的嵌入空间中;原始音频也以同样的方式进入。这消除了在语言模型之外再运行两个额外塔架所需的内存和延迟成本,也正是多模态模型能塞进 16 GB 的原因。这还意味着语言模型吸收了编码器原本要完成的工作,而对于精细的视觉细节来说,这是一个实实在在的取舍。
对于智能体工作而言,实际结果是:在这两个模型中,Gemma 4 12B 是唯一一个能够在循环中读取截图、扫描页面或语音便笺的模型。如果你的智能体工作需要查看某些东西,那么这场比较还没开始就已经结束了。
Solar Mini 4 究竟是用来做什么的
Solar Mini 4 针对的是相反的场景:高频、对成本敏感的工作,其中输入是文本且体量很大。Upstage 自己的描述是“响应速度和成本至关重要”,而 3B 活跃参数量正是其机制所在。以这一比例而言,稀疏模型的服务成本很低,因此 Upstage 才能为拥有 512K 窗口的模型标出每百万输入词元 0.10 美元的价格。
512K 上下文是更犀利的武器。这与 Upstage 在其旗舰 Solar Pro 4 上提供的数字相同,意味着这款紧凑型模型在文档容量上并未被打折扣——一份 400 页的合同、一整个代码库、一年的支持工单。按任何常规标准,Gemma 4 12B 的 256K 都算宽裕,而按这一标准则只有 Solar 的一半。
推理对 Mini 系列来说是全新能力。上一代的 solar-mini 模型会直接忽略 reasoning_effort 参数;Solar Mini 4 则接受该参数,第三方智能体工具也已更新,将其视为具备推理能力,而不是把它列入拒绝名单。Upstage 还在同一天发布了 Solar Jev,这是一个测试版决策端点,在 Solar Mini 4 上提供服务,只返回选项、分数或概率,完全没有叙述性文字——这释放了一个信号:Upstage 认为该模型面向哪些工作负载。
截至本文撰写之时,Solar Mini 4 尚未拥有任何一项独立数据。没有 Intelligence Index,没有 Agent Arena 的排名,也没有来自 Upstage 的基准测试表——其变更日志条目只包含规格参数,没有任何评分。目前流传的唯一一个勉强算得上第三方来源的数字,是某个社区封装工具自行报告的 test400 测试运行结果;该结果由另一个模型依据一套明确给出的评分标准进行评判,其中 Solar Mini 4 在 reasoning_effort=none 下的字段准确率达到了 98.4%,平均每次调用耗时 1.21 秒。那不过是一位开发者针对自家评测框架所做的对比,不足以成为推动生产决策的依据。
决定一切的比较

如果你有 GPU,并且有理由把数据留在内部,那么 Gemma 4 12B 其实根本不是在和 Solar Mini 4 竞争——它是在和你的电费竞争。你下载一次,就能永久运行,每个 token 都不花钱,还能获得 Solar Mini 4 无论出什么价都无法提供的多模态输入。之后显现的成本是运营层面的:得有人负责服务栈,得有人在 Google 发布下一代模型时处理升级,而你的吞吐量则受限于你买了什么硬件。
如果你没有 GPU,或者你有 GPU 但工作负载波动很大,那么 Solar Mini 4 就是那个没有资本支出的选择。在发布促销期间,每百万输入 token 支付 $0.05,之后为 $0.10;你会获得两倍的上下文窗口,还会获得厂商 SLA,而不是一个寻呼机。你要放弃的是权重、多模态输入,以及任何用“它永远不会离开这栋楼”来回答“我的数据会怎样”的能力。
价格对比比标题所暗示的更接近,值得仔细比较。按标价计算,Solar Mini 4 与托管的 Gemma 4 12B 在输入上价格相同($0.10),而 Gemma 在输出上更便宜($0.30,对比 $0.40)。在 Upstage 促销期间,Solar 的输入和输出价格都只有上述的一半。如果你的工作负载以输入为主——长文档、短答案——按标价两者实际上持平,而目前 Solar 更便宜。如果以输出为主,除非促销正在进行,否则 Gemma 更便宜。
在不重建你的技术栈的情况下运行其中任意一个
这个决定尴尬的地方在于,它并非显然可逆。下载 Gemma 4 12B 就把你绑定在某个服务栈上;采用 Solar Mini 4 则把你绑定在某种 API 形态上。无论你选哪一个,真正让你在六个月后不再重新评估的,正是切换成本,而诚实地讲,把路由器留在方案里的理由,就是让这项成本趋近于零。
有一点需要说准确:OrcaRouter 不路由任何 Upstage 模型,所以这里用不了 Solar Mini 4——它来自 Upstage 自家的 API 以及若干第三方平台。我们确实路由 Google 较大规格的 Gemma 4,即 26B-A4B 和 31B,但不包括本文所讨论的那个 12B 检查点。在这个语境下,该平台真正的用途在于你紧接着要做的这次比较:一旦你已经确定“紧凑型智能体模型,文本输入”,有意思的问题就变成该选哪一个,而这个问题你要这样来回答:把其中三个放在同一个密钥之后,再拿你自己的流量来测量,而不是去读另一份规格表。用一个路由 DSL 把多个模型组合进单次调用,正是无需编写三套集成就能跑这项测试的方式。

该选哪一个
如果你有相应的硬件,就选 Gemma 4 12B;如果你的智能体需要查看图像或收听音频,如果你需要权重来进行微调,或者如果“数据会流向哪里”的答案必须是“哪里都不去”,那就选它。如果你不想运行推理,如果你的输入是长文本而输出很短,如果 512K 窗口很重要,或者如果你需要一个有供应商合同作为后盾的韩语优先模型,就选 Solar Mini 4。
如果你还没拿定主意,决定取舍的并不是基准测试,而是你目前还无法回答的那个关于 Solar Mini 4 的问题:Upstage 之外没有人测过它。Gemma 4 12B 的 Intelligence Index 为 14,且有公开排名;Solar Mini 4 只有规格表、价格,以及一项 10 月 22 日到期的促销。在促销窗口期内测试它,只需花你几美元。若把生产路径押在它身上,等数据出来却不乐观,你就要付出重写的代价。
