
Solar Mini 4 与 Solar Pro 4:相同的上下文窗口,三倍的价格
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
Upstage 当前的两款 Solar 模型在买家通常会首先查看的每一个维度上都共享同一份规格表。于 2026 年 9 月 22 日发布的 Solar Mini 4 和于 2026 年 8 月 6 日发布的 Solar Pro 4,都可接受 512,000 个 token 的上下文,最多可输出 128,000 个 token,都覆盖英语、韩语和日语,并且训练数据都截止于 2026 年 2 月。区别在于,Solar Pro 4 的标价是 Solar Mini 4 的三倍——每百万输入 token 0.30 美元,而 Solar Mini 4 为 0.10 美元——并且 Solar Pro 4 有已发布的独立基准分数,而面世仅一天的 Solar Mini 4 则完全没有。这意味着,这项比较要回答的问题不是“哪个更好”,而是:你付出三倍价钱所买的东西,是否正是你的工作负载所欠缺的东西。
两个折扣计时器同时运行
先说价格论证,后说能力论证——因为眼下这两个模型处在不同的促销时间线上,这笔账算下来比标价所显示的还要离奇。
Solar Mini 4 于 9 月 22 日发布,五折优惠持续至 2026 年 10 月 22 日,因此其当前费率为每百万 token 输入 $0.05、缓存输入 $0.005、输出 $0.20。Upstage 自家的定价页面将这一结构化时段标注为 9 月 22 日 05:00 UTC 至 10 月 23 日 00:00 UTC。
Solar Pro 4 的促销活动在9月11日发生了变化,Upstage 将折扣从90%下调至70%——说白了就是涨价,不过该模型的价格仍远低于标价。该促销活动将持续至2026年10月9日,10月10日起执行标准定价。促销期间,Solar Pro 4 的价格为输入 $0.09、缓存 $0.018、输出 $0.36。
因此,从现在到10月9日的大约两周里,两个模型之间的差距是1.8倍,而非3倍:输入价格为0.09美元对0.05美元,输出价格为0.36美元对0.20美元。10月9日之后,Solar Pro 4 恢复为0.30美元和1.20美元,而 Solar Mini 4 则保持折扣价直至22日。22日之后,两者均按标价计费,差距为完整的3倍。

由此可以得出三个结论。如果你要把两者相互进行基准测试,那就在10月9日之前做,因为那时较便宜模型的优势最小,而且你衡量的是能力而非价格。如果你要为11月启动的生产部署做预算,请使用标价,因为届时两项促销都不会仍在进行。如果你计划在两者之间迁移,要知道,分界点是一个日期,而不是一项工作负载。
这两个模型真正差距悬殊的唯一之处
独立评估正是 Solar Pro 4 彰显其档位定位之处,而 Solar Mini 4 目前还无法回答这一问题。
Artificial Analysis 在其 Intelligence Index 上给 Solar Pro 4 打了 42 分,比 Solar Pro 3 的 14 分跃升了 27 分,而且这些提升恰好集中在旗舰产品应当胜出的领域。Terminal-Bench v2.1 从 12% 提升到 57%。AA-LCR,即长上下文推理评估,从 31% 提升到 71%。τ³-Banking 从 9% 提升到 23%。在 GDPval-AA v2 上,该基准以 1000 的人类 Elo 基线来衡量真实世界的代理任务,Solar Pro 3 得分 498,Solar Pro 4 得分 1277。这些是第三方数据,由 Artificial Analysis 发布,而非厂商数据。

同一篇报道也如实说明了这一改进的代价。Solar Pro 4 完成一项平均 Intelligence Index 任务需要 8.6 分钟,而 Solar Pro 3 为 6.0 分钟,尽管其输出 token 用量减少了约 17%——每项任务 43,000 个,而后者为 52,000 个。它的 token 效率更高,但按实际耗时计算则更慢。而且它的 AA-Omniscience 分数从 −53 提升到 −1,主要靠的是拒答:它只尝试回答 41% 的问题,而 Pro 3 为 92%;虽然其幻觉率从 88% 降至 24%,但准确率几乎没变,仅从约 17% 升到 19%。一个通过拒绝回答来提升诚实度分数的模型,对智能体工作来说是真正的进步——一个自信的错误答案比一次拒答代价更高——但这并不等同于知道得更多。
Solar Mini 4 并无可比肩者。没有 Intelligence Index 评分,没有 Agent Arena 排名,没有第三方智能体评测,Upstage 也没有提供基准测试表。目前流传的唯一数据,是某个社区封装自行报告的 test400 运行结果,由另一个模型进行评判,其中 Solar Mini 4 取得了 98.4% 的字段准确率,平均调用时间为 1.21 秒。那只是某位开发者用自建测试框架针对自己的实现所做的测试,作为烟雾信号有些用处,作为采购依据则毫无价值。
3B 活跃参数买到了什么,又没买到什么
参数披露是这对组合中最清晰的意图表达。Solar Mini 4 总参数为 35B,每个 token 激活 3B。Solar Pro 4 的参数规模未披露。
3B 活跃比率是一项服务经济性决策,而不是能力宣称。它意味着模型存储 35B 权重,却对每个 token 执行 3B 的运算量,这正是 Upstage 能把一个 512K 上下文模型定价为每百万输入 token 0.10 美元的原因。Solar Pro 4 定价 0.30 美元,说明它每个 token 做的工作更多;Upstage 不公布这个数字,说明它不想让这种比较以算术方式进行。
根据已公布的证据,真正将二者区分开的,是模型被要求完成的任务难度,而非交给它的文档体量。Solar Mini 4 发布时宣称具备 512K 上下文和最高 128K 输出——与旗舰型号数字相同——因此长文档场景并非层级分界线所在。分界线位于多步骤智能体工作:Terminal-Bench、τ³-Banking 和 GDPval 的数值,才是 Solar Pro 4 的价格所换来的东西,而它们衡量的任务需要在多轮交互中进行规划、调用工具并从错误中恢复。
值得先说明一个注意事项,因为这正是那种会在项目进行到一半时坑到人的事情。Upstage 的模型历史记录中,Solar Pro 4 的上下文为 512K,最大输出为 128K。Artificial Analysis 对同一模型的撰文则列出 384K 上下文窗口和 256K 最大输出——同样的上限和下限,刚好对调。两个来源都可信,但说法不一致。如果你正在估算一个接近上限的提示词,请以 API 响应为准,而不是任何一份文档,因为这两个已公布的数字无法调和。
每个在流水线中应处的位置
把这两个模型理解为一种分层搭配,而不是二选一,才是更有用的方式,这大致也是 Upstage 对它们的定位。Solar Mini 4 是默认之选:抽取、分类、长文档上的结构化输出,以及高吞吐循环——百万次廉价调用就是这类工作负载。Solar Pro 4 则是升级选项:用于必须规划、使用工具、从失败步骤中恢复并仍然完成任务的智能体运行。
这种分层的经济账毫不留情地偏向便宜的那一档——只要便宜档能胜任。Solar Mini 4 在促销期间输入 $0.05、输出 $0.20,比 Solar Pro 4 的促销价便宜五到六倍,即使按标价也便宜三倍。如果你的调用量中 90% 是抽取任务、10% 是智能体式工作,把 90% 的那部分下探到更低一档,省下的钱比任何提示词优化都多。失败模式是错误路由——把智能体式工作发给小模型,结果付两次钱:一次是那次白费的调用,一次是在昂贵模型上重试。
这种错误路由的风险,正是为什么这首先是测量问题、其次才是定价问题的原因,也是路由层得以发挥价值的地方。把产品边界说清楚:OrcaRouter 不路由任何 Upstage 模型,因此 Solar Mini 4 和 Solar Pro 4 都无法通过我们获得——两者都来自 Upstage 自家的 API 以及若干第三方平台。这个平台真正要做的,是这种搭配所形成的模式:一个便宜层级和一个昂贵层级、一条决定哪些流量去向何处的规则,以及自动故障转移,在较小模型出错或返回你的解析器拒绝的内容时,把调用升级到更大的模型。在我们确实路由的那 190 多个模型中,这种分层只需配置一次,而不必接入到每一个调用方。如果你同时运行两个 Solar 层级,等效的逻辑存在于 Upstage 自己的控制台中,而你需要仔细阅读的部分,正是那些决定何时升级的环节。

如何处理它们
如果今天必须二选一,那么只有当你的工作在基准所衡量的特定意义上是智能体式的——多步骤、使用工具、自我纠错——才选择 Solar Pro 4。这正是那 3 倍性能所对应的价值所在,也是已公布证据能清晰区分两者的唯一维度。至于其他一切,Solar Mini 4 提供相同的上下文窗口、相同的输出上限、相同的三种语言,而且价格更低;对它的诚实质疑并非它不够强,而是 Upstage 之外还没有人测量过它。
最后一点就是整个决策的关键,而且它附带着一个截止期限。Solar Mini 4 的促销持续到 10 月 22 日,Solar Pro 4 的则持续到 10 月 9 日,所以以低价对二者进行相互比较的窗口就是接下来的两周。在任一倒计时结束之前,以促销价格、按照你自己的验收标准,在你自己的流量上把两者都跑起来。针对 Solar Mini 4 的独立基准测试最终会出现,而等到它们出现时,它们告诉你的将是它在别人任务上的表现,这是一个与你本月花几美元就能买到的答案不同、且用处更小的答案。
