一张标题卡,上书“Solar Mini 4”,副标题为“Upstage 的 3B 活跃参数智能体模型,以及随之悄然发布的模型”,背景为蓝到青绿的渐变,右下角是 OrcaRouter 标志。
Guides & Insights

Solar Mini 4:Upstage 的 3B 激活参数智能体模型,以及与之悄然一同发布的沉默模型

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Upstage 在 2026 年 9 月 22 日发布了两样东西,而第二样才是你读完第一条后还该继续往下看的理由。那个模型就是 Solar Mini 4:一个 350 亿参数的混合专家检查点,每个 token 激活 30 亿参数,上下文窗口达 512,000 token,最多可输出 128,000 token,标价为每百万输入 token 0.10 美元、每百万输出 token 0.40 美元。它已在 Upstage Console 和 Playground 上线,也支持本地部署,没有预览标签,也没有等待名单。这就是这次发布,而且是一次合情合理的发布。同一天 Upstage 推出的另一样东西是 Solar Jev——一个构建在 Solar Mini 4 之上的决策端点,它完全不生成任何行文:它在单次前向传播中返回一个选择、一个分数,或一个附带概率的是/否答案,而 Upstage 对其输出 token 的计费为零。这两项公告里,一项是模型发布。另一项则是一个小小的押注:有一类有用的智能体工作,并不希望语言模型开口说话。

9月22日到底落地了什么?

Solar Mini 4 的更新日志条目简短,且毫不含糊。新模型,现已可用。Upstage 自己的说法是,它为智能体工作提供成本效益,适用于“响应速度和成本至关重要”的场景——这是一个实验室在希望你拿它去和价格三倍于它的东西比较、而不是和前沿模型比较时,才会写下的句子。

Screenshot of Upstage’s changelog page, showing the entry announcing Solar Mini 4 as a new model now available.

规格表,依据 Upstage 的模型历史页面:

• 参数 — 总计 35B,每个 token 激活 3B。这是一种稀疏专家混合模型,因此你需要为存储 35B 付费,却只用 3B 进行计算。Upstage 没有细分披露有多少专家,也没有说明它们是如何路由的。

• 上下文 — 512,000 tokens,输出 token 上限为 128,000。这两个数字与旗舰型号完全相同,是规格表上最引人注目的一行。

• 训练数据截止时间——2026年2月。发布时已滞后七个月,这对这种规模的模型来说很正常,在向它询问近期事件之前值得了解一下。

• 语言——英语、韩语和日语。Upstage 将其描述为“韩语流利,并具备强大的英语和日语能力”,这对一家韩国实验室来说是正确的顺序,对模型来说可能也是正确的顺序。

• 能力 — 聊天、推理、结构化输出和工具调用。推理是相较上一代的一项变化:较旧的 solar-mini 模型会完全忽略 reasoning_effort 参数,而 Solar Mini 4 则不会。

• 模型 ID — solar-mini4 是别名,目前解析为带日期的快照 solar-mini4-260922。solar-mini4-preview 这个标识符也一直在第三方 agent 工具中流传;如果你正在针对一个可能无法长期存在的预览字符串编写路由配置,这一点值得了解。

• 可用性——Upstage Console、Playground 和本地部署。没有开放权重。Upstage 此前曾发布过开放权重(Solar Open 2 曾通过 Hugging Face 发布,其 API 服务已于 2026 年 8 月 12 日终止),但关于 Solar Mini 4,没有任何信息表明这是本次的计划。

Solar Jev 是没有人会去写的部分

Solar Jev 正在一个新的 POST /v1/systemone 端点上进行 beta 测试。你发送一段状态——一份文档、一行日志、一张支持工单——再加上一组带类型的问题,然后你会收到从你提供的选项集合中选出的一个选项、按评分标准给出的分数,或一个是/否答案,每一项都带有直接来自模型、而非以文本形式写出的校准概率。

其设计结果是:没有散文式叙述。没有解释,没有思维链,没有前言。Upstage 表示,每个决策都是一次单次前向传递,并且输出 token 是免费的。凭借 512K 上下文窗口,整个状态——一整份合同、一整份转录文本——都可以作为输入。

这是一个比初看之下更窄的产品,而“窄”正是重点。一个什么都不写的模型不可能写出错误的东西。如果你的流水线目前让聊天模型返回一个 JSON 判定结果,然后再解析它,而且你花了哪怕一点点时间来防范模型把那段 JSON 包在一句友好的话里,那么 Solar Jev 就是直接冲着你来的。代价是,你得到的是一个概率,没有推理轨迹,所以当它出错时,你没有任何东西可读。

值得精确说明一下 Solar Jev 不是什么:它不是更小型的 Solar Mini 4,也不是可以下载的微调版本。它是建立在 Solar Mini 4 之上的服务端点,在 Upstage Console 上以 Beta 版提供。Beta 才是关键词。

价格是多少,以及折扣的倒计时

标价为每百万输入 token 0.10 美元、每百万缓存输入 token 0.01 美元、每百万输出 token 0.40 美元。所有价格均不含 10% 增值税。

那些标价并不是你今天实际要支付的价格。Upstage 正在开展 50% 的上线折扣,其官方定价页面标注的日期为 2026 年 10 月 22 日(UTC)——该页面底层的结构化数据给出的时段为 9 月 22 日 05:00 UTC 至 10 月 23 日 00:00 UTC,这不过是同一件事的两种说法。在该时段内,费率为输入 $0.05、缓存 $0.005、输出 $0.20。

Screenshot of Upstage’s pricing page listing Solar Mini 4’s input, cached input and output rates alongside the launch promotion window.

由此得出两点。第一,如果你要拿它和其他任何东西做成本对比,请按两个价格都算,因为一个月后就失效的五折不是价格,而是促销。第二,为了说明标价处在什么水平:上一代 Solar Mini 的标价是输入和输出均为每百万 token $0.15,上下文为 32,768 个 token,而且完全没有推理模式。Solar Mini 4 的输入更便宜,输出更贵,并提供 16 倍的上下文窗口和一种推理模式。这不是一次小改款。这是一款顶着同一个名字的不同产品。

还没有人测量过的

Solar Mini 4 才发布一天,尚无独立评测。没有 Artificial Analysis 智能指数,没有 Agent Arena 排名,也没有第三方智能体基准测试。Upstage 也未为其发布任何基准测试表——更新日志条目只有规格参数,没有任何分数。任何向你提供这款模型数据的人,引用的都是别的东西。

目前流传的、带点第三方色彩的数据点恰好只有一个,而且需要谨慎标注,因为它并不是它看起来像的那两种东西中的任何一种。一个社区仓库 hunkim/solar-mini4-jev 将 Solar Mini 4 封装在兼容 TypeSafe Jev 决策 API 的形态之后,并发布了自己的 test400 运行结果,该结果由另一个模型依据一份明确说明的评分标准进行评判。在那次运行中,reasoning_effort=none 下的 Solar Mini 4 取得了 98.4% 的字段准确率,而包装器自身为 94.2%;在 447 个计分字段中漏掉 7 个,而后者漏掉 26 个;它在韩语(98.8%)和英语(98.4%)上都领先;并且平均每次调用耗时 1.21 秒,而包装器为 0.38 秒。

按它本来的样子来看待它。它不是厂商基准测试——Upstage 并没有发布它。它也不是独立评估——没有中立机构运行它,评测框架是竞争对手自己的,而评判者是一个模型。它是一位开发者自行报告的、将托管 API 与其自己的封装层进行对比的结果;坦诚的总结是,它是目前唯一可用的信号,不应单凭它左右生产决策。它确实提示了两件值得你自己测试的事情:该模型的速度足以用于交互式使用,以及它的韩语能力至少与英语能力一样强。

如何在不押上整条流水线的情况下试用它

一个刚问世一天、还没有独立评分的模型,尴尬之处在于:要知道它是否合适,唯一办法就是让真实流量经过它;而要安全地做到这一点,唯一办法就是在它不合适时,让这些流量有地方可去。

故障转移才是这里最诚实的答案,而这正是路由层存在的意义。你把 Solar Mini 4 放在某个端点后面,把已经在跑的那个模型留作回退方案,当新模型报错、超时,或开始返回你的解析器无法接受的结构化输出时,就让路由器把流量切过去。这样一来,新模型的第一周就是一次有底线的实验,而不是一场你必须为之辩护的发布。

有一点更正值得明确说明,因为很容易让人产生相反的暗示:OrcaRouter 目前并不路由任何 Upstage 模型。Solar Mini 4、Solar Pro 4 和 Solar Jev 可通过 Upstage 自家的 API 以及若干第三方平台获取,如果你特别想要 Solar Mini 4,那里才是你该去的地方。我们提供的是一个 API 密钥,覆盖我们实际路由的 190 多个模型。如果你真正想做的实验是“一个紧凑型 agent 模型能否胜过我现有的方案”,而不是“这个特定的韩语模型能否胜过我现有的方案”,那这会很有用。这是两个不同的问题,而其中只有一个存在错误答案。

OrcaRouter scoreboard card listing Solar Mini 4’s release date of 22 September 2026, its 35B total / 3B active parameter split, 512K context with 128K output, $0.10 / $0.40 list price, the 50% launch promotion to 22 October, and no Artificial Analysis Intelligence Index yet.

悬而未决的问题

Upstage 如今已在同一份 512K/128K 规格表上推出了一个紧凑型模型和一个旗舰模型,定价层级相隔三周,并且它把决策端点放在了小模型而非大模型上。这种顺序是刻意为之:Solar Jev 由 Solar Mini 4 提供服务,因为不生成文本的决策不需要旗舰级的推理能力,也因为当你要做出上百万个决策时,你会想要便宜的那个模型。

目前尚不清楚的是,30亿活跃参数是否足以为涉及提取之外的智能体式工作提供足够的推理能力。Upstage 的营销宣传说它是智能体式的。Upstage 的基准测试则什么都没说。在独立机构对其进行测试之前——考虑到发布日期,那至少也是几周之后的事——正确的做法是:以促销价格、在你自己的任务上测试它,并配置好回退方案,同时把关于其智能体性能的任何说法(包括厂商自己的说法)都当作假设来对待。