
Solar Mini 4 在 Artificial Analysis 指数上得分 24——且每项任务成本是 GPT-6 Luna 的五倍
- openai新OpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 每百万 tokens
- anthropic新Anthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 每百万 tokens · 159 tok/s
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 220 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Solar Mini 4 每输入 token 的收费与 GPT-6 Luna 相同,而实际完成一项任务的花费大约是后者的五倍。这就是对 Upstage 新模型首次独立评估得出的全部结论,而这并不是发布材料所讲述的故事。Solar Mini 4 于 2026 年 9 月 22 日上线,是一款 350 亿参数的稀疏专家混合模型,每个 token 激活约 30 亿参数,定价为每百万输入 token 0.10 美元、每百万输出 token 0.40 美元。GPT-6 Luna 是 OpenAI 的效率层级模型,标价为 0.10 美元和 0.50 美元,而对于超过 272,000 token 的长上下文层级,这两项价格大约翻倍。从价目表上看,它们像是同一笔采购。在 Artificial Analysis 的 Intelligence Index 上,两个模型都运行了同一套十项评估,Solar Mini 4 每完成一项任务花费 0.36 美元,而 GPT-6 Luna (max) 为 0.07 美元——相差 5.4 倍,而这完全来自两个模型在执行任务过程中的行为方式,而不是它们对每个 token 的收费。
2026年9月30日,Artificial Analysis 发布了其关于该模型的评测文章,该模型得分为 24 分(Intelligence Index v4.3.2)。本文中凡归属于 Artificial Analysis 的内容,均是该机构自身的测量结果;凡归属于 Upstage 的内容,均为厂商的说法。这一点在这里比通常更为重要,因为这两组数字并不总是一致。
独立运行实际上说明了什么

Solar Mini 4 在智能指数上得分为 24.05,而同价位推理模型的中位数为 12。这使其在同类量级中远高于平均水平,而 Upstage 自己的说法——“在 Artificial Analysis 智能指数对比中,3B 激活参数模型中总分最高”——在这一具体点上经得起独立测试。Qwen3.6 35B A3B 同样激活 3B 参数,在同一指数上得分 18.2。K2 Horizon MoVA 36B A4B 激活 4B 参数,得分 25.3——而且它是在更短的上下文上做到这一点:524K tokens,而 Solar Mini 4 为 1.05M。与 7 月发布的 9750 亿参数开放权重 MoE 模型 Inkling 相比,Solar Mini 4 为 24.1,Inkling 为 25.0——与一个规模近其三十倍、每百万 tokens 收费 $1.00/$4.05 的模型相差不到一分。
那份乐谱内部的轮廓并不均匀,而不均匀之处正是有用的部分:
• 长上下文推理是其相对优势。Solar Mini 4 在 AA-LCR v1.1 上得分 83%,与 MiniMax-M3 和 GPT-6 Luna(max)持平,并领先于 Gemini 3.8 Flash(high)和 GPT-6 Astra(max)的 81%。
• 科学编程依然过硬。 在 SciCode 上达到 48%,领先 MiniMax-M3 和 Inkling (xhigh) 一个百分点。
• 智能体编程崩塌了。在 Terminal-Bench 4.0 上只有 1%。不是“弱”——就是 1%。在 AutomationBench-AA 上,该基准可跨真实 SaaS 应用运行多步骤工作流,成绩为 22.3%。
• 知识准确率较低,但模型知道自己是在猜测。AA-Omniscience 得分为 −11,准确率为 18%;对于被问到的问题,该模型约有半数选择不作答。其非幻觉率为 64%,远超 Inkling(xhigh)的 32% 和 GPT-6 Luna(max)的 23%。一个有一半时间说“我不知道”、而作答时又有三分之二概率答对的模型,与一个自信地虚构答案的模型,是两种不同的工具。
在智能体知识工作方面,其成绩为 GDPval-AA 上的 1072 Elo 和 AA-Briefcase 上的 872 Elo,两者都接近 Inkling(xhigh)。
五倍之数,详细拆解
Artificial Analysis 的每任务成本数字,将决定大多数采购对话的走向,它值得被当作一份明细来解读,而不是被当作一个标题数字来引用。有两个因素在推动它。
首先,是体量。Solar Mini 4 在每项 Intelligence Index 任务中输出约 88,300 个 token;其中 71,600 个是推理 token。按每百万输出 token 0.40 美元计算,这大约是账单中的 0.035 美元——很便宜,因为输出很便宜。它真正的代价是时间:在实测每秒 204 个 token 的速度下,Artificial Analysis 记录到,平均每项 Intelligence Index 任务需要 430 秒的工作量,约合 7.2 分钟。GPT-6 Luna(max)以每秒 127 个 token 的速度在每项任务中输出 50,000 个 token,耗时 396 秒。Inkling(xhigh)是一个拥有 9,750 亿参数的开放权重模型,输出 34,700 个 token,并在 169 秒内完成。Solar Mini 4 比两者都慢,但其差距与五倍的成本差距毫无关系。
第二——而这才是关键所在——缓存写入输入。Artificial Analysis 的成本拆解显示,Solar Mini 4 每任务 0.36 美元中,约 0.30 美元来自写入提示缓存的 token,相比之下,缓存读取为 0.03 美元,输出为 0.035 美元,而真正未缓存的输入只占一个舍入误差。对于 GPT-6 Luna(max),缓存写入为 0.068 美元中的 0.012 美元——约占账单的 17%,而 Solar Mini 4 则为 82%。缓存输入是 Upstage 价目表上最便宜的一项,每百万 0.01 美元,而 Artificial Analysis 的模型确实使用了它;问题在于,在能够读取之前,必须写入多少。一个在每一轮都重新发送不断增长的对话的 agent,其支付写入成本的频率远高于一个以简短、封闭的单轮进行回答的模型。
这才是值得带入生产环境的结论:对于这样的模型,每 token 的价格几乎无法预测每项任务的账单。缓存行为却可以。
Upstage 自己的数据何处不同

Upstage 于 2026 年 10 月 1 日发布了一篇标题为“Solar Mini 4: Built for High-Volume Agent Workloads”的发布文章,报告在 Artificial Analysis Intelligence Index 上得分为 24.1——实际上数值相同——并提出了若干说法,这些说法与独立数据并列,而非凌驾于其上。
供应商在AutomationBench-AA上给出22.3%,与Artificial Analysis完全一致,并在τ³-Banking上给出47.2,而该指数套件此后已不再包含这一策略与工具使用基准。它在AA-LCR上报告83.3%,在SciCode上报告47.6%,两者与独立数据均在一个舍入误差范围内。在Humanity's Last Exam上,它报告19.6%,而Artificial Analysis页面针对同一模型给出25.8%;两者都是对一个以波动剧烈著称的评测的合理解读,但它们并不是同一个数字,也不应将任何一个当作另一个来呈现。
两行规格参数同样存在分歧。Upstage 文档中写明的是 512K token 的上下文窗口,最多可输出 128K token。Artificial Analysis 则列出 1.0M token 的上下文窗口和 262K 的最大输出。Upstage 的博客明确指出,512K 这一数字才是实际交付的约定;这类差异值得通过 API 响应来核实,而不是让任何人在此基础上直接搭建检索流水线。
该厂商还做了它唯一能按自己标准进行的比较:一项内部测试,涵盖三个韩语智能体任务、每个模型各运行三次,其中完成 1,000 组三任务集,使用 Solar Mini 4 的估计成本为 1.25 美元,使用 MiMo-V2.5 为 2.20 美元。这是一项由厂商运行、任务由厂商选定且不计延迟的测试,其结论与 Artificial Analysis 的结果相反。它并没有错——不同任务会消耗不同的 token 预算——但它是一个营销数字,而且该模型公布的发布折扣,也是你应该重新跑自己的数据、而不是采用任何人数据的另一个原因。
定价,依据 Upstage 控制台实时文档:每百万输入 token 0.10 美元,每百万缓存输入 token 0.01 美元,每百万输出 token 0.40 美元;目前宣传的发布优惠为截至 2026 年 10 月 22 日 UTC 享受 5 折,因此在此时段之前,实际费率相当于输入 0.05 美元、缓存输入 0.005 美元、输出 0.20 美元。
如果你是付钱的那一方,这意味着什么
Solar Mini 4 的有趣之处不在于它是个糟糕的模型。而在于它是一个真正优秀的小模型,其经济性主要由费率卡无法向你展示的行为所主导。以三个激活参数在该指数上拿到 24 分,是一项真实的工程成果,而韩语工作负载——与英语和日语一道,是该模型宣称的强项——恰恰是这一成果最有可能值回其价格的地方。
真正别扭的地方在于首次调用之后的所有环节。冗长的助手回合、偏低的缓存复用率,再加上每次索引运行就要花七分钟解码的任务,这些加起来得到的数字与 $0.10/$0.40 相去甚远。如果你要评估它,诚实的实验应该是:在你自己的工作负载上,按照生产技术栈实际使用提示缓存的方式启用它,然后做一次“每完成一项任务的成本”测试——而不是比较 token 单价。
这同样是路由器存在的意义所要解决的那类问题,也正是 OrcaRouter 以 0% 加价率透传各服务商目录价的原因,因此供应商一旦调价,当天就会反映到你的账单上。我们并不路由 Upstage 的模型,所以无论是 Solar Mini 4 还是 Solar Pro 4 都无法通过我们获取——它们来自 Upstage 自家的 API 和第三方平台。我们真正路由的,是这场对比的另一半:GPT-6 Luna、Qwen3.8-Max、Qwen3.8-27B、Qwen3.8-Flash 以及可由单个密钥调用的 200 多个其他模型,正因如此,把便宜模型和昂贵模型用在同一个任务上、让自动故障转移和按请求路由来决定由哪一个来作答,才变得切实可行。当两个模型之间的差距是价目表上看不出来的五倍单任务成本时,能否在两者之间切换单个请求,比任何基准测试榜单都更重要。

简而言之:Solar Mini 4 是 Artificial Analysis 为活跃参数量低于三十亿的模型绘制的新的帕累托点,而按每项已完成任务计算,它的成本大约是一个输入标价与之相同的模型的五倍。这两句话都成立,而第二句才是会出现在账单上的那一句。
