一张生成的 hero 标题卡,显示“Solar Mini 4 vs LFM2.5 2.6B Base”,副标题为“索引的三倍,以及一个并不存在的成本对比”,还有两个徽章,分别写着“2.69B 稠密对 35B 稀疏”和“一个是文件,另一个是端点”。
Guides & Insights

Solar Mini 4 与 LFM2.5 2.6B Base 对比:三倍指数,以及一个并不存在的成本比较

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

诚实地比较 Solar Mini 4 和 LFM2.5 2.6B Base,首先要承认它们并不属于同一个市场。Solar Mini 4 是 Upstage 的 350 亿参数稀疏专家混合模型,于 2026 年 9 月 22 日发布,每个 token 激活约 30 亿参数,专有,计费为每百万输入 token 0.10 美元、每百万输出 token 0.40 美元。LFM2.5 2.6B Base 是 Liquid AI 的 26.9 亿参数预训练检查点,于 2026 年 8 月初根据 LFM Open License v1.0 发布到 Hugging Face,小到可以驻留在手机内存中。一个是端点。另一个是权重文件,而如果你读到这里,是因为你想运行一个模型,而不是调用一个模型,那么这场比较早已结束。

这对组合之所以仍值得写成一篇专文,原因就在于它们真正重叠的那一个维度:两者都被放在同一把独立的标尺下衡量,而这种比较所呈现出的形态,并非参数量所能预测的。Artificial Analysis 在 Intelligence Index v4.3.2 上给 Solar Mini 4 打出 24 分,并给 LFM2.5 2.6B 这一代评出 8.4 分——但后一个数字只是估算,而且它衡量的并不是本文标题中的那个检查点。这两个前提都很重要,而它们正是首先要厘清的事。

并排对照的规格表

• 参数——Solar Mini 4 总参数量为 35B,激活参数 3B;LFM2.5 2.6B Base 是稠密模型,参数量为 2.69B,毫无保留。在每 token 计算预算大致相当的情况下,Upstage 这边的权重规模是对方的十三倍。

• 架构 — Solar Mini 4 是一种稀疏专家混合模型。LFM2.5 2.6B Base 共 30 层,其中 22 层为双门控短卷积块,8 层为分组查询注意力,这一混合架构是 Liquid 专为 CPU 与边缘推理而设计的。

• 训练 — Upstage 并未公布 token 预算。Liquid 的模型卡记录了 34 万亿 token 以及横跨 16 种语言的 128,000 词词汇表,其中包含韩语和日语。

• 许可证 — Solar Mini 4 是专有软件。LFM2.5 2.6B Base 依据 LFM 开放许可证 v1.0 发布——允许商业使用但附带条件,且可进行微调。

• 上下文 — Upstage 记录为 512K tokens,而 Artificial Analysis 对同一模型列出 1.05M,因此该上限尚无定论。LFM2.5 2.6B Base 可运行 131,072。

• 模态 —— 两者都是文本输入、文本输出。二者均不接受图像或音频。

• 价格 — Solar Mini 4 为每百万 token $0.10 / 缓存 $0.01 / $0.40,目前五折,截至 2026 年 10 月 22 日。LFM2.5 2.6B Base 完全没有价目表;托管方 Artificial Analysis 将 LFM2.5 2.6B 这一代的价格追踪为 $0.00。

“8.4,估计值”衡量了什么,又没有衡量什么

A two-column comparison scoreboard titled 'Solar Mini 4 vs LFM2.5 2.6B Base', subtitled 'An endpoint and a checkpoint, on the only axis where they meet'. Solar Mini 4: parameters 35B total / 3B active, sparse; what you get a hosted endpoint; context 512K claimed and 1.05M listed; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05 independently measured; cost per index task $0.36; output per task 88,300 tokens at 204 tok/s; long-context reasoning 83.3% on AA-LCR v1.1. LFM2.5 2.6B Base: parameters 2.69B dense with a 34T training budget; what you get weights and a fine-tuning recipe; context 131,072; price per 1M no rate card exists; Intelligence Index 8.39 for the post-trained 2.6B generation, estimated; cost per index task not measured; output per task not measured; long-context reasoning 5.7% on AA-LCR v1.1.

Artificial Analysis 对 LFM2.5 2.6B 这一代的条目——是后训练模型,而非预训练的 Base——给出的指数为 8.4,并被标记为估计值,其大多数组成评估也以同样方式标注。那只是排行榜上的一个位置,而不是可用于构建的规格说明,绝不应被引述得好像有人把 Base 检查点跑完了整套测试一样。没有人这样做过。Liquid 自己的模型卡根本没有为 LFM2.5 2.6B Base 发布任何基准测试表:它是一个预训练文本补全检查点,而模型卡明确表示,它仅推荐用于重度微调。

被打分的那个同门模型是另一件产物。Liquid 为后训练版 LFM2.5 2.6B 给出的基准测试表显示:IFStruct 为 85.5,Multi-IF 为 80.1,AIME25 为 51.9,LiveCodeBench v6 为 59.4,BFCLv4 为 56.9,τ³-Banking 为 5.7——全部由厂商自行运行,全部基于指令微调版本,而其中读起来像警告的,正是 τ³ 这个数字。

Solar Mini 4 的画像则完全是另一种形态。它在衡量长上下文推理的 AA-LCR v1.1 上得分为 83.3%,在 SciCode 上为 47.6%,在 AA-Omniscience 上为 −10.8,准确率 18.4%,非幻觉率为 64.2%。它在 Terminal-Bench 4.0 上的得分仅为 1%,在 AutomationBench-AA 上为 22.3%。两个系列都不擅长智能体任务;Upstage 的模型既弱于智能体任务,价格又高昂,这比弱于智能体任务但免费可用的处境更糟。

Solar Mini 4 值回票价之处在于推理规模。每个索引任务输出 88,300 个 token——其中 71,600 个用于推理——它消耗算力的方式,是 2.6B 稠密模型无论被喂多长的提示词都无法模仿的。一个拥有 2.69B 参数的模型可以被要求逐步思考;但它无法被要求拥有 35B 参数。这才是真正的产品。

指数的三倍,而没有可比的成本数据

Artificial Analysis 将 Solar Mini 4 定为每完成一项索引任务 $0.36,而 Granite 4.2 3B 为 $0.006,并且 LFM2.5 2.6B 这一代的定价为零,因此不存在任何一种每任务成本数字能让这一比例变得公平。所以,“Solar Mini 4 的成本远高于 LFM2.5 2.6B Base”这一说法属实,却有点偏离重点。真正相关的问题是,Solar Mini 4 专为韩语、长文档、结构化抽取工作而打造,而一个 2.69B 预训练检查点究竟能否胜任这些工作。通常它不能,于是比较就变成了 Solar Mini 4 对前沿通用模型,而不是 Solar Mini 4 对手机模型。

LFM2.5 2.6B Base 胜出的场景,并不是它更便宜的场景,而是任务足够窄、以至于微调就能补齐差距的场景。从已知文档格式中做结构化字段抽取、针对固定分类体系做分类、必须断网运行的端侧助手——这些任务里,一个 2.69B 检查点加上你自己的训练数据,胜过一个 35B 通用模型加上一张价目表,而且消耗的是一台 GPU 实例,而不是按 token 计费的计量表。Liquid 正是为这一路径,通过 Unsloth 和 TRL 提供了带有继续预训练、LoRA SFT、DPO 和 GRPO 方案的基础检查点。

该给哪一个打电话

需要处理长输入、输出需要经过推理、并且语言混合包含韩语或日语时,选择 Solar Mini 4——同时也适用于每个难题可容忍七分钟解码时间的情况。当权重必须归你所有、设备没有网络,并且任务足够窄、可以微调时,选择 LFM2.5 2.6B Base。有意思的部署会同时使用两者,因为它们并非二选一:小型本地模型负责路由、脱敏和抽取,只有当那一小部分请求确实需要 35B 参数时,才调用托管模型。

Liquid 的模型不在 OrcaRouter 上,Upstage 的也不在,所以这两条路线都不是我们能卖给你的东西。我们能做的,是让这个对比从一个决策变成一个配置:一个密钥背后超过 200 个模型,0% 加价,按供应商标价计费,跨供应商自动故障转移,以及一套路由 DSL,让你能将多个模型组合成一次调用。当正确答案是“大多数时候用便宜的那个,关键时刻用好用的那个”时,这就是一个路由问题,而这正是路由 DSL 存在的原因。

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base showing the sixteen-language tag, the Apache-style conversational text-generation tags, the LFM Open License v1.0, a Model Details table listing the base checkpoint at 2.69B parameters as a pre-trained model for fine-tuning beside the post-trained 2.6B sibling, a 3B-parameter BF16 safetensors model size, and a model tree with eight finetunes branching off the Base checkpoint.

那个两家供应商都不会放到幻灯片上的数字

延迟。Solar Mini 4 在每项 Intelligence Index 任务上要消耗 88,300 个输出 token,实测速度为每秒 204 个 token,因此它在每个高难度任务上平均耗时 430 秒——略超七分钟。而 LFM2.5 2.6B 这一代模型,在 Artificial Analysis 所测试的那台主机上,以每秒 45.7 个 token 的速度运行,首块输出的等待时间为 2.8 秒——但那是一台数据中心主机在跟一个通常会在你自己桌面上运行的模型对话。Liquid 自家的测量结果显示,同一架构在 M5 Max 上达到每秒 220 个 token,在 Ryzen AI Max+ 395 上为 113,在手机上约为每秒 30 个 token——这意味着在一台没有网络的设备上也能跑出可用的 agent 循环。

如果你的工作负载是交互式的,那么这场比较毫无悬念,任何基准测试分数都改变不了这一点。如果你的工作负载是批处理的,而等待的只是一个 cron 任务,那么七分钟完全没问题,推理深度对得起这点时间。

A screenshot of Upstage's Console documentation page for Solar Mini 4 showing the Intelligence, Speed and Price gauges, the '$0.10 / 1M tokens' input rate and '$0.40 / 1M tokens' output rate with a '$0.01 / 1M tokens' cached rate, the description of a 35B total / 3B active compact model built for agentic use, English, Japanese and Korean support, tool calling, a 128K max output, and the version string solar-mini4-260922.

最后两条来源说明。这里的每一个 Artificial Analysis 数据,都是该机构在共享测试套件上独立测得的结果;LFM2.5 2.6B 的指数明确为估算值,且覆盖的是后训练模型,而非上文提到的预训练 Base 检查点。每一个 Liquid AI 数据,都是厂商在自家基准上自行运行所得,未经复现;而 Base 检查点本身根本没有已公布的分数,这是预训练模型的一个普遍事实,而非对这一个模型的批评。