
AREX-2 与 LFM2.5 2.6B Base:一个空仓库和一个没有说明文档的检查点
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 507 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 194 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
把 AREX-2与 LFM2.5 2.6B Base放在一起看,它们最首要的共同点就是:这两者都不是你如今能够使用的产品——而原因彼此毫无关联。AREX-2 是 BAAI 于 2026 年 9 月 29 日 17:56 UTC 创建的 Hugging Face 仓库;它包含一个 .gitattributes 文件,模型数据存储量为零字节,而且没有模型卡、没有许可证标签,也没有任何形式的公告。LFM2.5 2.6B Base 由 Liquid AI 于 2026 年 8 月发布,则是另一种意义上的未完成:一个完整、可下载的 26.9 亿参数纯文本检查点,采用 LFM 开放许可证(lfm1.0),并且刻意不附带指令微调,因为它的用途是被微调,而不是被拿来提问。
一种是产物的缺席,另一种则是一个产物缺少了一个它本就不该有的步骤。只有在你走马观花时,这两者才属于同一类别;而把它们当成同一类别,恰恰会让一个团队最终等错东西。这两者之间有用的比较不在于能力——根本没有 AREX-2 可供衡量——而在于二者各自用于什么的原材料,以及要弄清楚它到底好不好需要付出多大代价。
性质上的差异,首先说明。
LFM2.5 2.6B Base 是一种基底。它是 Liquid AI 的 LFM2.5 混合家族的预训练检查点:30 层,其中 22 层是双门控短卷积块,8 层是分组查询注意力,在约 34 万亿个 token、16 种语言上训练,具有 131,072 token 的上下文窗口,以及一个量化版本,在 Q4_K_M 下约为 1.67 GB。它没有指令微调。给它一个问题,它会续写文本;它不会回答。Liquid AI 自己的模型卡指出,预期用途是进行大量微调,并且对于想要一个能响应提示的模型的人来说,还有一个经过后训练的同系列模型。它是一种基底,而它在提示遵循基准上得分很差这一事实并非缺陷——这正是它的定义。
AREX-2 不是一种物质或产品;它是一个命名空间。目前仅有的事实是所属机构(BAAI)、创建时间戳(2026年9月29日)和名称。没有任何内容被上传,也没有任何声明发布。这个名字本身属于一个确实存在的家族:2026年7月23日,BAAI 发布了 AREX-Base——一个拥有1220亿参数的混合专家模型,激活参数为100亿,基于 Qwen3.5-122B-A10B 构建——以及 AREX-Turbo——一个基于 Qwen3.5-4B 的稠密4B模型——两者均采用 Apache 2.0 许可,均为深度研究智能体,采用双循环设计:先收集证据,生成带有置信度数值的候选答案,然后依据原始约束验证该答案,并进行改进或重新开始。其公布的数值由厂商报告,未经独立复现:Base 在 BrowseComp 上达到 82.5,在 GAIA 上达到 85.4;Turbo 则为 70.7 / 81.6。
• 可用性 — LFM2.5 2.6B Base 现已可下载。AREX-2 的仓库中没有任何文件。
• 规模 —— Liquid 模型为 2.69B 稠密参数,全部可在检查点中看到。AREX-2 则未知;该系列涵盖 122B MoE 与 4B 稠密模型,因此“2”并不能预示任何信息。
• 上下文 — LFM2.5 2.6B Base 为 131,072 个 token。AREX-2 尚未公布任何信息。
• 许可证——LFM 开放许可证 v1.0,年收入低于 1000 万美元时免费使用,达到或超过该门槛则需另行获得许可证。AREX-2 目前尚无许可证标签;第一代 AREX 采用 Apache 2.0。
• 它是什么——一个是微调基座;而另一个,若以该系列的整体表现为参照,则是托管式智能体,其价值在于搜索与验证的循环,而非其权重。

空白记分卡,含义却截然相反
这两个模型都没有可供你作为规划依据的基准测试,而且背后的原因也截然不同。
Liquid AI 让 Base 保持未评分,并没有隐瞒任何东西。在指令遵循基准上给预训练检查点打分,衡量的只是缺少微调,而不是这个基座的质量——正因如此,公司才对经过后训练的同系列模型做基准测试,而让 Base 保持未评估。那个空白是你这边可以验证的,而这正是关键:你可以下载 1.67 GB,在你自己的任务上运行你自己的评估,并在为服务花任何钱之前就知道答案。
AREX-2 的空白不是设计决策,而是尚未到来。没有什么可下载,因此没有什么可测试,而且你本周能跑的任何评估都不会告诉你关于它的任何信息。任何在未来几天发布 AREX-2 基准数字的人,发布的都是他们不可能测量过的东西。

两个不同的微调问题
由于这两者都只是起点,而非已完成的服务,因此值得精确说明各自会成为什么的起点,因为正是在这一点上,它们才真正不再彼此相似。
一个 2.69B 的混合检查点是用来打造小型、廉价、专用模型的工具。真正有意思的用途是那些不起眼的:在受监管的工作流中读取文档类型的分类器,把表单转换为结构化 JSON 的抽取模型,在靠近数据的单张卡上运行的领域专用改写模型。价值来自这样一个事实:之后你拥有这个产物,而一次调用的边际成本就是电费。训练循环就是这项工作,而这是你今天就可以开始做的工作。
AREX-2 指向的是另一个方向。AREX 家族并非被设计成经过微调后成为一款产品;它的设计目的是被调用为一个智能体,去执行搜索、整合证据,并对照约束条件验证自己的答案。如果第二代延续这一点,那么你要评估的就是一条轨迹——它需要多少步、它是否察觉矛盾、它候选答案上的置信度数值是否有任何意义。这不是一个微调问题,也不是一个权重问题。这是一个服务问题,而它始于有人发布权重和一张模型卡。
无论规模大小,这些都不是替代品。一个需要能自己拥有并重新训练模型的团队,不会去等 AREX-2。一个需要研究智能体的团队,也不会把 2.6B 混合模型微调成研究智能体。
对它们中的每一个而言,路由层所处的位置
这两者之间的实际差别,在模型进入应用的那一刻就会显现出来,因为二者与托管之间的关系截然相反。
LFM2.5 2.6B Base 不在 OrcaRouter 的目录中,任何 LFM2.5 变体也都不在其中,因此它来自 Liquid AI 自家的分发渠道以及常见的第三方托管方——是一个本地产物,而非经由路由的端点。AREX-Base 和 AREX-Turbo 同样不在我们的目录里。在这一图景中,路由层真正存在的意义在于架构的另一侧:当有一天你要把微调结果与它必须战胜的模型进行比较时,你希望这场比较只需付出一次配置更改的代价,而不是一整个采购周期。一个 API 置于 200 多个模型之前,提供方标价原样透传,每个 token 不额外加价,整个面板只需一个密钥,并具备故障转移,让某个提供方的糟糕下午不会变成你评测的糟糕下午。正是在这些条件下,对未经证实的模型做 A/B 测试才足够廉价,值得真正跑起来。
这也是对 AREX-2 本身最诚实的定位。当它发布时——假设它像前两代一样以开放权重发布——要把一个全新的智能体用在真实工作负载上,明智的做法是放在旁路、置于故障转移之后,而不是当作生产循环所依赖的唯一提供方。
一个理性的人本周会如何应对每一件事
如果你有一个小型、狭窄的任务,而且数据不能离开你的基础设施,那么 Liquid checkpoint 是可用的、体积小、在收入门槛以下采用宽松许可,并且今天下午就能测试。下载它,在你自己的评估集上运行,让结果来决定。AREX-2 没有任何方面会改变这一计划。
如果你今天就需要长时程研究行为,该选的模型就是已经存在的那个:AREX-Base,于7月发布,并附有已公开的智能体基准,至少可以对照论文核查。AREX-2 只是一个带着时间戳的名字,而会改变其地位的两件事从外部就能看出来——是否有文件出现在目录树中,以及是否有一张带有参数量和许可证的卡片与它们一同出现。
这篇文章旨在防止的失败模式,是把一个保留名称当作路线图项目来对待。它并不是。它是 BAAI 昨天建的一个仓库,而现在围绕它需要做的正确规划量是零。
