
Apodex 1.1 解析:智能指数 44 分,真正的智能体实力——以及知识可靠性的隐患
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
Apodex 1.1 问世仅一周,是专有模型,而直到本周之前,它在很大程度上还只是实验室里的新奇事物。随后,Artificial Analysis 发布了对其的首次独立评估——也是 Apodex 在该平台上的首次评估——排行榜出现了一个不寻常的现象:Apodex 1.1 在 Artificial Analysis Intelligence Index 上获得 44 分,在 177 个模型中排名第 11,同时其智能体工作得分超过了其智能层级中的所有模型,包括 DeepSeek V4 Pro、Qwen3.7 Max 和 Kimi K2.6。同一份报告还暴露出另一个更难看的数字:知识可靠性记录糟糕到足以让人改变在其上运行实际工作的决定。其开放权重兄弟模型 Apodex 1.1 Mini 才是大多数人真正能运行的模型。以下是这份评估说明了什么、没有说明什么,以及谁应该关注。
由陈天桥创立的 AI 公司 Apodex 于 2026 年 8 月 24 日发布了这一系列模型,同时发布了一篇 70 位作者的 arXiv 论文《Apodex 1.1: Scaling Agentic Intelligence for Complex Work》(2608.23283)。旗舰模型是专有的——据供应商报告,参数量约 397B——其核心论点是:智能体的真正瓶颈并非原始智能,而是它们所运行的执行环境。因此,Apodex 1.1 针对长时间跨度的文件处理、搜索与编程进行了专门训练,并配备一个统一的执行框架(AgentOS),可协调多达 150 个并行子智能体,并对每一步操作保留完整的溯源记录。开源部分则是其姊妹模型:Apodex 1.1 Mini,这是一个基于阿里巴巴的Qwen3.5-35B-A3B微调而来的 35B 级 MoE 模型,以 Apache-2.0 许可证发布,并附带名为 FrontierAgent 的配套智能体框架。完整模型只能通过 Apodex 自有的 API 和在线工作台访问;Mini 则要么自托管,要么不可用。
智力指数达到44意味着什么
{{1}}Artificial Analysis 智能指数是该平台基准测试套件的加权汇总,涵盖 GDPval-AA v2 和 Terminal-Bench 等智能体评估,以及推理、数学和知识类组件。{{/1}}{{2}}44 分的成绩使 Apodex 1.1 在 177 个模型中位列第 11 名,远高于 18 分的中位数。{{/2}}{{3}}这也让该模型进入了一个竞争激烈且颇有意思的梯队:Kimi K2.6(45 分)、MiniMax-M3(45 分)和 Inkling(42 分)与它的分差都在 3 分以内,而 Apodex 1.1 是该组中唯一一个一周前大多数 AI 用户还不知道名字的模型。{{/3}}{{4}}Artificial Analysis 指出,该页面介绍的是该模型的推理版本,此外可能还存在非推理版本。{{/4}}

标题指数得分并不是这个模型的趣味所在。它的趣味在于,其强项和弱项相对于该得分的位置——而层级比较正是将这一点具体化。
它超越自身级别之处:智能体与知识工作评测
在衡量真实世界智能体工作的两个Index组件上,Apodex 1.1的表现优于其44分范围内的邻近模型。在GDPval-AA v2——一个评估智能体端到端完成现实办公室风格任务能力的基准测试——上,Apodex 1.1的Elo达到1348,领先于DeepSeek V4 Pro(1333)、Qwen3.7 Max(1308)和Kimi K2.6(1202)。在TerminalBench v2.1上,该基准测试智能体在终端环境中的工作能力,Apodex 1.1得分70%,领先于Kimi K2.6(66%),略逊于Qwen3.7 Max(75%)。这些是Artificial Analysis运营的独立数据,也是报告中证明环境优先训练方法有效的最强证据。
厂商自身的基准测试声明更进一步,但在有人复现之前,应将其视为厂商自报数据:APEX-Agents 38.5、GDPVal 78.8、SWE-bench Verified 77.7%、Terminal-Bench 2.1 70.8%、Humanity's Last Exam(配合工具)56.1%、DeepSearchQA 92.4%、FrontierFinance 54.3、FrontierScience-Research 63.3。让这一智能体形象可信而非炒作的是其背后的架构:环境扩展(扩大训练中使用的可执行文件、搜索和代码环境的多样性)和智能体协调扩展(训练模型分解长周期任务、委派并行工作、整合异步结果并重新规划)。"Agent Team"模式可在检索和综合任务中派生多达150个子智能体,内置的验证步骤("Statement Review")会在结论交付前对其进行检查。换句话说:这是一个被设计为会犯错、自我检查并修复问题的模型——而不是从记忆中背诵事实。
所有这些自主性的隐藏代价:冗长
这种设计在Artificial Analysis的成本效益表中,表现为该模型继知识之后最明显的弱点:它非常冗长。运行完整的Intelligence Index消耗了1.8亿个输出token——而中位数为6700万——每个基准测试任务大约消耗17,000个输出token,相比之下Qwen3.7 Max约为9,400个,MiniMax-M3为8,100个。据Artificial Analysis统计,整个评估总共花费了618.41美元的API费用。

产生该账单的定价结构:每百万输入token收费0.30美元,每百万输出token收费3.00美元——其中缓存输入命中价格为0.03美元,相当于90%的折扣——按典型的7:2:1缓存/输入/输出混合比例折算,综合单价约为每百万token 0.38美元。两项按token计算的单价均高于平台中位数(输入0.25美元,输出0.90美元)。然而,Artificial Analysis的每任务成本估算仍显示,Apodex 1.1每个基准任务的成本约为0.05美元,低于Qwen3.7 Max(约0.07美元)和Kimi K2.6(约0.06美元)。这种差异的调和对于预算规划至关重要:其token价格足够低,即便模型输出极为冗长,每任务的成本依然具备竞争力——真正的成本风险在于调用量,而非单价。如果你让一个长期运行的agent跑在它上面,账单将取决于它“话”有多少,而它的话确实很多。
在您做预算之前,有一个定价说明:$0.30/$3.00 是供应商自己的标价。一个以 0% 加价直传供应商标价的路由平台,收取的正是这个数字,而且未来 Apodex 的任何降价都会在公布的当天同步生效。
问题在于:知识可靠性记录薄弱
这是发布报道大多忽略的一个数字。在Artificial Analysis的知识可靠性探针AA-Omniscience上,Apodex 1.1的得分为-21.9。它没有拒答,而是尝试回答了87%的问题,但正确率仅为32%,幻觉率高达78.4%。对于一个定位为重型求解器的模型来说,这是一种严重的分裂人格:智能体执行能力强,但扎实知识方面薄弱。
这两项事实相互关联,而非相互矛盾。智能体基准测试(Agentic benchmarks)奖励的是在环境中的行动——发出工具调用、迭代、恢复——因此模型即便回忆能力不佳,也能在此类测试中取得高分,因为环境替它完成了记忆。这种设计甚至默认了这一点:Statement Review 的存在就是为了审查输出,而工作台则围绕验证而构建,而非围绕模型凭记忆给出正确答案。务实的解读很直白:不要将 Apodex 1.1 用于依赖它从自身权重中检索事实的任务。应将其用于长周期任务,其成果可对照文件、代码和来源进行核查——并验证交付物。
开源兄弟:Apodex 1.1 Mini 和 FrontierAgent
如果旗舰紧闭的门是个问题,那么家族中敞开的那一半便是平衡砝码。Apodex 1.1 Mini 是一个总参数约35B、激活参数约3B的MoE模型,由阿里巴巴于2026年2月开源的基础模型Qwen3.5-35B-A3B微调而来,以Apache-2.0许可证发布,支持262K上下文窗口,并在Hugging Face上提供FP8、FP4和GPTQ-Int4变体。其厂商报告的招牌成绩为FrontierFinance上的50.2分(在Apodex自家对比中位列第一),以及启用Agent Team框架后APEX-Agents上的27.7分。而随附的开源运行时FrontierAgent才是真正有趣的产物:它是一款基于终端的框架,支持ReAct和Agent Team模式、沙盒文件操作、审批门、检查点与轨迹追踪,并能与任何兼容OpenAI的端点对接。
在自托管之前,有两件事值得了解。首先,Mini 是一个微调模型,而非前沿模型——阅读其基准测试数据时,应像阅读旗舰型号的供应商表格一样:这些对比无法复现、包含测试框架、且由供应商自行挑选。其次,它的行为继承自基座模型:如果你想测试底层的 Qwen3.5-35B-A3B 是否已经能完成你的任务,你并不需要 GPU 和推理服务栈来验证——基座模型只需一个 API 调用即可访问。
哪些人今天应该使用 Apodex 1.1
旗舰模型目前仍处于早期阶段,且为封闭状态,现阶段只能通过供应商自家的 API 和在线工作台使用;Apodex 表示,后续将通过主流平台提供更广泛的 API 可用性,但权重不会开放。这限制了谁能参与本周的排行榜:只有已经入驻 Apodex 工作台的团队,或者愿意注册第一方 API 密钥的团队才能参与。Mini 是更易上手的路径,但需要自行托管。

这款模型真正能发挥作用的地方在于:长周期智能体流水线,其输出会在下游得到验证——研究工作台、多步骤的文件与工具任务、终端操作——以及那些每次任务约0.05美元的成本结构能够经受住冗长输出考验的场景。而它尚不适合的地方包括:任何依赖模型自身知识可信度的任务,或是无法容忍一个未经充分验证、发布仅七天的模型行为失常的生产路径。针对这种情况,路由层正是合适的封装方案。一个API,200+模型意味着基础版Qwen3.5-35B-A3B已经可以按列表价格调用,自托管的Mini可以放在同一路由后面并具备自动故障转移功能,而且不稳定的新模型不会拖垮生产路径——当它表现不佳时,请求会转而发往健康的服务提供商。
接下来看什么
这项评估只是初步解读,并非最终定论。一个月后,Apodex 1.1 是否重要,将取决于三件事:供应商的智能体声明能否被独立复现(目前只有 Artificial Analysis 运营的 GDPval 和 TerminalBench 数据不是由 Apodex 自己产出的);知识可靠性差距能否在非推理变体或后续版本中缩小;以及该模型是否会出现在更多 API 和更多独立评测榜单上——到那时,44 和 -21.9 就成了别人需要去超越的难题。对于一个发布仅七天、却拥有这种分化特征的模型来说,这差不多就是你能要求的全部:一个真正的智能体优势、一个诚实的定价,以及一个你在注册之前就已经知道的弱点。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
