Apodex 1.1 的英雄标题卡片,标题为“Apodex 1.1”,副标题为“智能指数 44 分——智能体强度、重度冗长与知识获取”,胶囊徽章显示“AA 指数 44”、“177 中的第 11 名”、“256K 上下文”,页脚文字为“2026 年 8 月 24 日发布——Artificial Analysis 上首款 Apodex 模型”,右下角带有 OrcaRouter 标志。
Guides & Insights

Apodex 1.1 解析:智能指数 44 分,真正的智能体实力——以及知识可靠性的隐患

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Apodex 1.1 问世仅一周,是专有模型,而直到本周之前,它在很大程度上还只是实验室里的新奇事物。随后,Artificial Analysis 发布了对其的首次独立评估——也是 Apodex 在该平台上的首次评估——排行榜出现了一个不寻常的现象:Apodex 1.1 在 Artificial Analysis Intelligence Index 上获得 44 分,在 177 个模型中排名第 11,同时其智能体工作得分超过了其智能层级中的所有模型,包括 DeepSeek V4 ProQwen3.7 MaxKimi K2.6。同一份报告还暴露出另一个更难看的数字:知识可靠性记录糟糕到足以让人改变在其上运行实际工作的决定。其开放权重兄弟模型 Apodex 1.1 Mini 才是大多数人真正能运行的模型。以下是这份评估说明了什么、没有说明什么,以及谁应该关注。

由陈天桥创立的 AI 公司 Apodex 于 2026 年 8 月 24 日发布了这一系列模型,同时发布了一篇 70 位作者的 arXiv 论文《Apodex 1.1: Scaling Agentic Intelligence for Complex Work》(2608.23283)。旗舰模型是专有的——据供应商报告,参数量约 397B——其核心论点是:智能体的真正瓶颈并非原始智能,而是它们所运行的执行环境。因此,Apodex 1.1 针对长时间跨度的文件处理、搜索与编程进行了专门训练,并配备一个统一的执行框架(AgentOS),可协调多达 150 个并行子智能体,并对每一步操作保留完整的溯源记录。开源部分则是其姊妹模型:Apodex 1.1 Mini,这是一个基于阿里巴巴的Qwen3.5-35B-A3B微调而来的 35B 级 MoE 模型,以 Apache-2.0 许可证发布,并附带名为 FrontierAgent 的配套智能体框架。完整模型只能通过 Apodex 自有的 API 和在线工作台访问;Mini 则要么自托管,要么不可用。

智力指数达到44意味着什么

{{1}}Artificial Analysis 智能指数是该平台基准测试套件的加权汇总,涵盖 GDPval-AA v2 和 Terminal-Bench 等智能体评估,以及推理、数学和知识类组件。{{/1}}{{2}}44 分的成绩使 Apodex 1.1 在 177 个模型中位列第 11 名,远高于 18 分的中位数。{{/2}}{{3}}这也让该模型进入了一个竞争激烈且颇有意思的梯队:Kimi K2.6(45 分)、MiniMax-M3(45 分)和 Inkling(42 分)与它的分差都在 3 分以内,而 Apodex 1.1 是该组中唯一一个一周前大多数 AI 用户还不知道名字的模型。{{/3}}{{4}}Artificial Analysis 指出,该页面介绍的是该模型的推理版本,此外可能还存在非推理版本。{{/4}}

A single-column scoreboard for Apodex 1.1 titled 'Apodex 1.1 - the scoreboard' listing AA Intelligence Index 44 (#11 of 177), GDPval-AA v2 Elo 1348, TerminalBench v2.1 70%, Output tokens per task ~17,000, Full Index evaluation cost 18.41, and AA-Omniscience -21.9 (78% hallucination), with a footer 'All figures per Artificial Analysis, August 2026.' and the OrcaRouter logo in the bottom-right corner.

标题指数得分并不是这个模型的趣味所在。它的趣味在于,其强项和弱项相对于该得分的位置——而层级比较正是将这一点具体化。

它超越自身级别之处:智能体与知识工作评测

在衡量真实世界智能体工作的两个Index组件上,Apodex 1.1的表现优于其44分范围内的邻近模型。在GDPval-AA v2——一个评估智能体端到端完成现实办公室风格任务能力的基准测试——上,Apodex 1.1的Elo达到1348,领先于DeepSeek V4 Pro(1333)、Qwen3.7 Max(1308)和Kimi K2.6(1202)。在TerminalBench v2.1上,该基准测试智能体在终端环境中的工作能力,Apodex 1.1得分70%,领先于Kimi K2.6(66%),略逊于Qwen3.7 Max(75%)。这些是Artificial Analysis运营的独立数据,也是报告中证明环境优先训练方法有效的最强证据。

厂商自身的基准测试声明更进一步,但在有人复现之前,应将其视为厂商自报数据:APEX-Agents 38.5、GDPVal 78.8、SWE-bench Verified 77.7%、Terminal-Bench 2.1 70.8%、Humanity's Last Exam(配合工具)56.1%、DeepSearchQA 92.4%、FrontierFinance 54.3、FrontierScience-Research 63.3。让这一智能体形象可信而非炒作的是其背后的架构:环境扩展(扩大训练中使用的可执行文件、搜索和代码环境的多样性)和智能体协调扩展(训练模型分解长周期任务、委派并行工作、整合异步结果并重新规划)。"Agent Team"模式可在检索和综合任务中派生多达150个子智能体,内置的验证步骤("Statement Review")会在结论交付前对其进行检查。换句话说:这是一个被设计为会犯错、自我检查并修复问题的模型——而不是从记忆中背诵事实。

所有这些自主性的隐藏代价:冗长

这种设计在Artificial Analysis的成本效益表中,表现为该模型继知识之后最明显的弱点:它非常冗长。运行完整的Intelligence Index消耗了1.8亿个输出token——而中位数为6700万——每个基准测试任务大约消耗17,000个输出token,相比之下Qwen3.7 Max约为9,400个,MiniMax-M3为8,100个。据Artificial Analysis统计,整个评估总共花费了618.41美元的API费用。

A screenshot of the Artificial Analysis model page for Apodex 1.1 (captured August 31, 2026), showing 'Apodex 1.1 scores 44 on the Artificial Analysis Intelligence Index' with a median of 18, the note that it generated 180M tokens versus a 67M median, pricing of $0.30 per 1M input and $3.00 per 1M output tokens, and the $618.41 total cost to evaluate the model on the Intelligence Index.

产生该账单的定价结构:每百万输入token收费0.30美元,每百万输出token收费3.00美元——其中缓存输入命中价格为0.03美元,相当于90%的折扣——按典型的7:2:1缓存/输入/输出混合比例折算,综合单价约为每百万token 0.38美元。两项按token计算的单价均高于平台中位数(输入0.25美元,输出0.90美元)。然而,Artificial Analysis的每任务成本估算仍显示,Apodex 1.1每个基准任务的成本约为0.05美元,低于Qwen3.7 Max(约0.07美元)和Kimi K2.6(约0.06美元)。这种差异的调和对于预算规划至关重要:其token价格足够低,即便模型输出极为冗长,每任务的成本依然具备竞争力——真正的成本风险在于调用量,而非单价。如果你让一个长期运行的agent跑在它上面,账单将取决于它“话”有多少,而它的话确实很多。

在您做预算之前,有一个定价说明:$0.30/$3.00 是供应商自己的标价。一个以 0% 加价直传供应商标价的路由平台,收取的正是这个数字,而且未来 Apodex 的任何降价都会在公布的当天同步生效。

问题在于:知识可靠性记录薄弱

这是发布报道大多忽略的一个数字。在Artificial Analysis的知识可靠性探针AA-Omniscience上,Apodex 1.1的得分为-21.9。它没有拒答,而是尝试回答了87%的问题,但正确率仅为32%,幻觉率高达78.4%。对于一个定位为重型求解器的模型来说,这是一种严重的分裂人格:智能体执行能力强,但扎实知识方面薄弱。

这两项事实相互关联,而非相互矛盾。智能体基准测试(Agentic benchmarks)奖励的是在环境中的行动——发出工具调用、迭代、恢复——因此模型即便回忆能力不佳,也能在此类测试中取得高分,因为环境替它完成了记忆。这种设计甚至默认了这一点:Statement Review 的存在就是为了审查输出,而工作台则围绕验证而构建,而非围绕模型凭记忆给出正确答案。务实的解读很直白:不要将 Apodex 1.1 用于依赖它从自身权重中检索事实的任务。应将其用于长周期任务,其成果可对照文件、代码和来源进行核查——并验证交付物。

开源兄弟:Apodex 1.1 Mini 和 FrontierAgent

如果旗舰紧闭的门是个问题,那么家族中敞开的那一半便是平衡砝码。Apodex 1.1 Mini 是一个总参数约35B、激活参数约3B的MoE模型,由阿里巴巴于2026年2月开源的基础模型Qwen3.5-35B-A3B微调而来,以Apache-2.0许可证发布,支持262K上下文窗口,并在Hugging Face上提供FP8、FP4和GPTQ-Int4变体。其厂商报告的招牌成绩为FrontierFinance上的50.2分(在Apodex自家对比中位列第一),以及启用Agent Team框架后APEX-Agents上的27.7分。而随附的开源运行时FrontierAgent才是真正有趣的产物:它是一款基于终端的框架,支持ReAct和Agent Team模式、沙盒文件操作、审批门、检查点与轨迹追踪,并能与任何兼容OpenAI的端点对接。

在自托管之前,有两件事值得了解。首先,Mini 是一个微调模型,而非前沿模型——阅读其基准测试数据时,应像阅读旗舰型号的供应商表格一样:这些对比无法复现、包含测试框架、且由供应商自行挑选。其次,它的行为继承自基座模型:如果你想测试底层的 Qwen3.5-35B-A3B 是否已经能完成你的任务,你并不需要 GPU 和推理服务栈来验证——基座模型只需一个 API 调用即可访问。

哪些人今天应该使用 Apodex 1.1

旗舰模型目前仍处于早期阶段,且为封闭状态,现阶段只能通过供应商自家的 API 和在线工作台使用;Apodex 表示,后续将通过主流平台提供更广泛的 API 可用性,但权重不会开放。这限制了谁能参与本周的排行榜:只有已经入驻 Apodex 工作台的团队,或者愿意注册第一方 API 密钥的团队才能参与。Mini 是更易上手的路径,但需要自行托管。

A screenshot of the Apodex online workbench homepage (captured August 31, 2026), showing the deep-research interface with the prompt field 'Ask the question that matters', feature points for a step-level reasoning trace, citations in every report, branching off any report, and full-text search across threads, and a sign-in prompt for saving inquiries.

这款模型真正能发挥作用的地方在于:长周期智能体流水线,其输出会在下游得到验证——研究工作台、多步骤的文件与工具任务、终端操作——以及那些每次任务约0.05美元的成本结构能够经受住冗长输出考验的场景。而它尚不适合的地方包括:任何依赖模型自身知识可信度的任务,或是无法容忍一个未经充分验证、发布仅七天的模型行为失常的生产路径。针对这种情况,路由层正是合适的封装方案。一个API,200+模型意味着基础版Qwen3.5-35B-A3B已经可以按列表价格调用,自托管的Mini可以放在同一路由后面并具备自动故障转移功能,而且不稳定的新模型不会拖垮生产路径——当它表现不佳时,请求会转而发往健康的服务提供商。

接下来看什么

这项评估只是初步解读,并非最终定论。一个月后,Apodex 1.1 是否重要,将取决于三件事:供应商的智能体声明能否被独立复现(目前只有 Artificial Analysis 运营的 GDPval 和 TerminalBench 数据不是由 Apodex 自己产出的);知识可靠性差距能否在非推理变体或后续版本中缩小;以及该模型是否会出现在更多 API 和更多独立评测榜单上——到那时,44 和 -21.9 就成了别人需要去超越的难题。对于一个发布仅七天、却拥有这种分化特征的模型来说,这差不多就是你能要求的全部:一个真正的智能体优势、一个诚实的定价,以及一个你在注册之前就已经知道的弱点。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新