
Octen Search 在 Artificial Analysis Search Index 上位列第三:每项任务最快,在领先者中最便宜
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Octen Search 首次亮相 Artificial Analysis 搜索指数便拿下 77 分,位列榜单第三——而且它达到这一成绩的速度是每个任务 17.2 秒,比 Artificial Analysis 测试过的其他任何产品都快。这款产品本身并不新鲜:Octen Search 自 2026 年 4 月 22 日起便已商业可用,当时其母公司 APITECH AI 宣布完成了一轮由 Square Peg 领投的 1000 万美元种子融资。真正的变化在于,截至 Artificial Analysis 9 月 8 日的数据,它终于有了一个第三方数字,而这个数字比最早对 Octen Search 进行的独立上手测试所能预判的还要好。
Artificial Analysis 实际上在衡量什么
Search Index 于 2026 年 8 月 18 日正式上线,其设计对于排行榜而言异常简洁。每个提供商都在同一个 agent harness 中运行——Stirrup,Artificial Analysis 自家的开源 agent——由相同的模型驱动,即中等推理级别的 GPT-5.6 Luna,并由相同的评分器打分。该 agent 获得两个工具,web_search和web_fetch,每个任务最多 25 轮,每次搜索最多十条结果,并会过滤掉已知的污染来源。一次运行若耗尽全部 25 轮却没有调用 finish,就得零分,因此让 agent 无法完成任务,与什么都没检索到会受到同样严厉的惩罚。
唯一的变量是搜索提供商。这正是大多数搜索对比所缺失的特性,也正是它让 Octen Search 的排位可以被解读为一种关于检索的陈述,而不是关于哪个供应商捆绑了最强答案模型的陈述。
分数是三项评估在 0–100 分制上的等权平均值。DeepSearchQA F1 在涵盖广泛研究问题的 900 项任务划分上运行,并将答案按条目列表进行评分。BrowseComp 准确率使用 200 个样本的多跳事实困难子集,其中答案是单个可验证值。AA-Omniscience 准确率使用 600 个留出的常识性问题,主要旨在分离搜索在模型已知内容之外额外增加了多少。由于该指数是直接平均值,单个软性组成部分会拉低头条数字,而组成部分概况通常比排名更有用。在完全没有搜索工具的情况下运行同一智能体得分为 33,因此提供商获得的几乎一切都是对模型自身参数的提升。
Artificial Analysis 表示,它测试了来自 10 家提供商的 20 款搜索产品;默认图表显示其中 12 款。
Octen Search 最终落地何处
9月8日表格的顶部,其中每项任务的成本是通过将 Artificial Analysis 按每 1,000 项任务公布的搜索列和模型 token 列相加计算得出的——排行榜本身并不会显示一个单一的合并数字:
• Perplexity Search(中等)— 指数 80,每任务 28.8 秒,每任务约 0.091 美元
• Perplexity 搜索(高)— 指数 79,29.7 秒,约 $0.091
• Octen Search(高亮)— 索引 77,17.2秒,约 $0.058
• Perplexity Search(低)— 索引 77,37.4 秒,约 $0.105
• 并行搜索(高级)— 指数 75,42.9秒,约 $0.084
• Brave Search(LLM 上下文)—— 指数 75,24.4 秒,约 $0.130
• You.com 搜索(亮点)— 索引 74,20.7秒,约 $0.117
• Exa Search(自动)— 索引 74,33.3 秒,约 0.127 美元
各分项得分才是格局比排名本身更有看头的地方。Octen Search 在 DeepSearchQA 上得 80 分,在 BrowseComp 上得 86 分,在 AA-Omniscience 上得 66 分。发布时领跑该指数的 Parallel Search(advanced)则分别得 81、77 和 67 分。因此,在多跳事实查找基准上,Octen Search 领先 Parallel Search 九分,在广泛研究上与之打平,但在通用知识提升方面落后于 Perplexity Search 的各档设置——66 分对 Perplexity Search(medium)的 72 分。通俗地说,Octen Search 非常擅长挖出那些真正难以找到的东西,而对于模型已经半知半解的问题,它能带来的额外增益较少。
对于任何引用这一结果的人,有一个小细节值得注意:Artificial Analysis 自己发布的结果公告中,将 Octen Search 列为每项任务 16.9 秒,而实时表格基于 9 月 8 日数据显示为 17.2 秒。这是重跑带来的漂移,而非矛盾,但正因如此,应当引用表格而不是那篇社交帖子。

速度是头条;成本分摊才是关键
每项任务 17.2 秒,使 Octen Search 成为该榜单上最快的条目。Perplexity Search(中等)需要 28.8 秒,Parallel Search(高级)需要 42.9 秒,Firecrawl Search 需要 63.2 秒。Artificial Analysis 还报告称,Octen Search 的单次查询速度也最快,平均每次搜索 0.21 秒——这是测得的最快调用时间,与一项任务需要多少次调用无关。
不过,真正值得盯着看的数字是成本明细。按每 1,000 个任务计算,Artificial Analysis 将 Octen Search 的搜索支出列为 9.07 美元,模型 token 支出列为 49.15 美元。token 成本大约是搜索成本的 5.4 倍。这并不是 Octen Search 的怪癖——而是这个指数不断指出的结构性问题。搜索提供商不只是向你收取检索费用;它还决定了智能体要执行多少轮,而每多一轮,都是按模型费率计费的模型 token。
Artificial Analysis 在 Parallel 发布时也提出了同样的论点:高级模式每次搜索的成本高于基础模式(0.048 美元对 0.045 美元),但每项任务的成本更低(0.084 美元对 0.11 美元),因为更好的结果将每项任务的 token 使用量从约 339,000 减少到 169,000。更便宜的调用和更便宜的任务是两回事,而只有其中一项会出现在你的账单上。
与榜单其余项目相比,Octen Search 每项任务约 0.058 美元,是所有得分 75 或以上的项目中最低的。TinyFish Search 更便宜,约为 0.035 美元,但它的得分是 71,完成一项任务需要 60.4 秒。
这一结果解决了什么,又没有解决什么
Octen 自己公布的数字一向激进,而且始终是厂商自报数据。该公司声称,在 SealQA Hard 基准测试上实现 62 毫秒 P50、68 毫秒 P90 延迟,每账户吞吐量超过每秒一百万次查询,新内容可在五分钟内完成索引,并在 DeepResearch Bench 上以总分 55.58 位列全球第三。这些数据均未经过独立复现,其中多项也无法与其他已发布结果直接比较。
目前存在两项独立测试,而它们指向了不同的方向。Artificial Analysis 在固定模型与测试框架不变的情况下,将 Octen Search 的质量排在第三、速度排在第一。另一项于 2026 年 8 月发布的独立基准测试测得 Octen Search 的延迟为 P50 359 毫秒、P95 941 毫秒——是厂商所宣称延迟的数倍——其 nDCG@10 为 0.495,刚好低于 0.5 这条线,在该指标上落后于 Parallel、Brave、Kagi、Perplexity、Context、Tavily 和 Exa。Octen 团队对那位评测者表示,其自家基准测试主要考察的是延迟,而非结果质量。这一澄清是合理的,同时也等于承认:结果质量本来就不是其所宣称的内容。
两个结果都可能正确,因为它们问的是不同问题。早先的那项测试评估的是:在其自己的查询集上,排名前十的结果是否通过元数据启发式判断看起来相关;Artificial Analysis 评估的是:一个由真实模型驱动的智能体能否正确完成一项任务。这个指数排名所牢固确立的,比“最佳搜索 API”更窄,但比厂商的说法更有用:在智能体任务完成上,在模型保持不变的情况下,Octen Search 与最强大的提供商相比具有竞争力,并且比它们所有人都更快。
实际运行 Octen Search 的成本是多少
Octen 公布的定价,公司最后一次更新于 2026 年 9 月 7 日:
• Search API 调用 — 每 1,000 次调用 $1,较 $5 的标价享有 80% 折扣,自 2026 年 7 月 16 日起已自动生效
• {{1}}结果限制{{/1}} — 搜索中的前10条结果免费;额外结果按每1,000条$0.50计费
其他端点 — 图片搜索和视频搜索每 1,000 次调用收费 $5;提取每 1,000 个成功处理的 URL 收费 $1
• 嵌入模型 — octen-embedding-8b 每百万 token 0.07 美元,octen-embedding-0.6b 每百万 token 0.01 美元
• 吞吐量方案 — 免费层级最高 10 QPS;Base 最高 20 QPS,账户存有余额后即可免费使用;Builder 最高 50 QPS,每月 $2,099;Pro 最高 200 QPS,每月 $13,999;Max 最高 500 QPS,每月 $33,999
• 注册 — 赠送 $5 免费余额
吞吐量档位才是悄悄打破成本账的那部分。每任务 0.058 美元纯粹是按调用量计算的。如果你的工作负载每秒需要 200 个并发查询,那么在第一次搜索运行之前,你每月就要支付 13,999 美元,而每任务数字就不再是那个值得关注的数字了。
Octen 发布时还暴露出一些差距:零数据保留条款、合规认证和区域可用性,都没有像成熟提供商那样详细公布。如果你要进入受监管环境,这远比三个点的指数差距重要得多。


如果它排在第三,为什么还会有人选择 Perplexity Search?
与 Perplexity Search(medium)之间三个百分点的差距比看起来要小,彻底转投它的理由也没有看上去那么充分。Perplexity Search 在 AA-Omniscience 上以 72 比 66 胜出,并且能在单次调用中返回经过综合并带有引用的答案,这是某些流水线所想要的,而这一指数——围绕工具调用型智能体构建——并不奖励这一点。Octen Search 的优势在于速度和价格:根据这些数字,每项任务的速度约为 Perplexity Search(medium)的 1.7 倍,每项任务的成本约低 36%。
实践总结:如果你的智能体受延迟制约,或者你的账单主要由大规模检索开销主导,那么 Octen Search 如今已是站得住脚的默认选项,而非一场赌博。如果你的流水线依赖合成答案,或依赖在位厂商的合规资质,那么这个索引就没有给你任何迁移的理由。
这让你的 agent 技术栈处于什么境地
搜索索引衡量的是大多数团队视为管道的一层,而且它提出了一个超越搜索本身的观点。在 Octen Search 自身这一行中,模型的 token 成本是检索账单的 5.4 倍。无论你为检索选择什么,钱都花在模型这一侧,而每当你试用新的搜索供应商时,这一侧也是你最不希望重新集成的一侧。
这正是把模型路径保持在单一端点之后的意义所在。OrcaRouter 在一个 API 背后以 0% 加价提供 200 多个模型——按提供商的标价原样透传,因此厂商一降价,你当天就能享受到——并具备跨提供商的自动故障转移,以及一套可将多个模型组合成一次调用的路由 DSL。让模型路由保持固定,只替换其背后的检索层;这样,如果新提供商在你的实际流量上表现得比在 DeepSearchQA 上更弱,你也只是更换了一个依赖项,而不是两个。你可以在以下位置查看目录:OrcaRouter 的模型目录。
为了明确我们提供和不提供哪些服务:Octen Search 不在 OrcaRouter 的目录中,我们也不对其进行代理——该调用直接发送至 Octen。我们路由的是其另一端的模型。
接下来看什么
三件事会改变这个故事的走向。Artificial Analysis 会在提供商发布变更时重新运行该指数,因此,若出现第二个处于或接近 77 的数据点,就会让一次首次亮相变成一条发展轨迹;而若出现下滑,则说明首次排名被查询组合抬高了。Octen 尚未公布其自己的各基准 DeepSearchQA、BrowseComp 和 AA-Omniscience 数值,而这是它能获得的最廉价的可信度。而且,每 1,000 次调用 1 美元的费率自 7 月 16 日起一直有效;如果该促销价回落至 5 美元标价,Octen Search 成本中的搜索项大约会变为原来的五倍,价格依据也会大幅削弱。
对于本季度正在构建智能体的人来说,这一步很小。该指数是一个衡量单位成本质量的信号,而不是兼容性测试。在迁移生产检索路径之前,先针对 Octen Search 运行你自己的查询分布,并把 77 分视为进行基准测试的理由,而不是迁移的理由。
