
Octen Search 於 Artificial Analysis Search Index 排名第三:每項任務最快、領先者中最便宜
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Octen Search 首次登上 Artificial Analysis Search Index 就拿下 77 分,在排行榜上名列第三——而且它每項任務僅花 17.2 秒就達到這個成績,比 Artificial Analysis 測試過的任何其他產品都快。這款產品本身並不新:Octen Search 自 2026 年 4 月 22 日起就已商業販售,當時其母公司 APITECH AI 宣布了一筆由 Square Peg 領投的 1,000 萬美元種子輪融資。改變的是,截至 Artificial Analysis 9 月 8 日的資料,它的表現終於有了第三方數字佐證,而這個數字比最早針對 Octen Search 的獨立實測所預期的還要好。
Artificial Analysis 實際上在衡量什麼
搜尋索引於 2026 年 8 月 18 日正式上線,而其設計在排行榜之中顯得格外簡潔。每個供應商都在同一套代理框架內運行——Stirrup,Artificial Analysis 自家的開源代理——由同一個模型驅動,即處於中等推理程度的 GPT-5.6 Luna,並由同一個評分器評分。該代理取得兩項工具,web_search 與 web_fetch,每項任務最多 25 回合,每次搜尋最多十筆結果,並已過濾掉已知的汙染來源。一次執行若耗盡全部 25 回合卻未呼叫 finish,便得零分,因此讓代理無法完成任務,與什麼都沒檢索到受到同等嚴厲的懲罰。
唯一的變數是搜尋供應商。這正是大多數搜尋比較所缺乏的特性,也正是它讓 Octen Search 的排名得以被解讀為一種關於檢索的陳述,而不是關於哪家供應商綁定了最強答案模型的陳述。
分數是三項評估在 0–100 分制上的等權平均。DeepSearchQA F1 是在 900 項任務的切分集上執行,題目為廣泛的研究型問題,並將答案評分為一組項目清單。BrowseComp 準確率採用 200 個樣本的難題子集,內容為多跳事實,且答案為單一可驗證的值。AA-Omniscience 準確率採用 600 題保留的常識問題,其主要存在目的是分離出搜尋在模型已知知識之外額外增添了多少價值。由於該指數是單純的平均值,任何一個偏弱的組成部分都會拖低整體數字,而組成部分的概況往往比排名更有用。以完全沒有搜尋工具的方式執行同一個代理時得分為 33,因此供應商所獲得的幾乎一切都是相對於模型自身參數的提升。
Artificial Analysis 表示,它測試了來自 10 家供應商的 20 項搜尋產品;預設圖表顯示其中 12 項。
Octen Search 落腳何處
9月8日表格的最上方,其中每項任務成本是將 Artificial Analysis 每 1,000 項任務所公布的搜尋與模型 token 欄位相加計算得出——排行榜本身並未印出單一合併數字:
• Perplexity Search(中等)— 索引 80,每項任務 28.8 秒,每項任務約 $0.091
• Perplexity Search(高)— 索引 79,29.7 秒,約 $0.091
• Octen Search(重點摘要)— 索引 77,17.2 秒,約 $0.058
• Perplexity Search(低)— 索引 77,37.4 秒,約 $0.105
• 平行搜尋(進階)— 指數 75,42.9 秒,約 $0.084
• Brave Search(LLM 上下文)— 指數 75,24.4 秒,約 $0.130
• You.com Search(重點摘要)— Index 74,20.7s,約 $0.117
• Exa Search(自動)— 索引 74,33.3 秒,約 $0.127
各項組成部分的分數,才是讓排名位置比整體排名更有看頭的地方。Octen Search 在 DeepSearchQA 拿下 80 分,在 BrowseComp 拿下 86 分,在 AA-Omniscience 拿下 66 分。Parallel Search(advanced)是推出時領先指數的供應商,得分為 81、77 和 67。因此,Octen Search 在多跳事實查找基準上以九分之差勝過 Parallel Search,並在廣泛研究上與其打成平手,但在常識增益方面則落後於 Perplexity Search 設定——66 對上 Perplexity Search(medium)的 72。簡單來說,Octen Search 非常擅長找出真正難以找到的東西,而對於模型已經略知一二的問題,能提供的額外幫助較少。
對於任何要引用這項結果的人,有一個值得注意的小細節:Artificial Analysis 自己發布的結果公告將 Octen Search 列為每項任務 16.9 秒,而即時表格在 9 月 8 日的資料中顯示 17.2 秒。這是重新執行造成的漂移,並非矛盾,但這正是應該引用表格、而非社群貼文的原因。

速度是頭條;成本分攤才是關鍵
每項任務 17.2 秒,讓 Octen Search 成為該排行榜上最快的項目。Perplexity Search(中等)需要 28.8 秒,Parallel Search(進階)需要 42.9 秒,Firecrawl Search 則需要 63.2 秒。Artificial Analysis 也指出,Octen Search 在單一查詢上最快,平均每次搜尋 0.21 秒——這是測得最快的呼叫時間,與一項任務需要多少次呼叫無關。
不過,真正值得緊盯的數字,是成本明細。每 1,000 項任務,Artificial Analysis 估算 Octen Search 的搜尋支出為 $9.07,模型 token 支出為 $49.15。token 的成本大約是搜尋的 5.4 倍。這不是 Octen Search 的怪異特例——而是這個指數不斷指出的結構性重點。搜尋服務供應商不只是向你收取檢索費用;它還決定代理要進行多少回合,而每一個額外回合,都是按模型費率計算的模型 token。
Artificial Analysis 在 Parallel 推出時也提出過同樣的論點:進階模式每次搜尋的成本高於基本模式(0.048 美元對 0.045 美元),但每項任務的成本反而較低(0.084 美元對 0.11 美元),因為更好的結果把每項任務的 token 用量從約 339,000 降到 169,000。更便宜的呼叫和更便宜的任務是兩回事,而只有其中一種會出現在你的帳單上。
相較於排行榜上的其他項目,Octen Search 每項任務約 0.058 美元的價格,是所有得分達 75 以上者當中最低的。TinyFish Search 更便宜,約 0.035 美元,但得分為 71,且完成一項任務需要 60.4 秒。
這個結果確定了什麼,以及它沒有確定什麼
Octen 自家公布的數字一向激進,而且仍屬廠商自行提報。該公司聲稱在 SealQA Hard 基準測試上達到 62 毫秒 P50 與 68 毫秒 P90 延遲、每個帳號的吞吐量超過每秒一百萬次查詢、新內容在五分鐘內完成索引,並在 DeepResearch Bench 以總分 55.58 拿下全球第三名。這些數據沒有一項經過獨立重現,而且有幾項無法與任何其他已發布的結果直接比較。
現在有兩項獨立測試,而它們指向不同方向。Artificial Analysis 在固定模型與測試框架的情況下,將 Octen Search 的品質評為第三、速度評為第一。另一項於 2026 年 8 月發表的獨立基準測試測得 Octen Search 的 P50 為 359 毫秒、P95 為 941 毫秒——是該供應商宣稱延遲的數倍——nDCG@10 為 0.495,略低於 0.5 這條線,且在該指標上落後於 Parallel、Brave、Kagi、Perplexity、Context、Tavily 與 Exa。Octen 團隊告訴該評論者,其自家基準測試主要測試延遲而非結果品質;這是一項合理的澄清,同時也等於承認結果品質並非其當時所宣稱的重點。
這兩項結果都可能是正確的,因為它們問的是不同的問題。早先那項測試評判的是,前十筆結果在其自身的查詢集上,透過中繼資料啟發式判斷看起來是否相關;Artificial Analysis 評判的則是,在真實模型驅動下的代理,是否能正確完成任務。這項指數排名所確切確立的,比「最佳搜尋 API」更狹窄,卻比供應商的自稱更有用:在代理式任務完成方面,在模型保持不變的情況下,Octen Search 與最強的供應商旗鼓相當,且比它們全都更快。
實際運行 Octen Search 的成本是多少
Octen 公布的定價,該公司最後於 2026 年 9 月 7 日更新:
• 搜尋 API 呼叫 — 每 1,000 次呼叫 $1,為 $5 定價的 80% 折扣,此折扣自 2026 年 7 月 16 日起已自動套用。
• 結果數量限制 — 每次搜尋中的前 10 筆結果免費;額外結果每 1,000 筆收費 $0.50
• 其他端點 — Image Search 與 Video Search 每 1,000 次呼叫收費 $5;Extract 每 1,000 個成功處理的 URL 收費 $1
• 嵌入 — octen-embedding-8b 每百萬個 token 為 $0.07,octen-embedding-0.6b 每百萬個 token 為 $0.01
• 吞吐量方案 — 免費方案最高 10 QPS;Base 方案最高 20 QPS,帳戶持有信用額度後即免費;Builder 方案每月 $2,099,最高 50 QPS;Pro 方案每月 $13,999,最高 200 QPS;Max 方案每月 $33,999,最高 500 QPS
• 註冊 — 免費餘額 $5
吞吐量層級才是悄悄打亂成本計算的那個部分。每項任務 $0.058 是純粹的每次呼叫計算。如果你的工作負載每秒需要 200 個並行查詢,那麼在第一次搜尋執行之前,你每月就得支付 $13,999,而每項任務的數字就不再是那個值得注意的數字了。
此外,還有 Octen 推出時被標記出的缺口:零資料保留條款、合規認證與區域可用性,未像成熟供應商那樣公開同等詳細的資訊。如果你要將產品交付到受監管的環境,這點遠比三分的指數落差重要得多。


如果它排名第三,為什麼還會有人選擇 Perplexity Search?
與 Perplexity Search(medium)之間三分之差比看起來更小,而直接改用它的理由也是如此。Perplexity Search 在 AA-Omniscience 上以 72 比 66 勝出,並能在單次呼叫中回傳經過綜合、附有引用的答案;有些管線想要這種結果,而這個以工具呼叫代理為核心打造的索引並不獎勵這種做法。Octen Search 的優勢在於速度與價格:根據這些數據,每項任務約快 1.7 倍,且每項任務比 Perplexity Search(medium)便宜約 36%。
實用總結:如果你的代理程式受延遲所限,或者你的帳單在高使用量下主要由檢索費用主導,Octen Search 現在是站得住腳的預設選擇,而不是一場賭博。如果你的管線依賴合成答案,或依賴現有供應商的合規態勢,這套索引就沒有給你任何轉換的理由。
這會讓你的代理堆疊處於什麼境地
搜尋索引所衡量的,是多數團隊視為底層管線的一層,而它提出的觀點遠遠超出搜尋本身。在 Octen Search 本身的那一列,模型的詞元成本是檢索帳單的 5.4 倍。無論你選擇什麼來做檢索,錢都花在模型這一側,而這一側也是每次試用新搜尋供應商時,你最不想重新整合的一側。
這就是把模型路徑放在單一端點後面的理由。OrcaRouter 在單一 API 後提供 200 多個模型,加成 0%——直接傳遞供應商的定價,因此廠商一降價,當天就能反映到你身上——並具備跨供應商的自動容錯移轉,以及能把多個模型組合成單次呼叫的路由 DSL。讓模型路由保持固定,只替換它後面的檢索層;萬一新供應商在你的流量上表現得比在 DeepSearchQA 上還弱,你改動的是一個相依項目,而不是兩個。你可以在 OrcaRouter 的模型目錄。
明確說清楚我們提供什麼、不提供什麼:Octen Search 並不在 OrcaRouter 的目錄中,我們也不代理它——那個呼叫會直接送到 Octen。我們所路由的,是它另一端的那個模型。
接下來要看什麼
有三件事會改變這個故事的走向。Artificial Analysis 會在供應商推出變更時重新執行該指數,因此若出現第二個落在 77 或接近 77 的資料點,就會讓一次初登場變成一段發展軌跡;而若下滑,則會顯示首次排名是因查詢組合而被高估。Octen 尚未公布自家在 DeepSearchQA、BrowseComp 與 AA-Omniscience 各基準上的分項數字,而這是它所能取得最廉價的可信度。而且每 1,000 次呼叫 1 美元的費率自 7 月 16 日起實施;如果這項優惠到期並回復到 5 美元的牌價,Octen Search 成本中的搜尋列大約會變成五倍,價格論述也會大幅減弱。
對任何在本季打造代理程式的人來說,這個動作並不大。這個指數是品質成本比的訊號,不是相容性測試。在遷移正式環境的檢索路徑之前,先用自己的查詢分佈對 Octen Search 跑一遍,並把 77 當成做基準測試的理由,而不是遷移的理由。
