Một thẻ tiêu đề được tạo có nội dung Octen Search đứng thứ ba trên AI Search Index, với các thẻ số liệu hiển thị điểm Artificial Analysis Search Index là 77 ở vị trí thứ ba, 17,2 giây mỗi tác vụ là mức nhanh nhất được đo và chi phí khoảng 0,058 USD mỗi tác vụ.
Guides & Insights

Octen Search đứng thứ ba trên Artificial Analysis Search Index: Nhanh nhất trên mỗi tác vụ, rẻ nhất trong nhóm dẫn đầu

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Octen Search đạt 77 điểm trong lần đầu xuất hiện trên Artificial Analysis Search Index, đủ để đứng thứ ba trên bảng xếp hạng — và nó đạt được vị trí đó với 17,2 giây mỗi tác vụ, nhanh hơn bất kỳ thứ gì khác mà Artificial Analysis từng thử nghiệm. Bản thân sản phẩm không mới: Octen Search đã được bán ra thị trường từ ngày 22 tháng 4 năm 2026, khi công ty mẹ APITECH AI công bố vòng gọi vốn hạt giống trị giá 10 triệu USD do Square Peg dẫn dắt. Điều đã thay đổi là tính đến dữ liệu ngày 8 tháng 9 của Artificial Analysis, cuối cùng đã có một con số của bên thứ ba gắn với nó, và con số này tốt hơn mức mà những thử nghiệm độc lập thực tế sớm nhất đối với Octen Search có thể dự đoán.

Artificial Analysis thực sự đang đo lường điều gì

Search Index ra mắt vào ngày 18 tháng 8 năm 2026, và thiết kế của nó sạch sẽ một cách bất thường đối với một bảng xếp hạng. Mọi nhà cung cấp đều chạy bên trong cùng một khung tác tử — Stirrup, tác tử mã nguồn mở của chính Artificial Analysis — được điều khiển bởi cùng một mô hình, GPT-5.6 Luna ở mức suy luận trung bình, và được chấm điểm bởi cùng một bộ chấm điểm. Tác tử nhận được hai công cụ, web_searchweb_fetch, tối đa 25 lượt mỗi tác vụ và tối đa mười kết quả mỗi lần tìm kiếm, với các nguồn ô nhiễm đã biết bị lọc bỏ. Một lượt chạy đốt hết cả 25 lượt mà không gọi finish sẽ nhận điểm không, nên việc để tác tử không thể kết thúc một tác vụ bị trừng phạt nặng ngang với việc không truy xuất được gì.

Biến số duy nhất là nhà cung cấp dịch vụ tìm kiếm. Đó là thuộc tính mà hầu hết các so sánh tìm kiếm đều thiếu, và chính nó khiến cho vị trí của Octen Search có thể được đọc như một phát biểu về truy xuất, thay vì về việc nhà cung cấp nào đã đi kèm mô hình trả lời mạnh nhất.

Điểm số là trung bình có trọng số bằng nhau của ba đánh giá trên thang điểm 0–100. DeepSearchQA F1 chạy trên một tập 900 tác vụ gồm các câu hỏi nghiên cứu tổng quát và chấm điểm câu trả lời dưới dạng danh sách các mục. Độ chính xác BrowseComp sử dụng một tập con khó gồm 200 mẫu về các dữ kiện đa bước, trong đó câu trả lời là một giá trị đơn lẻ có thể kiểm chứng. Độ chính xác AA-Omniscience sử dụng 600 câu hỏi kiến thức phổ thông được giữ riêng và tồn tại chủ yếu để tách riêng mức độ mà tìm kiếm bổ sung thêm ngoài những gì mô hình đã biết. Vì chỉ số là một trung bình thẳng, một thành phần yếu duy nhất sẽ kéo con số chính xuống, và hồ sơ thành phần thường hữu ích hơn cả bảng xếp hạng. Chạy cùng một tác nhân mà không có bất kỳ công cụ tìm kiếm nào đạt 33 điểm, vì vậy gần như mọi thứ mà một nhà cung cấp giành được đều là phần nâng lên so với chính các tham số của mô hình.

Artificial Analysis cho biết họ đã thử nghiệm 20 sản phẩm tìm kiếm từ 10 nhà cung cấp; các biểu đồ mặc định hiển thị 12 trong số đó.

Nơi Octen Search hạ cánh

Phần trên cùng của bảng ngày 8 tháng 9, với chi phí trên mỗi tác vụ được tính bằng cách cộng các cột tìm kiếm và token mô hình mà Artificial Analysis công bố trên mỗi 1.000 tác vụ — bản thân bảng xếp hạng không in một con số tổng hợp duy nhất:

• Perplexity Search (trung bình) — Index 80, 28,8 giây mỗi tác vụ, khoảng 0,091 USD mỗi tác vụ

• Perplexity Search (cao) — Chỉ số 79, 29,7 giây, khoảng $0,091

• Octen Search (điểm nổi bật) — Chỉ số 77, 17.2s, khoảng $0.058

• Perplexity Search (thấp) — Chỉ số 77, 37,4 giây, khoảng $0,105

• Tìm kiếm song song (nâng cao) — Chỉ số 75, 42,9 giây, khoảng $0,084

• Brave Search (ngữ cảnh LLM) — Chỉ mục 75, 24,4 giây, khoảng $0,130

• You.com Search (điểm nổi bật) — Chỉ số 74, 20,7 giây, khoảng 0,117 USD

• Exa Search (tự động) — Chỉ số 74, 33,3 giây, khoảng $0.127

Điểm số thành phần là nơi vị trí trở nên thú vị hơn so với thứ hạng. Octen Search đạt 80 điểm trên DeepSearchQA, 86 trên BrowseComp và 66 trên AA-Omniscience. Parallel Search (advanced), nhà cung cấp dẫn đầu chỉ mục khi ra mắt, đạt 81, 77 và 67. Vì vậy, Octen Search đánh bại Parallel Search với cách biệt chín điểm trên bài kiểm tra tìm kiếm sự thật đa bước và ngang bằng trên nghiên cứu rộng, trong khi kém hơn các cài đặt Perplexity Search về mức nâng cao kiến thức tổng quát — 66 so với 72 của Perplexity Search (medium). Nói một cách đơn giản, Octen Search rất giỏi săn lùng những thứ thực sự khó tìm, và cung cấp ít giá trị bổ sung hơn cho những câu hỏi mà mô hình đã biết một nửa.

Một chi tiết nhỏ đáng lưu ý cho bất kỳ ai trích dẫn điều này: thông báo của chính Artificial Analysis về kết quả ghi Octen Search ở mức 16,9 giây mỗi tác vụ, trong khi bảng trực tiếp hiển thị 17,2 trên dữ liệu ngày 8 tháng 9. Đó là độ lệch khi chạy lại, không phải mâu thuẫn, nhưng đó là lý do nên trích dẫn bảng thay vì bài đăng trên mạng xã hội.

Screenshot of the Artificial Analysis Search Index leaderboard, September 8 2026 data, showing Octen Search (highlights) third at Index 77 with 17.2 seconds per task, behind Perplexity Search medium at 80 and high at 79.

Tốc độ là tiêu đề; còn việc phân chia chi phí mới là câu chuyện.

17,2 giây mỗi tác vụ khiến Octen Search trở thành mục nhanh nhất trên bảng chỉ số. Perplexity Search (medium) cần 28,8 giây, Parallel Search (advanced) cần 42,9 giây, và Firecrawl Search cần 63,2 giây. Artificial Analysis cũng báo cáo Octen Search là nhanh nhất trên từng truy vấn riêng lẻ, trung bình 0,21 giây mỗi lượt tìm kiếm — thời gian gọi nhanh nhất được đo, không phụ thuộc vào việc một tác vụ cần bao nhiêu lượt gọi.

Tuy nhiên, con số đáng để chăm chú nhìn vào là phần phân tích chi tiết chi phí. Tính trên 1.000 tác vụ, Artificial Analysis xếp Octen Search ở mức 9,07 USD chi cho tìm kiếm và 49,15 USD chi cho token mô hình. Chi phí token cao hơn khoảng 5,4 lần so với chi phí tìm kiếm. Đó không phải là điểm dị thường riêng của Octen Search — mà là điểm mang tính cấu trúc mà chỉ số này liên tục nêu ra. Một nhà cung cấp tìm kiếm không chỉ tính phí bạn cho việc truy xuất; họ còn quyết định tác nhân thực hiện bao nhiêu lượt, và mỗi lượt thêm đều là token mô hình theo mức giá của mô hình.

Artificial Analysis đã đưa ra lập luận tương tự với Parallel khi ra mắt: chế độ nâng cao có chi phí mỗi lượt tìm kiếm cao hơn so với chế độ cơ bản ($0.048 so với $0.045) nhưng chi phí mỗi tác vụ lại thấp hơn ($0.084 so với $0.11), vì kết quả tốt hơn giúp giảm lượng token sử dụng từ khoảng 339.000 xuống 169.000 mỗi tác vụ. Lượt gọi rẻ hơn và tác vụ rẻ hơn là những thứ khác nhau, và chỉ một trong số đó xuất hiện trên hóa đơn của bạn.

So với phần còn lại của bảng xếp hạng, mức khoảng 0,058 đô la mỗi tác vụ của Octen Search là thấp nhất trong số bất kỳ mục nào đạt từ 75 điểm trở lên. TinyFish Search rẻ hơn ở khoảng 0,035 đô la, nhưng nó đạt 71 điểm và mất 60,4 giây để hoàn thành một tác vụ.

Kết quả giải quyết được điều gì, và không giải quyết được điều gì

Các số liệu của chính Octen vốn luôn rất tham vọng, và chúng vẫn chỉ do nhà cung cấp tự báo cáo. Công ty tuyên bố độ trễ P50 là 62 ms và P90 là 68 ms trên chuẩn đánh giá SealQA Hard, thông lượng trên một triệu truy vấn mỗi giây cho mỗi tài khoản, nội dung mới được lập chỉ mục trong vòng năm phút, và vị trí thứ ba toàn cầu trên DeepResearch Bench với điểm tổng thể 55,58. Không có số liệu nào trong số đó được tái lập một cách độc lập, và một số không thể so sánh trực tiếp với bất kỳ thứ gì khác đã được công bố.

Hiện đã có hai bài kiểm tra độc lập, và chúng chỉ về hai hướng khác nhau. Artificial Analysis, khi giữ cố định mô hình và khung đánh giá, xếp Octen Search thứ ba về chất lượng và thứ nhất về tốc độ. Một benchmark độc lập riêng được công bố vào tháng 8 năm 2026 đo Octen Search ở mức 359 ms P50 và 941 ms P95 — gấp nhiều lần độ trễ mà nhà cung cấp tuyên bố — cùng nDCG@10 là 0,495, ngay dưới mốc 0,5 và xếp sau Parallel, Brave, Kagi, Perplexity, Context, Tavily và Exa ở chỉ số đó. Nhóm của Octen nói với người đánh giá đó rằng benchmark của chính họ chủ yếu kiểm tra độ trễ chứ không phải chất lượng kết quả, đây là một lời làm rõ hợp lý và cũng là sự thừa nhận rằng chất lượng kết quả không phải là điều được tuyên bố.

Cả hai kết quả đều có thể đúng, vì chúng hỏi những câu hỏi khác nhau. Bài kiểm tra trước đó chấm điểm liệu mười kết quả hàng đầu có vẻ liên quan hay không bằng các heuristic metadata trên tập truy vấn của riêng nó; Artificial Analysis chấm điểm liệu một agent, với một mô hình thực điều khiển nó, có hoàn thành đúng một tác vụ hay không. Điều mà vị trí trên bảng xếp hạng xác lập một cách chắc chắn thì hẹp hơn "API tìm kiếm tốt nhất" và hữu ích hơn một tuyên bố của nhà cung cấp: về hoàn thành tác vụ agentic, với mô hình được giữ cố định, Octen Search cạnh tranh được với những nhà cung cấp mạnh nhất và nhanh hơn tất cả bọn họ.

Bảng giá đã công bố của Octen, được công ty cập nhật lần cuối vào ngày 7 tháng 9 năm 2026:

• Lượt gọi Search API — 1 USD cho mỗi 1.000 lượt gọi, giảm 80% so với giá niêm yết 5 USD, được tự động áp dụng kể từ ngày 16 tháng 7 năm 2026

• Giới hạn kết quả — 10 kết quả đầu tiên trong một tìm kiếm là miễn phí; các kết quả thêm sẽ bị tính phí $0.50 cho mỗi 1.000 kết quả

• Các endpoint khác — Image Search và Video Search với giá 5 USD cho mỗi 1.000 lần gọi; Extract với giá 1 USD cho mỗi 1.000 URL được xử lý thành công

• Embeddings — octen-embedding-8b với giá $0.07 và octen-embedding-0.6b với giá $0.01 mỗi triệu token

• Các gói thông lượng — gói miễn phí lên tới 10 QPS; Base lên tới 20 QPS miễn phí khi tài khoản có tín dụng; Builder lên tới 50 QPS với 2.099 USD/tháng; Pro lên tới 200 QPS với 13.999 USD/tháng; Max lên tới 500 QPS với 33.999 USD/tháng

• Đăng ký — $5 số dư miễn phí

Các bậc thông lượng chính là phần âm thầm phá vỡ bài toán chi phí. Mức $0.058 mỗi tác vụ đó chỉ là một phép tính thuần túy theo từng lần gọi. Nếu khối lượng công việc của bạn cần 200 truy vấn đồng thời mỗi giây, bạn đang trả $13,999 một tháng trước cả khi tìm kiếm đầu tiên chạy, và con số mỗi tác vụ không còn là con số đáng quan tâm nữa.

Cũng có những lỗ hổng được chỉ ra khi Octen ra mắt: các điều khoản không lưu trữ dữ liệu, chứng nhận tuân thủ và tính sẵn sàng theo khu vực không được công bố chi tiết như các nhà cung cấp lâu năm. Nếu bạn đang triển khai vào một môi trường chịu quản lý chặt chẽ, điều đó quan trọng hơn hẳn một khoảng cách ba điểm trên chỉ số.

A scoreboard card for Octen Search listing its Artificial Analysis Search Index score of 77 in third place, 17.2 seconds per task as the fastest measured, an estimated $0.058 cost per task as the lowest of anything scoring 75 or above, 0.21 seconds average per search query, a $1 per 1,000 calls search list price, and an independent nDCG@10 of 0.495.Screenshot of Octen's official pricing documentation showing the QPS plan tiers from the free 10 QPS tier through the $2,099 Builder, $13,999 Pro and $33,999 Max plans, the $1 per 1,000 calls web search rate discounted 80 percent from the $5 list price, and the $5 per 1,000 calls image and video search rate.

Khoảng cách ba điểm so với Perplexity Search (medium) nhỏ hơn vẻ ngoài của nó, và lý do để chuyển hẳn sang cũng vậy. Perplexity Search thắng trên AA-Omniscience với tỷ số 72 so với 66, và nó trả về một câu trả lời tổng hợp, có trích dẫn chỉ trong một lần gọi, điều mà một số pipeline muốn nhưng chỉ số này — được xây dựng quanh một agent gọi công cụ — không thưởng. Lợi thế của Octen Search nằm ở tốc độ và giá: nhanh hơn khoảng 1,7 lần mỗi tác vụ và rẻ hơn khoảng 36% mỗi tác vụ so với Perplexity Search (medium), theo các số liệu này.

Tóm tắt thực tiễn: nếu agent của bạn bị giới hạn bởi độ trễ, hoặc hóa đơn của bạn bị chi phối bởi hoạt động truy xuất ở quy mô lớn, thì Octen Search hiện là một mặc định có thể biện minh được thay vì một canh bạc. Nếu pipeline của bạn phụ thuộc vào một câu trả lời được tổng hợp, hoặc vào lập trường tuân thủ của một nhà cung cấp hiện hữu, thì chỉ mục này không cho bạn lý do nào để chuyển đổi.

Điều này đặt ngăn xếp tác nhân của bạn ở đâu

The Search Index đo lường một lớp mà hầu hết các nhóm coi là phần hạ tầng kỹ thuật, và nó đưa ra một luận điểm vượt ra ngoài phạm vi tìm kiếm. Ở chính dòng của Octen Search, token của mô hình tốn gấp 5,4 lần chi phí truy xuất. Dù bạn chọn gì cho truy xuất, phía mô hình mới là nơi tiền đổ vào, và đó là phía bạn ít muốn phải tích hợp lại nhất mỗi khi thử nghiệm một nhà cung cấp tìm kiếm mới.

Đó là lý do nên giữ đường dẫn mô hình phía sau một endpoint duy nhất. OrcaRouter phục vụ hơn 200 mô hình sau một API với mức markup 0% — giá niêm yết của nhà cung cấp được chuyển nguyên, nên khi nhà cung cấp giảm giá, bạn nhận được mức giá đó ngay trong cùng ngày — cùng với khả năng chuyển đổi dự phòng tự động giữa các nhà cung cấp và một DSL định tuyến để kết hợp nhiều mô hình vào một lệnh gọi. Hãy giữ cố định tuyến mô hình, thay lớp truy xuất phía sau nó, và nếu nhà cung cấp mới hóa ra yếu hơn trên lưu lượng của bạn so với trên DeepSearchQA, thì bạn đã thay đổi một phụ thuộc thay vì hai. Bạn có thể xem danh mục tại danh mục mô hình của OrcaRouter.

Nói rõ về những gì chúng tôi phục vụ và không phục vụ: Octen Search không có trong danh mục của OrcaRouter và chúng tôi không làm proxy cho nó — lệnh gọi đó đi thẳng đến Octen. Thứ chúng tôi định tuyến là mô hình ở đầu bên kia của nó.

Xem gì tiếp theo

Ba điều sẽ làm thay đổi câu chuyện này. Artificial Analysis chạy lại chỉ số khi các nhà cung cấp tung ra thay đổi, nên một điểm dữ liệu thứ hai ở mức 77 hoặc xấp xỉ 77 sẽ biến một màn ra mắt thành một quỹ đạo, trong khi một sự sụt giảm sẽ cho thấy vị trí đầu tiên đã được tô hồng nhờ thành phần truy vấn. Octen chưa công bố các con số DeepSearchQA, BrowseComp và AA-Omniscience theo từng benchmark của riêng mình, đây là cách rẻ nhất để có được uy tín mà họ có thể làm. Và mức giá 1 USD cho mỗi 1.000 lượt gọi đã được áp dụng từ ngày 16 tháng 7; nếu ưu đãi đó hết hạn và quay trở lại mức giá niêm yết 5 USD, dòng chi phí tìm kiếm của Octen Search sẽ tăng khoảng gấp năm lần và luận điểm về giá sẽ yếu đi đáng kể.

Với bất kỳ ai đang xây dựng một agent trong quý này, nước đi thì nhỏ. Chỉ số là một tín hiệu chất lượng trên mỗi chi phí, không phải một bài kiểm tra tương thích. Hãy chạy phân phối truy vấn của riêng bạn với Octen Search trước khi bạn di chuyển một luồng truy xuất production, và coi điểm 77 là lý do để chạy đánh giá chuẩn hơn là lý do để di trú.