Một gateway. Mọi mô hình.

Suy luận an toàn, không phụ phí, theo mức dùng hoặc gói thuê bao. Hoặc dùng khóa của riêng bạn. Định tuyến thích ứng giúp giảm hóa đơn.

Không cần thẻ tín dụng · chạy trong 60 giây

200+
mô hình, một endpoint
0%
phụ phí token, mãi mãi
75.5%
độ chính xác định tuyến
vượt GPT-5 trên RouterArena
<50ms
chuyển dự phòng giữa luồng
40+%
chi phí suy luận thấp hơn
nhờ định tuyến thích ứng theo phiên
<1%
suy giảm chất lượng
nhờ tự động nâng cấp lên frontier
Tất cả tích hợp
from openai import OpenAI
 
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=ORCAROUTER_API_KEY,
)
resp = client.chat.completions.create(
model="orcarouter/auto", # we grade + route
messages=[{"role": "user", "content": "..."}],
)

Một dòng. Chúng tôi chấm điểm từng prompt, định tuyến tới frontier hoặc OSS, và cộng thêm $0.

Cổng kết nối

Định tuyến khôn hơn. Ship an toàn hơn. Tốn ít hơn.

Định Tuyến

Mỗi prompt được chấm điểm rồi gửi tới mô hình trả lời tốt nhất.

Duyệt mô hình

Quan Sát

Nhật ký đầy đủ, chi tiêu theo thời gian thực và hóa đơn cho từng prompt. Không hộp đen.

Xem một hóa đơn

Quản Lý

Quản lý phiên bản prompt và tái dùng lệnh gọi đã cache mà không đụng tới mã.

Quản lý phiên bản prompt

Quản Trị

Guardrail và tường lửa agent thực sự chặn, không chỉ ghi log.

Xem tường lửa
Cài đặt

Hoạt động trong 60 giây.

Bước 1

Hướng SDK về chúng tôi

Đặt base_url thành api.orcarouter.ai/v1 và thay khóa API. Không cần đổi mã nào khác.

Bước 2

Chúng tôi định tuyến, bảo vệ và giám sát

Chấm điểm dưới 1ms, tích hợp sẵn chuyển dự phòng, cache và nhật ký đầy đủ.

Bước 3

Bạn ship, trên một endpoint

Đi thẳng tới từng nhà cung cấp theo giá niêm yết — chúng tôi cộng thêm $0 mỗi token.

Mô hình

Mọi model. Một bảng giá.

Bảng giá trực tiếp, cạnh nhau — đúng bằng giá bạn trả thẳng cho nhà cung cấp.

Xem tất cả 200+ →
Mô hìnhĐịnh tuyến đếnĐầu vào /MĐầu ra /MNgữ cảnhChất lượng
z-ai/glm-5.3MỚIZhipu AI$1.26$3.961M9.0
qwen/qwen3.8-27b-freeMỚIAlibaba Cloud66K4.0
qwen/qwen3.8-27bMỚIAlibaba Cloud$0.330$2.40262K4.0
deepseek/deepseek-v4-pro-0813MỚIDeepSeek$0.442$0.8841M7.0
grok/grok-4.6MỚI$2.00$6.00500K9.0
meta/muse-spark-1.2MỚI$1.25$4.251M8.0
qwen/qwen3.8-maxMỚIAlibaba Cloud$2.00$6.001M9.0
deepseek/deepseek-v4-flash-0731MỚIDeepSeek$0.147$0.2951M6.0
+ Thêm 194 mô hình · Giá cập nhật mỗi 60 giây
Thanh toán cho token

Ba cách thanh toán cho token.

Nạp tiền và đăng ký tính theo giá nhà cung cấp. Không cộng thêm.

Các gói bên dưới là tính năng nhóm, không đổi giá token.

Giá

Chúng tôi không bao giờ ăn phần trăm chi phí token của bạn.

Doanh thu của chúng tôi đến từ các tính năng nhóm tùy chọn.

Hacker

Miễn phí
Mãi mãi. Không phụ phí trên tất cả token.
Định Tuyến — 200+ mô hình, tự động chuyển dự phòng
Quan Sát — dashboard cơ bản
Quản Lý — phiên bản hóa prompt
3 API key · 0% phụ phí token
Bắt đầu miễn phí

Doanh nghiệp

Tuỳ chỉnh
Cam kết SLA và hạ tầng riêng.
Mọi thứ trong Team
Không giới hạn chỗ ngồi cho nhóm
Ưu tiên truy cập mô hình mới
Mọi tính năng ẩn và bản beta
Hạ tầng riêng
SLA uptime 99.99%
Hỗ trợ chuyên trách & giá tùy chỉnh
Tin cậy và tuân thủ
Kiểm toán độc lập, tuân thủ liên tục — báo cáo cung cấp theo NDA.
Câu hỏi thường gặp

AI router, LLM gateway, định tuyến thích ứng — giải đáp tất cả.

AI router là gì?

AI router nằm giữa ứng dụng của bạn và nhiều mô hình, chọn mô hình tốt nhất cho từng yêu cầu. OrcaRouter chấm điểm mỗi prompt trong chưa đầy 1 ms và định tuyến — mô hình frontier cho suy luận khó, mã nguồn mở cho việc thường nhật — trên hơn 200 mô hình với 0 phụ phí token.

LLM router là gì và hoạt động ra sao?

LLM router phân loại từng prompt và ghép nó với mô hình có khả năng trả lời tốt nhất ở chi phí thấp nhất. OrcaRouter định tuyến bằng embedding ngữ cảnh với học trực tuyến từ lưu lượng thật — độ chính xác 75,5% trên bảng xếp hạng công khai RouterArena.

OrcaRouter có phải là AI gateway không?

Có. OrcaRouter là AI gateway cấp production: một endpoint tương thích OpenAI với định tuyến thích ứng, cân bằng tải, tự động failover, guardrail, tường lửa agent, cache prompt và khả năng quan sát theo từng yêu cầu.

AI CDN là gì?

Giống như CDN phân phối nội dung từ điểm biên tốt nhất, AI CDN phân phối suy luận từ nhà cung cấp tốt nhất: dung lượng khỏe, nhanh, rẻ; cache các prompt lặp lại; failover khi sự cố. OrcaRouter đảm nhiệm vai trò này trên hơn 200 mô hình.

Định tuyến thích ứng là gì?

Định tuyến thích ứng học sự đánh đổi chất lượng/chi phí từ chính lưu lượng của bạn. Hướng mỗi workspace tới "rẻ nhất mà vẫn đạt chuẩn", chất lượng cao nhất, hoặc cân bằng — hoặc để orcarouter/auto liên tục tinh chỉnh theo từng yêu cầu.

Có cần cả AI gateway lẫn LLM router không?

Chúng giải quyết hai bài toán khác nhau — quản trị và chọn mô hình — nhưng bạn không cần hai hệ thống: OrcaRouter định tuyến theo từng yêu cầu và thực thi ngân sách, guardrail, khả năng quan sát ngay trên cùng một chặng.

Định tuyến có làm tăng độ trễ không?

Chấm điểm prompt mất chưa đầy 1 ms và tổng độ trễ cộng thêm dưới 50 ms — thường được bù lại nhiều lần nhờ nhà cung cấp nhanh hơn và token prompt đã cache.

OrcaRouter có cộng phí vào giá token không?

Không. Bạn trả đúng giá niêm yết của từng nhà cung cấp; OrcaRouter cộng $0 mỗi token và kiếm doanh thu từ các tính năng tùy chọn Team và Enterprise.

Tôi có thể giữ nguyên mã OpenAI SDK hiện có không?

Có — đổi base_url sang https://api.orcarouter.ai/v1 và mã SDK OpenAI, Anthropic hay Google của bạn vẫn chạy bình thường: Chat Completions, Responses, Embeddings, Images, Audio và streaming.

Điều gì xảy ra khi một nhà cung cấp sập?

OrcaRouter thử lại trên dung lượng dự phòng khỏe mạnh của cùng mô hình hoặc mô hình tương đương trước khi phản hồi bắt đầu, nên sự cố upstream không lộ ra với người dùng của bạn.

Thông minh hơn, an toàn hơn, tối ưu chi phí.

Đổi một dòng. Đó là toàn bộ việc migration.

Vượt GPT-5 và Azure trên RouterArenaĐược hỗ trợ bởi nghiên cứu đã công bố

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube