Thẻ tiêu đề chính có dòng chữ 'LLM Router là gì?' với phụ đề 'Lớp chọn mô hình, phép toán thực tế và khi nào nên bỏ qua nó', hiển thị ba thẻ bo tròn được gắn nhãn MỘT ĐIỂM CUỐI, ĐÁNH GIÁ & ĐỊNH TUYẾN và DỰ PHÒNG trên nền trắng với các điểm nhấn màu xanh dương và xanh lơ, cùng logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

LLM Router là gì? Lớp chọn mô hình, Phép toán thực sự và Khi nào nên bỏ qua nó

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Bộ định tuyến LLM là một lớp phần mềm nằm giữa ứng dụng của bạn và các nhà cung cấp mô hình, quyết định mô hình nào sẽ trả lời cho mỗi yêu cầu — một mô hình rẻ, nhanh như DeepSeek V4 Flash khi nhiệm vụ đơn giản, một mô hình hàng đầu như Claude Opus 5 khi nhiệm vụ thực sự khó. Vấn đề cốt lõi là tiền: DeepSeek V4 Flash có giá $0.09 cho mỗi triệu token đầu vào và Claude Opus 5 có giá $5.00, mức giá trực tiếp từ nhà cung cấp trong danh mục mô hình OrcaRouter được xem vào ngày 2026-08-10 — chênh lệch gấp 55 lần cho cùng một lượt gọi. Gửi 80% lưu lượng dễ xuống và giữ 20% khó lên, bạn sẽ kéo đòn bẩy chi phí lớn nhất mà hầu hết các đội không bao giờ chạm tới.

Bộ định tuyến LLM thực chất là gì

Gạt bỏ phần tiếp thị đi, một bộ định tuyến mô hình có ba nhiệm vụ, tất cả đều nhàm chán và tất cả đều có giá trị. Nó là một điểm cuối duy nhất: mã của bạn gọi một URL tương thích với OpenAI thay vì một SDK cho mỗi nhà cung cấp. Nó đánh giá yêu cầu, ước tính độ khó, và định tuyến: việc dễ đến mô hình rẻ, suy luận thực sự khó đến mô hình tiên tiến. Và nó chuyển đổi dự phòng: nếu nhà cung cấp đã chọn giới hạn tốc độ (rate-limit) bạn hoặc trả về mã 5xx, bộ định tuyến sẽ thử lại với một mô hình khỏe mạnh mà ứng dụng của bạn không bao giờ thấy lỗi.

Bước ra quyết định là nơi các bộ định tuyến khác nhau, và phổ này là một phổ quen thuộc. Bộ định tuyến dựa trên quy tắc khớp từ khóa hoặc độ dài prompt với một mô hình — dưới một mili giây, có thể dự đoán trước, nhưng mong manh khi giá cả hoặc mô hình thay đổi. Bộ định tuyến ngữ nghĩa nhúng prompt và định tuyến theo ý nghĩa, vì vậy "số dư của tôi là bao nhiêu?" và "tôi có bao nhiêu tiền" sẽ đi vào cùng một đường dẫn. Bộ định tuyến học hỏi quan sát lưu lượng thực tế và chuyển hướng về phía mô hình nào đang thắng về chất lượng trên mỗi đô la. Cơ chế của từng loại — bao gồm các dải độ chính xác của các loại bộ phân loại khác nhau và chế độ tự động chấm điểm mọi prompt — được trình bày đầy đủ trong hướng dẫn của chúng tôi, Auto Router for LLMs; ở đây, điểm cốt lõi là trí thông minh định tuyến tồn tại trên một phổ, và bạn cần điểm nào là một quyết định về sản phẩm, không phải một danh sách kiểm tra tính năng.

Flow card titled 'One request, three jobs' showing a horizontal pipeline: a request enters ONE ENDPOINT ('one OpenAI-compatible URL'), passes through GRADE & ROUTE ('easy to a cheap model, hard to a frontier model'), then FAILOVER ('provider down? retry a healthy model'), with a footer reading 'Grading under 1ms · mid-stream failover under 50ms' and the OrcaRouter logo composited bottom-right.

Nếu bạn cũng từng thấy "AI router" được dùng để chỉ phần cứng Wi-Fi có tích hợp NPU — thì đó là một sản phẩm khác tình cờ trùng tên, và chúng tôi sẽ làm rõ sự trùng tên này trong bài hướng dẫn về AI router của chúng tôi. Mọi nội dung trong bài viết này đều nói về danh mục phần mềm.

Chênh lệch giá chính là điều khiến nó có lời.

Một router chỉ đáng giá khi các mô hình chênh lệch giá nhiều, và hiện tại chúng chênh lệch rất lớn. Tất cả mức giá dưới đây là giá trực tiếp từ nhà cung cấp cho mỗi 1 triệu token từ danh mục mô hình OrcaRouter, được đọc vào ngày 2026-08-10:

Price table card titled 'The price spread, per 1M tokens' listing five models with input and output prices per 1M tokens: DeepSeek V4 Flash $0.09/$0.18, GPT-5.6 Luna $0.10/$0.60, Gemini 3.6 Flash $1.50/$7.50, Claude Sonnet 5 $2.00/$10.00 (intro through Aug 31 2026), Claude Opus 5 $5.00/$25.00, with DeepSeek V4 Flash highlighted in blue and Claude Opus 5 highlighted, and a footnote reading 'Input spread: DeepSeek V4 Flash $0.09 vs Claude Opus 5 $5.00 — about 55x. Provider-direct rates per the OrcaRouter model catalogue, read 2026-08-10.'

Chỉ cần nhìn vào chênh lệch giá là lập luận tự nó hiện ra. DeepSeek V4 Flash với giá $0.09 so với Claude Opus 5 với giá $5.00 là một chênh lệch khoảng 55 lần chỉ tính riêng token đầu vào, và khoảng cách giữa phân khúc giá rẻ và phân khúc tiên phong giờ đây là một đặc điểm thường trực của thị trường chứ không phải là một khoản chiết khấu một lần. Nếu lưu lượng truy cập của bạn là một hỗn hợp điển hình — phần lớn là các yêu cầu ngắn, được xác định rõ ràng và một số ít là các suy luận thực sự khó — chạy mọi thứ trên mô hình tiên phong nghĩa là trả giá cao nhất cho 80% yêu cầu dễ dàng.

Đây là nơi các kết quả trang đầu hiện tại cho "llm router" khiến bạn thất vọng. Mục từ điển thuật ngữ của Decagon, chẳng hạn, trích dẫn "GPT-4o, Claude 3.5 Sonnet và Gemini 1.5 Pro" ở mức "$5–15 mỗi triệu token đầu vào" — những mô hình đã lỗi thời từ hai năm trước với mức giá gần gấp đôi hiện nay. Thị trường đã thay đổi; định nghĩa thì không. Đó là lý do lớn nhất để không tin tưởng một bài giải thích về LLM router không ghi ngày tháng.

Nghiên cứu về tiết kiệm thực sự nói gì

Phép tính ở trên là thật, và nghiên cứu cũng vậy — nhưng bức tranh trung thực là một khoảng, không phải một con số duy nhất.

Cost card titled 'One support bot, two ways' showing the monthly API cost for 100,000 conversations (1,000 input + 200 output tokens each): all traffic on Claude Sonnet 5 at $400/month versus routed traffic with 80% on DeepSeek V4 Flash and 20% on Claude Sonnet 5 at $90/month, with a highlighted note reading 'about 78% cheaper' and a footnote stating the assumptions: 100k conversations per month, introductory rates through Aug 31 2026, no caching, provider-direct rates per the OrcaRouter model catalogue read 2026-08-10.

Đây là phép tính chi tiết, kèm các giả định nêu rõ để bạn có thể điều chỉnh. Một bot hỗ trợ xử lý 100.000 cuộc hội thoại mỗi tháng, mỗi cuộc gửi 1.000 token đầu vào và tạo ra 200 token đầu ra: chạy mọi thứ trên Claude Sonnet 5 tốn khoảng 400 USD mỗi tháng. Chuyển 80% phần dễ sang DeepSeek V4 Flash và giữ 20% phần khó trên Claude Sonnet 5, cùng lượng lưu lượng đó sẽ tốn khoảng 90 USD — rẻ hơn khoảng 78%, trước khi tính đến bộ nhớ đệm prompt, điều này sẽ làm khoảng cách càng rộng hơn.

Điều cần rút ra: định tuyến tích cực giúp tiết kiệm 60–85% khi lưu lượng của bạn chủ yếu là dễ, định tuyến cân bằng tiết kiệm 35–45%, và thậm chí định tuyến thận trọng cũng tiết kiệm 10–15%. Con số chính xác cho bạn là một thuộc tính của lưu lượng của bạn, được đo trên chính các prompt của bạn — không phải một hằng số bạn có thể sao chép từ một bài blog.

Ba chi phí mà định tuyến che giấu

Hai chi phí mà không ai đề cập đến trong mục thuật ngữ là độ trễ và độ chính xác, và còn có chi phí thứ ba tinh tế hơn.

Độ trễ.Mỗi yêu cầu được định tuyến đều phải trả một khoản "thuế phân loại" trước khi mô hình bắt đầu hoạt động. Bộ phân loại dựa trên quy tắc mất dưới một mili giây; mô hình embedding hoặc phân loại nhỏ thêm khoảng 50–200ms; bộ phân loại miền được huấn luyện còn nhiều hơn. Một bộ định tuyến tốt sẽ che giấu phần lớn điều này bằng cách phân loại trong khi chuẩn bị yêu cầu ngược dòng, và một endpoint định tuyến trong sản xuất được đo có chi phí trọn gói khoảng 55ms ở mức trung vị — chưa đến 1% thời gian phản hồi bình thường. Nhưng nếu lưu lượng của bạn là thời gian thực — một trợ lý thoại, một giao diện người dùng phải trả lời trong vòng 300ms — một bước nhảy định tuyến ở mức hàng trăm mili giây có thể tạo ra khác biệt giữa dùng được và không dùng được. Ràng buộc duy nhất đó là lý do phổ biến nhất khiến một nhóm có trường hợp sử dụng định tuyến hợp pháp quyết định không định tuyến.

Độ chính xác. Một router chỉ tốt bằng phán đoán mà nó dựa vào để định tuyến. Một bộ phân loại được huấn luyện trên các benchmark tổng quát có thể sai một cách đầy tự tin về lĩnh vực của bạn: tác vụ tóm tắt "dễ" của bạn có thể dễ với mô hình hàng đầu nhưng bất khả thi với mô hình giá rẻ. Chế độ lỗi này diễn ra thầm lặng — người dùng chỉ nhận được đầu ra tệ hơn và không ai ghi nhận lại — đó là lý do vì sao mọi router đáng tin cậy đều đi kèm một ngưỡng chất lượng tối thiểu hoặc một chế độ cân bằng.

Vô hiệu hóa bộ nhớ đệm. Cả OpenAI và Anthropic đều chiết khấu cho các tiền tố prompt lặp lại, thường giảm khoảng 90% trên token đầu vào khi đọc bộ nhớ đệm. Nếu lớp định tuyến của bạn viết lại, sắp xếp lại, hoặc chèn một dấu thời gian xoay vòng vào prompt, nó sẽ vô hiệu hóa tiền tố và vứt bỏ khoản chiết khấu đó. Một bộ định tuyến tốt sẽ truyền prompt nguyên vẹn từng byte và để cho bộ nhớ đệm của nhà cung cấp tự hoạt động.

Khuyến nghị: một bộ định tuyến được quản lý với mức chất lượng tối thiểu

Nếu bạn chạy nhiều hơn một mô hình trong production, lưu lượng truy cập của bạn là sự pha trộn giữa các yêu cầu dễ và khó, và khối lượng đủ lớn để một phần trăm cũng là tiền thật, thì khuyến nghị là một bộ định tuyến được quản lý, duy trì chất lượng ở mức tối thiểu và không tính phí chênh lệch trên token. Sản phẩm của chúng tôi là OrcaRouter, và đây là sản phẩm chúng tôi có thể nói chi tiết; danh sách kiểm tra sau đây áp dụng cho bất kỳ bộ định tuyến nào bạn đánh giá.

Chế độ tự động của OrcaRouter — yêu cầu tên mô hình orcarouter/auto trên endpoint tương thích chuẩn OpenAI — chấm điểm từng prompt và định tuyến nó qua hơn 200 mô hình. Nó đi kèm bốn chính sách định tuyến với Balanced làm mặc định: Cheapest gửi đến mô hình có chi phí thấp nhất có thể trả lời; Balanced gửi đến mô hình rẻ nhất vượt qua ngưỡng chất lượng; Quality gửi đến mô hình có điểm cao nhất bất kể giá cả; Adaptive học từ lưu lượng trực tiếp của bạn và điều chỉnh định tuyến trong quá trình hoạt động. Việc chấm điểm được đo trong chưa đầy một mili giây, tổng độ trễ tăng thêm giữ ở mức dưới 50ms, và nếu nhà cung cấp được chọn bị giới hạn tốc độ hoặc gặp lỗi, bộ định tuyến sẽ chuyển đổi dự phòng ngay giữa luồng sang một mô hình khỏe mạnh trong chưa đầy 50ms. Không có phụ phí ở bất kỳ lớp nào: bạn trả cho mỗi nhà cung cấp đúng giá công bố của họ — các con số 0,09 đô la hoặc 5,00 đô la ở trên chính là số tiền bạn phải trả — và bản thân việc định tuyến là miễn phí.

Về độ chính xác, bảng xếp hạng RouterArena tháng 6 năm 2026 chấm OrcaRouter đạt 75,5% so với phương án thay thế được theo dõi sát nhất là 74,0% (theo orcarouter.ai). Một bảng xếp hạng không chứng minh được điều gì — hãy coi nó chỉ là một điểm dữ liệu đơn lẻ và tự chạy đánh giá của riêng bạn trên các prompt của chính bạn trước khi tin tưởng bất kỳ router nào với lưu lượng production, kể cả của chúng tôi. Và nếu bạn đang cố quyết định liệu mình có cần các tính năng router hay tính năng gateway hay không, thì sự khác biệt giữa router và gateway được trình bày trong hướng dẫn của chúng tôi, AI API Gateway in 2026.

Khi khuyến nghị này sai

Danh sách {{KEEP}}skip list{{/KEEP}} trung thực, được trình bày một cách rõ ràng:

Phiên bản ngắn

{{1}}Bộ định tuyến LLM là tầng chọn mô hình nào sẽ trả lời từng yêu cầu{{/1}} — {{2}}rẻ và nhanh cho phần lớn yêu cầu dễ, tiên tiến cho số ít yêu cầu khó, kèm cơ chế chuyển đổi dự phòng khi nhà cung cấp ngừng hoạt động{{/2}}. {{3}}Nó tỏ ra hiệu quả khi các mô hình của bạn chênh lệch nhiều về giá (DeepSeek V4 Flash 0,09 USD so với Claude Opus 5 5,00 USD cho mỗi 1 triệu token đầu vào — chênh lệch 55×) và lưu lượng truy cập của bạn là sự kết hợp giữa yêu cầu dễ và khó{{/3}}. {{4}}Nghiên cứu đặt mức trần tiết kiệm ở khoảng 85% với điều kiện duy trì ngưỡng chất lượng, còn ngưỡng chất lượng đó do bài đánh giá (eval) của bạn quyết định{{/4}}. {{5}}Nó khiến bạn phải trả giá bằng độ trễ và phần nào mất kiểm soát độ chính xác{{/5}}, {{6}}và là giải pháp sai cho các đơn vị chỉ dùng một mô hình, ngân sách độ trễ dưới 300ms, chi phí nhỏ, và các đội ngũ không thể đo lường chất lượng đầu ra{{/6}}. {{7}}Khi nó thực sự phù hợp, hãy chạy nó đằng sau một ngưỡng chất lượng, không tính thêm phí token, định tuyến thử một phần lưu lượng trước, và đọc nhật ký định tuyến trước khi tin vào con số tiết kiệm{{/7}}.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube