
AI Router là gì? Lớp định tuyến LLM chọn mô hình của bạn
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
AI router là một lớp phần mềm nằm giữa ứng dụng của bạn và các nhà cung cấp mô hình, đảm nhận việc quyết định mô hình nào sẽ trả lời cho từng yêu cầu. Lời nhắc được chấm điểm theo độ khó và được định tuyến đến một mô hình rẻ tiền khi dễ, hoặc đến một mô hình tiên tiến khi khó — đó chính là sự khác biệt giữa việc trả $0.09 cho DeepSeek V4 Flash và $5.00 cho Claude Opus 5 trên mỗi 1 triệu token đầu vào cho cùng một lệnh gọi. Cái "AI router" còn lại mà bạn sẽ tìm thấy ở trang đầu của chính kết quả tìm kiếm này — phần cứng Wi-Fi có lõi thần kinh — là một sản phẩm hoàn toàn khác, và chính sự trùng tên đó là lý do vì sao rất ít kết quả trong số đó thực sự hữu ích.
Tìm kiếm "ai router" vào tháng 8 năm 2026 chủ yếu trả về báo chí về mạng gia đình. ASUS tiếp thị ROG Rapture GT-BE19000AI là "bộ định tuyến chơi game AI đầu tiên trên thế giới" — một thiết bị Wi-Fi 7 với NPU, RAM 4GB, bộ nhớ 32GB và công cụ Docker chạy Home Assistant hoặc AdGuard ngay trên bộ định tuyến. ZTE, cùng với Tianyi Digital Life của China Telecom, đã xuất xưởng một bộ định tuyến gia đình Wi-Fi 7 "AI-native" có thể cảm nhận khi bạn rời khỏi nhà và tự cấu hình lại mạng nhà thông minh. Đó là những thiết bị thực sự thú vị, nhưng không phải là thứ mà một nhà phát triển gọi là "AI router". Bài viết này nói về LLM router: hạng mục nằm giữa mã của bạn và các API mô hình ngôn ngữ lớn, chọn mô hình nào trả lời mỗi yêu cầu. Bài viết đề cập đến hai nghĩa của tên gọi, việc bộ định tuyến thực sự làm gì, lợi ích và chi phí, cũng như các trường hợp bạn không nên sử dụng nó.
Hai sản phẩm khác nhau dùng chung tên gọi
Cụm từ "AI router" là một sự trùng hợp, và hai nghĩa của nó hầu như không có điểm chung nào:
• Phần cứng "AI router." Một bộ định tuyến Wi-Fi có các tính năng AI trên hộp — một NPU để suy luận trên thiết bị, tối ưu hóa lưu lượng, đôi khi là Docker. Ví dụ như ASUS ROG Rapture GT-BE19000AI (công bố đầu năm 2026) và bộ định tuyến AI gia đình ZTE / Tianyi Digital Life (tháng 6 năm 2026). Công việc của nó là vận hành mạng gia đình hoặc văn phòng nhỏ của bạn.
• Router LLM.Một dịch vụ phần mềm nhận từng lời gọi API mà ứng dụng của bạn thực hiện và chuyển tiếp nó đến mô hình tốt nhất — mô hình vượt qua ngưỡng chất lượng của bạn với mức giá thấp nhất. Công việc của nó là chi tiêu ngân sách mô hình của bạn một cách hợp lý. Đây chính là "AI router" mà các kỹ sư AI nhắc đến, và là chủ đề của bài viết này.

Sự nhầm lẫn này có ý nghĩa nhiều hơn chỉ là ngữ nghĩa. Người tìm kiếm "ai router" để tìm danh mục phần mềm sẽ nhận được một bức tường các bài đánh giá phần cứng; người tìm kiếm "ai router" cho một hộp Wi-Fi mới lại nhận được tiếp thị về NPU thay vì các con số thông lượng. Không trang kết quả tìm kiếm nào trung thực về sự mơ hồ này, và đó chính xác là khoảng trống trang này lấp đầy — ý nghĩa phần mềm, được định nghĩa tương phản với ý nghĩa phần cứng.
LLM router thực sự làm gì?
Gạt lớp marketing sang một bên, {{1}}một bộ định tuyến mô hình có ba nhiệm vụ, tất cả đều nhàm chán và tất cả đều có giá trị{{/1}}. Thứ nhất, {{2}}nó là một endpoint duy nhất: mã của bạn gọi một URL, tương thích OpenAI, thay vì phải dùng một SDK riêng cho mỗi nhà cung cấp{{/2}}. Thứ hai, {{3}}nó chấm điểm yêu cầu — đọc prompt và ước tính độ khó — rồi định tuyến nó: việc dễ thì giao cho một mô hình rẻ và nhanh, việc suy luận thực sự khó thì giao cho một mô hình tiên phong{{/3}}. Thứ ba, {{4}}nó chuyển sang dự phòng: nếu nhà cung cấp được chọn áp dụng giới hạn tốc độ lên yêu cầu của bạn hoặc trả về lỗi 5xx, bộ định tuyến sẽ thử lại với một mô hình còn hoạt động tốt mà ứng dụng của bạn không bao giờ gặp phải lỗi{{/4}}.
Bước quyết định là nơi các bộ định tuyến khác nhau, và phổ này cũng chính là phổ mà bạn có thể hình dung. Các bộ định tuyến dựa trên quy tắc khớp từ khóa hoặc độ dài prompt với một mô hình — dưới một mili giây, có thể dự đoán trước, nhưng mong manh khi giá hoặc mô hình thay đổi. Các bộ định tuyến ngữ nghĩa nhúng prompt và định tuyến theo ý nghĩa, vì vậy "số dư của tôi là bao nhiêu?" và "tôi có bao nhiêu tiền" sẽ đi vào cùng một đường. Các bộ định tuyến học tập quan sát lưu lượng thực tế và chuyển hướng về phía mô hình nào đang thắng về chất lượng trên mỗi đô la — bộ định tuyến sản xuất của Ramp mô tả đây là một bandit lấy mẫu Thompson và ghi nhận nó đã cắt giảm khoảng 30% chi phí, còn nghiên cứu RouteLLM từ LMSYS báo cáo một bộ định tuyến phân rã ma trận giữ được khoảng 95% điểm số của GPT-4 trong khi chỉ gửi 14% truy vấn đến mô hình mạnh. Các cơ chế sâu hơn của chính sách định tuyến được trình bày đầy đủ trong hướng dẫn của chúng tôi, Auto Router for LLMs; ở đây, điểm mấu chốt là trí tuệ quyết định tồn tại trên một phổ, và "bạn cần điểm nào trên phổ đó" là một quyết định sản phẩm, không phải một danh sách kiểm tra tính năng.
Chênh lệch giá chính là điều khiến nó có lời.
Một router chỉ đáng giá khi các mô hình chênh lệch giá nhiều, và hiện tại chúng chênh lệch rất lớn. Tất cả mức giá dưới đây là giá trực tiếp từ nhà cung cấp cho mỗi 1 triệu token từ danh mục mô hình OrcaRouter, được đọc vào ngày 2026-08-10:

Đọc bảng giá là tự hiểu ra vấn đề. DeepSeek V4 Flash với giá $0,09/$0,18 cho mỗi 1M token so với Claude Opus 5 ở mức $5,00/$25,00 chênh lệch khoảng 55 lần chỉ riêng ở token đầu vào, và khoảng cách giữa phân khúc giá rẻ và phân khúc tiên tiến giờ đây là đặc điểm thường trực của thị trường, chứ không phải đợt giảm giá một lần. Nếu lưu lượng truy cập của bạn là sự pha trộn điển hình — phần lớn là các yêu cầu ngắn, được mô tả rõ ràng và thiểu số là các bài toán suy luận thực sự khó — thì gửi mọi thứ đến phân khúc tiên tiến đồng nghĩa với việc trả giá cao nhất cho 80% việc dễ. Một bộ định tuyến đưa các yêu cầu dễ xuống phân khúc giá rẻ chính là nơi bạn tiết kiệm được tiền.
Các con số đo được thống nhất với nhau. Nghiên cứu thuộc lớp RouteLLM báo cáo mức tiết kiệm lên tới khoảng 85% trong khi vẫn giữ được chất lượng ngang tầm frontier — nhưng chỉ khi bộ định tuyến được kết hợp với một sàn chất lượng, thứ không chấp nhận làm qua loa cho những yêu cầu thực sự cần mô hình frontier. Ramp báo cáo mức giảm khoảng 30% trên lưu lượng sản xuất thực tế mà không có sự sụt giảm chất lượng đáng kể. Chính các bảng thuật ngữ của các nhà cung cấp bộ định tuyến cũng trích dẫn mức giảm chi phí 50–70% cho mỗi truy vấn khi định tuyến các tác vụ dễ ra khỏi các mô hình frontier. Sự trải rộng của các con số mới là bức tranh trung thực: trần phụ thuộc vào đặc điểm lưu lượng của bạn, còn sàn là bất cứ thứ gì mà bài đánh giá chất lượng của bạn xác định. Điều bạn không nên tin là một con số cố định duy nhất kiểu "định tuyến tiết kiệm X%", vì đó là thuộc tính của khối lượng công việc của bạn, chứ không phải của các bộ định tuyến nói chung.
Định tuyến khiến bạn tốn kém điều gì?
Hai chi phí mà không ai tính đến trong bài đánh giá phần cứng là độ trễ và độ chính xác, và cả hai đều có thật.
Độ trễ. Mọi yêu cầu được định tuyến đều phải trả một khoản thuế phân loại trước khi mô hình bắt đầu xử lý. Bộ phân loại dựa trên quy tắc mất dưới một mili giây; mô hình embedding hoặc phân loại cỡ nhỏ thêm khoảng 50–200ms; bộ phân loại miền được huấn luyện thì còn tốn nhiều hơn. Hầu hết các bộ định tuyến che đi phần lớn chi phí này bằng cách phân loại trong khi chuẩn bị yêu cầu thượng nguồn, và chi phí đầu cuối của một endpoint định tuyến trong sản xuất được đo ở mức trung vị khoảng 55ms — dưới 1% thời gian phản hồi thông thường. Nhưng nếu lưu lượng của bạn là thời gian thực — trợ lý giọng nói, giao diện người dùng phải phản hồi trong 300ms — một chặng định tuyến tốn hàng trăm mili giây có thể là ranh giới giữa dùng được và không dùng được. Chính ràng buộc duy nhất đó là lý do phổ biến nhất khiến một nhóm có trường hợp sử dụng định tuyến chính đáng quyết định không định tuyến.
Độ chính xác. Một bộ định tuyến chỉ tốt bằng khả năng phán đoán mà nó dựa vào để định tuyến. Một bộ phân loại được huấn luyện trên các benchmark tổng quát có thể tự tin sai về miền của bạn: nhiệm vụ tóm tắt "dễ" của bạn có thể dễ với mô hình tiên tiến nhưng bất khả thi với mô hình rẻ. Chế độ lỗi thầm lặng — người dùng chỉ nhận được đầu ra tệ hơn và không ai ghi lại — đó là lý do tại sao mọi bộ định tuyến đáng tin cậy đều đi kèm một sàn chất lượng hoặc chế độ cân bằng, và tại sao chế độ tối ưu chi phí quyết liệt nên là một thí nghiệm, không phải mặc định.
Còn có một chi phí thứ ba tinh vi: mã định tuyến có thể phá vỡ các khoản giảm giá của nhà cung cấp mà bạn đang có. Cả OpenAI và Anthropic đều giảm giá cho các tiền tố lặp lại, thường khoảng 90% cho token đầu vào khi đọc bộ nhớ đệm. Nếu lớp định tuyến của bạn viết lại, sắp xếp lại, hoặc chèn một dấu thời gian luân phiên vào prompt, nó sẽ làm mất hiệu lực tiền tố và vứt bỏ khoản giảm giá đó. Một bộ định tuyến tốt sẽ chuyển prompt qua nguyên vẹn từng byte và để cho bộ nhớ đệm của chính nhà cung cấp hoạt động; một bộ bất cẩn sẽ âm thầm biến các lần truy cập bộ nhớ đệm của bạn thành các cuộc gọi với giá đầy đủ.
Router so với gateway, trong một đoạn văn.
Bạn cũng sẽ thấy "AI gateway" được dùng gần như thay thế cho nhau, và sự khác biệt này đáng để nắm rõ dù hầu hết các sản phẩm được quản lý đều có cả hai. Một bộ định tuyến trả lời mô hình nào — chi phí, độ trễ, khả năng. Một gateway trả lời ai có thể gọi nó — xác thực, giới hạn tốc độ token, ngân sách, nhật ký kiểm toán, tuân thủ. Nếu bạn cần quản trị cho một nhóm hoặc một sản phẩm, bạn cần các tính năng gateway; nếu bạn cần một tổ hợp mô hình rẻ hơn, bạn cần định tuyến. Sự khác biệt về vận hành được trình bày đầy đủ trong hướng dẫn của chúng tôi, AI API Gateway in 2026; ở đây, điểm mấu chốt là "một AI router" thường có nghĩa là một sản phẩm có cả hai phần, và bạn nên hỏi bạn thực sự đang trả tiền cho phần nào.
Khi bạn thực sự cần một bộ định tuyến AI
Danh sách trigger trung thực, thay vì một bài tiếp thị cho việc luôn định tuyến:
• Bạn chạy nhiều hơn một mô hình trong production.Định tuyến là cách bạn giữ cho tổ hợp mô hình hợp lý khi các mô hình mới ra mắt và giá cả biến động. Một hệ thống chỉ dùng một mô hình duy nhất thì không cần đến nó.
• Lưu lượng truy cập của bạn bao gồm cả yêu cầu dễ lẫn khó. Nếu mọi yêu cầu đều khó như nhau, bộ định tuyến không có gì để khai thác chênh lệch. Phân loại-rồi-định tuyến chỉ có lợi khi có phần lớn yêu cầu rẻ để tận dụng.
• Khối lượng của bạn đủ lớn để tỷ lệ phần trăm có ý nghĩa. Mức giảm 40% trên khoản chi 50 đô la mỗi tháng là 20 đô la; với 50.000 đô la thì đó là chi phí cho một nhân viên.
• Sự cố nhà cung cấp đang gây thiệt hại cho bạn. Chuyển đổi dự phòng tự động giữa các nhà cung cấp thường là lợi ích thực sự đầu tiên mà các nhóm cảm nhận được, trước cả khoản tiết kiệm chi phí.
• Bạn muốn một hợp đồng, một khóa, một điểm cuối. Chi phí tích hợp N nhà cung cấp tự nó là một lý do để định tuyến qua một.
Đảo ngược những điều đó và bạn có danh sách bỏ qua: một mô hình, độ khó đồng nhất, chi phí không đáng kể, hoặc ngân sách độ trễ mà một bước phân loại phá vỡ. Đối với những nhóm đó, một bộ định tuyến là chi phí phụ, và gọi trực tiếp nhà cung cấp là câu trả lời tốt hơn.
Khuyến nghị: một bộ định tuyến được quản lý với mức chất lượng tối thiểu
Đối với một nhóm đã vượt qua các tiêu chí nêu trên, khuyến nghị là sử dụng một bộ định tuyến được quản lý (managed router) duy trì chất lượng tối thiểu và không tính phí chênh lệch trên token. Sản phẩm của chúng tôi là OrcaRouter, và đây là sản phẩm chúng tôi có thể trình bày chi tiết, vì vậy các thông tin cụ thể dưới đây là của chúng tôi; danh sách kiểm tra tiếp theo áp dụng cho bất kỳ bộ định tuyến nào bạn đánh giá.
Chế độ tự động của OrcaRouter — yêu cầu tên mô hình orcarouter/auto trên endpoint tương thích OpenAI tiêu chuẩn — chấm điểm từng prompt và định tuyến nó qua hơn 200 mô hình. Nó cung cấp bốn chính sách với Balanced là mặc định: Cheapest gửi đến mô hình có chi phí thấp nhất có thể trả lời, Balanced đến mô hình rẻ nhất đạt tiêu chuẩn chất lượng, Quality đến mô hình có điểm cao nhất bất kể giá cả, và Adaptive học từ lưu lượng trực tiếp của bạn và điều chỉnh định tuyến trong quá trình hoạt động. Việc chấm điểm được đo trong chưa đầy một mili giây, tổng độ trễ bổ sung dưới 50ms, và nếu nhà cung cấp đã chọn giới hạn tốc độ hoặc gặp lỗi, bộ định tuyến sẽ chuyển đổi dự phòng ngay giữa luồng sang một mô hình khỏe mạnh trong vòng dưới 50ms. Không có phụ phí ở bất kỳ lớp nào: bạn trả cho mỗi nhà cung cấp đúng mức giá công bố — các con số $0.09 hoặc $5.00 ở trên là số tiền bạn trả — và bản thân việc định tuyến là miễn phí.

Về độ chính xác, bảng xếp hạng RouterArena tháng 6/2026 chấm OrcaRouter đạt 75,5%, GPT-5 đạt 74,0, Azure đạt 72,8, Martian đạt 61,6 và NotDiamond đạt 60,8 (theo orcarouter.ai). Một bảng xếp hạng không chứng minh được điều gì cả — hãy coi nó như một điểm dữ liệu đơn lẻ và tự chạy đánh giá trên chính prompt của bạn trước khi tin tưởng giao lưu lượng production cho bất kỳ router nào, kể cả của chúng tôi. Đó cũng chính là cách đúng đắn để chọn router nếu bạn không dùng chúng tôi: đưa một phần lưu lượng đi qua, giữ phương án dự phòng, ép những prompt khó nhất của bạn đi qua, và đọc nhật ký định tuyến theo từng yêu cầu trước khi tin vào lời tuyên bố tiết kiệm.
Khi khuyến nghị này sai
Các trường hợp mà router được quản lý (managed router) là lựa chọn sai, được nói thẳng ra:
• Về cơ bản bạn chỉ dùng một mô hình. Bộ định tuyến thêm một bước nhảy và một khoản phí phân loại chẳng để làm gì. Hãy gọi trực tiếp nhà cung cấp và bỏ qua lớp trung gian.
• Phản hồi của bạn phải tức thì. Nếu yêu cầu là độ trễ đầu cuối dưới khoảng 300ms, bước định tuyến cộng với độ chậm của mô hình tầm trung có thể phá vỡ ngân sách của bạn. Hãy cố định mô hình.
• Doanh số của bạn rất nhỏ.Định tuyến giúp bạn tiết kiệm một tỷ lệ phần trăm trên chi tiêu, nhưng nó không thể tiết kiệm cho bạn một tỷ lệ phần trăm của con số không. Với mức dưới vài trăm đô la mỗi tháng, thời gian của bạn đáng giá hơn số tiền tiết kiệm được.
• Việc lựa chọn mô hình phải có thể kiểm toán được. Nếu một phản hồi cần phải tái lập được, hoặc mô hình đằng sau nó cần được giải trình cho người đánh giá, thì lựa chọn của bộ định tuyến tự động là một biến số bạn phải biện minh. Hãy ghi log, cố định nó, hoặc đừng định tuyến.
• Bạn không thể đo lường chất lượng.Nếu không có đánh giá nào cho bạn biết đầu ra được định tuyến có đủ tốt hay không, bạn không thể biết liệu bộ định tuyến có hoạt động hay không, và việc định tuyến theo chi phí quyết liệt sẽ âm thầm làm giảm chất lượng đầu ra mà bạn không bao giờ kiểm tra.
• Bạn đang ở chế độ air-gapped hoặc bị ràng buộc bởi quy định tuân thủ. Nếu các mô hình không bao giờ được phép rời khỏi mạng của bạn, một bộ định tuyến được quản lý (managed router) hoàn toàn là lựa chọn sai — hãy chạy một lớp định tuyến mã nguồn mở trên cơ sở hạ tầng của riêng bạn.
• Bạn đã vận hành một API gateway. Nếu đã đầu tư vào một gateway, hãy mở rộng hệ thống hiện có thay vì thêm một bộ định tuyến song song. Các tính năng định tuyến và gateway đang hội tụ; một lớp thứ hai chỉ tạo thêm sự quản trị, chứ không tạo thêm giá trị.
Phiên bản ngắn
Một bộ định tuyến AI, theo nghĩa mà các kỹ sư AI hàm ý, là tầng phần mềm quyết định LLM nào sẽ trả lời mỗi yêu cầu — và cái tên này, thật khó hiểu, cũng được dùng để chỉ phần cứng Wi-Fi chạy Docker. Nó hoạt động bằng cách chấm điểm từng prompt và gửi phần lớn các yêu cầu dễ đến một mô hình rẻ tiền, trong khi giữ phần nhỏ khó ở mô hình tiên tiến, kèm cơ chế chuyển đổi dự phòng khi nhà cung cấp gặp sự cố. Nó đáng giá khi các mô hình của bạn chênh lệch giá nhiều (DeepSeek V4 Flash ở mức $0.09 so với Claude Opus 5 ở mức $5.00 cho mỗi 1M token đầu vào, tức chênh lệch khoảng 55 lần) và lưu lượng truy cập của bạn là hỗn hợp giữa dễ và khó; các nghiên cứu cùng lớp với RouteLLM cho thấy trần tiết kiệm khoảng 85% với một ngưỡng chất lượng tối thiểu. Nó khiến bạn mất thêm độ trễ và một phần kiểm soát độ chính xác, và nó là giải pháp sai cho các hệ thống chỉ dùng một mô hình, các ngân sách độ trễ dưới 300ms, mức chi tiêu nhỏ, và các đội ngũ không thể đo lường chất lượng đầu ra. Khi nó là lựa chọn đúng, hãy chạy nó với một ngưỡng chất lượng tối thiểu, không cộng thêm phí token, định tuyến thử một phần lưu lượng trước, và đọc nhật ký định tuyến trước khi tin vào khoản tiết kiệm.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
