การ์ดหัวเรื่องหลักที่อ่านว่า 'LLM Router คืออะไร?' พร้อมคำบรรยาย 'เลเยอร์ที่เลือกโมเดล คณิตศาสตร์จริง และเมื่อใดควรข้ามมัน' แสดงการ์ดมุมโค้งสามใบที่มีป้ายกำกับว่า 'หนึ่งเอนด์พอยต์', 'จัดระดับและเส้นทาง' และ 'เฟลโอเวอร์' บนพื้นหลังสีขาวพร้อมโทนสีน้ำเงินและสีเขียวน้ำเงิน และโลโก้ OrcaRouter ประกอบที่มุมขวาล่าง
Guides & Insights

LLM Router คืออะไร? เลเยอร์ที่เลือกโมเดล คณิตศาสตร์ที่แท้จริง และเมื่อใดควรข้ามมัน

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

LLM เราเตอร์คือชั้นซอฟต์แวร์ที่อยู่ระหว่างแอปพลิเคชันของคุณกับผู้ให้บริการโมเดล และตัดสินใจสำหรับทุกคำขอว่าโมเดลใดควรตอบคำขอนั้น — โมเดลที่ถูกและเร็วอย่าง DeepSeek V4 Flash เมื่องานง่าย ส่วนโมเดลระดับแนวหน้าอย่าง Claude Opus 5 เมื่องานยากจริงๆ ประเด็นคือเรื่องเงิน: DeepSeek V4 Flash มีค่าใช้จ่าย $0.09 ต่อล้านโทเค็นอินพุต และ Claude Opus 5 มีค่าใช้จ่าย $5.00 ซึ่งเป็นอัตราโดยตรงจากผู้ให้บริการตามแคตตาล็อกโมเดล OrcaRouter ที่อ่านเมื่อ 2026-08-10 ซึ่งต่างกัน 55 เท่าในคำขอเดียวกัน หากคุณส่งทราฟฟิกง่าย 80% ไปยังโมเดลราคาถูก และเก็บทราฟฟิกยาก 20% ไว้ที่โมเดลแพง คุณก็กำลังดึงคันโยกต้นทุนที่ใหญ่ที่สุดเพียงอันเดียวที่ทีมส่วนใหญ่ไม่เคยแตะต้อง

แท้จริงแล้ว LLM router คืออะไร

ไม่ต้องสนใจการตลาด แล้วเราเตอร์โมเดลมีหน้าที่สามอย่าง ทั้งหมดน่าเบื่อแต่ล้วนมีคุณค่า มันคือปลายทางเดียว: โค้ดของคุณเรียกใช้ URL ที่เข้ากันได้กับ OpenAI ได้หนึ่งเดียว แทนที่จะต้องใช้ SDK แยกตามผู้ให้บริการแต่ละราย มันจัดระดับคำขอ ประเมินความยาก แล้วจัดเส้นทาง: งานง่ายไปยังโมเดลราคาถูก ส่วนการใช้เหตุผลที่ยากจริง ๆ ไปยังโมเดลระดับแนวหน้า และมันทำ failover: ถ้าผู้ให้บริการที่เลือกจำกัดอัตราการเรียกใช้ของคุณ หรือส่งคืนข้อผิดพลาด 5xx เราเตอร์จะลองใหม่กับโมเดลที่ทำงานปกติ โดยที่แอปพลิเคชันของคุณไม่เห็นข้อผิดพลาดนั้นเลย

ขั้นตอนการตัดสินใจคือจุดที่เราเตอร์ต่างกัน และสเปกตรัมนี้ก็เป็นสิ่งที่คุ้นเคย เราเตอร์แบบอิงกฎจับคู่คีย์เวิร์ดหรือความยาวพรอมป์ต์กับโมเดล — ภายในไม่ถึงมิลลิวินาที คาดเดาได้ แต่เปราะบางเมื่อราคาหรือโมเดลเปลี่ยนไป เราเตอร์เชิงความหมายทำเอมเบดดิ้งพรอมป์ต์และจัดเส้นทางตามความหมาย ดังนั้น 'ยอดเงินฉันเท่าไหร่?' และ 'ฉันมีเงินเท่าไหร่' จึงไปเส้นทางเดียวกัน เราเตอร์แบบเรียนรู้เฝ้าดูทราฟฟิกจริงและปรับไปทางโมเดลที่กำลังชนะด้านคุณภาพต่อดอลลาร์ กลไกของแต่ละแบบ — รวมถึงช่วงความแม่นยำของตัวจำแนกประเภทชนิดต่าง ๆ และโหมดอัตโนมัติที่ให้คะแนนทุกพรอมป์ต์ — มีรายละเอียดครบถ้วนในคู่มือ Auto Router for LLMs ของเรา ส่วนประเด็นตรงนี้คือ ความฉลาดในการจัดเส้นทางมีอยู่บนสเปกตรัม และจุดที่คุณต้องการคือการตัดสินใจเชิงผลิตภัณฑ์ ไม่ใช่รายการตรวจสอบฟีเจอร์

Flow card titled 'One request, three jobs' showing a horizontal pipeline: a request enters ONE ENDPOINT ('one OpenAI-compatible URL'), passes through GRADE & ROUTE ('easy to a cheap model, hard to a frontier model'), then FAILOVER ('provider down? retry a healthy model'), with a footer reading 'Grading under 1ms · mid-stream failover under 50ms' and the OrcaRouter logo composited bottom-right.

หากคุณเคยเห็นคำว่า "AI router" ถูกใช้กับฮาร์ดแวร์ Wi-Fi ที่มี NPU ในตัว — นั่นเป็นผลิตภัณฑ์คนละประเภทที่บังเอิญใช้ชื่อเดียวกัน และเราได้คลี่คลายความสับสนนี้ไว้ในคู่มือ AI router ของเรา ทุกอย่างในบทความนี้เกี่ยวกับหมวดหมู่ซอฟต์แวร์

ส่วนต่างราคาคือสิ่งที่ทำให้มันคุ้มค่า

เราเตอร์จะคุ้มค่าก็ต่อเมื่อรุ่นต่าง ๆ มีราคาแตกต่างกันมาก และในตอนนี้ราคาก็แตกต่างกันอย่างมหาศาล อัตราทั้งหมดด้านล่างเป็นราคาตรงจากผู้ให้บริการต่อ 1 ล้านโทเคน จากแคตตาล็อกรุ่น OrcaRouter อ่านเมื่อวันที่ 2026-08-10:

Price table card titled 'The price spread, per 1M tokens' listing five models with input and output prices per 1M tokens: DeepSeek V4 Flash $0.09/$0.18, GPT-5.6 Luna $0.10/$0.60, Gemini 3.6 Flash $1.50/$7.50, Claude Sonnet 5 $2.00/$10.00 (intro through Aug 31 2026), Claude Opus 5 $5.00/$25.00, with DeepSeek V4 Flash highlighted in blue and Claude Opus 5 highlighted, and a footnote reading 'Input spread: DeepSeek V4 Flash $0.09 vs Claude Opus 5 $5.00 — about 55x. Provider-direct rates per the OrcaRouter model catalogue, read 2026-08-10.'

อ่านตัวเลขส่วนต่างแล้วข้อโต้แย้งก็เขียนออกมาเอง DeepSeek V4 Flash ที่ $0.09 เทียบกับ Claude Opus 5 ที่ $5.00 คือความต่างราว 55 เท่าเฉพาะค่า input tokens อย่างเดียว และช่องว่างระหว่างระดับราคาถูกกับระดับ前沿 (frontier) กลายเป็นคุณสมบัติถาวรของตลาด ไม่ใช่ส่วนลดแบบครั้งเดียว ถ้าทราฟฟิกของคุณเป็นแบบผสมทั่วไป — ส่วนใหญ่เป็นคำขอสั้น ๆ ที่ระบุชัดเจน และส่วนน้อยเป็นงานใช้เหตุผลที่ยากจริง ๆ — การรันทุกอย่างบนโมเดลระดับ前沿หมายถึงการจ่ายราคาสูงสุดสำหรับ 80% ที่ง่ายนั้น

นี่คือจุดที่ผลการค้นหาหน้าแรกในปัจจุบันสำหรับ "llm router" ทำให้คุณผิดหวัง ตัวอย่างเช่น รายการในพจนานุกรมศัพท์ของ Decagon อ้างอิง "GPT-4o, Claude 3.5 Sonnet และ Gemini 1.5 Pro" ที่ "$5–15 ต่อล้านโทเค็นอินพุต" — โมเดลที่ยังเป็นรุ่นปัจจุบันเมื่อสองปีก่อนในราคาที่สูงกว่าราคาปัจจุบันประมาณสองเท่า ตลาดเปลี่ยนไปแล้ว แต่คำนิยามไม่เปลี่ยนตาม นั่นคือเหตุผลสำคัญที่สุดข้อเดียวที่จะไม่เชื่อถือคำอธิบาย LLM router ที่ไม่มีวันที่กำกับ

สิ่งที่งานวิจัยเรื่องการออมเงินกล่าวไว้จริงๆ

เลขคณิตข้างต้นเป็นเรื่องจริง และงานวิจัยก็เป็นจริงเช่นกัน — แต่ภาพที่ตรงไปตรงมาคือช่วงของค่า ไม่ใช่ตัวเลขเดียว

Cost card titled 'One support bot, two ways' showing the monthly API cost for 100,000 conversations (1,000 input + 200 output tokens each): all traffic on Claude Sonnet 5 at $400/month versus routed traffic with 80% on DeepSeek V4 Flash and 20% on Claude Sonnet 5 at $90/month, with a highlighted note reading 'about 78% cheaper' and a footnote stating the assumptions: 100k conversations per month, introductory rates through Aug 31 2026, no caching, provider-direct rates per the OrcaRouter model catalogue read 2026-08-10.

นี่คือการคำนวณที่ทำไว้แล้ว พร้อมระบุข้อสมมติฐานชัดเจน เพื่อให้คุณปรับได้ตามต้องการ แชทบอตฝ่ายสนับสนุนที่จัดการ 100,000 บทสนทนาต่อเดือน โดยแต่ละบทสนทนาส่ง input 1,000 โทเคนและสร้าง output 200 โทเคน: หากรันทุกอย่างบน Claude Sonnet 5 จะมีค่าใช้จ่ายประมาณ $400 ต่อเดือน แต่ถ้าเส้นทาง 80% ที่ง่ายไปยัง DeepSeek V4 Flash และเก็บ 20% ที่ยากไว้บน Claude Sonnet 5 ปริมาณการใช้งานเดียวกันนี้จะมีค่าใช้จ่ายประมาณ $90 — ถูกกว่าราว 78% และยังไม่นับ prompt caching ซึ่งจะทำให้ส่วนต่างยิ่งห่างขึ้นไปอีก

สิ่งที่ควรนำไปใช้: การกำหนดเส้นทางแบบ aggressive ประหยัดได้ 60–85% เมื่อทราฟฟิกของคุณส่วนใหญ่เป็นแบบง่าย การกำหนดเส้นทางแบบ balanced ประหยัด 35–45% และแม้แต่การกำหนดเส้นทางแบบ conservative ก็ยังประหยัด 10–15% ตัวเลขที่แม่นยำสำหรับคุณนั้นเป็นคุณสมบัติของทราฟฟิกของคุณ ซึ่งวัดจากพรอมต์ของคุณเอง — ไม่ใช่ค่าคงที่ที่คุณจะคัดลอกจากบล็อกโพสต์ได้

ต้นทุนสามอย่างที่การกำหนดเส้นทางซ่อนไว้

ต้นทุนสองอย่างที่ไม่มีใครระบุไว้ในรายการศัพท์คือความหน่วงและความแม่นยำ และยังมีอย่างที่สามซึ่งละเอียดอ่อนยิ่งกว่า

ความหน่วง. ทุกคำขอที่ถูกกำหนดเส้นทางต้องจ่ายภาษีการจัดหมวดหมู่ก่อนที่โมเดลจะเริ่มทำงานด้วยซ้ำ ตัวจำแนกแบบกฎใช้เวลาต่ำกว่ามิลลิวินาที; โมเดล embedding หรือตัวจำแนกขนาดเล็กเพิ่มเวลาประมาณ 50–200 มิลลิวินาที; ตัวจำแนกโดเมนที่ผ่านการฝึกเพิ่มมากกว่านั้น เราเตอร์ที่ดีจะซ่อนภาระส่วนใหญ่โดยจัดหมวดหมู่ไปพร้อมกับการเตรียมคำขอต้นทาง และเอนด์พอยต์การกำหนดเส้นทางในระบบผลิตหนึ่งแห่งวัดค่าใช้จ่ายแบบ end-to-end ได้ค่ามัธยฐานประมาณ 55 มิลลิวินาที — ซึ่งน้อยกว่า 1% ของเวลาตอบสนองปกติ แต่หากทราฟฟิกของคุณเป็นแบบเรียลไทม์ — เช่น เอเจนต์เสียง หรือ UI ที่ต้องตอบสนองภายใน 300 มิลลิวินาที — การกระโดดเส้นทางที่ใช้เวลาหลายร้อยมิลลิวินาทีอาจเป็นตัวชี้ขาดระหว่างที่ใช้งานได้กับใช้งานไม่ได้ ข้อจำกัดเพียงข้อเดียวนี้เป็นเหตุผลที่พบบ่อยที่สุดที่ทีมซึ่งมีกรณีการใช้งานการกำหนดเส้นทางที่สมเหตุสมผลตัดสินใจไม่ใช้การกำหนดเส้นทาง

ความแม่นยำ. เราเตอร์จะดีได้เพียงเท่ากับวิจารณญาณที่มันใช้ตัดสินใจเส้นทางเท่านั้น ตัวจำแนกที่ฝึกบนเกณฑ์มาตรฐานทั่วไปอาจผิดอย่างมั่นใจสำหรับโดเมนของคุณ: งานสรุปความที่ "ง่าย" ของคุณอาจง่ายสำหรับโมเดลระดับแนวหน้าแต่เป็นไปไม่ได้สำหรับโมเดลราคาถูก รูปแบบความล้มเหลวนี้เงียบ — ผู้ใช้ได้รับผลลัพธ์ที่แย่ลงและไม่มีใครบันทึกไว้ — ซึ่งเป็นเหตุผลที่เราเตอร์ที่น่าเชื่อถือทุกตัวมาพร้อมกับพื้นคุณภาพขั้นต่ำหรือโหมดสมดุล

การทำให้แคชไม่ถูกต้อง. ทั้ง OpenAI และ Anthropic ให้ส่วนลดสำหรับคำนำหน้าพรอมต์ที่ซ้ำกัน โดยทั่วไปแล้วจะลดประมาณ 90% ของโทเค็นอินพุตเมื่อมีการอ่านจากแคช หากเลเยอร์การจัดเส้นทางของคุณเขียนพรอมต์ใหม่ จัดเรียงใหม่ หรือแทรก timestamp ที่หมุนเวียนลงในพรอมต์ มันจะทำให้คำนำหน้านั้นไม่ถูกต้องและทำให้ส่วนลดนั้นสูญเปล่า เราเตอร์ที่ดีจะส่งพรอมต์ผ่านไปแบบไบต์ต่อไบต์ และปล่อยให้แคชของผู้ให้บริการทำงานเอง

คำแนะนำ: เราเตอร์แบบมีการจัดการที่มีระดับคุณภาพขั้นต่ำ

หากคุณใช้งานมากกว่าหนึ่งโมเดลในโปรดักชัน ทราฟฟิกของคุณคือส่วนผสมของงานง่ายและงานยาก และปริมาณมากพอที่เปอร์เซ็นต์หนึ่งคิดเป็นเงินจริง คำแนะนำคือการเลือกใช้ managed router ที่รักษาระดับคุณภาพขั้นต่ำและไม่คิดมาร์กอัปเพิ่มจากโทเค็น ผลิตภัณฑ์ของเราเองคือ OrcaRouter และเป็นตัวที่เราสามารถพูดถึงในรายละเอียดได้ รายการตรวจสอบที่ตามมาต่อจากนี้ใช้ได้กับเราเตอร์ทุกตัวที่คุณประเมิน

โหมดอัตโนมัติของ OrcaRouter — ขอชื่อโมเดล orcarouter/auto บนเอนด์พอยต์มาตรฐานที่เข้ากันได้กับ OpenAI — จะจัดเกรดแต่ละพรอมป์ต์และกำหนดเส้นทางไปยังโมเดลมากกว่า 200 รุ่น มาพร้อมนโยบายการกำหนดเส้นทางสี่แบบ โดยมี Balanced เป็นค่าเริ่มต้น: Cheapest ส่งไปยังโมเดลที่ราคาถูกที่สุดที่สามารถตอบได้; Balanced ส่งไปยังโมเดลที่ถูกที่สุดที่ผ่านเกณฑ์คุณภาพ; Quality ส่งไปยังโมเดลที่ได้คะแนนสูงสุดโดยไม่คำนึงถึงราคา; Adaptive เรียนรู้จากทราฟฟิกจริงของคุณและปรับเส้นทางไปเรื่อยๆ การจัดเกรดใช้เวลาวัดไม่ถึงหนึ่งมิลลิวินาที ระยะหน่วงรวมที่เพิ่มขึ้นยังคงต่ำกว่า 50 มิลลิวินาที และหากผู้ให้บริการที่เลือกจำกัดอัตราการเรียกใช้หรือเกิดข้อผิดพลาด เราเตอร์จะสลับไปยังโมเดลที่ทำงานได้ดีในระหว่างสตรีมภายในไม่ถึง 50 มิลลิวินาที ไม่มีส่วนต่างค่าใช้จ่ายในทุกชั้น: คุณจ่ายราคาที่ผู้ให้บริการแต่ละรายประกาศไว้เท่านั้น — ตัวเลข $0.09 หรือ $5.00 ข้างต้นคือจำนวนที่คุณจ่าย — และการกำหนดเส้นทางนั้นฟรี

ในด้านความแม่นยำ ลีดเดอร์บอร์ด RouterArena ประจำเดือนมิถุนายน 2026 ให้คะแนน OrcaRouter อยู่ที่ 75.5% เทียบกับทางเลือกที่ใกล้เคียงที่สุดที่ติดตามไว้ที่ 74.0% (อ้างอิงจาก orcarouter.ai) ลีดเดอร์บอร์ดเพียงหนึ่งเดียวไม่ได้พิสูจน์อะไร — จงถือว่ามันเป็นข้อมูลจุดเดียว แล้วรันการประเมินผลของคุณเองบนพรอมป์ตของคุณเอง ก่อนที่คุณจะไว้วางใจเราเตอร์ใดๆ กับการรับส่งข้อมูลในระบบ production รวมถึงของเราด้วย และหากคุณกำลังตัดสินใจว่าคุณต้องการฟีเจอร์เราเตอร์หรือฟีเจอร์เกตเวย์เลยหรือไม่ ความแตกต่างระหว่างเราเตอร์กับเกตเวย์ได้อธิบายไว้ในคู่มือของเรา AI API Gateway in 2026

เมื่อคำแนะนำนี้ไม่ถูกต้อง

สกิปลิสต์ที่ตรงไปตรงมา พูดง่ายๆ:

เวอร์ชันสั้น

ตัวจัดเส้นทาง LLM (LLM router) คือเลเยอร์ที่เลือกว่าโมเดลใดจะตอบแต่ละคำขอ — ราคาถูกและเร็วสำหรับงานง่ายส่วนใหญ่ ใช้โมเดลระดับแนวหน้าสำหรับงานยากส่วนน้อย พร้อมการสำรองเมื่อผู้ให้บริการล่ม มันคุ้มค่าเมื่อโมเดลของคุณมีราคาแตกต่างกันมาก (DeepSeek V4 Flash ที่ $0.09 เทียบกับ Claude Opus 5 ที่ $5.00 ต่อ 1M input tokens คือส่วนต่าง 55 เท่า) และทราฟฟิกของคุณผสมระหว่างงานง่ายและงานยาก งานวิจัยระบุว่าเพดานการประหยัดอยู่ที่ประมาณ 85% ภายใต้พื้นคุณภาพขั้นต่ำ และพื้นนั้นคือสิ่งที่การประเมิน (eval) ของคุณบอก มันแลกกับความหน่วง (latency) และการควบคุมความแม่นยำบางส่วน และเป็นคำตอบที่ผิดสำหรับร้านที่ใช้โมเดลเดียว งบประมาณความหน่วงต่ำกว่า 300ms ค่าใช้จ่ายน้อย และทีมที่ไม่สามารถวัดคุณภาพผลลัพธ์ได้ เมื่อมันเหมาะสม ให้รันภายใต้พื้นคุณภาพขั้นต่ำโดยไม่มีการบวกค่า token จัดเส้นทางกับทราฟฟิกส่วนหนึ่งก่อน และอ่านล็อกการจัดเส้นทางก่อนเชื่อตัวเลขการประหยัด

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube