
LLM Router คืออะไร? เลเยอร์ที่เลือกโมเดล คณิตศาสตร์ที่แท้จริง และเมื่อใดควรข้ามมัน
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
LLM เราเตอร์คือชั้นซอฟต์แวร์ที่อยู่ระหว่างแอปพลิเคชันของคุณกับผู้ให้บริการโมเดล และตัดสินใจสำหรับทุกคำขอว่าโมเดลใดควรตอบคำขอนั้น — โมเดลที่ถูกและเร็วอย่าง DeepSeek V4 Flash เมื่องานง่าย ส่วนโมเดลระดับแนวหน้าอย่าง Claude Opus 5 เมื่องานยากจริงๆ ประเด็นคือเรื่องเงิน: DeepSeek V4 Flash มีค่าใช้จ่าย $0.09 ต่อล้านโทเค็นอินพุต และ Claude Opus 5 มีค่าใช้จ่าย $5.00 ซึ่งเป็นอัตราโดยตรงจากผู้ให้บริการตามแคตตาล็อกโมเดล OrcaRouter ที่อ่านเมื่อ 2026-08-10 ซึ่งต่างกัน 55 เท่าในคำขอเดียวกัน หากคุณส่งทราฟฟิกง่าย 80% ไปยังโมเดลราคาถูก และเก็บทราฟฟิกยาก 20% ไว้ที่โมเดลแพง คุณก็กำลังดึงคันโยกต้นทุนที่ใหญ่ที่สุดเพียงอันเดียวที่ทีมส่วนใหญ่ไม่เคยแตะต้อง
แท้จริงแล้ว LLM router คืออะไร
ไม่ต้องสนใจการตลาด แล้วเราเตอร์โมเดลมีหน้าที่สามอย่าง ทั้งหมดน่าเบื่อแต่ล้วนมีคุณค่า มันคือปลายทางเดียว: โค้ดของคุณเรียกใช้ URL ที่เข้ากันได้กับ OpenAI ได้หนึ่งเดียว แทนที่จะต้องใช้ SDK แยกตามผู้ให้บริการแต่ละราย มันจัดระดับคำขอ ประเมินความยาก แล้วจัดเส้นทาง: งานง่ายไปยังโมเดลราคาถูก ส่วนการใช้เหตุผลที่ยากจริง ๆ ไปยังโมเดลระดับแนวหน้า และมันทำ failover: ถ้าผู้ให้บริการที่เลือกจำกัดอัตราการเรียกใช้ของคุณ หรือส่งคืนข้อผิดพลาด 5xx เราเตอร์จะลองใหม่กับโมเดลที่ทำงานปกติ โดยที่แอปพลิเคชันของคุณไม่เห็นข้อผิดพลาดนั้นเลย
ขั้นตอนการตัดสินใจคือจุดที่เราเตอร์ต่างกัน และสเปกตรัมนี้ก็เป็นสิ่งที่คุ้นเคย เราเตอร์แบบอิงกฎจับคู่คีย์เวิร์ดหรือความยาวพรอมป์ต์กับโมเดล — ภายในไม่ถึงมิลลิวินาที คาดเดาได้ แต่เปราะบางเมื่อราคาหรือโมเดลเปลี่ยนไป เราเตอร์เชิงความหมายทำเอมเบดดิ้งพรอมป์ต์และจัดเส้นทางตามความหมาย ดังนั้น 'ยอดเงินฉันเท่าไหร่?' และ 'ฉันมีเงินเท่าไหร่' จึงไปเส้นทางเดียวกัน เราเตอร์แบบเรียนรู้เฝ้าดูทราฟฟิกจริงและปรับไปทางโมเดลที่กำลังชนะด้านคุณภาพต่อดอลลาร์ กลไกของแต่ละแบบ — รวมถึงช่วงความแม่นยำของตัวจำแนกประเภทชนิดต่าง ๆ และโหมดอัตโนมัติที่ให้คะแนนทุกพรอมป์ต์ — มีรายละเอียดครบถ้วนในคู่มือ Auto Router for LLMs ของเรา ส่วนประเด็นตรงนี้คือ ความฉลาดในการจัดเส้นทางมีอยู่บนสเปกตรัม และจุดที่คุณต้องการคือการตัดสินใจเชิงผลิตภัณฑ์ ไม่ใช่รายการตรวจสอบฟีเจอร์

หากคุณเคยเห็นคำว่า "AI router" ถูกใช้กับฮาร์ดแวร์ Wi-Fi ที่มี NPU ในตัว — นั่นเป็นผลิตภัณฑ์คนละประเภทที่บังเอิญใช้ชื่อเดียวกัน และเราได้คลี่คลายความสับสนนี้ไว้ในคู่มือ AI router ของเรา ทุกอย่างในบทความนี้เกี่ยวกับหมวดหมู่ซอฟต์แวร์
ส่วนต่างราคาคือสิ่งที่ทำให้มันคุ้มค่า
เราเตอร์จะคุ้มค่าก็ต่อเมื่อรุ่นต่าง ๆ มีราคาแตกต่างกันมาก และในตอนนี้ราคาก็แตกต่างกันอย่างมหาศาล อัตราทั้งหมดด้านล่างเป็นราคาตรงจากผู้ให้บริการต่อ 1 ล้านโทเคน จากแคตตาล็อกรุ่น OrcaRouter อ่านเมื่อวันที่ 2026-08-10:

อ่านตัวเลขส่วนต่างแล้วข้อโต้แย้งก็เขียนออกมาเอง DeepSeek V4 Flash ที่ $0.09 เทียบกับ Claude Opus 5 ที่ $5.00 คือความต่างราว 55 เท่าเฉพาะค่า input tokens อย่างเดียว และช่องว่างระหว่างระดับราคาถูกกับระดับ前沿 (frontier) กลายเป็นคุณสมบัติถาวรของตลาด ไม่ใช่ส่วนลดแบบครั้งเดียว ถ้าทราฟฟิกของคุณเป็นแบบผสมทั่วไป — ส่วนใหญ่เป็นคำขอสั้น ๆ ที่ระบุชัดเจน และส่วนน้อยเป็นงานใช้เหตุผลที่ยากจริง ๆ — การรันทุกอย่างบนโมเดลระดับ前沿หมายถึงการจ่ายราคาสูงสุดสำหรับ 80% ที่ง่ายนั้น
นี่คือจุดที่ผลการค้นหาหน้าแรกในปัจจุบันสำหรับ "llm router" ทำให้คุณผิดหวัง ตัวอย่างเช่น รายการในพจนานุกรมศัพท์ของ Decagon อ้างอิง "GPT-4o, Claude 3.5 Sonnet และ Gemini 1.5 Pro" ที่ "$5–15 ต่อล้านโทเค็นอินพุต" — โมเดลที่ยังเป็นรุ่นปัจจุบันเมื่อสองปีก่อนในราคาที่สูงกว่าราคาปัจจุบันประมาณสองเท่า ตลาดเปลี่ยนไปแล้ว แต่คำนิยามไม่เปลี่ยนตาม นั่นคือเหตุผลสำคัญที่สุดข้อเดียวที่จะไม่เชื่อถือคำอธิบาย LLM router ที่ไม่มีวันที่กำกับ
สิ่งที่งานวิจัยเรื่องการออมเงินกล่าวไว้จริงๆ
เลขคณิตข้างต้นเป็นเรื่องจริง และงานวิจัยก็เป็นจริงเช่นกัน — แต่ภาพที่ตรงไปตรงมาคือช่วงของค่า ไม่ใช่ตัวเลขเดียว

นี่คือการคำนวณที่ทำไว้แล้ว พร้อมระบุข้อสมมติฐานชัดเจน เพื่อให้คุณปรับได้ตามต้องการ แชทบอตฝ่ายสนับสนุนที่จัดการ 100,000 บทสนทนาต่อเดือน โดยแต่ละบทสนทนาส่ง input 1,000 โทเคนและสร้าง output 200 โทเคน: หากรันทุกอย่างบน Claude Sonnet 5 จะมีค่าใช้จ่ายประมาณ $400 ต่อเดือน แต่ถ้าเส้นทาง 80% ที่ง่ายไปยัง DeepSeek V4 Flash และเก็บ 20% ที่ยากไว้บน Claude Sonnet 5 ปริมาณการใช้งานเดียวกันนี้จะมีค่าใช้จ่ายประมาณ $90 — ถูกกว่าราว 78% และยังไม่นับ prompt caching ซึ่งจะทำให้ส่วนต่างยิ่งห่างขึ้นไปอีก
สิ่งที่ควรนำไปใช้: การกำหนดเส้นทางแบบ aggressive ประหยัดได้ 60–85% เมื่อทราฟฟิกของคุณส่วนใหญ่เป็นแบบง่าย การกำหนดเส้นทางแบบ balanced ประหยัด 35–45% และแม้แต่การกำหนดเส้นทางแบบ conservative ก็ยังประหยัด 10–15% ตัวเลขที่แม่นยำสำหรับคุณนั้นเป็นคุณสมบัติของทราฟฟิกของคุณ ซึ่งวัดจากพรอมต์ของคุณเอง — ไม่ใช่ค่าคงที่ที่คุณจะคัดลอกจากบล็อกโพสต์ได้
ต้นทุนสามอย่างที่การกำหนดเส้นทางซ่อนไว้
ต้นทุนสองอย่างที่ไม่มีใครระบุไว้ในรายการศัพท์คือความหน่วงและความแม่นยำ และยังมีอย่างที่สามซึ่งละเอียดอ่อนยิ่งกว่า
ความหน่วง. ทุกคำขอที่ถูกกำหนดเส้นทางต้องจ่ายภาษีการจัดหมวดหมู่ก่อนที่โมเดลจะเริ่มทำงานด้วยซ้ำ ตัวจำแนกแบบกฎใช้เวลาต่ำกว่ามิลลิวินาที; โมเดล embedding หรือตัวจำแนกขนาดเล็กเพิ่มเวลาประมาณ 50–200 มิลลิวินาที; ตัวจำแนกโดเมนที่ผ่านการฝึกเพิ่มมากกว่านั้น เราเตอร์ที่ดีจะซ่อนภาระส่วนใหญ่โดยจัดหมวดหมู่ไปพร้อมกับการเตรียมคำขอต้นทาง และเอนด์พอยต์การกำหนดเส้นทางในระบบผลิตหนึ่งแห่งวัดค่าใช้จ่ายแบบ end-to-end ได้ค่ามัธยฐานประมาณ 55 มิลลิวินาที — ซึ่งน้อยกว่า 1% ของเวลาตอบสนองปกติ แต่หากทราฟฟิกของคุณเป็นแบบเรียลไทม์ — เช่น เอเจนต์เสียง หรือ UI ที่ต้องตอบสนองภายใน 300 มิลลิวินาที — การกระโดดเส้นทางที่ใช้เวลาหลายร้อยมิลลิวินาทีอาจเป็นตัวชี้ขาดระหว่างที่ใช้งานได้กับใช้งานไม่ได้ ข้อจำกัดเพียงข้อเดียวนี้เป็นเหตุผลที่พบบ่อยที่สุดที่ทีมซึ่งมีกรณีการใช้งานการกำหนดเส้นทางที่สมเหตุสมผลตัดสินใจไม่ใช้การกำหนดเส้นทาง
ความแม่นยำ. เราเตอร์จะดีได้เพียงเท่ากับวิจารณญาณที่มันใช้ตัดสินใจเส้นทางเท่านั้น ตัวจำแนกที่ฝึกบนเกณฑ์มาตรฐานทั่วไปอาจผิดอย่างมั่นใจสำหรับโดเมนของคุณ: งานสรุปความที่ "ง่าย" ของคุณอาจง่ายสำหรับโมเดลระดับแนวหน้าแต่เป็นไปไม่ได้สำหรับโมเดลราคาถูก รูปแบบความล้มเหลวนี้เงียบ — ผู้ใช้ได้รับผลลัพธ์ที่แย่ลงและไม่มีใครบันทึกไว้ — ซึ่งเป็นเหตุผลที่เราเตอร์ที่น่าเชื่อถือทุกตัวมาพร้อมกับพื้นคุณภาพขั้นต่ำหรือโหมดสมดุล
การทำให้แคชไม่ถูกต้อง. ทั้ง OpenAI และ Anthropic ให้ส่วนลดสำหรับคำนำหน้าพรอมต์ที่ซ้ำกัน โดยทั่วไปแล้วจะลดประมาณ 90% ของโทเค็นอินพุตเมื่อมีการอ่านจากแคช หากเลเยอร์การจัดเส้นทางของคุณเขียนพรอมต์ใหม่ จัดเรียงใหม่ หรือแทรก timestamp ที่หมุนเวียนลงในพรอมต์ มันจะทำให้คำนำหน้านั้นไม่ถูกต้องและทำให้ส่วนลดนั้นสูญเปล่า เราเตอร์ที่ดีจะส่งพรอมต์ผ่านไปแบบไบต์ต่อไบต์ และปล่อยให้แคชของผู้ให้บริการทำงานเอง
คำแนะนำ: เราเตอร์แบบมีการจัดการที่มีระดับคุณภาพขั้นต่ำ
หากคุณใช้งานมากกว่าหนึ่งโมเดลในโปรดักชัน ทราฟฟิกของคุณคือส่วนผสมของงานง่ายและงานยาก และปริมาณมากพอที่เปอร์เซ็นต์หนึ่งคิดเป็นเงินจริง คำแนะนำคือการเลือกใช้ managed router ที่รักษาระดับคุณภาพขั้นต่ำและไม่คิดมาร์กอัปเพิ่มจากโทเค็น ผลิตภัณฑ์ของเราเองคือ OrcaRouter และเป็นตัวที่เราสามารถพูดถึงในรายละเอียดได้ รายการตรวจสอบที่ตามมาต่อจากนี้ใช้ได้กับเราเตอร์ทุกตัวที่คุณประเมิน
โหมดอัตโนมัติของ OrcaRouter — ขอชื่อโมเดล orcarouter/auto บนเอนด์พอยต์มาตรฐานที่เข้ากันได้กับ OpenAI — จะจัดเกรดแต่ละพรอมป์ต์และกำหนดเส้นทางไปยังโมเดลมากกว่า 200 รุ่น มาพร้อมนโยบายการกำหนดเส้นทางสี่แบบ โดยมี Balanced เป็นค่าเริ่มต้น: Cheapest ส่งไปยังโมเดลที่ราคาถูกที่สุดที่สามารถตอบได้; Balanced ส่งไปยังโมเดลที่ถูกที่สุดที่ผ่านเกณฑ์คุณภาพ; Quality ส่งไปยังโมเดลที่ได้คะแนนสูงสุดโดยไม่คำนึงถึงราคา; Adaptive เรียนรู้จากทราฟฟิกจริงของคุณและปรับเส้นทางไปเรื่อยๆ การจัดเกรดใช้เวลาวัดไม่ถึงหนึ่งมิลลิวินาที ระยะหน่วงรวมที่เพิ่มขึ้นยังคงต่ำกว่า 50 มิลลิวินาที และหากผู้ให้บริการที่เลือกจำกัดอัตราการเรียกใช้หรือเกิดข้อผิดพลาด เราเตอร์จะสลับไปยังโมเดลที่ทำงานได้ดีในระหว่างสตรีมภายในไม่ถึง 50 มิลลิวินาที ไม่มีส่วนต่างค่าใช้จ่ายในทุกชั้น: คุณจ่ายราคาที่ผู้ให้บริการแต่ละรายประกาศไว้เท่านั้น — ตัวเลข $0.09 หรือ $5.00 ข้างต้นคือจำนวนที่คุณจ่าย — และการกำหนดเส้นทางนั้นฟรี
ในด้านความแม่นยำ ลีดเดอร์บอร์ด RouterArena ประจำเดือนมิถุนายน 2026 ให้คะแนน OrcaRouter อยู่ที่ 75.5% เทียบกับทางเลือกที่ใกล้เคียงที่สุดที่ติดตามไว้ที่ 74.0% (อ้างอิงจาก orcarouter.ai) ลีดเดอร์บอร์ดเพียงหนึ่งเดียวไม่ได้พิสูจน์อะไร — จงถือว่ามันเป็นข้อมูลจุดเดียว แล้วรันการประเมินผลของคุณเองบนพรอมป์ตของคุณเอง ก่อนที่คุณจะไว้วางใจเราเตอร์ใดๆ กับการรับส่งข้อมูลในระบบ production รวมถึงของเราด้วย และหากคุณกำลังตัดสินใจว่าคุณต้องการฟีเจอร์เราเตอร์หรือฟีเจอร์เกตเวย์เลยหรือไม่ ความแตกต่างระหว่างเราเตอร์กับเกตเวย์ได้อธิบายไว้ในคู่มือของเรา AI API Gateway in 2026
เมื่อคำแนะนำนี้ไม่ถูกต้อง
สกิปลิสต์ที่ตรงไปตรงมา พูดง่ายๆ:
เวอร์ชันสั้น
ตัวจัดเส้นทาง LLM (LLM router) คือเลเยอร์ที่เลือกว่าโมเดลใดจะตอบแต่ละคำขอ — ราคาถูกและเร็วสำหรับงานง่ายส่วนใหญ่ ใช้โมเดลระดับแนวหน้าสำหรับงานยากส่วนน้อย พร้อมการสำรองเมื่อผู้ให้บริการล่ม มันคุ้มค่าเมื่อโมเดลของคุณมีราคาแตกต่างกันมาก (DeepSeek V4 Flash ที่ $0.09 เทียบกับ Claude Opus 5 ที่ $5.00 ต่อ 1M input tokens คือส่วนต่าง 55 เท่า) และทราฟฟิกของคุณผสมระหว่างงานง่ายและงานยาก งานวิจัยระบุว่าเพดานการประหยัดอยู่ที่ประมาณ 85% ภายใต้พื้นคุณภาพขั้นต่ำ และพื้นนั้นคือสิ่งที่การประเมิน (eval) ของคุณบอก มันแลกกับความหน่วง (latency) และการควบคุมความแม่นยำบางส่วน และเป็นคำตอบที่ผิดสำหรับร้านที่ใช้โมเดลเดียว งบประมาณความหน่วงต่ำกว่า 300ms ค่าใช้จ่ายน้อย และทีมที่ไม่สามารถวัดคุณภาพผลลัพธ์ได้ เมื่อมันเหมาะสม ให้รันภายใต้พื้นคุณภาพขั้นต่ำโดยไม่มีการบวกค่า token จัดเส้นทางกับทราฟฟิกส่วนหนึ่งก่อน และอ่านล็อกการจัดเส้นทางก่อนเชื่อตัวเลขการประหยัด
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
