כרטיס כותרת ראשי שעליו כתוב 'מהו נתב LLM?' עם כותרת המשנה 'שכבת בחירת המודל, המתמטיקה האמיתית, ומתי לוותר עליה', המציג שלושה כרטיסים מעוגלים המסומנים נקודת קצה אחת, דירוג וניתוב, ומעבר לגיבוי על רקע לבן עם הדגשים בכחול וציאן ולוגו OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

מהו ראוטר LLM? שכבת בחירת המודל, המתמטיקה האמיתית, ומתי לוותר עליו

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

נתב LLM הוא שכבת תוכנה שיושבת בין היישום שלך לספקי המודלים ומחליטה, עבור כל בקשה, איזה מודל יענה עליה — מודל זול ומהיר כמו DeepSeek V4 Flash כשהמשימה קלה, מודל מתקדם כמו Claude Opus 5 כשהמשימה באמת קשה. העניין הוא כסף: DeepSeek V4 Flash עולה $0.09 למיליון טוקני קלט ו-Claude Opus 5 עולה $5.00, תעריפים ישירים מהספק מתוך קטלוג המודלים של OrcaRouter שנקרא ב-2026-08-10 — פער של פי 55 על אותה קריאה. שלחו את 80% מהתעבורה הקלה למטה ושמרו את 20% הקשה למעלה, ואתם מושכים במנוף העלויות הגדול ביותר שרוב הצוותים אף פעם לא נוגעים בו.

מהו בעצם ראוטר LLM

אם מורידים את כל השיווק, לנתב מודלים (model router) יש שלוש משימות — כולן משעממות וכולן בעלות ערך. הוא stanford endpoint אחד: הקוד שלך קורא לכתובת אחת שתואמת ל-OpenAI במקום SDK נפרד לכל ספק. הוא מדרג את הבקשה, מעריך עד כמה היא קשה, ומנתב אותה: עבודה קלה למודל זול, חשיבה קשה באמת למודל מתקדם. והוא גם מבצע failover: אם הספק שנבחר מגביל אותך בקצב הבקשות או מחזיר שגיאת 5xx, הנתב מנסה שוב מול מודל תקין — והיישום שלך לעולם לא רואה את השגיאה.

שלב ההחלטה הוא המקום שבו נתבים נבדלים, והספקטרום הוא מוכר. נתבים מבוססי חוקים מתאימים מילות מפתח או אורך prompt למודל — מתחת למילישנייה, צפויים, שבירים כשהמחירים או המודלים משתנים. נתבים סמנטיים מטמיעים את ה-prompt ומנתבים לפי משמעות, כך ש"מה היתרה שלי?" ו"כמה כסף יש לי" מגיעים לאותו מסלול. נתבים מבוססי למידה צופים בתעבורה אמיתית ונוטים לכיוון המודל שמנצח באיכות לכל דולר. המכניקה של כל אחד — כולל רצועות הדיוק של סוגי המסווגים השונים ומצב ה-auto שמדרג כל prompt — זוכה לטיפול מלא במדריך שלנו, Auto Router for LLMs; כאן הנקודה היא שאינטליגנציית ניתוב נעה על ספקטרום, ואיזו נקודה אתה צריך היא החלטה מוצרית, לא רשימת תכונות.

Flow card titled 'One request, three jobs' showing a horizontal pipeline: a request enters ONE ENDPOINT ('one OpenAI-compatible URL'), passes through GRADE & ROUTE ('easy to a cheap model, hard to a frontier model'), then FAILOVER ('provider down? retry a healthy model'), with a footer reading 'Grading under 1ms · mid-stream failover under 50ms' and the OrcaRouter logo composited bottom-right.

אם גם אתם נתקלתם במונח "AI router" בהקשר של חומרת Wi-Fi עם NPU עליה — מדובר במוצר שונה שמשתף את אותו השם, ואנחנו מבהירים את ההתנגשות הזו במדריך ה-AI router שלנו. כל מה שכתוב במאמר זה עוסק בקטגוריית התוכנה.

פער המחירים הוא מה שהופך את זה לכדאי.

ראוטר מצדיק את קיומו רק כשהמודלים נבדלים מאוד במחיר, וכרגע הם נבדלים בצורה עצומה. כל התעריפים להלן הם מחירים ישירים מהספק עבור 1M טוקנים מקטלוג המודלים של OrcaRouter, כפי שנקראו ב-2026-08-10:

Price table card titled 'The price spread, per 1M tokens' listing five models with input and output prices per 1M tokens: DeepSeek V4 Flash $0.09/$0.18, GPT-5.6 Luna $0.10/$0.60, Gemini 3.6 Flash $1.50/$7.50, Claude Sonnet 5 $2.00/$10.00 (intro through Aug 31 2026), Claude Opus 5 $5.00/$25.00, with DeepSeek V4 Flash highlighted in blue and Claude Opus 5 highlighted, and a footnote reading 'Input spread: DeepSeek V4 Flash $0.09 vs Claude Opus 5 $5.00 — about 55x. Provider-direct rates per the OrcaRouter model catalogue, read 2026-08-10.'

קראו את הפער במחירים והטיעון מדבר בעד עצמו. DeepSeek V4 Flash ב-$0.09 מול Claude Opus 5 ב-$5.00 הוא הפרש של פי 55 בערך רק על טוקנים של קלט, והפער בין הדרג הזול לדרג הגבוה הוא כיום תכונה קבועה של השוק ולא הנחה חד-פעמית. אם התעבורה שלכם היא תערובת אופיינית — רוב של בקשות קצרות ומוגדרות היטב ומיעוט של חשיבה קשה באמת — להריץ הכל על הדרג הגבוה פירושו לשלם מחיר מלא על 80% הקלים.

כאן תוצאות העמוד הראשון הנוכחיות עבור "llm router" מאכזבות אותך. ערך המילון של Decagon, למשל, מצטט את "GPT-4o, Claude 3.5 Sonnet ו-Gemini 1.5 Pro" במחיר של "$5–15 למיליון טוקנים" — מודלים שהיו עדכניים לפני שנתיים במחירים גבוהים בערך פי שניים ממחירי היום. השוק השתנה; ההגדרה לא. זו הסיבה החשובה ביותר לא לתת אמון בהסבר על LLM router ללא תאריכים.

מה באמת אומר מחקר החיסכון

החשבון שלמעלה הוא אמיתי, וכך גם המחקר — אך התמונה הכנה היא טווח, לא מספר יחיד.

Cost card titled 'One support bot, two ways' showing the monthly API cost for 100,000 conversations (1,000 input + 200 output tokens each): all traffic on Claude Sonnet 5 at $400/month versus routed traffic with 80% on DeepSeek V4 Flash and 20% on Claude Sonnet 5 at $90/month, with a highlighted note reading 'about 78% cheaper' and a footnote stating the assumptions: 100k conversations per month, introductory rates through Aug 31 2026, no caching, provider-direct rates per the OrcaRouter model catalogue read 2026-08-10.

הנה החישוב המפורט, עם ההנחות שצוינו כדי שתוכלו להתאים אותן. בוט תמיכה המטפל ב-100,000 שיחות בחודש, שכל אחת שולחת 1,000 טוקני קלט ומייצרת 200 טוקני פלט: הרצת הכל על Claude Sonnet 5 עולה כ-400 דולר בחודש. אם מנתבים את 80% הקלים ל-DeepSeek V4 Flash ומשאירים את 20% הקשים על Claude Sonnet 5, אותה כמות תנועה עולה כ-90 דולר — זול בכ-78% בערך, לפני כל אחסון במטמון (prompt caching), מה שירחיב עוד יותר את הפער.

הצורה שכדאי לקחת מכאן: ניתוב אגרסיבי חוסך 60–85% כאשר התעבורה שלך קלה ברובה, ניתוב מאוזן חוסך 35–45%, ואפילו ניתוב שמרני חוסך 10–15%. הנתון המדויק עבורך הוא תכונה של התעבורה שלך, שנמדדת על הפרומפטים שלך — לא קבוע שאפשר להעתיק מפוסט בבלוג.

ניתוב מסתיר את שלוש העלויות

שתי העלויות שאיש אינו שם בערך במילון המונחים הן זמן ההשהיה והדיוק, ויש עלות שלישית שהיא עדינה יותר.

חביון.כל בקשה שמנותבת משלמת מס סיווג לפני שהמודל בכלל מתחיל. מסווג מבוסס-חוקים הוא מתחת לאלפית שנייה; מודל embedding או מסווג קטן מוסיף בערך 50–200 אלפיות שנייה; מסווג תחום מאומן מוסיף יותר. נתב טוב מסתיר את רוב זה בכך שהוא מסווג תוך כדי הכנת הבקשה למעלה (upstream), ונקודת קצה ייצור אחת של ניתוב מדדה תקורה מקצה לקצה בחציון של כ-55 אלפיות שנייה — פחות מ-1% מזמן תגובה רגיל. אבל אם התעבורה שלכם היא בזמן אמת — סוכן קולי, ממשק משתמש שחייב להשיב תוך 300 אלפיות שנייה — קפיצת ניתוב של מאות אלפיות שנייה יכולה להיות ההבדל בין שמיש ללא שמיש. האילוץ היחיד הזה הוא הסיבה הנפוצה ביותר לכך שצוות עם מקרה שימוש לגיטימי לניתוב מחליט לא לנתב.

דיוק. מנתב טוב רק כמו השיפוט שעל פיו הוא מנתב. מסווג שאומן על אמות מידה כלליות יכול להיות בטוח בטעותו לגבי התחום שלך: משימת הסיכום "הקלה" שלך עשויה להיות קלה למודל המוביל ובלתי אפשרית למודל הזול. מצב הכשל הוא שקט — המשתמש פשוט מקבל פלט גרוע יותר ואף אחד לא מתעד את זה — ולכן כל מנתב אמין כולל רצפת איכות או מצב מאוזן.

ביטול מטמון. גם OpenAI וגם Anthropic נותנות הנחה על קידומות prompt שחוזרות על עצמן, בדרך כלל כ-90% הנחה על אסימוני קלט בקריאות מטמון. אם שכבת הניתוב שלך משכתבת, משנה סדר, או מזריקה חותמת זמן מתחלפת לתוך ה-prompt, היא פוסלת את הקידומת ומשליכה את ההנחה הזו. ראוטר טוב מעביר את ה-prompt בייט אחר בייט ומאפשר למטמון של הספק עצמו לעבוד.

ההמלצה: ראוטר מנוהל עם סף איכות

אם אתם מריצים יותר ממודל אחד בסביבת ייצור, התעבורה שלכם היא תערובת של בקשות קלות וקשות, והנפח שלכם גדול מספיק כך שאחוז הוא כסף אמיתי, ההמלצה היא נתב מנוהל ששומר על רף איכות ולא גובה תוספת על טוקנים. המוצר שלנו הוא OrcaRouter, וזה המוצר שאנחנו יכולים להרחיב עליו; רשימת הבדיקה שלהלן חלה על כל נתב שתבחנו.

המצב האוטומטי של OrcaRouter — בקש את שם המודל orcarouter/auto בנקודת הקצה הסטנדרטית התואמת ל־OpenAI — מדרג כל פרומפט ומנתב אותו בין יותר מ־200 מודלים. הוא כולל ארבע מדיניות ניתוב, ו-Balanced היא ברירת המחדל: המדיניות Cheapest שולחת למודל הזול ביותר שיכול לענות; המדיניות Balanced שולחת למודל הזול ביותר שעומד ברף האיכות; המדיניות Quality שולחת למודל עם הציון הגבוה ביותר ללא קשר למחיר; המדיניות Adaptive לומדת מהתעבורה החיה שלך ומשנה את הניתוב תוך כדי. הדירוג נמדד בפחות ממילישנייה, סך ההשהיה הנוספת נשאר פחות מ־50ms, ואם הספק שנבחר מגביל קצב או מחזיר שגיאה, הנתב עובר באמצע הזרם למודל תקין בפחות מ־50ms. אין שום תוספת מחיר באף שכבה: אתה משלם לכל ספק את המחיר המדויק שפורסם — המספרים $0.09 או $5.00 שלמעלה הם מה שאתה משלם — והניתוב עצמו בחינם.

בנוגע לדיוק, לוח התוצאות של RouterArena מיוני 2026 מעניק ל-OrcaRouter ציון של 75.5% לעומת החלופה הקרובה ביותר במעקב עם 74.0% (לפי orcarouter.ai). לוח תוצאות אחד אינו הוכחה לשום דבר — התייחסו אליו כנקודת נתונים בודדת והריצו הערכה משלכם על הפרומפטים שלכם לפני שאתם בוטחים באף נתב עם תעבורת ייצור, כולל שלנו. ואם אתם מנסים להחליט אם אתם צריכים בכלל תכונות נתב או תכונות שער, ההבחנה בין נתב לשער מכוסה במדריך שלנו, AI API Gateway in 2026.

כשההמלצה הזו שגויה

רשימת הדילוג הכנה, במילים פשוטות:

הגרסה הקצרה

מנתב LLM הוא השכבה שבוחרת איזה מודל עונה לכל בקשה — זול ומהיר עבור הרוב הקל, מתקדם עבור המיעוט הקשה, עם מעבר גיבוי כשספק נופל. זה משתלם כאשר המודלים שלך שונים מאוד במחיר (DeepSeek V4 Flash ב-$0.09 לעומת Claude Opus 5 ב-$5.00 למיליון טוקני קלט, פער של פי 55) והתנועה שלך היא תערובת של קל וקשה. המחקר מציב את התקרה סביב 85% חיסכון מאחורי רצפת איכות, ואת הרצפה בכל מה שה-eval שלך אומר. זה עולה לך בזמן השהיה ובמידת שליטה בדיוק, וזו התשובה הלא נכונה עבור חנויות עם מודל יחיד, תקציבי זמן השהיה מתחת ל-300 אלפיות השנייה, הוצאות זעירות, וצוותים שלא יכולים למדוד איכות פלט. כשזה מתאים, הריץ אותו מאחורי רצפת איכות ללא תוספת מחיר על טוקנים, נתב תחילה נתח קטן, וקרא את יומני הניתוב לפני שאתה מאמין לחיסכון.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube