
ما هو موجه LLM؟ طبقة اختيار النموذج، والرياضيات الحقيقية، ومتى تخطيه
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianجديدQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
موجّه النماذج اللغوية الكبيرة هو طبقة برمجية تقع بين تطبيقك ومزوّدي النماذج، ويقرّر لكل طلبٍ أيُّ نموذجٍ يجب أن يجيبه — نموذج رخيص وسريع مثل DeepSeek V4 Flash عندما تكون المهمة سهلة، ونموذج متقدّم مثل Claude Opus 5 عندما تكون صعبة حقًا. الهدف هو المال: تبلغ تكلفة DeepSeek V4 Flash 0.09 دولار لكل مليون رمز إدخال، بينما تبلغ تكلفة Claude Opus 5 5.00 دولارات، وهي أسعار مباشرة من كتالوج نماذج OrcaRouter الذي تمت قراءته في 2026-08-10 — أي فرق بمقدار 55 ضعفًا على نفس الاستدعاء. أرسِل 80% من حركة المرور السهلة إلى النموذج الأرخص، وأبقِ 20% الصعبة على النموذج المتقدم، وستكون بذلك تسحب أكبر رافعة توفير في التكاليف لا يلمسها معظم الفرق.
ما هو موجه LLM في الحقيقة
بتجاهل الجانب التسويقي، يقوم موجه النماذج بثلاث مهام، كلها مملة وكلها ذات قيمة. إنه نقطة نهاية واحدة: يستدعي كودك عنوان URL واحدًا متوافقًا مع OpenAI بدلاً من استخدام SDK منفصل لكل مزود. يقوم بتقييم الطلب، وتقدير مدى صعوبته، ثم يوجّهه: المهام السهلة إلى نموذج رخيص، والاستدلال الصعب حقًا إلى نموذج متطور. كما أنه يتحول تلقائيًا عند الفشل: إذا قام المزود المختار بتقييد معدل طلباتك أو أرجاع خطأ 5xx، يقوم الموجّه بإعادة المحاولة عبر نموذج سليم دون أن يرى تطبيقك الخطأ أبدًا.
خطوة القرار هي حيث تختلف الموجّهات، والطيف مألوف. الموجّهات القائمة على القواعد تطابق الكلمات المفتاحية أو طول المطالبة مع نموذج — في أقل من مللي ثانية، قابلة للتنبؤ، وهشّة عندما تتغيّر الأسعار أو النماذج. الموجّهات الدلالية تدمج المطالبة وتوجّه حسب المعنى، لذا "ما هو رصيدي؟" و"كم لديّ من المال" تصلان إلى نفس المسار. الموجّهات المتعلّمة تراقب حركة المرور الحقيقية وتتحوّل نحو النموذج الأكثر تحقيقًا للجودة مقابل الدولار. آليات كلٍّ منها — بما في ذلك نطاقات الدقة لأنواع المصنّفات المختلفة والوضع التلقائي الذي يقيّم كل مطالبة — تحصل على معالجة كاملة في دليلنا، "الموجّه التلقائي لنماذج اللغات الكبيرة"؛ هنا النقطة هي أن ذكاء التوجيه يوجد على طيف، وأي نقطة تحتاجها هو قرار منتج، وليس قائمة ميزات.

إذا كنت قد رأيت أيضًا استخدام "AI router" لأجهزة Wi-Fi المزودة بوحدة NPU — فهذا منتج مختلف يشاركه الاسم نفسه، ونحن نوضح هذا التضارب في دليلنا الخاص بـ AI router. كل ما في هذه المقالة يتعلق بالفئة البرمجية.
فارق السعر هو ما يجعله مربحًا
الموجّه لا يبرّر وجوده إلا عندما تختلف النماذج كثيرًا في السعر، وهي الآن تختلف اختلافًا هائلًا. جميع الأسعار أدناه هي أسعار مباشرة من المزوّد لكل مليون رمز (توكن) من كتالوج نماذج OrcaRouter، تم قراءتها في 2026-08-10:

اقرأ الفارق وستكتب الحجة نفسها. إن DeepSeek V4 Flash بسعر $0.09 مقابل Claude Opus 5 بسعر $5.00 يمثل فرقًا بحوالي 55× على توكنات الإدخال وحدها، وأصبحت الفجوة بين الطبقة الرخيصة والطبقة الحدودية سمة دائمة في السوق وليست خصمًا لمرة واحدة. إذا كانت حركة المرور لديك مزيجًا نموذجيًا — أغلبية من الطلبات القصيرة المحددة جيدًا وأقلية من الاستدلال الصعب حقًا — فإن تشغيل كل شيء على الطبقة الحدودية يعني دفع أعلى سعر مقابل الـ 80% السهلة.
هنا تخيبك نتائج الصفحة الأولى الحالية لـ"llm router". فمثلًا، يستشهد مدخل قاموس Decagon بـ"GPT-4o وClaude 3.5 Sonnet وGemini 1.5 Pro" بسعر "5–15 دولارًا لكل مليون رمز إدخال" — وهي نماذج كانت حديثة قبل عامين بأسعار تبلغ ضعف أسعار اليوم تقريبًا. السوق تحرّك، أما التعريف فبقي على حاله. هذا هو السبب الأكبر الوحيد لعدم الوثوق بأي شرحٍ لموجّه نماذج اللغة (LLM router) لا يحمل تواريخ.
ما تقوله أبحاث الادخار في الواقع
الحساب أعلاه حقيقي، وكذلك البحث — لكن الصورة الصادقة هي نطاق، وليس رقمًا واحدًا.

إليك الحسابات التفصيلية، مع ذكر الافتراضات حتى تتمكن من تعديلها. روبوت دعم يتعامل مع 100,000 محادثة شهريًا، كل محادثة ترسل 1,000 رمز إدخال وتولّد 200 رمز إخراج: تشغيل كل شيء على Claude Sonnet 5 يكلف حوالي 400 دولار شهريًا. إذا وجّهت الـ80% السهلة إلى DeepSeek V4 Flash وأبقيت الـ20% الصعبة على Claude Sonnet 5، فإن نفس حجم الحركة يكلف حوالي 90 دولارًا — أي أرخص بنحو 78%، قبل احتساب أي تخزين مؤقت للمطالبات، وهو ما من شأنه توسيع الفجوة أكثر.
الخلاصة المستفادة: التوجيه العدواني يوفر 60–85% عندما تكون معظم طلباتك سهلة، والتوجيه المتوازن يوفر 35–45%، وحتى التوجيه المتحفظ يوفر 10–15%. الرقم الدقيق بالنسبة لك هو خاصية من خصائص حركة الطلبات لديك، يُقاس على استفساراتك الخاصة — وليس ثابتًا يمكنك نسخه من منشور مدونة.
التكاليف الثلاثة التي يخفيها التوجيه
التكلفتان اللتان لا يضعهما أحد في مدخل المسرد هما زمن الاستجابة والدقة، وهناك تكلفة ثالثة أكثر خفاءً.
الكمون.كل طلب مُوجَّه يدفع ضريبة تصنيف قبل أن يبدأ النموذج. المصنّف القائم على القواعد يستغرق أقل من ملي ثانية؛ نموذج تضمين صغير أو مصنّف صغير يضيف ما يقارب 50-200 مللي ثانية؛ المصنّف المجالي المدرب يضيف أكثر. يخفي الموجّه الجيد معظم هذا الحمل من خلال التصنيف أثناء تجهيز الطلب الصادر، وقد قاس أحد نقاط نهاية التوجيه في الإنتاج الحمل الإضافي الكلي بحوالي 55 مللي ثانية في المتوسط — أي أقل من 1% من زمن الاستجابة المعتاد. لكن إذا كانت حركة المرور لديك في الوقت الفعلي — وكيل صوتي، أو واجهة مستخدم يجب أن تجيب خلال 300 مللي ثانية — فإن خطوة توجيه بمئات المللي ثانية يمكن أن تشكل الفرق بين ما هو قابل للاستخدام وما هو غير قابل. ذلك القيد وحده هو السبب الأكثر شيوعًا لاتخاذ فريق لديه حالة استخدام مشروعة للتوجيه قرارًا بعدم التوجيه.
الدقة. لا يكون الموجّه أفضل من الحكم الذي يوجّه به. فالمصنّف المُدرَّب على معايير عامة يمكن أن يكون مخطئًا بثقة في مجالك: مهمة التلخيص "السهلة" الخاصة بك قد تكون سهلة على النموذج المتطور ومستحيلة على النموذج الرخيص. نمط الفشل صامت — يحصل المستخدم على مخرجات أسوأ ولا يوثّقها أحد — ولهذا يوفّر كل موجه موثوق حدًا أدنى من الجودة أو وضعًا متوازنًا.
إبطال التخزين المؤقت. تقدم كل من OpenAI وAnthropic خصمًا على بادئات البرومبت المتكررة، عادةً حوالي 90٪ خصمًا على رموز الإدخال عند قراءات التخزين المؤقت. عندما تقوم طبقة التوجيه بإعادة كتابة البرومبت أو إعادة ترتيبه أو حقن طابع زمني متغير فيه، فإنها تُبطل البادئة وتُضيع هذا الخصم. الموجّه الجيد يمرر البرومبت كما هو بايت ببايت ويترك التخزين المؤقت الخاص بالمزود يعمل.
التوصية: موجه مُدار بحد أدنى من الجودة
إذا كنت تشغّل أكثر من نموذج واحد في الإنتاج، وكانت حركة المرور لديك مزيجًا من السهل والصعب، وكان حجم حركة المرور كبيرًا بما يكفي بحيث تكون النسبة المئوية أموالًا حقيقية، فإن التوصية هي استخدام موجه مُدار يحافظ على حد أدنى من الجودة ولا يفرض أي زيادة على الرموز المميزة. منتجنا الخاص هو OrcaRouter، وهو الوحيد الذي يمكننا التحدث عنه بالتفصيل؛ وتنطبق قائمة التحقق التالية على أي موجه تقوم بتقييمه.
الوضع التلقائي في OrcaRouter — اطلب اسم النموذج orcarouter/auto على نقطة النهاية القياسية المتوافقة مع OpenAI — يقيّم كل مطالبة ويوجّهها عبر أكثر من 200 نموذج. يأتي بأربع سياسات توجيه مع كون Balanced هي الافتراضية: ترسل Cheapest إلى النموذج الأقل تكلفة القادر على الإجابة؛ وترسل Balanced إلى أرخص نموذج يتخطى مستوى الجودة؛ وترسل Quality إلى النموذج الأعلى تقييمًا بغض النظر عن السعر؛ وتتعلّم Adaptive من حركة المرور المباشرة لديك وتغيّر التوجيه أثناء ذلك. يُقاس التقييم في أقل من ملي ثانية، ويبقى إجمالي زمن الاستجابة المضاف أقل من 50ms، وإذا قام المزوّد المختار بتقييد معدل الطلبات أو أخطأ، يتحوّل الموجّه في منتصف البث إلى نموذج سليم في أقل من 50ms. لا توجد أي رسوم إضافية في أي طبقة: أنت تدفع لكل مزوّد سعره المنشور بالضبط — الرقمان $0.09 أو $5.00 أعلاه هما ما تدفعه — والتوجيه نفسه مجاني.
في ما يتعلق بالدقة، يُظهر تصنيف RouterArena لشهر يونيو 2026 أن OrcaRouter يحقق 75.5% مقابل أقرب بديل مُتتبَّع بنسبة 74.0% (وفقًا لموقع orcarouter.ai). لا يُعد تصنيف واحد دليلًا على أي شيء — تعامل معه كنقطة بيانات واحدة، وقم بتقييمك الخاص على استفساراتك الخاصة قبل أن تثق في أي موجّه لحركة المرور الإنتاجية، بما في ذلك الموجّه الخاص بنا. وإذا كنت تحاول أن تقرر ما إذا كنت بحاجة إلى ميزات الموجّه أو ميزات البوابة على الإطلاق، فإن الفرق بين الموجّه والبوابة مغطى في دليلنا: AI API Gateway في 2026.
عندما تكون هذه التوصية خاطئة
قائمة التخطي الصادقة، بعبارة صريحة:
النسخة المختصرة
موجه LLM هو الطبقة التي تختار أي نموذج يجيب على كل طلب — رخيص وسريع للأغلبية السهلة، والنماذج المتطورة للأقلية الصعبة، مع تجاوز الفشل عند انقطاع المزود. يكون مجديًا عندما تختلف نماذجك كثيرًا في السعر (DeepSeek V4 Flash بسعر 0.09$ مقابل Claude Opus 5 بسعر 5.00$ لكل مليون رمز إدخال، أي فرق 55 ضعفًا) وكانت حركة المرور لديك خليطًا من السهل والصعب. يضع البحث سقف التوفير عند حوالي 85% مع حد أدنى للجودة، والحد الأدنى عند ما يحدده تقييمك. يكلفك زمن استجابة وبعض التحكم في الدقة، وهو الحل الخاطئ للشركات ذات النموذج الواحد، وميزانيات زمن الاستجابة الأقل من 300 مللي ثانية، والإنفاق الزهيد، والفرق التي لا تستطيع قياس جودة المخرجات. عندما يكون مناسبًا، شغّله مع حد أدنى للجودة دون أي زيادة على الرموز، وجرّب على جزء من الحركة أولًا، واقرأ سجلات التوجيه قبل أن تصدق التوفير.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
