
ما هو موجه الذكاء الاصطناعي؟ طبقة التوجيه لنماذج اللغة الكبيرة التي تختار نموذجك
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianجديدQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
موجّه الذكاء الاصطناعي هو طبقة برمجية بين تطبيقك ومزوّدي النماذج، تحدد لكل طلب أي نموذج يجب أن يجيب عليه. يتم تقييم الطلب من حيث الصعوبة وتوجيهه إلى نموذج رخيص عندما يكون سهلاً، وإلى نموذج متطوّر عندما يكون صعبًا — الفرق بين دفع $0.09 مقابل DeepSeek V4 Flash و$5.00 مقابل Claude Opus 5 لكل مليون رمز إدخال لنفس الطلب. أما "موجّه الذكاء الاصطناعي" الآخر الذي ستجده في الصفحة الأولى من هذا البحث بالضبط — جهاز Wi-Fi المزود بنواة عصبية — فهو منتج مختلف، وهذا التصادم في التسمية هو السبب في أن القليل من تلك النتائج مفيد.
البحث عن "موجه الذكاء الاصطناعي" في أغسطس 2026 يُرجِع في الغالب صحافة الشبكات المنزلية. تسوّق ASUS جهاز ROG Rapture GT-BE19000AI بوصفه "أول موجه ألعاب بالذكاء الاصطناعي في العالم" — وهو جهاز Wi-Fi 7 مزوّد بوحدة معالجة عصبية (NPU)، وذاكرة RAM بسعة 4GB، وتخزين بسعة 32GB، ومحرك Docker يشغّل Home Assistant أو AdGuard على الموجّه نفسه. أما ZTE، بالتعاون مع Tianyi Digital Life التابعة لشركة China Telecom، فقد أصدرت موجّه Wi-Fi 7 منزلي "جوهري الذكاء الاصطناعي" يستشعر مغادرتك المنزل ويعيد هيكلة شبكة المنزل الذكي من تلقاء نفسه. هذه أجهزة مثيرة للاهتمام حقًا، لكنها ليست ما يعنيه المطوّر بعبارة "موجه الذكاء الاصطناعي". تتناول هذه المقالة موجّه نماذج اللغة الكبيرة (LLM router): الفئة التي تقع بين كودك وواجهات برمجة تطبيقات نماذج اللغة الكبيرة، وتختار أي نموذج يجيب عن كل طلب. وتغطي المعنيين للاسم، وما يفعله الموجّه فعليًا، وما يوفّره وما يكلّفه، والحالات التي لا ينبغي لك استخدامه فيها.
منتجان مختلفان يشتركان في الاسم
عبارة "موجه الذكاء الاصطناعي" هي تصادم، والمعنيان لا يشتركان في أي شيء تقريبًا:
• العتاد «موجه الذكاء الاصطناعي». جهاز توجيه Wi-Fi مزوّد بميزات الذكاء الاصطناعي على العبوة — وحدة معالجة عصبية (NPU) للاستدلال على الجهاز، وتحسين حركة المرور، وأحيانًا Docker. من الأمثلة على ذلك ASUS ROG Rapture GT-BE19000AI (الذي أُعلن عنه في أوائل 2026) وموجه الذكاء الاصطناعي المنزلي ZTE / Tianyi Digital Life (يونيو 2026). وتتمثل مهمته في تشغيل شبكة منزلك أو مكتبك الصغير.
• موجّه LLM. خدمة برمجية تستقبل كل استدعاء API يصدره تطبيقك وتعيد توجيهه إلى أفضل نموذج — النموذج الذي يحقق معيار الجودة الخاص بك بأقل سعر. وظيفتها هي إنفاق ميزانية النماذج الخاصة بك على النحو الأمثل. هذا هو "موجّه الذكاء الاصطناعي" الذي يتحدث عنه مهندسو الذكاء الاصطناعي، وهو موضوع هذه المقالة.

هذا الالتباس مهم لأكثر من مجرد دلالات. مَن يبحث عن “ai router” وهو يقصد فئة البرمجيات يحصل على جدار من مراجعات العتاد؛ ومَن يبحث عن “ai router” لشراء صندوق واي-فاي جديد يحصل على تسويق حول معالجات NPU بدلاً من أرقام الإنتاجية. لا تعكس أيٌّ من نتائج محركات البحث الغموضَ بصدق، وهذا بالضبط هو الثغرة التي تملؤها هذه الصفحة — المعنى البرمجي، مُعرَّفًا في مقابل المعنى العتادي.
ما الذي يفعله موجه LLM فعليًا
بعد أن نُزيح التسويق جانبًا، نجد أنّ موجّه النماذج (model router) يؤدّي ثلاث مهام، كلّها مملّة وكلّها قيّمة. أولًا، هو نقطة وصول واحدة: يستدعي كودك عنوان URL واحدًا متوافقًا مع OpenAI، بدلًا من استخدام SDK منفصل لكل مزوّد. ثانيًا، يقيّم الطلب — يقرأ البرومبت ويقدّر مدى صعوبته — ثم يوجّهه: العمل السهل إلى نموذج رخيص وسريع، والاستدلال الصعب فعلًا إلى نموذج متطوّر. ثالثًا، يقوم بالتبديل الاحتياطي عند الفشل: إذا فرض عليك المزوّد المختار حدًّا لعدد الطلبات أو أعاد رمزًا من فئة 5xx، فإنّ الموجّه يعيد المحاولة مع نموذج سليم دون أن يطّلع تطبيقك على الخطأ إطلاقًا.
خطوة اتخاذ القرار هي النقطة التي تختلف فيها الموجّهات، والطيف هو نفسه الذي تتوقعه. الموجّهات القائمة على القواعد تطابق الكلمات المفتاحية أو طول المطالبة مع نموذج — في أقل من ملي ثانية، ويمكن التنبؤ بها، لكنها هشّة عندما تتغير الأسعار أو النماذج. الموجّهات الدلالية تُضمِّن المطالبة وتوجّه بناءً على المعنى، لذا فإن "ما هو رصيدي؟" و"كم من المال لديّ" تصلان إلى نفس المسار. الموجّهات المتعلِّمة تراقب حركة المرور الحقيقية وتتحول نحو النموذج الأفضل من حيث الجودة مقابل الدولار — يصف موجّه الإنتاج لدى Ramp هذا بأنه مستكشف أخذ العينات تومسون، وينسب إليه خفضًا في التكاليف بنحو 30%، كما يذكر بحث RouteLLM من LMSYS موجّهًا قائمًا على تحليل المصفوفات حافظ على نحو 95% من درجة GPT-4 بينما أرسل 14% فقط من الاستعلامات إلى النموذج القوي. الآليات الأعمق لسياسات التوجيه تحظى بمعالجة كاملة خاصة بها في دليلنا، Auto Router for LLMs؛ النقطة هنا هي أن ذكاء القرار يوجد على طيف، و"أي نقطة على الطيف تحتاجها" هو قرار منتج، وليس قائمة ميزات.
فارق السعر هو ما يجعله مربحًا
الموجّه لا يبرّر وجوده إلا عندما تختلف النماذج كثيرًا في السعر، وهي الآن تختلف اختلافًا هائلًا. جميع الأسعار أدناه هي أسعار مباشرة من المزوّد لكل مليون رمز (توكن) من كتالوج نماذج OrcaRouter، تم قراءتها في 2026-08-10:

اقرأ الفارق لتجد أن الحجة تكتب نفسها بنفسها. DeepSeek V4 Flash بسعر $0.09/$0.18 لكل مليون توكن مقابل Claude Opus 5 بسعر $5.00/$25.00، وهو فرق يبلغ نحو 55 ضعفًا على توكنات الإدخال وحدها، والفجوة بين الفئة الرخيصة والفئة المتقدمة أصبحت الآن سمة منتظمة في السوق وليست خصمًا لمرة واحدة. إذا كان حجم طلباتك مزيجًا نموذجيًا — أغلبية من الطلبات القصيرة المحددة جيدًا وأقلية من الاستدلال الصعب حقًا — فإن إرسال كل شيء إلى الفئة المتقدمة يعني دفع أعلى سعر مقابل الـ80% السهلة. أما التوفيرات فتكمن في موجّه يوجّه المكالمات السهلة إلى الفئة الرخيصة.
الأرقام المقاسة متطابقة. الأبحاث من فئة RouteLLM تذكر توفيرات تصل إلى حوالي 85% مع الحفاظ على جودة بمستوى الروّاد — ولكن فقط عندما يقترن الموجّه بأرضية جودة ترفض التبخيس على الطلبات التي تحتاج بحق إلى النموذج الرائد. تشير Ramp إلى انخفاض بنحو 30% في حركة الإنتاج الفعلية دون أي انخفاض ملحوظ في الجودة. قواميس بائعي الموجّهات نفسها تذكر تخفيضات بنسبة 50–70% في تكلفة الطلب الواحد عند تحويل المهام السهلة بعيدًا عن النماذج الرائدة. تباين الأرقام هو الصورة الصادقة: السقف يعتمد على شكل حركة البيانات لديك، والأرضية هي ما يقوله تقييم الجودة لديك. ما لا ينبغي أن تصدّقه هو رقم ثابت واحد مثل "التوجيه يوفّر %X"، لأنه خاصية لعبء عملك وليس للموجّهات عمومًا.
ما الذي يكلّفه التوجيه عليك؟
التكلفتان اللتان لا يضعهما أحد في اعتباره عند مراجعة العتاد هما زمن الاستجابة والدقة، وكلتاهما حقيقيتان.
زمن الاستجابة.كل طلب مُوجَّه يدفع ضريبة تصنيف حتى قبل أن يبدأ النموذج. المصنِّف القائم على القواعد يستغرق أقل من ميلي ثانية؛ نموذج تضمين أو تصنيف صغير يضيف حوالي 50–200 مللي ثانية؛ والمصنِّف النطاقي المُدرَّب يضيف أكثر. معظم الموجِّهات تُخفي معظم هذا العبء بالتصنيف أثناء تجهيز الطلب العلوي، وقد قاس أحد نقاط نهاية التوجيه في بيئة الإنتاج الحملَ الإضافي الكلي بقيمة وسيطية تبلغ حوالي 55 مللي ثانية — أي أقل من 1% من زمن الاستجابة الطبيعي. لكن إذا كانت حركة المرور لديك في الوقت الفعلي — وكيل صوتي أو واجهة مستخدم يجب أن تستجيب خلال 300 مللي ثانية — فإن قفزة توجيه بمئات المللي ثانية قد تشكّل الفرق بين قابلية الاستخدام وعدمها. هذا القيد الوحيد هو السبب الأكثر شيوعًا الذي يدفع فريقًا لديه حالة استخدام توجيه مشروعة إلى عدم التوجيه.
الدقة. إن جودة الموجّه لا تتجاوز جودة الحكم الذي يوجّه بناءً عليه. فالمصنّف المدرَّب على مقاييس عامة يمكن أن يكون مخطئًا بثقة بشأن مجالك: فمهمة التلخيص «السهلة» لديك قد تكون سهلة على النموذج المتطور ومستحيلة على النموذج الرخيص. نمط الفشل صامت — فالمستخدم يحصل على مخرجات أسوأ فحسب ولا أحد يسجّل ذلك — ولهذا يوفّر كل موجّه موثوق حدًّا أدنى للجودة أو وضعًا متوازنًا، ولذلك ينبغي أن يكون وضع التكلفة العدواني تجربةً لا خيارًا افتراضيًا.
هناك أيضًا تكلفة ثالثة خفيّة: يمكن أن يؤدي كود التوجيه إلى إلغاء الخصومات التي تحصل عليها بالفعل من المزود. تقدم كل من OpenAI وAnthropic خصومات على بادئات الاستعلام المتكررة، عادةً حوالي 90% من رموز الإدخال عند قراءات الكاش. إذا قامت طبقة التوجيه لديك بإعادة كتابة الاستعلام أو إعادة ترتيبه أو حقنه بطابع زمني متغيّر، فإنها تُبطل البادئة وتتخلص من ذلك الخصم. الموجّه الجيد يمرّر الاستعلام كما هو بايت ببايت ويترك آلية التخزين المؤقت الخاصة بالمزود تعمل؛ أما الموجّه المهمل فيحوّل بصمت ضربات الكاش لديك إلى مكالمات بالسعر الكامل.
الراوتر مقابل البوابة، في فقرة واحدة
سترى أيضًا استخدام "AI gateway" بشكل شبه مترادف، والتمييز بينهما يستحق العناء حتى لو كانت معظم المنتجات المُدارة تجمع بينهما. يجيب الموجّه عن أي نموذج — التكلفة وزمن الاستجابة والقدرة. وتجيب البوابة عن من يمكنه الاتصال بها — المصادقة وحدود معدل الرموز والميزانيات وسجلات التدقيق والامتثال. إذا كنت بحاجة إلى حوكمة حول فريق أو منتج، فأنت بحاجة إلى ميزات البوابة؛ وإذا كنت بحاجة إلى مزيج نماذج أرخص، فأنت بحاجة إلى التوجيه. يحصل الفرق التشغيلي على معالجة كاملة في دليلنا "AI API Gateway in 2026"؛ هنا الخلاصة هي أن "AI router" عادةً ما يعني منتجًا يجمع بين الشقين، وعليك أن تسأل أي الشقين تدفع مقابله فعليًا.
عندما تحتاج فعلاً إلى موجّه ذكاء اصطناعي
قائمة المحفّزات الصريحة، بدلاً من الترويج التسويقي للتوجيه الدائم:
• أنت تشغّل أكثر من نموذج في الإنتاج. التوجيه هو الوسيلة للحفاظ على توازن المزيج عند ظهور نماذج جديدة وتغيّر الأسعار. أما من يكتفي بنموذج واحد فلا يحتاج إلى أيٍّ من ذلك.
• حركة المرور الخاصة بك هي مزيج من السهل والصعب. إذا كان كل طلب صعبًا بنفس القدر، فليس لدى الموجّه ما يراجحه. التصنيف-ثم-التوجيه لا يُجدي إلا عندما تكون هناك أغلبية رخيصة يمكن استغلالها.
• حجمك كبير بما يكفي بحيث تكون النسبة المئوية مهمة. خصم 40% على إنفاق 50 دولارًا شهريًا هو 20 دولارًا؛ أما على 50,000 دولار فهو يمثل وظيفة.
• فشل المزودين يكلفك خسائر. غالبًا ما يكون التحويل التلقائي بين المزودين أول فائدة حقيقية تشعر بها الفرق، قبل توفير التكاليف.
• تريد عقدًا واحدًا، ومفتاحًا واحدًا، ونقطة وصول واحدة. تكلفة التكامل مع N من المزودين هي بحد ذاتها سببًا للتوجيه عبر مزود واحد.
اعكس هذه وستحصل على قائمة التخطي: نموذج واحد، مستوى صعوبة موحّد، إنفاق زهيد، أو ميزانية زمن استجابة تكسرها قفزة تصنيف. بالنسبة لتلك الفرق، يمثّل الموجّه تكلفة إضافية، والاتصال المباشر بالمزوّد هو الحل الأفضل.
التوصية: موجه مُدار بحد أدنى من الجودة
بالنسبة لفريقٍ اجتاز المحفّزات المذكورة أعلاه، فإن التوصية هي استخدام موجّه مُدار يحافظ على حدٍّ أدنى من الجودة ولا يفرض أي زيادة على التوكنات. منتجنا الخاص هو OrcaRouter، وهو الوحيد الذي يمكننا التحدث عنه بالتفصيل، لذا فإن التفاصيل أدناه تخصّنا؛ وتنطبق قائمة التحقق التالية على أي موجّه تقوم بتقييمه.
وضع OrcaRouter التلقائي — اطلب اسم الموديل orcarouter/auto على نقطة النهاية القياسية المتوافقة مع OpenAI — يقيّم كل مطالبة ويوجّهها عبر أكثر من 200 موديل. ويأتي بأربع سياسات، مع كون Balanced الافتراضية: Cheapest ترسل إلى أرخص موديل يمكنه الإجابة، وBalanced إلى أرخص موديل يتجاوز معيار الجودة، وQuality إلى الموديل الأعلى تقييمًا بغض النظر عن السعر، وAdaptive تتعلم من حركة المرور المباشرة لديك وتغيّر التوجيه أثناء العمل. يُقاس التقييم في أقل من ملي ثانية، ويظل إجمالي زمن الاستجابة المضاف أقل من 50ms، وإذا قام المزوّد المختار بتقييد المعدل أو أخطأ، ينتقل الموجّه أثناء البث إلى موديل سليم خلال أقل من 50ms. لا توجد أي رسوم إضافية في أي طبقة: أنت تدفع لكل مزوّد سعره المنشور بالضبط — الأرقام $0.09 أو $5.00 أعلاه هي ما تدفعه — والتوجيه نفسه مجاني.

فيما يتعلق بالدقة، يمنح تصنيف RouterArena ليونيو 2026 درجة 75.5% لـ OrcaRouter مقابل 74.0 لـ GPT-5، و72.8 لـ Azure، و61.6 لـ Martian، و60.8 لـ NotDiamond (وفقًا لموقع orcarouter.ai). لوحة تصنيف واحدة ليست دليلًا على أي شيء — تعامل معها كنقطة بيانات واحدة وشغّل تقييمك الخاص على مطالباتك الخاصة قبل أن تثق في أي راوتر بحركة مرور الإنتاج، بما في ذلك راوترنا. هذه أيضًا هي الطريقة الصحيحة للاختيار بين الرواتر إذا كنت لا تستخدمنا: مرر جزءًا من حركة المرور، واحتفظ بخيار احتياطي، وادفع أصعب مطالباتك من خلاله، واقرأ سجل التوجيه لكل طلب قبل أن تصدق ادعاء التوفير.
عندما تكون هذه التوصية خاطئة
الحالات التي يكون فيها جهاز التوجيه المُدار خيارًا خاطئًا، بشكل صريح:
• أنت في الأساس تستخدم نموذجًا واحدًا. الموجّه يضيف قفزة وضريبة تصنيف دون أي فائدة. اتصل بالمزوّد مباشرةً وتجاوز الطبقة.
• يجب أن تكون استجاباتك فورية. إذا كان المطلوب هو زمن استجابة شامل أقل من 300 مللي ثانية تقريبًا، فإن قفزة التوجيه وبطء نموذج المستوى المتوسط قد يتجاوزان ميزانيتك. ثبّت النموذج.
• حجم معاملاتك ضئيل.التوجيه يوفّر لك نسبة مئوية من الإنفاق، ولا يمكنه أن يوفّر لك نسبة مئوية من الصفر. إذا كان إنفاقك أقل من بضع مئات من الدولارات شهريًا، فإن وقتك أثمن من التوفير.
• يجب أن يكون اختيار النموذج قابلاً للتدقيق.إذا كان لا بد أن يكون الرد قابلاً لإعادة الإنتاج، أو كان لا بد أن يكون النموذج الذي يقف خلفه قابلاً للتفسير لمراجع، فإن اختيار الموجّه التلقائي متغير يتعين عليك تبريره. سجّله، أو ثبّته، أو لا توجّه.
• لا يمكنك قياس الجودة. وبدون تقييم يخبرك ما إذا كان الناتج المُوجَّه جيدًا بما يكفي، لا يمكنك معرفة ما إذا كان الموجّه يعمل، وسيُضعف التوجيه العدواني للتكلفة بهدوء الناتج الذي لا تتفقده أبدًا.
• أنت معزول عن الشبكة أو ملتزم بالامتثال. إذا كان يجب ألا تغادر النماذج شبكتك أبدًا، فإن جهاز التوجيه المُدار غير مناسب إطلاقًا — شغّل طبقة توجيه مفتوحة المصدر على بنيتك التحتية الخاصة.
• أنت تدير بالفعل بوابة API. إذا كنت قد استثمرت في واحدة، فوسّع الحل القائم بدلاً من إضافة موجه موازٍ. تتقارب ميزات التوجيه والبوابة؛ الطبقة الثانية هي مزيد من الحوكمة، وليست مزيدًا من القيمة.
النسخة المختصرة
موجّه الذكاء الاصطناعي، بالمعنى الذي يقصده مهندسو الذكاء الاصطناعي، هو الطبقة البرمجية التي تقرر أي نموذج لغوي كبير (LLM) يجيب عن كل طلب — ويُشارك هذا الاسم، بشكل مربك، مع أجهزة واي-فاي التي تشغّل دوكر. يعمل عبر تقييم كل مطالبة (prompt) وإرسال الأغلبية السهلة إلى نموذج رخيص مع إبقاء الأقلية الصعبة على النماذج الحدودية (frontier)، مع تجاوز الفشل (failover) عندما يتعطل مزوّد. إنه يحقق فائدة عندما تختلف نماذجك كثيرًا في السعر (مثل DeepSeek V4 Flash بسعر 0.09$ مقابل Claude Opus 5 بسعر 5.00$ لكل مليون رمز إدخال، أي بفارق يبلغ حوالي 55 ضعفًا) وكانت حركة المرور خليطًا من السهل والصعب؛ ويضع بحث من فئة RouteLLM سقف التوفير عند حوالي 85% مع الحفاظ على حد أدنى من الجودة. وهو يكلّفك زمن استجابة (latency) وفقدان بعض التحكم في الدقة، وهو الحل الخاطئ للشركات التي تستخدم نموذجًا واحدًا، ولميزانيات زمن استجابة أقل من 300 مللي ثانية، وللإنفاق المحدود جدًا، وللفرق التي لا تستطيع قياس جودة المخرجات. عندما يكون مناسبًا، شغّله خلف حد أدنى من الجودة دون أي زيادة على سعر الرموز (token markup)، ووجّه جزءًا من الحركة أولًا، واقرأ سجلات التوجيه (routing logs) قبل أن تصدّق التوفير.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
