
البنية التحتية لتوجيه OrcaRouter: التوجيه المراعي للجلسات والتصعيد الحدودي
- obsidianجديدQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 لكل مليون رمز · 22 tok/s
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaجديدMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0856الذكاء72البرمجة
- tencentTencent: Hy32026-07-0642الذكاء59البرمجة
ORCAROUTER · معمارية التوجيه
كل بوابة LLM تخزّن الطلبات يجب أن تُثبّت المحادثة على نموذج واحد. وكل بوابة تُثبّت محادثةً تتخذ قرار التوجيه بناءً على الدورة الأقل إفادة في تلك المحادثة. هذا تقرير عن تلك المقايضة، وعن آلية الالتصاق المتدرجة التي تتضمنها OrcaRouter للهروب منها.
الموضوع: بوابة OrcaRouter LLM (Go / Gin / Redis) · المكوّن: الارتباط بالجلسة + محرك تصعيد Frontier · الطريقة: إعادة 400 جلسة مقابل كود قرار الإنتاج · التاريخ: 14 أغسطس 2026
ملخص — توجيه نماذج اللغات الكبيرة (LLM) على مستوى الطلب — تقييم كل طلب بشكل مستقل وإرساله إلى أرخص نموذج مناسب — هو الأسلوب الذي تتناوله جميع الأبحاث المنشورة تقريبًا حول التوجيه. وهو أيضًا الأسلوب الخاطئ لحركة المرور التي تهيمن الآن على حجم البوابات: جلسات الوكلاء متعددة الجولات، حيث يتكون الطلب بنسبة 90% من سياق منقول، وتُكافئ ذاكرة التخزين المؤقت للطلبات لدى المزود الاستمرارية. إن تبديل النماذج في منتصف المحادثة يخسر خصمًا بمقدار 10× على البادئة المشتركة، لذا تثبّت البوابات الجلسات. لكن التثبيت الذي يتم في الجولة 1 هو تثبيت في الجولة التي تتوفر فيها أقل قدر من الأدلة، ويستمر طوال عمر المحادثة.
100 / 100 — جلسات ذات صعوبة كامنة لا يمكن تمييز نتيجتها في الجولة الأولى عن نتيجة جلسة بسيطة
+16% — انحراف درجة الصعوبة الناتج عن طول النص وحده، عند تساوي صعوبة المهمة
45% — من تكلفة الحدود الأمامية الدائمة، مقابل 67% من تغطية الانعطافات الحادة
0.019 — الهامش بين البوابة المُصدَّرة وسقف الدرجات الواقعية
1 نظامان للتوجيه
بوابة LLM التي تقف أمام العديد من المزودين يجب أن تجيب على سؤال واحد لكل طلب: أي نموذج يخدم هذا؟ هناك طريقتان مختلفتان بنيوياً للإجابة عليه، وقد تباعدت الأدبيات وواقع الإنتاج حول أيهما يهم.
التوجيه على مستوى الطلب يعامل كل طلب كطلب مستقل. يقوم مُقيّم بتقدير صعوبة الاستعلام أو جودة الاستجابة المتوقعة، ثم يُرسل الطلب إلى أرخص نموذج يُتوقع أن يتعامل معه. هذا هو النهج المتبع في جميع الأعمال المنشورة حول الموجّهات تقريبًا: يدرّب RouteLLM موجّهات على بيانات تفضيلية تحقق 95% من جودة GPT-4 مع 14% من استدعاءات النماذج القويةsup>[1]/sup>; يتدرج FrugalGPT من الأرخص إلى الأغلى مع فحص قبول/رفض، ويُعلن عن خفض في التكلفة يصل إلى 98%sup>[2]/sup>; يبني RouterArena معيارًا من 8,400 استعلام لمقارنة الموجّهات على هذا المحور تحديدًاsup>[3]/sup>. وحدة التحليل هي الاستعلام.
سبب وجود التوجيه المدرك للجلسات ليس الأناقة، بل الحساب.
2 اقتصاديات التخزين المؤقت التي تجعل الالتصاق إلزاميًا
في جلسة وكيل متعددة الأدوار، مطالبة الدور n هي مطالبة الدور n−1 بالإضافة إلى دلتا. بحلول الدور 10، تكون البادئة المنقولة هي الغالبية العظمى من رموز الإدخال. جميع المزودين الرئيسيين الآن يسعرون تلك البادئة بشكل مختلف اعتمادًا على ما إذا كانت إصابة في الذاكرة المؤقتة:
الجدول 1. دلالات ذاكرة التخزين المؤقت للطلبات (Prompt Cache) حسب المزوّد. يُستند التخزين المؤقت إلى بادئة مطابقة تمامًا وإلى مفتاح التقديم — فتبديل النموذج أو تدوير المفتاح يُعدّ قراءة باردة بالتكلفة الكاملة.
يقوم OrcaRouter بترميز هذه الأعمار الزمنية بدقة كقيم TTL للتثبيت: خريطة لكل نوع قناة لنوافذ التخزين المؤقت للمزود — 5 دقائق لـ OpenAI وAnthropic وGemini و60 دقيقة لـ DeepSeek — مع قيمة افتراضية 5 دقائق للمزود غير المعيّن. ينتهي تثبيت القناة والمفتاح عند انتهاء تلك النافذة، لأن فهرس المفتاح القديم لا قيمة له في التخزين المؤقت ويشوّه فقط موازنة التحميل. وبخصوص النموذج، فإن تثبيته في النشر المدعوم بـ Redis وبالنسبة لمعرف جلسة مؤهل للتثبيت الطويل، يستمر لمدة 30 يومًا — ليس لقيمة التخزين المؤقت، التي ولّت منذ زمن، بل لاستمرارية تنسيق الطلب. إن تبديل النموذج في منتصف المحادثة يفرض تحويلاً في تنسيق الطلب قد يكون غير متوافق مع البيانات: فكتل التفكير ومعرفات استدعاء الأدوات لا تنجو بالضرورة من التحويل بين مخططات المزودين.
التفصيل غير المُقدَّر
تُفهرَس ذاكرات التخزين المؤقت للطلبات حسب مفتاح API، وليس حسب النموذج. فالبوابة التي تثبّت النموذج ولكنها توزّع الحمل عبر ثلاثة مفاتيح على نفس القناة ستظل تقرأ من الذاكرة الباردة مرتين من كل ثلاث مرات. لهذا السبب يخزّن تثبيت القناة في OrcaRouter {ChannelID, KeyIndex} بدلاً من معرّف قناة، وهو أيضًا السبب في إسقاط التثبيت عندما لا يعود فهرس المفتاح المسجَّل يشير إلى مفتاح مفعّل — فالمفتاح المُعزَّز ولكن المُدوَّر من شأنه أن يوجّه نحو ذاكرة باردة مع تجاوز التوازن، وهو أسوأ الحالين.
التثبيتات لينة في جميع الحالات: عدم وجود معرّف جلسة قابل للحل لا يترتب عليه أي إجراء، والقناة المثبّتة المعطّلة أو غير السليمة تتراجع إلى الاختيار المتوازن العادي، والتثبيت إلى قناة بوزن صفر في مجمع مختلط يُسقَط حتى لا يُهزم مسؤول يستنزف قناةً بسبب الالتصاق. وهي لا تُفشل أي طلب أبدًا.
3 الفخ: الالتصاق يعطل الموجه
إليك نمط الفشل. في مسار كود ما قبل التصعيد الخاص بـOrcaRouter، بالنسبة لموجّه مدرِك للجلسات على أي استراتيجية غير DSL، أعاد تثبيت الجلسة→النموذج
سيكون ذلك مقبولاً لو كانت الجولة الأولى ممثلة. لكنها ليست كذلك بشكل منهجي، لسببين متراكمين.
3.1 الدور الأول هو الدور الأقل إفادة.
العدد القياسي للصعوبة (service/model_router_difficulty.go) هو توليفة خطية موزونة عبر ست ميزات معجمية:
LogPromptTokens × 0.20 بحد أقصى log(8001) ≈ 8.99
ReasoningCueCount × 0.15 بحد أقصى 5
SystemPromptLogLen × 0.10 بحد أقصى log(2001) ≈ 7.60
CodeKeywordDensity × 0.20 سقف 5.0 (مطابقات لكل 100 حرف)
HasTools × 0.15 بالفعل 0/1
MathMarkerCount × 0.20 بحد أقصى 5
المفتتح القصير دون أي سجلّ سابق يسجّل درجة منخفضة تقريبًا بحكم تكوينه: مصطلح الرمز الموزون بوزن 0.20 قريب من الحد الأدنى، ومصطلحات الاستدلال/الرياضيات تنطلق على مفردات لم تتاح للمستخدم بعد فرصة لاستخدامها. لذلك تلتزم الجلسات بنموذج مجموعة ضعيفة في لحظة أقلّ معلومات — ومع تثبيت النموذج لمدة 30 يومًا المدعوم بـ Redis، يكون هذا الالتزام طويلًا.
الشكل 1.متوسط صعوبة الجولة الأخيرة حسب جولة المحادثة، عبر 100 جلسة صعبة كامنة و200 جلسة سهلة حقًا، وفق تقييم المُقيِّم الإنتاجي. في الجولة 1 — الجولة التي يُكتب فيها الدبوس اللاصق — لا يمكن التمييز بين المجموعتين (0.210 مقابل 0.208). تعبر المجموعة الصعبة البوابة عند الجولة 5. في ظل سياسة تعتمد على الدبوس فقط، تُخصص جميع الجلسات الصعبة الكامنة الـ100 إلى المجموعة منخفضة التكلفة قبل وجود أي من هذا الدليل.
3.2 الطول يتنكر في صورة الصعوبة
المشكلة الثانية أكثر دقة وهي تقوّض الإصلاح الواضح. إذا قمت ببساطة بإعادة تشغيل بوابة الصعوبة في كل دورة، فأنت تعيد تشغيلها على درجة محسوبة على النص الكامل المجمّع. تلك الدرجة تتضمن انحرافًا تصاعديًا مدمجًا: حد LogPromptTokens الموزون بـ 0.20 يرتفع بشكل رتيب مع طول المحادثة، ولأي جلسة وكيل، فإن حدي HasTools (0.15) وSystemPromptLogLen (0.10) يمثلان في الواقع قاعًا ثابتًا. الجلسة الطويلة المملّة تبدو أصعب تدريجيًا.

الشكل 2. الانحياز الاصطناعي للطول، والذي تم قياسه على 60 جلسة تتكون بالكامل من تعديلات تافهة (“أعد تسمية هذا المتغير”، “أضف فحصًا للقيمة الصفرية”). تنحرف درجة النص الكامل بنسبة +16% عبر 25 دورة مع ثبات صعوبة المهمة؛ بينما تكون درجة أحدث دورة (الدلتا) ثابتة. إن إعادة تقييم ساذجة لدرجة النص الكامل في كل دورة ستؤدي إلى تصعيد الجلسات بسبب طولها.
The fix OrcaRouter ships is a separate delta extractor (service/model_router_delta.go) that scores only the latest turn — the new user text plus any tool results attached after the last assistant message — reusing the same weights and caps but deliberately zeroing SystemPromptLogLen, which is not part of the delta. Figure 2's flat blue line is that extractor.
4 التصميم: الالتصاق المتدرج
المخرج الساذج من قفل الدورة الأولى هو إعادة توجيه كل دورة — وهذا مجرد توجيه على مستوى الطلب، ويُفقد ذاكرة التخزين المؤقت. أما الإصلاح الساذج في الاتجاه الآخر فهو جعل التثبيت بمثابة ذاكرة "أن هذه الجلسة أصبحت صعبة" — وهو ما لا يمكنه التعبير عن تخفيف الحدة ولا يمكن تحديد سقف له. تصميم OrcaRouter يرفض كلا الخيارين.
إعادة التأطير: الجلسة مثبتة على نموذج ضمن طبقة، وذاكرة Redis صغيرةلحالة الطبقة هي الذاكرة الوحيدة للتصعيد. تثبيت النموذج ليس هو الذاكرة أبدًا.
تجمعات المستويات. المستوى القوي هو تجمع التصعيد المُحدد (escalation_pool، والذي يعتمد افتراضيًا على strong_pool الخاص بالموجّه). المستوى الأساسي هو AllowedModels \ تجمع المستوى القوي؛ النموذج الموجود في كليهما ينتمي إلى المستوى القوي. داخل المستوى الأساسي، تستمر آلية تقسيم الصعوبة إلى نطاقات (ضعيفة/متوسطة/قوية) الخاصة بـ gated_adaptive في العمل تمامًا كما في السابق.
تثبيتات مقيّدة بالمستوى. يحصل مفتاح تثبيت النموذج في المستوى القوي على لاحقة :t:strong؛ بينما يحتفظ المستوى الأساسي بالمفتاح القديم دون تغيير. وبالتالي فإن التصعيد يحافظ على التثبيت الأساسي، بحيث تعود الجلسة التي خُفِّض مستواها — أو التي استُؤنفت بعد انتهاء صلاحية حالة المستوى — إلى النموذج نفسه الذي بدأت عليه، وليس إلى إعادة اختيار عشوائية. تُكتب التثبيتات القوية فقط مع مهلة انتهاء الصلاحية القصيرة لنافذة المزوّد: فالتثبيت القوي لمدة 30 يومًا سيتجاوز عمر حالة المستوى البالغة 4 ساعات التي برّرت وجوده.
البوابة تعمل أولاً. في selectByStrategy (service/model_router.go:1374) يتم تحديد الطبقة مسبقًا، ويتم تضييق مجموعة المرشحين إلى تجمع الطبقة، وفقط ثم يتم استشارة الدبوس الثابت — ضمن تلك الطبقة. هذا هو الإصلاح الهيكلي لـ§3: يتم حساب الصعوبة وتشغيل محفزات التصعيد كل دورة، قبل أن يتمكن الدبوس من تقصيرها.
4.1 ثلاث فئات للمحفزات، مرتبة حسب الثقة
الجدول 2. مشغلات التصعيد. لا تتصاعد أي إشارة غامضة بمفردها أبدًا؛ فقط طلب صريح من العميل يلتزم عند n=1، وحتى هو يخضع للحدود القصوى.
توجد ثلاث ثوابت نظافة أساسية. تتم إزالة تكرار الضربات عبر معرف الطلب من خلال مخزن مؤقت حلقي، لذا لا يمكن لإعادة محاولات العملاء المتداخلة أن تُحتسب مرتين.فشل البنية التحتية ليس فشلًا للقدرة أبدًا — لا تُسجَّل رموز 429 و5xx والتحويلات الاحتياطية للقنوات كضربات أبدًا؛ فقط إشارات الجودة بعد النجاح هي التي تُحتسب. ويُعرَّف «الدور» بأنه طلب مكتمل ناجح الفوترة وخضع لتقييم الضربات، لذا فإن الطلبات الفاشلة لا تُقدّم لا انحسار الضربات ولا عداد الأدوار النظيفة.
4.2 الحل نقي؛ الالتزام مؤجل
إن أهم خاصية بنيوية في المحرك هي أن ResolveEscalation لا يكتب شيئًا؛ فهو يُرجع قرارًا وقائمةً بما هو معلّق من النوايا. يطبّق الموزّع تلك النوايا في كتلة ما بعد النجاح الخاصة به، على قراءة جديدة داخل معاملة WATCH في Redis. هذا مهم لأن الحلّال يعمل على مسارات يجب ألّا تغيّر الحالة أبدًا: عمليات الحلّ التخمينية لسلاسل الاحتياط، ونقاط النهاية التشخيصية للقراءة فقط، والطلبات التي تُرجع لاحقًا رمز 403 أو تفشل في المنبع. كما أن إعادة تطبيق النوايا على حالة جديدة تعني أن كاتبًا متزامنًا قديمًا لا يمكنه أن يمحو تصعيدًا تم الالتزام به، وأن تصعيدين متطابقين متسابقين يندمجان بحيث تبقى النتيجة واحدة.
4.3 الأحرف الكبيرة، ولماذا تربط كل شيء
التصعيد الإيجابي الكاذب يكلف (القوي − الأساسي) × الرموز المتبقية من الحلقة الدافئة، ويكلف ذلك بصمت — لا يفشل شيء. نطاق الانفجار محدود بحدود قصوى تنطبق علىكل فئة:
escalation_max_per_session (الافتراضي 1). لا يتم استرداد هذا الحد عند تخفيض التصعيد أو إعادة تعيين العميل، مما يغلق مسار الاستغلال عبر حلقة إعادة التعيين.
لكل موجهسقف حصة التصعيد(الافتراضي 20%) عبر نافذة زمنية سابقة من 24 إلى 48 ساعة من الدلاء اليومية لـ Redis، بالإضافة إلى سقف عبر الموجّهين على مستوى مساحة العمل. عند بلوغ السقف، يتم قمع جميع توجيهات التصعيد — بما في ذلك الطلبات الصريحة والتعزيزات لمرة واحدة.
خفض التصعيد فقط عند حدود برودة التخزين المؤقت، لذا فإن الإيجابية الكاذبة محصورة في حلقة دافئة واحدة.
السبب في امتثال Class A للسقوف هو استنتاج نموذج التهديد، وليس تفضيلًا في السياسات: على بوابة API، من يملك رمز مساحة العمل يتحكم في الترويسات. مسار "العميل طلب ذلك" المعفى من السقف هو قناة إنفاق غير محسوبة. يقيس §7 ما يحدث عندما يسيء كل عميل استخدامها.
4.4 خفض التصعيد غير متماثل بطبيعته
قم بالتصعيد بناءً على أدلة مؤكدة؛ ولا تخفض التصعيد إلا عندما يكون ذلك مجانيًا. لا تعود الجلسة القوية إلى القاعدة إلا عندما تتوفر جميعالشروط التالية: الجلسة باردة الكاش (خاملة لمدة تتجاوز نافذة المزود المسجلة عند التصعيد)، وقد جمعت ≥3 دورات تقييم خالية من المخالفات، وأحدث دلتا صعوبة أقل من T1. داخل النافذة الدافئة، يدفع التبديل ثمن إعادة قراءة باردة بالسعر الكامل — التذبذب هو الطريقة الوحيدة المضمونة لجعل التصعيد سلبي التكلفة.
5 المنهجية
لقد قمنا بقياس الآلية من خلال إعادة تشغيل مجموعة جلسات اصطناعية عبر الكود الفعلي لاتخاذ القرار في الإنتاج. البنية الاختبارية هي اختبار Go في حزمة الخدمة يستدعي ResolveEscalation وCommitEscalationDecision لكل دورة على مخزن طبقات مدعوم بـ miniredis، مع مقيّمي الصعوبة الحقيقيين، ومنتجي الضربات الحقيقيين في جانب الطلب، وآلية سقف المشاركة الحقيقية. لا يُعاد تنفيذ أي شيء في مسار القرار ولا يتم محاكاته باستثناء مصرف أحداث التدقيق.
ما هو حقيقي وما هو غير حقيقي
حقيقي: كل قرار توجيه، ودرجة صعوبة، وكشف ضربة، وقاعدة تتابع، وتقييم سقف، وانتقال حالة Redis — هذه هي الوظائف المُسَلَّمة.اصطناعي: حركة المرور. مجموعة البيانات مُولَّدة، وليست مأخوذة من سجلات الإنتاج. مزيج نماذجها (50% صعبة) هو مزيج إجهاد اختير لاختبار الآلية، وليس تقديرًا لحركة المرور الحقيقية؛ يُبلغ القسم 6.4 عن الحساسية لذلك الاختيار، وهي كبيرة. تعكس أرقام الدقة النظيفة أدناه مجموعة بيانات فئاتها قابلة للفصل بالبناء، وينبغي قراءتها على أنها "الآلية تعمل حيث صُممت لتعمل"، وليس كتقديرٍ لدقة الإنتاج.
5.1 المدونة
400 جلسة، 3,968 دورة، ببذور محددة وحتمية. كل دورة هي نص طلب كامل لواجهة chat-completions يحمل السجل التراكمي، ومصفوفة تعريف أداتين، وموجه نظام واقعي — بالشكل الذي يرسله وكيل البرمجة فعليًا. خمسة نماذج أصلية، يحمل كلٌّ منها تسمية الحقيقة الأساسية:
الجدول 3.تكوين المدونة اللغوية. "بحاجة إلى تقوية" هي الحقيقة المرجعية المستخدمة في حساب درجات الدقة والتغطية.
تحمل المنعطفات الصعبة تفريغ goroutine مُلصقًا أو مقتطفًا من الكود المصدري بحجم 3–8 كيلوبايت بالإضافة إلى النثر، لأن هذا ما تحتويه منعطفات التصحيح الصعبة الحقيقية. وقد تبيّن أن هذه التفاصيل مهمة للغاية — انظر §6.2.
5.2 نموذج التكلفة
تُحتسب التكاليف من قوائم الأسعار المنشورة مع دلالات تخزين مؤقت لكل مزوّد؛ ويُذكر النموذج كاملاً بحيث يمكن الاعتراض عليه.
الجدول 4. معلمات نموذج التكلفة. الأسعار بالدولار لكل مليون رمز، قائمة أغسطس 2026.
التكلفة للدور الدافئ هي 0.1·p_in·prefix + write·p_in·delta؛ بينما التكلفة للدور البارد هي write·p_in·prompt. الدور الأول دائمًا كتابة كاملة للذاكرة المؤقتة. دور تبديل المستوى في سياسة التصعيد يُحتسب صراحةً كدور بارد، وبذلك تدفع الآلية ثمن إبطال ذاكرة التخزين المؤقت الخاصة بها.
يتم الإبلاغ عن الجودة كـتغطية المنعطفات الصعبة — أي نسبة المنعطفات الصعبة في البيانات المرجعية التي يقدمها النموذج القوي فعليًا — وليس كرقم دقة. لم نقم بتشغيل الاستدلال الأولي، لذا نرفض اختلاق أرقام دقة.
6 نتائج
6.1 تنطلق الآلية حيث صُممت لتنطلق.
الجدول 5.نتائج التصعيد حسب النمط، الوضع التلقائي، كناري 100%، T2 = 0.70 (الإعداد الافتراضي المُرفق).
صفر نتائج إيجابية خاطئة في الجلسات السهلة البالغ عددها 200، بما في ذلك ستين جلسة طويلة كان مُقيّم النص الكامل سينحرف بها إلى النطاق الصعب. تتخصص فئات المشغّلات بشكل نظيف وبدون تداخل: فئة الصعوبة تلتقط الأعمال كثيفة الاستدلال، وفئة الضربات تلتقط حلقات الفشل. لاحظ أن أعلى درجة صعوبة لـ failure_loop هي 0.262 — بوابة الصعوبة لا ترى تلك الجلسات إطلاقًا. الوكيل العالق في حلقة خطأ الترجمة لا يُنتج نثرًا كثيف الإشارات الاستدلالية؛ بل يُنتج نفس المطالبة القصيرة مع تتبع مكدس مختلف. بدون ضربات الفئة C، كانت كل واحدة من تلك الجلسات الستين ستواصل العمل على النموذج الرخيص إلى أجل غير مسمى.

الشكل 3. عندما تتصاعد الجلسات، قسّم حسب المُحفِّز. التصعيدات المدفوعة بالضربات تتركز بشكل حاد (الدور 4، أول دور يمكن أن تتجمع فيه ضربتان داخل نافذة الانحلال)؛ التصعيدات المدفوعة بالصعوبة تنتشر عبر الأدوار 2–11 وفقًا لتوزيع بدايات المتن. قاعدة الدورين المتتاليين تعني أن أول تصعيد ممكن بسبب الصعوبة هو الدور 2.
6.2 النتيجة: البوابة المُسلَّمة تقع على حافة منحدر
أنتج كوربوسنا الأول صفرًا من التصعيدات المدفوعة بالصعوبة. الجولات الصعبة — المحمّلة بشروط السباق، والثوابت، وتحليل التعقيد، ومفردات الإثبات — بلغت ذروتها عند 0.658 مقابل عتبة قدرها 0.70. وقد رفعت إضافةُ تتبعات المكدس المُلصقة التي تحملها جولات التصحيح الحقيقية فعليًا القيمة إلى 0.719. وبذا يُجتاز الحد بهامش قدره 0.019.

الشكل 4. أين تذهب ميزانية الصعوبة فعليًا، في المتوسط عبر 855 دورة صعبة و3,113 دورة سهلة. تصل الدورة الصعبة الواقعية إلى 0.719 من الحد الأقصى النظري البالغ 0.90 دلتا. يساهم مصطلح CodeKeywordDensity بمقدار 0.069 من ميزانيته البالغة 0.20 — الكثافة المقاسة هي 1.72 تطابقًا لكل 100 حرف مقابل حد تشبع يبلغ 5.0 — وقيمة SystemPromptLogLen البالغة 0.10 هي صفر بنيويًا في مستخرج الدلتا. تقريبًا ثلث النطاق الاسمي للنتيجة لا يمكن بلوغه بنص واقعي.
مسح العتبة يؤكد أن هذا منحدر حاد وليس انحدارًا تدريجيًا. عبر T2 من 0.35 إلى 0.65 تكون النتيجة متطابقة — 200 من 400 جلسة تتصاعد، مع صفر حالات إخفاق. عند العتبة 0.70 المُعتمَدة، يبدأ المصنّف في فقدان الجلسات؛ وعند 0.75 ينهار التصعيد الناتج عن الصعوبة من 122 جلسة إلى 23.

الشكل 5.حساسية العتبة. النطاق 0.35–0.65 بأكمله متطابق سلوكيًا، لأنه لا يوجد نص دلتا واقعي يقع ضمنه — توزيع الدرجات ثنائي المنوال، إذ تتجمع الأدوار السهلة قرب 0.23 والأدوار الصعبة قرب 0.72، ولا شيء بينهما. أما الافتراضي المُضمَّن فيقع عند الطرف العلوي للمنوال الأعلى.
الأثر الهندسي
T2 is calibrated for the full-transcript distribution the gated_adaptive bands were tuned on, and it is being reused as the delta extractor's threshold. The design document flags that the delta extractor “needs its own tuning”; this measurement quantifies how much. Either the delta gate needs a lower T2 of its own — anywhere in 0.45–0.60 buys identical behaviour with real margin — or the percentile-based threshold already scheduled for Phase 3 (“top X % of this router's recent traffic”) should land, which makes the escalation rate the operator's knob and sidesteps absolute calibration entirely.
6.3 التكلفة والتغطية

الشكل 6. خمس سياسات عبر نفس الجلسات الـ400. على اليسار: التكلفة لكل 1,000 جلسة (مقياس لوغاريتمي). على اليمين: نسبة الأدوار الصعبة حقًا التي يعالجها النموذج القوي.
الجدول 6.مقارنة السياسات. التكلفة لكل 1,000 جلسة وفق نموذج الجدول 4.
نتيجتان جديرتان بالفصل. أولًا، التصاق الجلسة وحده يوفّر 24٪ عند اختيار النموذج نفسه (16.64 → 12.63) و35٪ على الزوج الحدودي (290.93 → 188.30). هذا اقتصاد تخزين مؤقت خالص — نفس النماذج، نفس كل شيء، فقط التصاق المفتاح هو ما يختلف. ويكون التوفير أكبر على الزوج الحدودي لأن علاوة الكتابة البالغة 1.25× من Anthropic تجعل الجولات الباردة مكلفة بشكل غير متناسب.
ثانيًا، يقع التصعيد حيث ينبغي أن تكون آلية الإنقاذ: 45% من تكلفة الحدود الدائمة مقابل 67% من تغطية دوراتها الصعبة، حيث يخدم النموذج القوي في 21.4% فقط من الجولات.
الثُّلث المفقود من التغطية ليس عيبًا؛ بل هو ثمن السقاطة. قواعد التثبّت التي تُعطي صفر نتائج إيجابية خاطئة تعني أيضًا أن الآلية لا تستطيع التحرك في أول جولة لأي مشكلة:
الجدول 7. كمون التصعيد — منعطفات حادة مُقدَّمة على النموذج الرخيص قبل أن تنطلق السقاطة.
الدورتان هما بالضبط ما تنص عليه قاعدة السلسلة المكوّنة من دورتين متتاليتين، والدور الواحد هو بالضبط ما تنص عليه قاعدة الضربتين للتصعيد. التأخير مقصود في التصميم، وهو نفس الخاصية التي أنتجت صفر نتائج إيجابية كاذبة. من يريد إنقاذًا أسرع فبإمكانه استخدام ترويسة الفئة أ، التي تعمل عند n=1 — وهذا هو تحديدًا سبب صدور فتحة الهروب اليدوية أولاً.
6.4 تعتمد نسبة العنوان كليًا على حركة المرور لديك
المجموعة النصية صعبة بنسبة 50٪ حسب البناء. حركة مرور الموجّه الحقيقية ليست كذلك، ومقارنة التكلفة حساسة للغاية لذلك. إعادة وزن التكاليف المقاسة لكل نمط عبر مجموعة من معدلات انتشار الجلسات الصعبة:

الشكل 7.التكلفة لكل 1,000 جلسة كدالة لمقدار حركة المرور التي تحتاج حقًا إلى النموذج القوي. يُثبَّت السلوك داخل الفئة عند القيم المُقاسة؛ يتغير المزيج فقط.
الجدول 8.حساسية الانتشار، $ لكل 1,000 جلسة.
عند معدل التصعيد المستهدف الوارد في وثيقة التصميم نفسها والبالغ ≤5% من الجلسات، تبلغ تكلفة التصعيد 1.6 ضعف فاتورة المجمع الرخيص و12% من فاتورة المجمع الحدودي. وعند مزيج الإجهاد بنسبة 50%، تبلغ التكلفة 6.7 أضعاف فاتورة المجمع الرخيص. وكلاهما صحيح؛ إذ يجيبان عن سؤالين مختلفين. والأكثر صلةً من الناحية التشغيلية هو الأول، ولهذا السبب يُضبط سقف الحصة افتراضيًا على 20% بدلاً من «إيقاف التشغيل» — فسقف الحصة، وليس دقة المحفز، هو ما يحد الفاتورة فعليًا.
6.5 تظل الحدود القصوى صامدة في وجه سوء الاستخدام العدائي
أعدنا تشغيل المجموعة النصية باستخدام آلية حدّ المشاركة الحقيقية — لا دُمية، دلاء يومية حقيقية من Redis — وفق نموذج التهديد في §8: يرسل كل عميل X-OrcaRouter-Tier: strong في كل دورة.

الشكل 8.إساءة استخدام ترويسة معادية ضد سقف الحصة المتصاعدة البالغ 20٪. الطلبات العشرون الأولى غير مقيدة بالتصميم — فالأرضية الدافئة تمنع قراءة "تصعيد واحد من اثنين" على أنها 50٪ وقفل الميزة على موجه جديد — وبعدها تتقارب الحصة وتستقر. الحالة النهائية: 296 من أصل 1,439 طلبًا خُدمت بقوة (20.6٪)، بينما تم رفض 1,143 طلبًا صريحًا وتدقيقها كأحداث denied_cap.
التجاوز المتبقي بنسبة 0.6% هو السلوك المقصود لمقارنةٍ صارمةٍ بأكبر من على عدّاد لاحق تقريبي، وسقف الجلسة الواحدة البالغ 1 يمنع الجلسات الفردية من استهلاك الميزانية. كل رفض يظهر للعميل في ترويسة الاستجابة X-Orca-Session-Tier: base; reason=denied:share_cap ولمشغّل النظام في جدول التدقيق — التصعيد المكبوت لا يكون صامتًا أبدًا.
7 ما الذي سنغيره
امنح مستخرج الدلتا عتبة خاصة به. إعادة استخدام T2 الخاصة بالنص الكامل تترك هامشًا قدره 0.019 (§6.2). قيمة T2 المخصصة للدلتا في نطاق 0.45–0.60 متطابقة سلوكيًا على هذه المدونة مع هامش أكبر بمرتبتين من حيث الحجم. العمل المقرر بالفعل بشأن العتبات المئوية يشمل ذلك ويُعد الحل الأفضل.
لا تدع مصطلح كثافة الكود يبقى زخرفيًا.يساهم بـ 0.069 من ميزانيته البالغة 0.20 على النص الواقعي الأكثر كثافة الذي تمكنا من إنشائه، لأن سقف تشبعه البالغ 5 مطابقات لكل 100 حرف يستلزم تقريبًا كلمة كود واحدة كل عشرين حرفًا. إما أعد تحديد سقفه استنادًا إلى توزيع إنتاج مُقاس، أو أعد تخصيص وزنه.
الفئة C هي العمود الفقري لحركة مرور الوكلاء، وهي الأقل تطويرًا. مجموعة failure_loop غير مرئية لبوابة الصعوبة (ذروة 0.262) ويتم اكتشافها بالكامل بواسطة الضربات. تفشل جلسات الوكلاء بسبب التكرار الحلقي، وليس بزيادة الصعوبة المعجمية. أما بقية المُنتِجات في جانب الاستجابة — وخطاف التقاط بثّ native-Gemini الذي لا يزال مفقودًا — فهي أجدر من مزيد من ضبط الصعوبة.
انشر كمون التصعيد. جولتان من العمل الشاق على النموذج الرخيص هما التكلفة الحقيقية لآلية تأكيد تصاعدية، ويجب أن يراها المشغلون في لوحة التحليلات بجوار الدقة، لا أن يكتشفوها بأنفسهم.
القيود 8
المجموعة النصية اصطناعية. بُنيت لتنفصل بشكل نظيف، لذا فإن نتيجة الصفر في الإيجابيات الكاذبة تصف خصوصية الآلية على المدخلات القابلة للفصل، وليس دقتها على حركة الإنتاج الفعلية. لا يمكن أن يأتي رقم الدقة الحقيقي إلا من مهمة التوسيم في الوضع التجريبي التي تحددها المواصفة — خط أنابيب التشغيل الكامل يعمل، دون توجيه أي شيء، والقرارات تُوسَم بأثر رجعي — مع بوابة بدء التشغيل عند دقة توسيم ≥70٪.
يفترض نموذج التكلفة عددًا ثابتًا قدره 500 رمز إخراج لكل دورة، وهو ما يُخفي تأثيرًا حقيقيًا: النماذج الحدودية تُصدر رموز استدلال أكثر، لذا تكون العلاوة الحقيقية للنماذج الحدودية أقل من قيمتها الفعلية. كما أنه يصمم دفء ذاكرة التخزين المؤقت على مستوى الطلب كقيمة موحدة 1/N عبر الفتحات الرئيسية؛ بينما كان من شأن تجمع مرجح أن يستخدم مؤشر هيرفيندال Σw²، وقناة ذات مفتاح واحد لن تُظهر أي ميزة تخزين مؤقت لارتباط الجلسة على الإطلاق على مستوى القناة — على الرغم من أن تثبيت طبقة النموذج لا يزال مهمًا للاستراتيجيات التكيفية.
لم نُجْرِ الاستدلالَ الأولي (upstream inference)، لذا لا نَدّعي أي دقّةٍ أو نجاحٍ في المهمة. تغطيةُ المنعطفات الصعبة هي مؤشّرٌ على الجودة، وهي تفترض أن النموذج القويّ أفضلُ فعلًا في تلك المنعطفات — وهو أمرٌ معقولٌ بالنسبة للنماذج الأولية المُصمَّمة، لكنه غير مُتحقَّقٍ منه هنا.
أخيرًا، يقيس هذا تنفيذ بوابة واحدة. ينبغي أن ينطبق نمط فشل التثبيت في الجولة الأولى بشكل عام على أي موجّه مدرك للتخزين المؤقت يثبّت الجلسات، لكن الأرقام المحددة هي خصائص هذه العتبات، وهذه الأوزان، وهذه الأسعار.
9 الأعمال ذات الصلة
التوجيه على مستوى الطلب مغطى جيدًا.FrugalGPTsup>[2]/sup> قدّم سلسلة LLM — استعلام النموذج الرخيص، تقييم الإجابة، التصعيد عند انخفاض الثقة — محققًا خفضًا في التكلفة يصل إلى 98% مع دقة مطابقة.RouteLLMsup>[1]/sup> يدرّب الموجّهات على بيانات تفضيلات Chatbot Arena ويحقق 95% من جودة GPT-4 مع 14% من استدعاءات النماذج القوية، مع موجّهات تنتقل عبر أزواج النماذج دون إعادة تدريب.RouterArenasup>[3]/sup> يوفر الأساس التقييمي المفقود: 8,400 استعلام عبر مختلف المجالات ومستويات الصعوبة، مُقيَّمة على الدقة والتكلفة وأمثلية التوجيه والمتانة والعبء الإضافي للموجّه.
ما لا يتناوله أيٌّ من هذه الأساليب هو المحادثة بوصفها وحدة التوجيه. يُصعّد التسلسلُ الهرمي طلبًا ثم ينسى؛ وفي الدورة التالية يعيد تشغيل النموذج الرخيص نفسه على المهمة نفسها التي بات معروفًا أنها صعبة. والموجِّه المدرَّب على التفضيل يقيّم استعلامًا لا مسارًا. والفجوة التي يعالجها هذا التقرير هي: ما الذي ينبغي للموجِّه أن يتذكّره بين الدورات، وإلى متى، وما الذي ينبغي السماح له بتغيير رأيه — وهي مسألة لا تصبح ملحّة إلا عندما يجعل التخزين المؤقت للمطالبات النسيان مكلفًا.
يشتمل OrcaRouter على أداة RouterArena داخل الشجرة (eval/) تختبر أداء استراتيجياته الخمس على مستوى الطلب — cheapest، quality، balanced، linucb، gated_adaptive — مقابل مجموعة البيانات المفتوحة دون تعديل المستودع الأصلي. آلية مستوى الجلسة الموصوفة هنا مستقلة عن الاستراتيجيات الخمس جميعها وتتكامل معها.
10 الاستنتاج
غيّر التخزين المؤقت للمطالبات اقتصاديات توجيه نماذج اللغة الكبيرة بطريقة لم تواكبها أدبيات التوجيه بعد. بمجرد أن تصبح الاستمرارية تستحق خصمًا بمقدار 10× على غالبية توكنات الإدخال، يجب على الموجّه أن يثبّت — وفي اللحظة التي يثبّت فيها، يتخذ قراره في الجولة التي تكون معرفته فيها في أدنى مستوياتها، ويظل ملتزمًا بذلك القرار طوال المحادثة. التوجيه على مستوى الطلبات لا يعاني من هذه المشكلة ويدفع ثمن ذلك بإخفاقات الكاش؛ أما إعادة التقييم الساذجة لكل جولة فتعيد إدخال الإخفاقات وتضيف فوق ذلك أثر انحياز الطول.
الالتصاق المتدرج يحلّ ذلك بفصل أمرين يبدوان كشيء واحد: أي نموذج يخدم هذه الجلسة (المثبّت، الثابت داخل الطبقة) وأي طبقة تنتمي إليها هذه الجلسة (قطعة صغيرة ومحدودة ومؤكَّدة وقصيرة العمر من الحالة). في إعادة المحاكاة لدينا، يستعيد ذلك الفصل 87٪ من الجلسات التي لا يمكن اكتشاف صعوبتها في الدور الأول، مع صفر نتائج إيجابية كاذبة على 200 جلسة سهلة، بتكلفة تعادل 45٪ من تكلفة النهج دائم الحدود — ويحافظ على سقف إنفاق 20٪ في مواجهة العملاء الذين يحاولون بنشاط التغلب عليه.
نقاط الضعف الصادقة في الآلية هي المعايرة، وليس البنية: بوابة صعوبة أعيد استخدامها من توزيع لم تُضبط عليه، ومصطلح ميزة لا يمكن أن يصل إلى ميزانيته، وجولتان من تأخير الإنقاذ الذي لا يمكن تجنّبه. تلك أمور قابلة للحل. الادعاء البنيوي — أن ذاكرة التصعيد يجب أن تكون منفصلة عن الرقم السري، وأنه لا يجوز لأي إشارة ضبابية أن تتصاعد وحدها، وأن الحدود القصوى يجب أن تلزم طلب العميل الصريح لأن العميل يحمل الرمز — هو الجزء الذي سنحتفظ به.
11 مصدرًا
1. LMSYS Org. RouteLLM: إطار عمل مفتوح المصدر لتوجيه نماذج اللغات الكبيرة بتكلفة فعالة. a href="https://www.lmsys.org/blog/2024-07-01-routellm/">u>lmsys.org/blog/2024-07-01-routellm//u>/a> · الكود: a href="https://github.com/lm-sys/RouteLLM">u>github.com/lm-sys/RouteLLM/u>/a>
2. Chen، Zaharia وZou. FrugalGPT: كيفية استخدام نماذج اللغة الكبيرة مع تقليل التكلفة وتحسين الأداء. arXiv:2305.05176. a href="https://arxiv.org/abs/2305.05176">u>arxiv.org/abs/2305.05176/u>/a>
3. Lu, Liu, Yuan, Cui, Zhang, Liu و Xing. RouterArena: منصة مفتوحة للمقارنة الشاملة لموجّهات LLM. arXiv:2510.00202. a href="https://arxiv.org/abs/2510.00202">u>arxiv.org/abs/2510.00202/u>/a>
4. OpenAI. التخزين المؤقت للمطالبات في واجهة برمجة التطبيقات (API). a href="https://openai.com/index/api-prompt-caching/">u>openai.com/index/api-prompt-caching//u>/a> — تخزين مؤقت تلقائي، بادئة ≥1,024 رمزًا بزيادات قدرها 128 رمزًا، إخلاء عند الخمول لمدة 5–10 دقائق، ≤1 ساعة؛ خصم على المدخلات المخزنة مؤقتًا حسب مستوى النموذج. التسعير: a href="https://openai.com/api/pricing/">u>openai.com/api/pricing//u>/a>
5. Anthropic. التخزين المؤقت للموجّهات. a href="https://platform.claude.com/docs/en/build-with-claude/prompt-caching">u>platform.claude.com/docs/en/build-with-claude/prompt-caching/u>/a> — قراءات الكاش: 0.1× من الإدخال الأساسي، والكتابة: 1.25× (TTL: 5 دقائق) أو 2× (TTL: ساعة)، ويُحدَّث الكاش عند الاستخدام. التسعير: a href="https://www.anthropic.com/pricing">u>anthropic.com/pricing/u>/a>
6. DeepSeek. تُقدّم واجهة برمجة تطبيقات DeepSeek ميزة التخزين المؤقت للسياق على القرص. a href="https://api-docs.deepseek.com/news/news0802/">u>api-docs.deepseek.com/news/news0802//u>/a> — تلقائي، يُفوتر بناءً على مرات الوصول الفعلية إلى الكاش، مع تقليل التكلفة بمقدار عشرة أضعاف عند الوصول.
7. Google. التخزين المؤقت لسياق Gemini API. a href="https://ai.google.dev/gemini-api/docs/caching">u>ai.google.dev/gemini-api/docs/caching/u>/a> — التخزين المؤقت الضمني والصريح مع TTL مُسعّر حسب التخزين.
8. مصدر OrcaRouter، هذا المستودع: service/session_affinity.go (التثبيتات، قيم TTL، المفاتيح المقيّدة بالمستوى) · service/session_escalation.go (المحرك) · service/model_router.go:1374 (selectByStrategy: تضييق المستوى قبل قراءة التثبيت) · service/model_router_difficulty.go (الأوزان والسقوف) · service/model_router_delta.go (مستخرج الدلتا) · service/escalation_strikes.go (منتجات جانب الطلب) · service/escalation_caps.go (سقوف الحصة) · docs/features/frontier-escalation.md (التصميم، جولات المراجعة 1–4).
قابلية إعادة الإنتاج.أداة القياس عبارة عن اختبار Go في حزمة الخدمة يقوم بتشغيل ResolveEscalation / CommitEscalationDecision ضد miniredis، إلى جانب خط أنابيب للتحليل وإنتاج الأشكال بلغة Python. توليد المجموعة النصية مُبذر (rand.NewSource(20260814)) والتشغيل الكامل حتمي: 400 جلسة، و3,968 جولة، وثلاث تجارب (إعادة التشغيل الرئيسية، وتشغيل الحد الأقصى للخصومة، ومسح العتبة عبر 9 نقاط). تستخدم الأشكال لوحة ألوان فئوية مُعتمدة لضعاف رؤية الألوان (CVD)؛ كل شكل مقترن بجدوله الأساسي. لم يتم الوصول إلى أي بيانات إنتاجية، ولم يُودَع أي جزء من هذا التحليل في المستودع.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
