מיזוג מודלים בייצור: בתוך OrcaRouter Fusion ו-DSL הניתוב
- qwenחדשQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 212 tok/s
- orcaחדשOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicחדשAnthropic: Claude Opus 52026-07-2461אינטליגנציה78כתיבת קוד
- googleחדשGoogle: Gemini 3.6 Flash2026-07-2150אינטליגנציה69כתיבת קוד
- googleחדשGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1651אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1557אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0951אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0955אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0959אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0854אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0641אינטליגנציה59כתיבת קוד
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232אינטליגנציה42כתיבת קוד
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226אינטליגנציה39כתיבת קוד
- anthropicAnthropic: Claude Sonnet 52026-06-3053אינטליגנציה72כתיבת קוד
- klingKling: Kling 3.0 Turbo2026-06-1757אינטליגנציה52כתיבת קוד57מתמטיקה
- z-aiZ.ai: GLM 5.22026-06-1651אינטליגנציה69כתיבת קוד60מתמטיקה
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242אינטליגנציה61כתיבת קוד61מתמטיקה
- anthropicAnthropic: Claude Fable 52026-06-0960אינטליגנציה77כתיבת קוד
- qwenQwen: Qwen3.7 Plus2026-06-0139אינטליגנציה56כתיבת קוד59מתמטיקה
שלושה מודלים מתקדמים במקביל, תשובה אחת בחזרה. קרא לזה בשורה אחת — או הרכב בעצמך.
TL;DR. Claude Fable 5 הוסר מהזמינות. התשובה אינה מודל גדול יותר — זהו פאנל: הפעל מספר מודלים פורצי-דרך במקביל ותן לשופט להחזיר את התשובה החזקה ביותר. OrcaRouter מספקת זאת בשתי דרכים: נתבי orcarouter/fusion מובנים שאתה מפעיל כמו כל מודל, ו- Routing DSL להרכיב משלך. זהו המדריך לשניהם — עם מתכוני העתק-הדבק, חמשת הבוררים (כולל synthesize, מיזוג ה‑Mixture‑of‑Agents), וכיצד לפרוס זאת מבלי להמר על ה‑SLA שלך.
חלק 1 — קרא לזה בשורה אחת: נתבי Fusion המובנים
Fable 5 הופסק והוגבל, כך שאינו ניתן לקריאה נרחבת. Fusion בונה מחדש את הרמה הזו מהמודלים שאתה יכול עדיין לקרוא — מתאם תואם-OpenAI שמוכנס בקלות, שמפעיל פאנל של מודלים מתקדמים במקביל ומחזיר את התשובה החזקה ביותר. שלוש רמות אוצרות נשלחות בכל סביבת עבודה:
שלוש דרגות Fusion (הרכב פאנל × חלון הקשר)
Claude Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro
חלון הקשר: 1,000,000
מתאים ל: Fable-5 level Max intelligence
Claude Opus 4.8 + GPT-5.5
חלון הקשר: 1,000,000
מתאים ל: הסקה מאוזנת ברמת Fable-5
ג'מיני 3.5 פלאש + מינימקס M2.7 + GLM 5.1
חלון הקשר: 200,000
הכי טוב עבור: רמת Fable-5, מסקנה מהירה וזולה
(חלון הקשר = האיבר הקטן ביותר בפאנל — האילוץ המחייב על פיזור.)
אלה אינם סלוגים שיווקיים; הם נתבי DSL שהורכבו מראש המנוהלים באופן מרכזי. הנה האמיתיתהתוכנית orcarouter/fusion, כלשונה:
version: 1
rules:
- id: hard_panel
when: task_class == "code" || task_class == "agent" || code_keyword_density >= 0.3 || has_tools || difficulty >= 0.3
use:
parallel:
- { model: "anthropic/claude-opus-4.8" }
- { model: "openai/gpt-5.5" }
- { model: "google/gemini-3.1-pro-preview" }
arbiter:
strategy: best_of_n
model: "anthropic/claude-opus-4.8"
template: best_answer_v1
max_latency_ms: 120000
default:
delegate: balancedשתי בחירות עיצוב שכדאי לציין:
זה מופעל רק עבור עבודה אמיתית. שער ה-when: gate מפעיל את הפאנל עבור הנחיות של קוד, סוכן, שימוש בכלים, צפוף קוד, או הנחיות קושי גבוה (difficulty >= 0.3); כל השאר נופל לברירת המחדל המאוזנת של סביבת העבודה. אתה משלם את מחיר הפאנל בדיוק במקום שבו זה עוזר, לא על "היי."
השופט מגיש תשובה אמיתית, מילה במילה.best_of_n מפעיל שופט LLM (כאן, Opus 4.8 עם תבנית best_answer_v1) ש בוחר את המועמד החזק ביותר ומגיש אותו כמו שהוא - לעולם לא מיזוג מדולל. הפלט הוא תמיד תשובה של מודל אמיתי.
חלק 2 — Select לעומת Fuse: best_of_n וה-synthesize arbiter
נתבי Fusion בוחרים. אבל OrcaRouter גם שולחת מיזוגאסטרטגיית — synthesize, Mixture-of-Agentsתבנית שנוספה במנוע הניתוב (service/dispatch_parallel/synthesize.go). ההבדל הוא כל המשחק:
תצוגה 2 — בחירה לעומת איחוי
best_of_n (SELECT) synthesize (FUSE)
┌─ Opus 4.8 ─┐ ┌─ Opus 4.8 ─┐
├─ GPT-5.5 ─┼─► judge picks leg k ├─ GPT-5.5 ─┼─► aggregator LLM writes
└─ Gemini ─┘ └─► serve leg k verbatim └─ Gemini ─┘ ONE new fused answer
output = a real model's answer output = a new answer better than any legמתכון לפיוז'ן אמיתי:
use:
parallel:
- { model: "anthropic/claude-opus-4.8" }
- { model: "openai/gpt-5.5" }
- { model: "google/gemini-3.1-pro-preview" }
arbiter:
strategy: synthesize
model: "anthropic/claude-opus-4.8" # aggregator: fuses candidates into one new answer
template: synthesize_v1הסתייגויות כנות:
- החיוב הוא N+1 — כל רגל מחויבת, בתוספת המאגד כשיחה נוספת.
- פורמט צ'אט של OpenAI בלבד בגרסה 1 — המצרף פולט השלמת צ'אט של OpenAI; קלוד/ג'מיני ילידיים לקוחות יורדים לשרת-הראשון-מצליח (שיחות עדיין מחויבות).
המצרף חייב להיות בקבוצת המועמדים המורשית של הנתב, אחרת הוא מתדרדר.
מתי להשתמש באיזו: best_of_n כאשר סביר שהתשובה של מודל אחד לחלוטין נכון (קוד, שאלות ותשובות עובדתיות) — אתה רוצה תשובה נקייה ואמיתית. synthesize כאשר התשובות הן משלימות (מחקר, ניתוח, טקסט ארוך) ושילוב החוזקות מנצח כל תשובה יחידה.
חלק 3 — בנה בעצמך: ספר המתכונים של Routing DSL
לא רוצה את הפאנל המותאם? התחל מתבניות "Claude Fable 5 Level" ב-Routing DSL editor (הן נשלחות בכל workspace ומשקפות את נתבי Fusion), לאחר מכן התמחו. שישה דפוסי העתק-הדבק:
1 — קוד ששוחרר שבאמת רץ → פזר החוצה, תן ל- בדיקות בחר את המנצח:
- id: hard_code
when: task_class == "code" && difficulty > 0.6
use:
parallel:
- { model: "anthropic/claude-opus-4.8", thinking_budget_tokens: 16000 }
- { model: "openai/gpt-5.5", reasoning_effort: high }
- { model: "google/gemini-3.1-pro-preview" }
arbiter: { strategy: tests_pass }tests_pass הוא מבוסס ביצוע — הוא משרת את המועמד שעובר את ההארנס שלך, אין צורך ב-judge LLM.
2 — תפסיק לשלם יותר מדי עבור הנחיות קלות → שער קושי (תבנית Fusion, המודלים שלך):
- id: easy
when: difficulty < 0.3
use: { delegate: cheapest }
- id: hard
when: difficulty >= 0.3
use:
parallel:
- { model: "anthropic/claude-opus-4.8" }
- { model: "openai/gpt-5.5" }
arbiter: { strategy: best_of_n, model: "anthropic/claude-opus-4.8", template: best_answer_v1 }3 — שמור על ריצות סוכן ארוכות על המסילה → הסלמה רק כאשר הוא מתנדנד:
- id: agent
when: task_class == "agent" && agent_state.consecutive_errors == 0
use: { model: "anthropic/claude-sonnet-4.6", affinity_ttl: "5m" }
on_low_confidence:
signals: [next_turn_test_failed, self_doubt]
use: { model: "anthropic/claude-opus-4.8", thinking_budget_tokens: 24000 }4 — הפוך תפוקות לא יציבות לדטרמיניסטיות → הצבע, העלה על פיצול:
- id: extract
when: task_class == "rag"
use:
parallel:
- { model: "anthropic/claude-opus-4.8" }
- { model: "openai/gpt-5.5" }
- { model: "google/gemini-3.1-pro-preview" }
arbiter: { strategy: majority }
on_disagreement: { model: "anthropic/claude-opus-4.8", thinking_budget_tokens: 32000 }5 — התגבר על השהיית זנב ותקלות ספק → רוץ, הגש למגיב הראשון:
- id: race
when: request.stream == true && difficulty < 0.5
use:
parallel:
- { model: "google/gemini-3.5-flash" }
- { model: "minimax/minimax-m2.7" }
- { model: "z-ai/glm-5.1" }
arbiter: { strategy: first }6 — גלגל מבלי להמר על ה-SLA → צל (הערך לצד תעבורה חיה, רשום מה שהואהיה בוחר + דלתא עלות, הגש את הבחירה החיה) → קנרי % (dsl_canary_pct 5 → 25 → 100, אקראי-קריפטוגרפי לפי בקשה). העבר על פי סטייה נמדדת, חזור מיידית.
דף הרמאות: חמישה בוררים

כלכלה וכנות
פיזור מבוקר קושי שומר על החשבון שטוח (להמחשה; עלות = חישוב מחיר אסימון אמיתי) — עלות משוקללת = חלק קל × זול + חלק קשה × לוח:

עומס עבודה קל ב-70% מריץ את כל הפאנל תמורת שליש מהחשבון של כל הפאנל.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
