
Agora-2 מול Grok 4.6: שאלת מדיניות הסוכנים — 1,200 סוכני LLM, והסימולטור שלא משתמש באף אחד מהם
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 36 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 181 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
הנה מספר שעולה כסף. החקירה של METR בתקרית Hugging Face ביולי 2026 מנתה כ-1,200 סוכנים מתואמים בתוך הרצת הערכה אחת. לפי Grok 4.6 — המחירון שלו: 2.00 דולר למיליון טוקני קלט, 6.00 דולר למיליון טוקני פלט — צי בגודל כזה, שמעבד תמלילים ארוכים במשך שישה ימים, הוא חשבון שצוות ממומן היטב יכול למעשה לספוג. במחיר של המודל שאחרת היית בוחר בו, הוא לא. זו טענת המוצר האמיתית של Grok 4.6, וזו אותה טענה ש-Agora-2 סותר בשקט: כאשר Odyssey הציגה את מודל העולם הרב-סוכני שלה ב-21 בספטמבר 2026 — תצוגה מקדימה ניתנת למשחק שמייצרת סביבות משותפות לעד 20 בני אדם וסוכני AI — התברר שהסוכנים שבתוכו אינם מודלי שפה בכלל. Odyssey אימנה במקום זאת מדיניות קטנות של למידת חיזוק. השאלה המעניינת שהצימוד הזה מעלה אינה איזו מהן טובה יותר. היא למה המעבדה דילגה על ה-LLM.
כרטיס התעריפים, ביחידה שחשובה לציי רכב
Grok 4.6 שוחרר ב-12 באוגוסט 2026 כדרג החזית של xAI: חלון הקשר של 500,000 טוקנים, קלט טקסט, תמונה וקובץ, מאמץ חשיבה ניתן להגדרה, קריאה מקורית לכלים, פלטים מובנים, ומדד האינטליגנציה של Artificial Analysis שעומד על 44 בגרסת המדד v4.3.2 — אותו מדד שממקם את GPT-5.6 Sol ב-47 ואת Kimi K3 ב-44. Artificial Analysis נותן לו ציון 94.9 ב-GPQA Diamond, וזהו המודל ש-xAI מפרטת כ"Latest" בתיעוד המפתחים שלה. הוא מוגש כמודל OpenAI Responses מן השורה הראשונה, וזו הנקודה המעשית: מסגרות סוכנים מאמצות אותו על ידי שינוי base URL, ולא על ידי כתיבת מתאם.
אבל הנתון המעניין הוא השילוב של $2/$6 עם חלון ההקשר. לולאות סוכנים ארוכות טווח הן עומסי עבודה מכוערים — עשרות אלפי טוקנים של פלט כלים מצטבר לכל סוכן בכל שעה, שרובו מיותר. תעריף הקריאה מהמטמון של Grok 4.6 הוא $0.50 למיליון, רבע ממחיר הקלט שלו, וזה מה שהופך הרצה של אלף סוכנים לאפשרית אריתמטית ולא רק לאפשרית. שימו לב לגבול המדרגה: הנחיות מעל 200K טוקנים מחויבות בתעריף כפול מהבסיסי, כך שסוכן שצובר היסטוריה ארוכה מכפיל בשקט את העלות של עצמו.
• מחיר — ל-Agora-2 אין מחיר מפורסם, רק בדפדפן לעומת Grok 4.6 $2.00/$6.00 לכל 1M, $0.50 לקריאה מ-cache, כפול מעל 200K קלט
• הקשר — מצב משותף של Agora-2 בתוספת היסטוריה תחומה לכל תצוגה לעומת 500,000 טוקנים של Grok 4.6
• ציון עצמאי — Agora-2 לא פורסם, לעומת Grok 4.6 AA Intelligence Index 44 (v4.3.2)
• הסקה — Agora-2 לא רלוונטי, אינו מודל שפה, לעומת Grok 4.6: מאמץ ניתן להגדרה, קריאה מקורית לכלים
• גישה — תצוגה מקדימה ניתנת למשחק של Agora-2, ללא API וללא משקולות, לעומת ה-API הקנייני של Grok 4.6
• חומרה — Agora-2 עם ארבעה כרטיסי GPU מדגם RTX PRO 4500 עבור ארבע תצוגות בו-זמניות לעומת Grok 4.6, נקודת קצה מתארחת

מדוע Odyssey לא שמה LLM בזירה
הקיצור המובן מאליו, אם אתה בונה עולם שבו שישה עשר סוכני AI נלחמים בארבעה בני אדם, הוא לחבר מודל טקסט מוכשר לבקרות ולתת לו לשחק. Odyssey לא עשתה זאת, והדוח הטכני שלה מסביר מדוע בטבלת התצורה. מדיניות הסוכן ב-Agora-2 היא מדיניות רקורנטית סקלרית ומרחבית שצורכת היסטוריית תצפיות של שישה עשר, ומפיקה פעולה כל ארבעה צעדי סימולציה על פני ארבעה עשר ענפי תנועה בדידים. הסימולציה עצמה מתקדמת על בסיס זמן של 30 Hz. מודל שמתבקש לקבל החלטה שלושים פעמים בשנייה, מתוך תצוגה נצפית חלקית, עם אוצר פעולות בסיסי קבוע, אינו בעיית הסקה — הוא בעיית בקרה, ובעיות בקרה נפתרות באימון מדיניות קטנה, לא בהנחיה של מודל חוד בעל הקשר של 500K.
כדאי לומר זאת בבירור כי זוהי התפיסה השגויה הנפוצה ביותר בנוגע לקטגוריית מודל-העולם. Agora-2 אינו מתחרה ב-Grok 4.6 על אותה משבצת במערכת. הוא תופס את המשבצת שמתחת: הסביבה שבה המדיניות מאומנת ומוערכת. הארכיטקטורה של הדו"ח מפורשת לגבי הפיצול — מודל סימולציה חוזה כיצד פעולות משולבות משנות מצב משותף, שרת עולם מיישם אותן, ומודל רינדור לפי-תצוגה מייצר לכל משתתף פרספקטיבה משלו בגודל 640×480 מתוך אותו מצב. שום מודל טקסט לא מופיע בשום מקום בלולאת האינטראקציה.

היכן שמודל כמו Grok 4.6 כן מופיע הוא רמה אחת מעלה: בתור הדבר שכותב את תשתית ההערכה, מנתח את התמלולים, או מפעיל את הסוכן שמשתמש בכלים ושאת התנהגותו אתה מנסה לחקור. זה בדיוק התפקיד ש-GPT-5.6 Sol מילא בחקירה של METR — כחמישה אחוזים מהצי, והאנליסט שקורא את הלוגים — וזה התפקיד שאותו מחירו וחלון ההקשר של Grok 4.6 הופכים לזול.
פער הראיות כאן רחב יותר מאשר ברוב ההתמודדויות האלה.
ציון האינדקס של Grok 4.6 נמדד באופן עצמאי, כרטיס התעריפים שלו מפורסם, וחלון ההקשר שלו מתועד. המספרים של Agora-2 מגיעים מדוח שנכתב על ידי Team Odyssey ואף אחד אינו משחזר אותם. בשלושים קליפים לניטור, מרנדר ה-structured-prefix שלו מגיע ל-30.11 dB PSNR לעומת 20.67 dB עבור קו בסיס VAE — השוואה שהדוח עצמו מזהיר שהיא בין מערכות שלמות עם תקציבי אימון שאינם תואמים, ולא מבחן ארכיטקטורה מבודד. בנצ'מרק ה-conditioning שלו, שמראה הפחתה של 45.8% בזמן denoiser לעומת cross-attention, משתמש ב-denoisers מאותחלים באקראי על קלטים סינתטיים ומודד עלות הרצה, לא איכות תמונה.
ואז מגיע פרק המגבלות, שהוא ישיר באופן יוצא דופן. 15 עדכוני הלטנט המוצהרים ו-30 הפריימים המוצגים בשנייה הם יעדים. קצב פריימים מתמשך ושהיית קלט-להצגה במהלך אינטראקציה חיה בין ריבוי סוכנים „לא הוערכו באופן כמותי”. איכות חזותית לטווח ארוך, התאמה בין נקודות מבט ועמידה מקצה-לקצה בפעולות — כולם רשומים כלא מוערכים. הסביבה דורשת מנוע משחקים עם מכשור, בעל גאומטריה מפורשת ואוצר מראה קבוע, והעברה לנכסים, לכללים או לסביבות חדשים לא נבדקה. קראו את הרשימה הזאת לפני שאתם קוראים כל מספר כותרתי על Agora-2.
איזה מהם שייך לסטאק שלך?
אם אתם מריצים או לומדים מערכות מרובות-סוכנים היום, Grok 4.6 הוא הרכיב שאפשר באמת לפרוס — מודל טקסט ברמת חזית בקצב שהופך ציי סוכנים גדולים למשתלמים, עם ציון מפורסם ומשטח API מתועד. ב-OrcaRouter הוא מוגש במחיר המחירון של xAI עצמה ללא תוספת, כך שה-$2/$6 שלמעלה וכל שינוי תעריף עתידי מגיעים לחשבון שלכם ביום שהם קורים, עם מעבר אוטומטי לגיבוי אם נקודת הקצה הראשית נפגעת. שתי העובדות חשובות במיוחד לעומסי עבודה של ציים: אלף סוכנים הם אלף הזדמנויות לפגוע בספק שנפגע, ותוספת על גבי פלט של $6 היא תוספת מוכפלת בכל הריצה שלכם.

Agora-2 אינה תשתית הניתנת לפריסה ואנחנו לא מארחים אותה — אין API, אין משקלים ואין מחיר, רק תצוגה מקדימה ניתנת להפעלה של Odyssey עצמה. מה שהיא מציעה הוא סוג אחר של ערך: סביבה מבוקרת למחקר האינטראקציה שדוח METR מראה שהוא דחוף כעת, בעלות של ארבעה כרטיסי GPU מדגם RTX PRO 4500 עבור ארבע תצוגות במקביל, ולא חשבון API. פסק הדין הכנה הוא ששני אלה אינם מתחרים. Grok 4.6 הוא המוח המדיני שאפשר לקנות היום לפי טוקן; Agora-2 היא הצעה היכן לבחון מה קורה כאשר אלפים מהמוחות האלה נפגשים. השנייה היא מחקר מעניין יותר ומוצר פחות גמור, והדוח של Odyssey עצמה צלול באופן מרענן לגבי אילו חלקים ממנה הם עדיין יעדים.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
