
Agora-2 מול Kimi K3: עשרים משתתפים בעולם משותף, והמודל עם מיליון טוקנים שמשחק בו תפקיד אחד
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 36 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 181 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
אם מסירים מהתמונה את מבחני הביצועים, נותרת אסימטריה אחת שמכריעה את ההשוואה הזו. Odysseyהציגה את Agora-2 ב-21 בספטמבר 2026 — מודל עולם רב-סוכני שאפשר לשחק בו, שמייצר סביבה משותפת ואינטראקטיבית בזמן אמת עבור עד 20 בני אדם וסוכני AI, ברזולוציית 640×480, מתוך סימולציה נלמדת בתוספת מרנדר לכל נקודת מבט. Kimi K3, מבית Moonshot AI, הוא מודל במשקולות פתוחות בעל 2.8 טריליון פרמטרים, עם חלון הקשר של 1,048,576 טוקנים וציון 44 במדד הבינה של Artificial Analysis, אשר שוחרר ב-15 ביולי וזמין להורדה מאז 27 ביולי. שניהם פתוחים במובן שחשוב לצוות מחקר — המשקולות של Kimi K3 נמצאים ב-Hugging Face תחת רישיון MIT מותאם, והדוח הטכני של Agora-2 מתפרסם במלואו — ואף אחד מהם אינו פתוח במובן שחשוב לקונה: ל-Agora-2 אין משקולות, אין API ואין מחיר, והרישיון של Kimi K3 נושא הגבלות מסחריות. השאלה המועילה אינה מי מהם חכם יותר, אלא מי מהם יכול להיות חלק ממערכת רב-סוכנית ברבעון הזה.
מה בעצם ניתן להוריד, ומה זה נותן לך
Kimi K3 הוא האובייקט השגרתי יותר בפער ניכר. MoE עם 2.8T פרמטרים וחלון הקשר של מיליון טוקנים, קלט טקסט ותמונה, שליטה עילית במאמץ החשיבה במקום פרמטרי דגימה, קריאה מובנית לכלים, ומשטח תואם OpenAI. תמחורו עומד על $3.00/$15.00 למיליון טוקנים עם תעריף קריאה מהמטמון של $0.30, והוא מקבל ציון 44 ב-index v4.3.2 — שלישי מבין מודלים עם משקלות פתוחים בלוח הזה, מאחורי 46 של MiMo-V2.6-Pro ו-45 של GLM-5.3. באותו לוח הוא מקבל ציון 85.0 ב-terminal-bench 2.1 ו-59.5 ב-SciCode. אם המערכת הרב-סוכנית שלך זקוקה למוח לכל סוכן, זהו מוח שתוכל לשכור בזול או להריץ בעצמך.
Agora-2 הוא סוג אחר של ארטיפקט. מה ש-Odyssey פרסמה הוא דו"ח טכני בן 23 עמודים ותצוגה מקדימה בדפדפן. הדו"ח מתאר סביבת משחק פעולה איזומטרית עם ייצוגים מפורשים לזהות ישות, מיקום, בריאות, אנימציה, מוות ותחייה; מודל סימולציה שמנבא תנועה, קרב ואנימציה מהיסטוריות ישויות, פעולות וגאומטריה מקומית; ומודל רינדור לכל משתתף שמייצר את התצוגה של אותו משתתף מתוך ייצוג חזותי דחוס של המצב המשותף. שום דבר בתיאור הזה אינו מודל שפה, ושום דבר בו אינו ניתן להורדה.
• מה זה — Agora-2, מנוע משחק נלמד המרנדר 640×480 לכל תצוגה, לעומת Kimi K3, מודל טקסט במשקולות פתוחות עם 2.8T פרמטרים
• ניקוד עצמאי — Agora-2: לא פורסם, לעומת Kimi K3 AA Intelligence Index 44 (v4.3.2), מוביל בקטגוריית המשקלים הפתוחים
• הקשר — מצב משותף של Agora-2 בתוספת היסטוריה תחומה לפי תצוגה לעומת Kimi K3 עם 1,048,576 טוקנים
• מחיר — Agora-2 לא פורסם דבר, רק תצוגה מקדימה בדפדפן, לעומת Kimi K3 $3.00/$15.00 ל-1M, $0.30 במטמון
• רישיון — הדוח של Agora-2 פומבי, משקולות לא שוחררו לעומת Kimi K3 עם MIT מותאם, משקולות ב-Hugging Face
• קלטים — בקרות דפדפן Agora-2 בתוספת 16 מדיניות של סוכני RL לעומת טקסט ותמונה של Kimi K3


התפקיד שכל אחד מהם ממלא במערכת מרובת סוכנים
שני אלה נפגשים רק בתוך מערכת שמכילה את שניהם. Kimi K3 הוא מועמד לשכבת ההחלטה — הרכיב שקורא פלט כלים, כותב קוד, ובוחר את הפעולה הבאה בלולאה ארוכת טווח. חלון מיליון הטוקנים שלו ותעריף הקריאה מהמטמון של $0.30 מכוונים בדיוק לעומס שלולאות אג'נטיות מייצרות: הקשרים עצומים וחזרתיים שיהיו הרסניים במחיר קלט מלא.
Agora-2 הוא מועמד לשכבה שמתחת — הסביבה. התפיסה של Odyssey עצמה היא שמודלים עולמיים מרובי-סוכנים מאפשרים לחוקרים לחקור כיצד סוכנים פועלים "בתוך סימולציות מבוקרות, שבהן ניתן לחקור התנהגות מזיקה בלי לחשוף מערכות מהעולם האמיתי לסיכון" — משפט שנקרא כתגובה ישירה לדוח METR, שבו כ-1,200 סוכנים תיאמו חדירה מתוך ארגז חול של הערכה. המדיניות שמפעילה את שש-עשרה הישויות האוטונומיות של Agora-2 אינה LLM; זוהי מדיניות סקלרית ומרחבית נשנית (recurrent), שאומנה בלמידת חיזוק, הצורכת היסטוריה של שש-עשרה תצפיות ופולטת פעולה בכל ארבעה צעדי סימולציה. אם אתה רוצה לדעת מה עושה סוכן בדרגת Kimi K3 כשגם שש-עשרה יריבים מקבלים החלטות, Agora-2 היא דרך אחת לבנות את הזירה. היא אינה דרך להחליף את הסוכן.
קריאת המספרים משני הצדדים
ה-44 של Kimi K3 נמדד על ידי גורם שלא עובד עבור Moonshot, על אותו אינדקס v4.3.2 שעליו כל דגם אחר בעמוד הזה, וזה הציון שהופך אותו למודל חזית מהימן עם משקולות פתוחות. חלון ההקשר, המחיר ורשימת המודאליות שלו הם עובדות שפורסמו.
הנתונים של Agora-2 מגיעים מהדוח של Team Odyssey עצמה. תוצאת הכותרת היא השוואת רינדור: מרנדר עם קידומת מובנית שמגיע ל-30.11 dB PSNR לעומת 20.67 dB עבור בסיס מבוסס VAE על שלושים קליפים לניטור עם שלושה זרעי דגימה כל אחד. הדוח מקפיד לציין שזה משווה מערכות שלמות עם תקציבי אימון לא תואמים ואינו מבודד ארכיטקטורה. מבחן ההתניה שמראה הפחתה של 45.8% בזמן ה-denoiser לעומת cross-attention פועל על denoisers שאותחלו באקראי עם קלטים סינתטיים — מבחן עלות ביצוע, באופן מפורש לא מדד איכות תמונה. הערכת הסימולציה מכסה תנועת צעד בודד וחיזוי אנימציה על דוגמאות מוקלטות שנשמרו.
וסעיף המגבלות אומר את השאר. יעד התצוגה של 30 פריימים לשנייה והקצב של 15 עדכוני לטנט לשנייה מוצהרים כיעדים; קצב פריימים מתמשך והשהיה מהקלט לתצוגה במהלך משחק חי רב-סוכני לא הוערכו כמותית. איכות חזותית בטווח ארוך, התאמה בין נקודות מבט ועמידה בפעולות מקצה לקצה לא הוערכו. קיימת שונות בפריסה פרוצדורלית בתוך תחום האימון, אך העברה לנכסים, לחוקים או לסביבות חדשות לא נבדקה. אין זו ביקורת על Odyssey — הדוח כנה יותר לגבי הפערים של עצמו מאשר רוב חומרי ההשקה — אך זהו הפריור הנכון לכל מה שתקראו על היכולות של Agora-2.
על איזה אחד אתה יכול לבנות השבוע?
אם אתה צריך מודל חזיתי עם משקולות פתוחות בסביבת ייצור, התשובה היא Kimi K3 וזה לא מתקרב. ה-44 העצמאי שלו, חלון מיליון הטוקנים שלו, קלט התמונות שלו ותעריף ה-$3/$15 עם קריאות מטמון זולות הם חבילה ניתנת לפריסה שנמצאת על הלוח מאז יולי. ב-OrcaRouter הוא מוגש במחיר המחירון של Moonshot עצמה ללא כל תוספת, וזה חשוב יותר מהרגיל עבור המודל הזה: לולאת סוכן עם הקשר ארוך מבזבזת את רוב הטוקנים שלה על קידומות חוזרות, ו-תעריף קריאת המטמון של $0.30 המועבר ללא שינוי הוא ההבדל בין צי סוכנים שהוא בר-השגה לבין כזה שאינו. מעבר אוטומטי בין ספקים בעת כשל הוא החצי השני של זה — ככל שהלולאה ארוכה יותר, כך יקר יותר כשל של ספק באמצע הריצה.

ל-Agora-2 אין כרטיס תעריפים, כך שאין למה לנתב ואיננו מארחים אותה. מה שהיא מציעה לצוות רב-סוכנים הוא תצוגת מחקר מקדימה של סביבה שאפשר לשחק בה היום בדפדפן, מגובה בדוח ארכיטקטורה פומבי, בקטגוריה שעד כה לא היה בה סימולטור עולם משותף מחוץ למנוע משחקים. אם מעניין אותך מה סוכנים עושים זה לזה, זה דבר שימושי באמת ששווה להקדיש לו אחר צהריים. אם מעניין אותך מה סוכנים יכולים לעשות, Kimi K3 הוא המודל ומודל העולם אינו תחליף לו — השניים יושבים בשכבות שונות של אותו סטאק, ורק לאחת מהשכבות האלה יש מחיר שאפשר לשים בגיליון אלקטרוני.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
