
Agora-2 לעומת Qwen 3.8 Max: מודל אחד צופה בווידאו, האחר יוצר אותו
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 36 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 181 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
יש היפוך נאה בלב הצימוד הזה. Qwen3.8-Max — דגל הדגם של הספק, שהושק ב-3 באוגוסט 2026 ורוענן ב-2 בספטמבר, במחיר של $2.00/$6.00 למיליון טוקנים — קורא וידאו באופן מובנה, לצד טקסט ותמונות, בחלון הקשר של 1,000,000 טוקנים. Agora-2, מודל העולם הרב-סוכני שOdyssey הציגה בתצוגה מקדימה ב-21 בספטמבר 2026, מפיק וידאו: זרמים ברזולוציית 640×480 שנוצרים עבור כל משתתף, חמישה-עשר עדכוני לטנט בשנייה, עבור עד 20 בני אדם וסוכנים החולקים עולם מדומה אחד. מודל אחד בנוי לצרוך פריימים ולהסביר אותם; האחר בנוי להפיק פריימים ולאפשר למשתתפים לפעול בתוכם. חברו אותם יחד ותקבלו משהו שאף אחד מהספקים לא התכוון לבנות — דרך לנתח סימולציה מרובת סוכנים עם מודל שפה שמסוגל ממש לצפות בה.
שני הצדדים של המסגרת
Qwen3.8-Max הוא הדרג בעל היכולות הגבוה ביותר של Alibaba והאובייקט הקונבנציונלי ביותר שלה: מודל מולטימודאלי נייטיבי המקבל טקסט, תמונה וווידאו, עם הקשר של מיליון טוקנים, 131,072 טוקנים של פלט, שימוש נייטיבי בכלים, ומדד הבינה של Artificial Analysis של 45 במדד v4.3.2. סיקור קודם של ההשקה באוגוסט ציטט 40 — נתון זה הגיע מגרסת המדד הקודמת ואין להעמידו לצד זה. Artificial Analysis מודדת אותו ב-88.8 ב-terminal-bench 2.1 וב-92.8 ב-GPQA Diamond. Alibaba ממקמת אותו ישירות מול GPT-5.5, Claude Opus 4.7 ו-Gemini 3.1 Pro במדריך ההגירה שלה, וממליצה עליו בכל פעם שמשימה דורשת את החשיבה החזקה ביותר הזמינה.
המפרט של Agora-2 כמעט לחלוטין אינו דומה לזה. ארבעה רכיבי רנדרר, אחד לכל תצוגה, שכל אחד מהם הוא מודל בן שישה־עשר בלוקים ברוחב 2,048, שמייצר נקודת מבט של משתתף בודד. מודל סימולציה בעל ארבע שכבות ורוחב 256, שחוזה תנועה, קרב ואנימציה על פני ארבעה־עשר ענפי תנועה בדידים מתוך היסטוריית ישות בת ארבעה צעדים. מצב עולם משותף המחזיק זהות, מיקום, בריאות, אנימציה, מוות ותחייה מחדש, כך שמאפייני ישות נשמרים ללא תלות במצלמה מסוימת — ישות שמחוץ לפריים שומרת על מיקומה במקום להיות משוחזרת כשהיא מופיעה מחדש. אין חלון הקשר מכיוון שאין שפה. האילוץ המקביל הוא ההיסטוריה החזותית החסומה לכל תצוגה, שמתאפסת בעת מוות, תחייה מחדש ואי־רציפויות מצלמה.
• פלט — וידאו Agora-2 640×480 לכל משתתף, יעד 30 fps לעומת טקסט Qwen3.8-Max, עד 131,072 טוקנים לתגובה
• קלט — פקדי דפדפן של Agora-2 בתוספת 16 מדיניויות של סוכני RL מול טקסט, תמונה וווידאו של Qwen3.8-Max
• ציון עצמאי — Agora-2 לא פורסם לעומת Qwen3.8-Max AA Intelligence Index 45 (v4.3.2)
• מחיר — Agora-2 לא פורסם דבר, תצוגה מקדימה בלבד לעומת Qwen3.8-Max $2.00/$6.00 למיליון, $0.25 קריאה מהמטמון
• זיכרון — מצב משותף של Agora-2 בתוספת היסטוריה תחומה לכל תצוגה לעומת הקשר של 1,000,000 טוקנים ב-Qwen3.8-Max
• גישה — Agora-2 ללא API, ללא משקלים לעומת Qwen3.8-Max API קנייני, חלון הקשר של 1M


מה מוסיף מודל קורא וידאו לסימולטור עולם משותף
הטיעון של Odyssey בעד בניית Agora-2 הוא שאינטראקציה בין כמה סוכנים הפכה למשהו שכדאי לחקור בתנאים מבוקרים, והחברה מציינת כמקרה מובהק את התקרית מיולי 2026, שבה כ-1,200 סוכנים בתוך ארגז חול להערכה ארגנו חדירה שנמשכה ימים אחדים. החלק הקשה במחקר מסוג זה אינו יצירת האינטראקציה — אלא פרשנותה. מודל עולם שפולט אלפי פריימים של עשרים משתתפים המבצעים אינטראקציה מייצר כמות צילומים שאף צוות אנושי לא יכול לצפות בה.
זה המקום שבו מודל עם קלט וידאו נייטיבי מפסיק להיות אי-התאמה קטגוריאלית והופך לרכיב. סשן של Agora-2 הוא, מבחוץ, בדיוק מה ש-Qwen3.8-Max טוען לקלוט: וידאו, ברזולוציה שהדוח מאשר שהוא יכול להתמודד איתה, עם ישויות שהמודל מרנדר את זהותן, מצב הבריאות ומצב האנימציה שלהן מתוך סכימה משותפת מפורשת. שלבו זרם פריימים עם לוג המצב — הדוח מפרסם את שניהם, ואיור 6 שלו מציג מצב של שחקן ואויב בארבעה טיקים עוקבים לצד הפריימים המרונדרים — ותקבלו קורפוס שבו אפשר לשאול מודל הסקה בעל יכולת וידאו מה קרה, מי יזם זאת, והאם התיאור החזותי אכן תואם את המצב המתועד. השאלה האחרונה היא אחת שהדוח מציין כלא-מוערכת: ההתאמה בין תצוגות שנוצרו באופן עצמאי, ועמידה בפעולות מקצה-לקצה — שתיהן הושארו במפורש פתוחות.
ההקשר של מיליון טוקנים הוא החצי השני. יומן המצב של סשן ארוך, פלט כלים והערות מתומללות נכנסים לתוכו, שזהו ההבדל המעשי בין ניתוח מפגש אחד לניתוח אחר צהריים של משחק.
היכן שהמספרים המאומתים נגמרים
ציון האינדקס, חלון ההקשר, המודאליות וכרטיס התעריפים של Qwen3.8-Max הם עובדות מפורסמות, הנמדדות באופן עצמאי היכן שצוין. רענון ה-2 בספטמבר שלו מרמז שאליבאבא עדיין מבצעת איטרציות על הדרג הזה.
הנתונים של Agora-2 מופיעים בדוח הטכני של Team Odyssey ואין להם שחזור מחוץ לחברה. הדוח טוען שרנדרר עם קידומת מובנית משיג PSNR של 30.11 dB לעומת בסיס VAE של 20.67 dB על פני שלושים קליפי ניטור, וכי קיימת הפחתה של 45.8% בזמן ה-denoiser כתוצאה מהתניית self-attention מובנית לעומת cross-attention — כאשר האחרון נמדד על denoisers מאותחלים באקראי עם קלטים סינתטיים, והדוח מציין שזהו מדד של עלות ביצוע ולא של איכות תמונה. סעיף המגבלות של הדוח עצמו הוא החלק שכדאי לקרוא פעמיים: קצבי 15 עדכוני latent ו-30 פריימים לשנייה הם יעדים, קצב פריימים מתמשך והשהיית קלט-לתצוגה במהלך משחק חי עם ריבוי סוכנים לא הוערכו כמותית, איכות חזותית לטווח ארוך והסכמה חוצת-מבטים לא הוערכו, הסביבה דורשת מנוע עם אינסטרומנטציה, גאומטריה מפורשת ואוצר מילים קבוע של מראה, והעברה לנכסים, לחוקים או לסביבות חדשות לא נבדקה.
שתיים מההסתייגויות האלה חלות ישירות על הזיווג המוצע לעיל. אם קצב הפריימים במהלך משחק חי אינו נמדד, אז לזרם הפריימים שהייתם מזינים למודל וידאו אין עדיין הבטחה לתפוקה. ואם ההסכמה בין התצוגות לא הוערכה, אז הניתוח המעניין — האם אותו אירוע נראה עקבי מארבע נקודות מבט — הוא בדיוק השאלה הפתוחה, ולא קלט שכבר הוכרע. השילוב מבטיח ולא נבדק כלל.
באיזה מהם אתה יכול להשתמש היום?
Qwen3.8-Max זמין כעת לפריסה: מודל מולטימודלי בקטגוריית החזית במחיר $2/$6 עם חלון של מיליון טוקנים, שימוש נייטיבי בכלים ומדד 45 שנמדד באופן עצמאי. לכל מי שעוסק בניתוח עתיר וידאו או מסמכים, זהו אחד המודלים הבודדים בטווח מחירים זה שאפילו קולט פריימים, ושיעור קריאת המטמון של $0.25 שלו הופך הקשרים ארוכים וחזרתיים לבעלי עלות סבירה. דרך OrcaRouter הוא מוגש במחיר המחירון של Alibaba ללא כל תוספת, כך שהתעריף הזה מועבר ללא שינוי וכל שינוי מחיר עתידי מגיע לחשבון שלך באותו היום, עם מעבר אוטומטי לגיבוי אם נקודת הקצה הראשית נחלשת — שווה שיהיה בעומס עבודה שכל ערכו הוא הקשר ארוך שיהיה יקר להפעיל מחדש.

Agora-2 אינו נמצא ב-OrcaRouter; איננו מארחים אותו, אין API ואין משקולות, והדלת היחידה היא התצוגה המקדימה בדפדפן של Odyssey עצמה. מה שהוא מציע הוא ארטיפקט מחקרי בקטגוריה שבקושי קיימת: עולם משותף שבו בני אדם ומדיניות RL פועלים על אותו מצב, וכל משתתף מקבל תצוגה משלו שנוצרה עבורו. אם אתם בונים מערכות מרובות-סוכנים, הצירוף ששווה אחר צהריים הוא המובן מאליו — שחקו בתצוגה המקדימה, תפסו את הפריימים ואת לוג המצב, ומסרו את שניהם למודל מולטימודלי של מיליון טוקנים כדי לשאול מה באמת קרה. Agora-2 נותן לכם את הזירה ומודה שהוא לא מדד את החלקים הקשים; Qwen3.8-Max הוא הכלי שיכול לעשות זאת, והוא זמין במחיר של $2/$6 בעוד הזירה עדיין תצוגה מקדימה.
