
AREX-2 לעומת Qwen 3.8: האחד הוא מצע שהשני כנראה בנוי עליו
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 397 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 195 tok/s
- OrcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- xAISpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
העימות בין AREX-2 לבין Qwen3.8-Max נראה כמו קרב ישיר בין מערכות הדגל של שתי מעבדות סיניות, והוא לא כזה — לא מפני ש-AREX-2 אינו מוכח, למרות שהוא כן, אלא מפני ששניהם נמצאים בשכבות שונות של אותה מחסנית. Qwen3.8-Max פעיל מאז 3 באוגוסט 2026, במחיר של 2 דולר למיליון טוקנים בקלט ו-6 דולר למיליון בפלט, עם חלון הקשר של מיליון טוקנים; אחיו במשקלים פתוחים, Qwen3.8-27B ו-Qwen3.8-Flash, שיצאו ב-13 וב-26 באוגוסט עם מדדי ביצועים שפורסמו ומחירים שפורסמו. AREX-2 הוא מאגר ש-BAAI יצרה ב-Hugging Face ב-29 בספטמבר 2026 בשעה 17:56 UTC, המכיל קובץ .gitattributes ולא דבר אחר. והסיבה ששניהם אינם יריבים נמצאת בעובדה הבסיסית שאף אחד מהספקים אינו מפרסם בקול רם: כל מודל AREX ש-BAAI הוציאה עד כה בנוי על עמוד שדרה של Qwen.
זו אינה ספקולציה לגבי AREX-2. היא מתועדת עבור הדור שקיים. AREX-Base הוא תערובת מומחים בעלת 122 מיליארד פרמטרים עם 10 מיליארד פרמטרים פעילים, הבנויה על Qwen3.5-122B-A10B, ו-AREX-Turbo הוא מודל 4B צפוף הבנוי על Qwen3.5-4B; שניהם שוחררו ב-23 ביולי 2026 תחת רישיון Apache 2.0. אז הצורה הכנה של השוואה זו אינה סוכן מול דגם דגל. היא: מה המצע של Alibaba נותן לך היום, מה שכבת הסוכן של BAAI מוסיפה מעל, וכמה מהשאלה השנייה ניתן לענות עליה לפני ש-BAAI מעלה קובץ?
מה פעיל בצד של Qwen, וכמה זה עולה
הדור Qwen3.8 קל באופן יוצא דופן להסקה מכיוון שהוא מוגדר ומתומחר במלואו בפומבי, בשלוש דרגות שונות.
• Qwen3.8-Max — שוחרר ב-3 באוגוסט 2026. חלון הקשר של מיליון טוקנים, קלט טקסט, תמונה ווידאו נייטיבי, מצב חשיבה, קריאה לפונקציות ופלטים מובנים, ושלושה פורמטי תקשורת (תואם OpenAI, תואם Anthropic ו-DashScope נייטיבי) בחמישה אזורים. $2.00 למיליון טוקני קלט ו-$6.00 למיליון טוקני פלט, עם קריאות מהמטמון ב-$0.25.
• Qwen3.8-27B — שוחרר ב-13 באוגוסט 2026. צפוף, 27B פרמטרים, חלון הקשר של 256K (262,144 פוזיציות), קלט טקסט, תמונה ווידאו, משקולות Apache 2.0. פורסם בכרטיס של Qwen עצמה עם 90.3 ב-LiveCodeBench v6, 89.2 ב-GPQA Diamond, 84.3 ב-OSWorld-Verified ו-79.0 ב-QwenSWEBench — דווח על ידי הספק, לא שוחזר באופן עצמאי. מדידה עצמאית מציבה אותו במדד ה-Artificial Analysis Intelligence Index של 33.7 ו-68.1 במדד AA Coding.
• Qwen3.8-Flash — שוחרר ב-26 באוגוסט 2026. אותו חלון של מיליון טוקנים ואותם קלטים רב-מודאליים, במחיר של 0.15 דולר למיליון טוקני קלט ו-0.47 דולר למיליון טוקני פלט. השכבה הזולה של המשפחה, וזו שהופכת תעבורת סוכנים בנפח גבוה לנגישה.
קיימת גם רשומה לא מתויגת של Qwen3.8: דגם הדגל בעל 2.4 טריליון פרמטרים, שאליבאבא אמרה שהמשקולות שלו בדרך, ושאינו ניתן להפעלה בשום מקום עדיין. אם אתם מחפשים "Qwen 3.8" ומצפים למודל אחד, זו הסיבה שהתשובה היא משפחה של ארבעה, לא אחד.

לעומת כל זה, המפרט של AREX-2 הוא באורך שורה אחת: מאגר, חתימת זמן, ושם שמרמז על דור שני של משהו שכבר נבנה פעם בידי BAAI.
הפרט שממסגר מחדש את כל ההשוואה
AREX אינו מתחרה של Qwen; הוא צרכן שלו. שני דגמי AREX מהדור הראשון עוברים אימון-המשך על גבי עמודי השדרה של Qwen3.5, ואז עוטפים אותם במסגרת שהופכת אותם לסוכנים ולא למודלים של שיחה: לולאה פנימית שמחפשת, גולשת ומשלבת ראיות לתשובה מועמדת שנושאת ציון ביטחון, ולולאה חיצונית שבודקת את התשובה הזו מול האילוצים המקוריים, ואז או שמקבלת אותה, מחדדת אותה, או פוסלת את המסלול ומתחילה מחדש. ההנדסה המעניינת ב-AREX אינה הרשת. היא הלולאה, מנגנון עדכון ההקשר ששומר על סדר בין ממצאים מאומתים, מועמדים פתוחים ואילוצים לא פתורים לאורך אופק ארוך, וממשק הכלים שחושף את החיפוש והגלישה בפני המודל כפעולות מהמעלה הראשונה.
זו הסיבה שהמספרים שמשפחת המודלים עצמה פרסמה — 82.5 ב-BrowseComp, 85.4 ב-GAIA, 71.0 ב-xbench-2510, 89.9 ב-DeepSearch QA ו-82.0 ב-WideSearch-en עבור ה-122B Base, עם 70.7 / 81.6 / 57.0 / 78.5 / 68.5 עבור ה-4B Turbo — אינם ברי השוואה לציוני הקידוד והסוכנות של Qwen3.8-27B, אף שהשניים חולקים שושלת ארכיטקטונית. הם מודדים דברים שונים. QwenSWEBench שואל אם מודל יכול לפתור בעיה במאגר. BrowseComp שואל אם סוכן יכול למצוא עובדה שקשה בכוונה למצוא, לאורך חיפושים רבים, בלי לאבד את השאלה. צ'קפוינט גולמי של Qwen3.5 מקבל ציון גרוע בשני וטוב בראשון, וזה בדיוק הפער שהאימון המשלים וההרנס של BAAI נועדו לסגור.

מה שדור שני עשוי להיות באופן הסביר ביותר
אם AREX-2 ממשיך את התבנית, הפרשנות הסבירה ביותר — הסקה, לא עובדה — היא סוכן מחקר מהדור השני שעבר אימון-המשך על עמוד שדרה של Qwen חדש יותר מדור ה-3.5 שבו משתמשים דגמי AREX הנוכחיים. Qwen3.8-27B הוא צפוף, רב-מודאלי ו-Apache 2.0, מה שהופך אותו למועמד טבעי לסוכן בדרג איכות; Qwen3.8-Flash הוא זול לכל טוקן, וזה חשוב מאוד כאשר הסוכן שלך מבצע עשרות קריאות לכל שאילתה וקורא מחדש הקשר שהולך וגדל בכל שלב.
שום דבר מזה לא מאומת. השם לא נושא גודל, לא עמוד שדרה ולא תאריך, ו-"2" בקו מוצרים הוא מוסכמת שמות ולא מפרט. מה שכן מאומת הוא הרבה יותר מצומצם ויש לנסח זאת כך: BAAI יצרה את המאגר ב-29 בספטמבר 2026, לא שמה בו דבר, ולא הודיעה דבר. אין משקלים, אין כרטיס, אין ספירת פרמטרים, אין תג רישיון, אין מבחני ביצועים, אין ספק שמשרת אותו. אם אתם רואים מספרים של AREX-2 מצוטטים במקום כלשהו השבוע, הם לא מדידות.
מה שאתם באמת יכולים לקנות היום אחר הצהריים
האי-סימטריה המעשית בין השניים אינה שאלה של איכות, אלא שלצד אחד יש מחירון ולצד השני יש רשומה במדריך.
אם העבודה שלך היא סוכנית ואתה רוצה את המצע שמשפחת AREX נבנתה עליו, אפשר לקרוא לעמוד השדרה המדויק: Qwen3.5-122B-A10B נמצא בקטלוג של OrcaRouter במחיר $0.115 למיליון טוקני קלט ו-$0.917 למיליון טוקני פלט עד 128K טוקנים, ועולה ל-$0.287 / $2.294 מעבר לכך, עם ראייה, שימוש בכלים והסקה מופעלים. זהו המודל ש-AREX-Base מבצעת עליו פוסט-אימון, זמין בלי לחכות לשום דבר.
אם אתם רוצים את הדור הנוכחי, שתי שכבות ה-Qwen3.8 הפתוחות נמצאות בקטלוג: Qwen3.8-27B במחיר $0.33 למיליון טוקנים בקלט ו-$2.40 בפלט, כשהוא פועל על התשתית שלנו כי המשקלים פתוחים ואין עלות ספק לפי טוקן שצריך לגלגל הלאה, ו-Qwen3.8-Flash ב-$0.15 / $0.47 לשכבת הנפח. API אחד מכסה את שניהם, מחיר המחירון של הספק מועבר הלאה בלי שום תוספת לטוקן, כך שכאשר אליבאבא משנה מחיר, המספר כאן משתנה באותו יום.
וכאשר AREX-2 אכן ישוחרר, הסיבה שהוא שייך מאחורי אותה שכבה היא מבנית ולא שיווקית. לולאת סוכן שמבצעת עשרים קריאות לכל שאילתה מכפילה את שיעור הכשל של כל ספק פי עשרים; כלל ניתוב עם מעבר אוטומטי בעת כשל שמחליט בזמן ריצה הוא ההבדל בין פסק זמן שמשמעותו ניסיון חוזר לבין פסק זמן שמשמעותו תשובה שגויה בביטחון. הטיעון הזה חל על כל סוכן מחקר, והוא יחול על AREX-2 בכל פעם שתהיה AREX-2 לנתב אליו.
מי צריך לפעול, ועל מה
אם אתה זקוק היום לסוכן מחקרי, AREX-Base הוא מודל ה-AREX שקיים, הוא שוחרר ביולי תחת Apache 2.0, והבנצ'מרקים של הסוכן שלו הם של הספק עצמו, אבל לפחות הם מצורפים למודל שניתן להוריד. אם אתה זקוק היום לנימוק מולטימודלי בחזית הטכנולוגיה או לתעבורת סוכנים בנפח גבוה, שכבות Qwen3.8 פעילות, מתומחרות ומדורגות באופן בלתי תלוי בחלקן, ושום דבר בקיומו של AREX-2 לא משנה את ההחלטה הזו.
התרחיש היחיד שבו AREX-2 רלוונטי להחלטה שאתה מקבל השבוע הוא זה שבו אתה בוחר מודל בסיס לכיוונון עדין. ושם התשובה כבר גלויה בקטלוג: מודלי הבסיס 3.5 ששימשו את AREX עדיין זולים וזמינים, הדור 3.8 טוב יותר וגם זמין, ו-AREX מהדור השני — מתי שיגיע — יהיה כמעט בוודאות עדות לשאלה איזה בסיס Qwen BAAI חושבת ששווה לבנות עליו, ולא תחליף לו.
שלושה דברים יסדירו את השאר: קבצים בעץ, כרטיס עם מספר פרמטרים ושדה מודל בסיס, ותג רישיון. הראשון מביניהם הוא זה שחשוב, כי עד שזה יקרה, ההשוואה הזו היא בין משפחה מתומחרת לבין מציין מקום.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
