
Nex-N2.5 Pro מול Claude Opus 5: Nex-AGI בחרה בקרש המידה, והקרש ניצח
- openaiחדשOpenAI: GPT-6 Astra2026-09-0455אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0247אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0247אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0157אינטליגנציה82כתיבת קוד
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2646אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1849אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1541אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1251אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0547אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0347אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2140אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128אינטליגנציה49כתיבת קוד
Nex-AGI בחרה במדד, והמדד ניצח. כשהברית למודלים פתוחים משנחאי הציגה את Nex-N2.5 Pro ב-8 בספטמבר 2026, טבלת השימוש במחשב בכרטיס המודל הציבה את Claude Opus 5 בעמודת ההשוואה ואת Nex-N2.5 Pro במשבצת המתמודד: 68.3 ל-Claude Opus 5 לעומת 56.4 ל-Nex-N2.5 Pro ב-OSWorld-2, שני הנתונים בדיוק כפי ש-Nex-AGI הדפיסה אותם בכרטיס שלה. לוחות הדירוג העצמאיים הרחיבו מאז, במקום לצמצם, את הפער — תמונת ה-OSWorld 2.0 של BenchLM מ-29 באוגוסט מדרגת את Claude Opus 5 במקום הראשון מבין חמישה עשר המודלים שהיא מפרטת, עם 70.6. להפסיד שתים עשרה נקודות למוביל השדה במדד שבחרתם לפרסם אינו הכוריאוגרפיה הרגילה של השקה, ולכן החלק המעניין בהשוואת Nex-N2.5 Pro ל-Claude Opus 5 הוא לא הציון, אלא מה ששני הצדדים של הציון הזה הם בפועל: מודל פתוח לשימוש במחשב עם 397 מיליארד פרמטרים, שאיש מחוץ לברית לא הצליח עדיין להריץ או לאמת, ומודל הדגל הסגור של Anthropic, שמוביל את המדד ונושא תעבורת ייצור מאז סוף יולי.
הסיכום הכנה מלכתחילה: זה לא יריבות בין שני גדלים שנמדדו, כי רק צד אחד שלהם נמדד על ידי מישהו שאינו יוצרו. Nex-N2.5 Pro הוא מודל mixture-of-experts דליל, עם כ-17 מיליארד פרמטרים פעילים מתוך סך של 397B, שאומן לאחר מכן משושלת Qwen3.5, ומכוון ישירות לפעולה ארוכת-טווח במחשב ודפדפן עם לולאת משוב חזותי. הוא מוגש כיום דרך נקודות קצה מתארחות בחינם שקישורי Nex-AGI מופיעים בכרטיס המודל שלו, בעוד שמשקלי ה-Apache-2.0 שעליהם מבוססת המשפחה נותרים מסומנים "בקרוב" ללא תאריך. Claude Opus 5 הוא דגל הייצור של Anthropic לעבודה תובענית של חשיבה, קידוד וסוכנות — מודל סגור עם הקשר של מיליון טוקנים, חוגת חשיבה אדפטיבית, מחיר מתועד, ושבועות של רשומות לוח תוצאות ציבוריות ותעבורת ייצור מאחוריו. כל יתרון בעימות הזה שייך לאחת משתי העובדות האלה: מודל אחד ניתן להרצה ולאימות, והשני אינו כזה.
המדד ששני הצדדים מסכימים עליו
מדדי הייחוס של שימוש במחשב מתגמלים את אותה התנהגות שהמודלים הללו נועדו למכור: סוכן שמתבונן במסך, מחליט על פעולה, מבצע אותה, וקורא את המסך שהשתנה כדי לוודא שהפעולה הצליחה. Nex-N2.5 Pro בנוי בדיוק סביב הלולאה הזאת — הראייה אינה מודול קלט שהוצמד לו, אלא ערוץ המשוב שמולו הסוכן מאמת את עצמו. Claude Opus 5 מתייחס לאותה לולאה כאל אחת ממטלות רבות, אבל הוא במקרה טוב בה מאוד, וזו הסיבה ש-Nex-AGI השתמשה בו כנקודת ייחוס מלכתחילה.
שני המספרים אינם, למהדרין, מאותה רתמת הערכה. Nex-AGI הפיקה את נתוני ה-OSWorld-2 שלה באמצעות רתמת ההערכה NexCUA שלה, שלדבריה תפתח כקוד פתוח אך עדיין לא שחררה, וה-56.4 עבור Nex-N2.5 Pro הוא פלט ספק שלא שוחזר. ה-70.6 של Claude Opus 5 על BenchLM הוא תמונת מצב של צד שלישי של OSWorld 2.0, מיום 29 באוגוסט 2026, והוא עקבי עם ה-68.3 ש-Nex-AGI עצמה מצטטת ממקורות לוח התוצאות. רתמות שונות וגרסאות מדד שונות במקצת משמעותן שהפער המדויק — שתים־עשרה נקודות בכרטיס של Nex-AGI, קרוב לארבע־עשרה ב-BenchLM — צריך להיקרא ככיווני. אבל אין כל מחלוקת ש-Nex-N2.5 Pro, לפי המספרים הטובים ביותר הזמינים משני הצדדים, נמצא מתחת לסוכן השימוש־במחשב החזיתי הנוכחי.

שתי תשובות ל'האם אני יכול להריץ את זה היום'

זוהי נקודת הפיצול שבאמת מכריעה את תוצאת ההשוואה עבור צוות שעובד בפועל, והיא לא לטובת החדש. כרטיס ה־Hugging Face של Nex-N2.5 Pro עדיין מציג שהמשקלים יגיעו בקרוב תחת רישיון Apache-2.0, בלי תאריך שחרור מצורף. הגרסאות החיות היחידות כרגע הן נקודות הקצה המאוכסנות בחינם ש־Nex-AGI מקשרת מהכרטיס — אפשר לקרוא להן, אבל הן בבעלות של מישהו אחר: אין מחירון, אין תנאי שירות שצוות יכול לתכנן לפיהם, ואין שום דרך לשחזר ולו מדד benchmark אחד על החומרה שלכם. כשהמשקלים אכן יגיעו, ההנחיות המתועדות להגשה הן צומת יחיד של שמונה H100 על תמונת SGLang מותאמת אישית — טביעת רגל אמיתית אך שגרתית עבור מודל MoE עם 397B פרמטרים, ובדיוק מה שהופך את העיצוב עם 17B פרמטרים פעילים למעניין. עד שזה יקרה, Nex-N2.5 Pro הוא תצוגה מקדימה שאפשר להריץ עליה שאילתות, לא מודל שאפשר לבנות עליו.
Claude Opus 5 הוא ההפך בכל אחת מהשורות האלה. הוא מוגש דרך ה-API של Anthropic ובפלטפורמות מנותבות מאז 24 ביולי, המחיר שלו ציבורי ויציב, המשקלים שלו סגורים ויישארו סגורים, וכל אחד מהמספרים שלו ניתן לבדיקה היום באמצעות הרצה שלו. המערכת האקוסיסטמית שמסביב — Claude Code, כלי MCP, ונחיל סוכני הייצור שהפעילו אותו במרץ במשך שישה שבועות — היא בדיוק הרשומה המצטברת שמודל בן יום אחד לא יכול לטעון לה. עבור צוות שדרישתו היא "המודל חייב לעבוד ברבעון הבא," הרשומה הזו היא כל המשחק.
דף המפרט, כפי שהוא.
שים את שתי המעטפות זו לצד זו:
• הושק — Nex-N2.5 Pro: 8 בספטמבר 2026 (נקודות הקצה המתארחות פעילות, המשקלים בהמתנה). Claude Opus 5: 24 ביולי 2026, זמין באופן כללי.
• קנה מידה — Nex-N2.5 Pro: 397B סה״כ / ~17B פעילים MoE. Claude Opus 5: מספר הפרמטרים לא פורסם.
• מודאליות — Nex-N2.5 Pro: קלט טקסט ותמונה, פלט טקסט, ראייה מרכזית בלולאת השימוש במחשב שלו. Claude Opus 5: קלט טקסט ותמונה, פלט טקסט, עם ניתוח חזותי חזק.
• הקשר / פלטNex-N2.5 Pro: הקשר של 262,144 טוקנים — אורך הגשה מתועד. Claude Opus 5: הקשר של 1M טוקנים, תקרת פלט של 128K טוקנים.
• בקרת חשיבה — Nex-N2.5 Pro: מתג reasoning_effort עם none / medium (אדפטיבי, ברירת מחדל) / high. Claude Opus 5: חשיבה אדפטיבית כברירת מחדל, עם חוגת מאמץ מפורשת מנמוך למקסימום.
• משקלים — Nex-N2.5 Pro: Apache-2.0, בקרוב, ללא תאריך. Claude Opus 5: סגור.
• מחיר ל-1M טוקנים — Nex-N2.5 Pro: שכבה מתארחת חינמית, ללא מחירון מפורסם. Claude Opus 5: $5.00 קלט / $25.00 פלט, $0.50 קריאות ממטמון, $6.25 כתיבות למטמון.
מעטפות הביצועים שונות מספיק כדי שגיליון המפרט אכן עושה עבודה אמיתית: Opus 5 מביא חלון של מיליון טוקנים ותקרת פלט של 128K לסשני סוכן ארוכים, בעוד שהקונטקסט של 262K והמסלול החינמי של Nex-N2.5 Pro מתאימים לאוטומציה מונעת מסך בהיקף קטן יותר. אף מפרט לא הופך את השני למיותר; המודלים חלוקים בשאלה על מה סוכן מבזבז את הקונטקסט שלו.
לקרוא בכנות את לוח התוצאות של Nex-AGI
את שאר הכרטיס כדאי לקרוא עם אותו מסנן. שורות השימוש-במחשב האחרות של Nex-N2.5 Pro — OSWorld-G 87.4, OSWorld-Verified 82.2, WebArena-Verified 67.6, WebTest 52.8, Vision2Web 68.2 — ושורות התכנות שלו — Terminal-Bench 2.1 עם 82.7, SWE-Bench Pro עם 61.2, BrowseComp עם 89.7 — הן כולן מדידות יצרן שנעשו באמצעות הרתמה של הברית עצמה, שלא שוחזרו ב-48 השעות הראשונות. המסקנה היחידה שקורא ניטרלי יכול להסיק מהכרטיס היא ש־Nex-AGI סבורה כי Nex-N2.5 Pro הוא מודל שימוש-מחשב חזק בדרג־ביניים, שמפגר אחרי סוכן החזית בשורה החשובה ביותר. זהו מיצוב קוהרנטי, אפילו שמרני, למודל פתוח של 397B. זוהי גם טענה שממתינה למעבדה שנייה.
הכסף, כאשר לצד אחד אין מחיר
אין כאן השוואת מחירים כנה שניתן לבצע, כי רק לצד אחד יש מחיר. שכבת האירוח החינמית של Nex-N2.5 Pro אינה מלמדת דבר על שוויו של המודל — נקודות קצה חינמיות לתצוגה מקדימה הן הדרך שבה ספקים אוספים תנועה ומשוב, ו-Nex-AGI לא פרסמה תעריף בתשלום לכל טוקן עבור המשפחה. Claude Opus 5 עולה $5.00 למיליון טוקני קלט ו-$25.00 למיליון טוקני פלט במחיר המחירון של Anthropic, כשקריאות מטמון עולות $0.50, וזה המספר שתקציב חייב לספוג. אם אתה משלם היום את החשבון הזה עבור סוכני שימוש במחשב, ורוצה לדעת אם מודל פתוח עם 17B פרמטרים פעילים יכול לבצע את אותה עבודה בזול יותר, התשובה היא: אולי, אבל לא תוכל לדעת עד שמשקלי המודל ישוחררו ומישהו בלתי תלוי יריץ אותו. השוואת המחירים נדחית, לא מוכרעת, והתייחסות לנקודת קצה חינמית כראיה לזול תהיה שגיאה קטגוריאלית.

מה שתוכלו לעשות היום הוא להגדיר את בדיקת ה‑A/B כך שתהיה מוכנה ליום שבו זה יתאפשר. Claude Opus 5 זמין ב‑OrcaRouter במחיר המחירון של Anthropic — אותם $5.00 / $25.00, שמועברים ללא כל תוספת מחיר, כך שהחשבון כאן תואם לחשבון של Anthropic ומשתנה באותו היום שבו Anthropic משנה אותו. מפתח API אחד מציב אותו מאחורי אותו endpoint שמשרת 200+ מודלים אחרים, עם מעבר אוטומטי (failover) אם ספק מגמגם, ועם DSL לניתוב אם תרצו ש‑Opus יקבל את הקריאות הקשות ומודל זול יותר את הקריאות השגרתיות. Nex‑N2.5 Pro אינו נמצא ב‑OrcaRouter — בדקנו את ספריית המודלים שלנו לפני כתיבת המאמר, ואף מודל של nex‑agi לא רשום שם עדיין. ברגע שספק יציע אותו במחיר המחירון, הוא יופיע כאן באותו היום, וההשוואה הכנה שהמאמר הזה עוד לא יכול לבצע תהפוך לכלל ניתוב במקום למיגרציה.
מי צריך לפעול, ומי צריך לחכות
אם הצוות שלכם מריץ בסביבת ייצור היום עומסי עבודה של computer-use או של agentic-coding, וזקוק למודל עם מחיר ידוע, פרופיל כשל ידוע ורקורד בלתי-תלוי, Claude Opus 5 הוא הבחירה הרציונלית בהשוואה הזאת — ושום דבר ב-48 השעות הראשונות של Nex-N2.5 Pro לא משנה את זה. אם הצוות שלכם בוחן מודלים פתוחים של computer-use לבנייה עתידית, Nex-N2.5 Pro שייך לרשימת המעקב: מודל MoE רב-מודאלי בגודל 397B עם טביעת רגל אירוח-עצמי סבירה ועם סיפור ביצועים סביר בדרג הביניים הוא בדיוק סוג המודל הפתוח שמעצב מחדש את עקומת העלויות — בתנאי שהמשקלים אכן יגיעו, והמספרים בכרטיס המודל ישרדו ריצה בלתי-תלויה. העמדה הרציונלית היא גם וגם: להשאיר את המוביל המוכח על הנתיב הקריטי, ולתת ליום שבו המשקלים יגיעו להכריע אם החדש ראוי לניסיון. זו ההשוואה היחידה בהתמודדות הזו שעדיין לא התרחשה — והיא זו שבאמת תשנה.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
