כרטיס כותרת ראשי שנוצר עבור 'Nex-N2.5 Pro מול Kimi K3' עם הכתובית 'המפגש שבו כרטיס הבנצ'מרק של המצטרף החדש עצמו משמש כשופט', מסמך גדול ומעוגל שמסומן בתווית 'כרטיס בנצ'מרק של ספק' עם שתי עמודות דגמים, ומעליו השורה 'Pro מפגר אחרי K3 ברוב השורות המשותפות', ועם לוגו OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

Nex-N2.5 Pro מול Kimi K3: ההתמודדות שבה כרטיס המדדים של העולה החדשה הוא השופט

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

בדקו את המספרים המשותפים ל-Nex-N2.5 Pro ול-Kimi K3 ותשימו לב מי סיפק אותם. ה-Nex-N2.5 Pro של Nex-AGI — הסוכן המולטי-מודאלי בעל 397 מיליארד פרמטרים, עם כ-17 מיליארד פרמטרים פעילים, שהושק ב-8 בספטמבר 2026 כשהמשקולות עדיין מסומנות "בקרוב" — מפרסם טבלת benchmark שבה מופיע ה-Kimi K3 של Moonshot AI ישירות באותן עמודות. ה-Kimi K3 הוא דגם הדגל פתוח-המשקולות בעל 2.8 טריליון פרמטרים ש-Moonshot שחררה ב-16 ביולי 2026, עם קונטקסט של מיליון טוקנים, משקולות מלאות תחת רישיון MIT שונה כעבור אחד-עשר יום, וציון 57 במדד ה-Artificial Analysis Intelligence Index שהופך אותו למודל פתוח-המשקולות המוביל בטבלת הדירוג. ובשורה אחרי שורה בטבלה ההיא, ה-Nex-N2.5 Pro מפגר אחרי Kimi K3: Terminal-Bench 2.1 עם 82.7 לעומת 88.3 של K3, BrowseComp 89.7 מול 91.2, SWE-Bench Pro 61.2 מול 63.3, AutomationBench 44.2 מול 46.7. כשספק מדפיס את המספרים של המודל שלו ליד המוביל הנוכחי במשקולות פתוחות, והמודל שלו מפסיד ברוב השורות, הדבר המעניין ביותר בהשוואה הוא שהטבלה כנראה אומרת את האמת.

זו היא הצורה החריגה של ההשוואה הזאת. בדרך כלל, בכרטיס של מצטרף חדש מחפשים ספין. כאן, הכרטיס הוא הדבר הקרוב ביותר שיש לכל אחד מהמודלים לשופט הוגן, כי ל-Nex-AGI לא הייתה כל סיבה לפרסם טבלה שמנמיכה את דרגת ה-Pro שלה עצמה — והשורות שבהן Pro דווקא מביס את K3 הן בדיוק השורות שבהן מודל קטן, ייעודי לשימוש במחשב, אמור לנצח מודל כללי גדול בהרבה. אז השאלה האמיתית שהעמוד הזה עונה עליה צרה ושימושית יותר מאשר "מה עדיף": האם הנישה המוצהרת של Nex-N2.5 Pro — ביצועים סוכניים קרובים ל-K3 עם בערך שישית מהפרמטרים הפעילים — שורדת את המפגש עם העובדה שקימי K3 כבר קיים, כבר פרסם את המשקולות שלו, וכבר הוא המודל שצריך לנצח?

היריב, במלואו

Kimi K3 הוא לא דגם נישתי, וזו בדיוק הסיבה שהוא אמת המידה הנכונה. הוא דגם הדגל של Moonshot: 2.8T פרמטרים בסך הכול עם 104B פעילים בתצורת Stable LatentMoE, חלון הקשר של 1M טוקנים עם תקציב פלט תואם, הבנה מובנית של טקסט, תמונה ווידאו, חשיבה תמידית, ומשקלים פתוחים שכל מי שיש לו מספיק חומרה יכול בפועל להריץ. מעמדו העצמאי חזק — במדד האינטליגנציה (Artificial Analysis) הוא קיבל 57, ציון שעולה על כל דגם פתוח אחר, והוא רשם 1,679 Elo ב-Frontend Code Arena לפני Claude Fable 5 ו-GPT-5.6 Sol — בעוד שמחירו, $3.00 למיליון טוקני קלט ו-$15.00 למיליון טוקני פלט, עם $0.30 למיליון טוקני קלט שמור, ממוקם בקצה הגבוה של דרגת המשקלים הפתוחים. Kimi K3 הוא מה ש״פורץ דרך ופתוח״ נראה כמו כשהספק לא מתפשר על קנה המידה: הוא עולה יותר לכל טוקן פלט מאשר מתחרים סגורים כמו GPT-5.6 Sol, הוא יקר לתפעול, וקשה מאוד לערער על מעמדו בלוחות הדירוג.

החשבון של המאתגר

Nex-N2.5 Pro לא מנסה להתעלות על Kimi K3 בקנה המידה. היא מנסה לשרת אותה טוב יותר. Nex-AGI עשתה אימון-עוקב (post-training) לשכבת ה-Pro מבסיס משושלת Qwen3.5, והפכה אותה לסוכנת ראייה-מולדת (vision-native) לתפעול מחשבים ודפדפנים. המסר שלה הוא יעילות: 397B סך הכול / כ-17B פעילים, קונטקסט של 262K, ומתכון פריסה על צומת יחיד עם 8×H100 — לעומת 2.8T / 104B פעילים של K3 וציל השרתי הגשה שמודד בסדר גודל כזה דורש. הטיעון המשתמע הוא שמומחית עם 17B פרמטרים פעילים, שאומנה ספציפית ללולאת הסוכן עם משוב חזותי, יכולה לספק את רוב הביצועים הסוכניים של מודל כללי עם 104B פרמטרים פעילים, בשבריר מעלות ההגשה. בכרטיס של Nex-AGI עצמה הטענה סבירה אך חלקית: Pro מנצחת או משתווה ל-K3 ב-OSWorld-G (87.4 מול 79.6) וב-OmniDoc (92.2 מול 91.1), ומפסידה בשאר השורות המשותפות בספרות בודדות — מודל של 397B שמפסיד למודל של 2.8T ב-3 עד 6 נקודות קוד ובגלישה הוא, אם הדבר נכון, בדיוק סיפור היעילות ש-Nex רוצה לספר.

אם זה נכון. כל אחד מהמספרים האלה הוא של Nex-AGI עצמה, והופק לפחות בחלקו דרך מתקן ה-NexCUA הפנימי שלה, ואת Nex-N2.5 Pro אי אפשר לבדוק באופן בלתי תלוי כיום, משום שהמשקולות שלו אינן זמינות להורדה — מאגר Hugging Face מכיל קובץ README, תיקיית איורים ובאנר "weights are coming soon", ולא יותר מזה. אותו סייג חל גם על המספרים בצד של K3 המופיעים בכרטיס, שרובם נאספו על ידי Nex מדוחות שפורסמו על ידי Moonshot ולא נמדדו על ידה בעצמה. מה שהטבלה של Nex-AGI קובעת אינו מי מנצח; אלא שהמהנדסים של Nex-AGI עצמם, שבחרו את המדדים ואת המתקן, לא הצליחו לגרום לשכבת ה-Pro שלהם לנצח את Kimi K3 ברוב התחומים המשותפים. זהו נתון מועיל יותר מכל ציון בודד, משום שהוא מציב חסם עליון למידת ההגזמה האפשרית בשיווק.

A comparison scoreboard for Nex-N2.5 Pro and Kimi K3: Nex-N2.5 Pro rows 'Total / active: 397B / ~17B', 'Weights: coming soon', 'Context: 262K', 'Price: no rate card (free preview)', 'Terminal-Bench 2.1: 82.7 (Nex-reported)', 'OSWorld-2: 56.4 (Nex-reported)'; Kimi K3 rows 'Total / active: 2.8T / 104B', 'Weights: open, Modified MIT', 'Context: 1M', 'Price: $3 / $15, cache $0.30', 'Terminal-Bench 2.1: 88.3 (Moonshot)', 'OSWorld-2: 58.3 (Nex-compiled)'; footer 'All figures vendor-reported; Kimi K3 AA Index 57 per Artificial Analysis.'

השורות שחשובות, זה לצד זה

קנה מידה — Nex-N2.5 Pro: 397B בסך הכול / ~17B פעילים, רב-מודאלי ממשפחת Qwen3.5. Kimi K3: 2.8T בסך הכול / 104B פעילים, Stable LatentMoE, רב-מודאלי.

משקלים — Nex-N2.5 Pro: הובטח, לא שוחרר ("בקרוב" על הכרטיס). Kimi K3: פורסם ב-27 ביולי תחת רישיון MIT שונה — זמין להורדה היום.

הקשר — Nex-N2.5 Pro: 262K. Kimi K3: 1M טוקנים, במחיר קבוע.

מחיר — Nex-N2.5 Pro: אין עדיין מחירון; תצוגה מקדימה מתארחת ללא תשלום. Kimi K3: $3.00 / $15.00 למיליון, קלט במטמון $0.30.

דירוג עצמאי — Nex-N2.5 Pro: עדיין אין. Kimi K3: AA Intelligence Index 57, המודל המוביל בעל המשקל הפתוח בטבלת הדירוג.

קידוד (כרטיסי ספקים) — Nex-N2.5 Pro: Terminal-Bench 2.1 82.7, SWE-Bench Pro 61.2. Kimi K3: 88.3 ו-63.3 באותן שורות.

GUI / שימוש במחשב — Nex-N2.5 Pro: OSWorld-G 87.4 (מנצח את K3 במגרש הביתי שלו), OSWorld-2 56.4. Kimi K3: OSWorld-G 79.6, OSWorld-2 58.3 (בהידור Nex).

Self-host footprint

מה המשמעות השונה של "פתוח" בכל עמודה

המילה "open" עושה עבודה שונה מאוד בשני הצדדים, והיא מכריעה את ההתמודדות הזו יותר מכל מדד. Kimi K3 הוא פתוח במובן החשוב מבחינה תפעולית: המשקולות נמצאות על ה‑hub תחת רישיון Modified MIT מתירני‑למחצה, עקבות החשיבה חשופות ב‑API הסטרימינג, וחברה עם אילוצי ממשל נתונים יכולה להריץ אותו על חומרה שבשליטתה ולבקר את מה שהמודל חשב. הוא פתוח בדרך שעולה לך כסף — מודל של 2.8T צריך תשתית רצינית — אבל האפשרות קיימת היום. Nex‑N2.5 Pro הוא פתוח במובן של כוונה: Nex‑AGI אומרת שמשקולות המשפחה ישוחררו כקוד פתוח, ואחיו הקטן Nex‑N2.5 Mini אכן שחרר משקולות ברישיון Apache‑2.0 ביום ההשקה. המשקולות של Pro עדיין לא בחוץ, הרישיון שלו מוכרז בכרטיס אבל עדיין לא מחייב שום דבר שנתון להורדה, ועד שיהיה checkpoint, "open" הוא פריט מפת דרכים ולא תכונה של המודל. עבור צוות שבוחר בין השניים, זה לא הערת שוליים — זה ההבדל בין מודל שאתה יכול להחזיק בו החודש לבין מודל שמבטיחים לך שתוכל להחזיק בו.

הערכה ללא המתנה לכפתור הורדה

אינך צריך להקפיא את ההחלטה הזו עד שמשקלי Nex-N2.5 Pro ישוחררו, ושכבת הניתוב היא המקום שבו תריץ את הניסוי בעלות נמוכה.Kimi K3 זמין ב-OrcaRouter במחיר המחירון של Moonshot — $3.00 / $15.00, ללא תוספת מחיר (0%), מועבר ישירות ומתעדכן ביום שבו Moonshot משנה אותו — כך שהמודל המוביל עם המשקלים הפתוחים נמצא במרחק מפתח אחד, לצד 200+ המודלים האחרים בקטלוג. Nex-N2.5 Pro אינו מוצע דרכנו, ולכן התנסות בו היום פירושה התצוגה המקדימה של Nex-AGI, ובהמשך מערך של שמונה H100 משלך. התבנית שמתאימה: שים את העבודה הדורשת הקשר ארוך וביקורת כבדה על Kimi K3 דרך נקודת הקצה היחידה שבה אתה כבר משתמש, כוון ענף בדיקה לתצוגה המקדימה של Nex-N2.5 Pro, ותן למנגנון המעבר האוטומטי לעקוף את מי שיתדרדר — וזו בדיוק הדרך להשוות מודל חזיתי ששוחרר מול מתחרה שמשקלותיו טרם פורסמו, בלי להמר על מסלול הייצור שלך באף אחד מהם. כשמשקלי ה-Pro אכן יפורסמו, האימות פשוט: הרץ את השורות המשותפות שמעבדה בלתי-תלויה יכולה לשחזר, וראה אם סיפור היעילות של 17B-active שורד מחוץ למסגרת הבדיקות של Nex-AGI עצמה.

A screenshot of the Hugging Face 'Files and versions' tab for nex-agi/Nex-N2.5-Pro (captured September 9, 2026), showing the model header with Text Generation and Transformers tags, 'License: apache-2.0', and a file tree listing only figures, .gitattributes and README.md - no model weight shards, confirming the Pro checkpoint is not yet published.A screenshot of the OrcaRouter model page for kimi/kimi-k3 (captured September 9, 2026), showing the Kimi K3 card under vendor MoonshotAI with model id kimi/kimi-k3, a 1M-token context, text + image input and text output, vision/tools/reasoning chips, and a 'Public benchmarks by MoonshotAI' note dated 2026-07-15.

היכן שנוחתת ההתמודדות

נגד דגם המשקלים הפתוחים הגדול ביותר שנשלח אי פעם, Nex-N2.5 Pro לא צריך לנצח במלחמת הגנרליסטים כדי שיהיה ראוי למעקב — הוא צריך לנצח בוויכוח על עלות ההגשה (serving), והכרטיס שלו עצמו מרמז שהטיעון אמיתי אך לא מוכח. Kimi K3 הוא הבחירה הבטוחה והחזקה באמת כיום: משקלים פתוחים, ראש מדד המשקלים הפתוחים, קונטקסט של מיליון טוקנים, ומחיר שאפשר לתכנן לפיו תקציב — במחיר של תשתית שרק נהיית קשה יותר ככל שהדגם גדל. Nex-N2.5 Pro הוא ההימור על היעילות: כמעט שווה ל-K3 במשימות סוכן עם שישית מהפרמטרים הפעילים על צומת יחיד, לפי טבלה של ספק על דגם שעוד לא נשלח. קחו את Kimi K3 כשאתם רוצים את דגם הגבול שאתם באמת יכולים להחזיק ולבקר כבר עכשיו. עקבו אחרי Nex-N2.5 Pro ליום שבו המשקלים שלו ינחתו ומישהו בלתי-תלוי יריץ את המשימות המשותפות — כי אם סוכן עם 17B פרמטרים פעילים אכן נשאר בטווח של כמה נקודות מדגל עם 104B פרמטרים פעילים בשימוש במחשב, זו התוצאה שמשנה את המתמטיקה של עלויות ההגשה עבור כל סוכן פתוח שיבוא אחריו.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube