
GLM-5.2 מול Kimi K3: זול ומהיר יותר, או גדול וטוב יותר
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.2 ו-Kimi K3 הגיעו בהפרש של חודש זה מזה באמצע 2026, והם מהווים היפוך כמעט מושלם זה של זה. Kimi K3, שיצא ב-2026-07-16 עם משקולות פתוחות שהגיעו ב-2026-07-27, הוא הגדול יותר ועל הנייר המודל הטוב יותר: 2.8 טריליון פרמטרים, 104 מיליארד מהם פעילים, וציון גבוה יותר בכמעט כל מבחן השוואה שבו הורצו השניים. GLM-5.2 זמין מאז 2026-06-16, הוא הקטן מבין השניים עם 753 מיליארד פרמטרים ו-40 מיליארד פעילים, ועולה בערך שליש לכל אסימון פלט, עונה מהר יותר בחציון, ומופץ תחת MIT ולא תחת רישיון מותאם אישית עם טריגרים להכנסות.
זו ההחלטה בפסקה אחת. מה שמופיע בהמשך הוא הראיות העומדות מאחוריה — החשבון של המחיר בעבודה שאולי תריץ בפועל, המדידות שבהן השניים קרובים מספיק עד שההבדל הוא רעש, ומספר פופולרי אחד שאינו בר-השוואה למספר המודפס לצידו.
היכן עומדים השניים
שניהם זמינים בדרך כלל דרך ממשקי ה-API של הספקים שלהם, שניהם ניתנים לניתוב ב-OrcaRouter, ולשניהם יש משקלים להורדה. ההבדלים שמשנים לפני שאתם בכלל מתקרבים לבנצ'מרק:
• שוחרר — GLM-5.2 ב-2026-06-16 לעומת Kimi K3 ב-2026-07-16 (עמודי המודלים של Artificial Analysis; עמוד המודל של OrcaRouter עצמה עבור Kimi K3 מתארך אותו ליום אחד מוקדם יותר, 2026-07-15)
משקלים — GLM-5.2 פתוח תחת MIT לעומת Kimi K3 פתוח תחת רישיון Kimi K3, אשר מחייב הסכם נפרד מעל 20 מיליון דולר בהכנסות שנתיות מ־Model-as-a-Service וייחוס בולט מעל 100 מיליון משתמשים חודשיים (מחקר ופיתוח פנימי פטור)
• גודל — GLM-5.2 753B סה"כ / 40B פעילים לעומת Kimi K3 2.8T סה"כ / 104B פעילים
• הקשר — GLM-5.2 1,000,000 טוקנים לעומת Kimi K3 1,048,576 טוקנים
• קלט — GLM-5.2 טקסט נכנס, טקסט יוצא לעומת Kimi K3 טקסט ותמונות נכנסים, טקסט יוצא
• פלט מקסימלי מפורסם — GLM-5.2 128,000 טוקנים לעומת לא מפורסם בדף OrcaRouter של Kimi K3
ב-OrcaRouter, שניהם יושבים מאחורי מפתח אחד בנקודת קצה אחת תואמת OpenAI בכתובת https://api.orcarouter.ai/v1, ואנחנו מעבירים את מחיר המחירון של הספק כמו שהוא, בלי להוסיף תוספת — כך שכל נתון בהמשך הוא המספר של הספק, לא שלנו.
כמה עולים מיליון טוקנים, במשימה שעולה משהו
כרטיסי תעריפים של ספקים תחילה, נקראו מדפי התמחור של הספקים עצמם ב-2026-09-23. Z.ai מפרט את GLM-5.2 ב-$1.40 למיליון טוקני קלט, $0.26 למיליון טוקני קלט במטמון, ו-$4.40 למיליון טוקני פלט. Moonshot מפרט את Kimi K3 ב-$3.00 קלט, $0.30 קריאת מטמון, $15.00 פלט — בתוספת מטמון כתיבה חיוב של $3.00 למיליון עבור מטמון של חמש דקות ו-$6.00 למיליון עבור מטמון של שעה. אלה מחירים מפורסמים, לא כאלה שנבדקו באופן בלתי תלוי, וכל ספק יכול לשנות אותם.
הצב אותם במשימה שהיא בעיקרה קריאה: סקירת בסיס קוד של 600,000 טוקנים עם תשובה כתובה של 8,000 טוקנים. ב-GLM-5.2 זה 0.6 × $1.40 = $0.84 של קלט ועוד 0.008 × $4.40 = $0.035 של פלט, או בערך $0.88. ב-Kimi K3 זה 0.6 × $3.00 = $1.80 ועוד 0.008 × $15.00 = $0.12, או בערך $1.92. בערך פי 2.2 מהעלות עבור אותה משימה.
עכשיו הריצו את זה שוב כשבסיס הקוד כבר נמצא במטמון של הספק. שורת הקלט מתכווצת לתעריף קריאה מהמטמון, ושני המחירים שהיו במרחק פי 2.1 זה מזה הופכים ל-$0.26 מול $0.30 למיליון — פער של 15%. זה המספר שהכי פחות מדברים עליו בהשוואה, וזה שהכי חשוב לסוכן שקורא מחדש את אותו הקשר בכל תור. יש לו גם כוכבית: Kimi K3 מחייב בנפרד על כתיבה למטמון, והעמוד של GLM-5.2 לא מפרסם חיוב על כתיבה בכלל, כך שהתנעה קרה עולה משמעותית יותר ב-Kimi K3 ממה שמרמזת הכותרת של $3.00.
• קריאה של 600 אלף טוקנים עם תשובה של 8 אלף — GLM-5.2 בערך $0.88 לעומת Kimi K3 בערך $1.92
• אותה שורת קלט שמורה במטמון — GLM-5.2 $0.16 לעומת Kimi K3 $0.18 לכל 600 אלף טוקנים

המודל העצמאי מסכים לגבי הכיוון אך לא לגבי העוצמה. Artificial Analysis מערבת אסימוני פגיעת מטמון, קלט ופלט ביחס של 7:2:1 ומוסיפה את אסימוני החשיבה שהמודל צורך בפועל, והנתונים שלה לגבי שני אלה — כפי שנקראו ב-2026-09-23 תחת האינדקס v4.3.2 שלה — מציבים את GLM-5.2 על $0.902 למיליון אסימונים משולבים לעומת $2.31 של Kimi K3, ואת העלות של השלמת אחת ממשימות ההערכה שלה על $0.96 לעומת $2.00. הרצה מלאה אחת של ה-Intelligence Index עולה $1,559 ב-GLM-5.2 ו-$3,658 ב-Kimi K3.
יש פרט מנוגד לאינטואיציה הקבור במודל העלות הזה. Kimi K3 צורך פחות אסימוני פלט לכל משימה מאשר GLM-5.2 — 48,000 לעומת 64,000 — ופחות אסימוני הסקה, 32,000 לעומת 51,000. זהו המודל החסכוני יותר ליחידת עבודה, ובכל זאת הוא עולה בערך פי שניים לכל משימה, כי מחירו לאסימון הוא פי 2.1 בקלט ופי 3.4 בפלט. זול לכל משימה וזול לכל אסימון הם תכונות שונות, וזהו שילוב שבו הם מצביעים בכיוונים מנוגדים.
חלון ההקשר, ומה שלמעשה נכנס בו
השניים נמצאים בתוך 5% זה מזה על הנייר: 1,000,000 טוקנים לעומת 1,048,576. לדווח על כך כניצחון של Kimi K3 יהיה מגוחך. שניהם מודלים של מיליון טוקנים, והחלון אינו מהווה גורם מבדיל; השאלה הכנה היא מה כל אחד מהם עוד יכול לעשות עם טקסט שקבור באמצעו.
זה מה שמודדת הערכת הסקה בהקשר ארוך של Artificial Analysis, וזה אחד הפערים הרחבים יותר במערך הנתונים: Kimi K3 משיג 89% לעומת 78% של GLM-5.2. אם תפקידך הוא לטעון קורפוס גדול ולשאול שאלות שמחייבות לחבר עובדות משני קצותיו, 48,576 האסימונים הנוספים אינם הסיבה לבחור ב-Kimi K3 — היתרון של אחד-עשר נקודות בהקשר ארוך הוא.
גם הרצפה שמתחת לחלון שונה. GLM-5.2 מפרסם פלט מקסימלי של 128,000 טוקנים; העמוד של Kimi K3 לא מפרסם נתון מקביל, ולכן לא נספק נתון כזה. אם אתם מייצרים מסמכים ארוכים ולא קוראים אותם, כדאי לבדוק את האסימטריה הזו מול עומס העבודה שלכם לפני שתקנו את אחד מהשניים.
מהירות: הציר היחיד ש-GLM-5.2 שולט בו לחלוטין
שתי מדידות בלתי תלויות מצביעות כאן לאותו כיוון, וזה ראוי לציון דווקא מפני שהן אינן מסכימות על הכול.
נתוני הניתוב שלנו, על פני שבעת הימים עד 2026-09-23, מראים ש-GLM-5.2 עונה בחציון של 3.28 שניות עד לאסימון הראשון לעומת 8.09 שניות של Kimi K3, ומזרים 68.1 אסימונים לשנייה לעומת 43.4. זמן ה-p95 עד לאסימון הראשון בשני המודלים עומד בדיוק על 10.00 שניות. ב-Artificial Analysis, המודדת בנפרד, GLM-5.2 עומד על 68.2 אסימוני פלט לשנייה לעומת 36.7 של Kimi K3, על 41.29 שניות מקצה לקצה לעומת 72.13, ועל 33.95 שניות עד לתשובה הראשונה לעומת 58.52.

שני המקורות חלוקים בנקודה אחת, וכדאי לסמן אותה ולא להחליק אותה. Artificial Analysis מציבה את Kimi K3 מעט מלפנים בזמן הגולמי עד לאסימון הראשון, 4.08 שניות מול 4.62, בעוד שהניתוב שלנו מציג את GLM-5.2 מהיר כמעט פי שניים וחצי ב-p50. נקודות קצה שונות, ספקים שונים במעלה הזרם, חלונות שונים. התייחסו למגמת התפוקה — GLM-5.2 מהיר בהרבה ובנוחות — כמוצקה, והתייחסו לכל נתון בודד של זמן עד לאסימון הראשון, שלנו או שלהם, כתכונה של שבוע מסוים.
יש גם מספר בעמוד GLM-5.2 שלנו שאנחנו לא מתכוונים להשמיט בשקט: באותם שבעה ימים הוא מציג שיעור שגיאות של 9.2%, לעומת 0.26% עבור Kimi K3. פער בגודל כזה סביר באותה מידה שהוא שבוע רע עבור הספקים במעלה הזרם שמשרתים את GLM-5.2, כמו שהוא מאפיין של המודל, ושבעה ימים אינם חלון זמן ארוך מספיק כדי להבחין בהבדל. זה מסוג הבעיות שניתוב נועד לפתור — כאשר ספק נכשל בבקשה אחת מתוך אחת עשרה, מעבר אוטומטי לגיבוי מעביר את התעבורה בלי שאף אחד יזעיק את איש הכוננות.

מבחני ביצוע: ניצחון מוחלט, צר יותר מהכותרת
Kimi K3 מנצח כמעט בכל מה ששני המודלים הורצו עליו. אלו נתוני Artificial Analysis תחת עדכון המדד v4.3.2, שני המודלים בתצורת החשיבה המקסימלית שלהם, נכון ל-2026-09-23:
• מדד אינטליגנציה — Kimi K3 44 לעומת GLM-5.2 34
• AA-Briefcase v1.1 — 1510 מול 1233
• GDPval-AA v2.1 — 1524 מול 1358
• AutomationBench-AA — 58% לעומת 28%
• Terminal-Bench 4.0 — 13% לעומת 1%
• SciCode — 59% לעומת 51%
• Humanity's Last Exam — 47% לעומת 41%
• GDP.pdf — 22% לעומת 10%
• AA-LCR v1.1 — 89% מול 78%
• CritPt — 23% לעומת 21%
שתי הסתייגויות לפני שמישהו מצלם מסך של הרשימה הזו.
ראשית, עדכון המדד. סיקור ההשקה של Kimi K3 ביולי ציטט אותו ב-57 במדד Intelligence Index, בעוד GLM-5.2 היה ב-51. העמודים החיים כיום מציינים 44 ו-34. אלה אינם אותה מדידה — Artificial Analysis מעדכנת את המדד ומדרגת מחדש את המודלים לפיו, והצבת נתון מיולי לצד נתון מספטמבר היא הטעות הקלה ביותר לעשות בזיווג הזה. הכיוון יציב בכל תמונת מצב; המספרים המוחלטים אינם ברי השוואה בין עדכוני המדד.
שנית, הרמות. Terminal-Bench 4.0 עם 13% ו-1% הוא הערכה קשה, ובגובה כזה היחס מספר לך יותר מאשר כל אחד מהמספרים. AA-Omniscience, שבוחן אם מודל מכיר את גבולות הידע של עצמו, מציב את GLM-5.2 על 4 לעומת 20 של Kimi K3 — רצפה שכדאי להכיר אם אתה מתכנן להריץ את אחד מהם ללא השגחה.
עוד דבר ש-Artificial Analysis מתעדת לגבי הרשומה של GLM-5.2: היא מסמנת את תצורת החשיבה המרבית כ-deprecated (מיושנת) לטובת GLM-5.3 החדש יותר. זה לא משנה אף אחד מהנתונים שלמעלה, שהם תמונת מצב של GLM-5.2 כפי שהוא נמדד, אבל זה כן אומר שמפת הדרכים של Z.ai התקדמה מעבר למודל הזה. בנקודת קצה מנותבת זה עולה מחרוזת מודל אחת ולא מיגרציה, וזה הטיעון המרכזי שלא לקודד באופן קשיח אף אחד מהשמות האלה באפליקציה שלך.
סוכנים ושימוש בכלים: היכן שהפער הוא הרחב ביותר
אם בלוק אחד בטבלה הזו אמור להכריע את הרכישה, זה הבלוק הזה. עבודה סוכנית לטווח ארוך היא המקום שבו היתרון של Kimi K3 הוא הגדול והעקבי ביותר:
• AutomationBench-AA — 58% לעומת 28%, פער של 30 נקודות
• GDPval-AA v2.1 — 1524 מול 1358
• AA-Briefcase v1.1 — 1510 מול 1233
• Terminal-Bench 4.0 — 13% לעומת 1%
חומרי הפרסום של Moonshot עצמה נשענים על אותו סיפור — פרסום המשקולות של K3 הגיע עם דוח טכני המכסה את מחסנית האימון במקביליות מומחים של הספק ואת רתמת הסביבה־סוכנים — אבל חומרי ספק הם חומרי ספק, והנתונים שלמעלה הם העצמאיים.
האגרגטור מצד שלישי LLM Stats, שמריץ מדד משולב משלו על מערך בנצ'מרקים משותף, מגיע לאותה מסקנה מכיוון אחר: מתוך אחד עשר הבנצ'מרקים שהוא מדרג עבור שני המודלים, Kimi K3 זוכה בכל האחד עשר, וציוני הקטגוריות שלו מציבים את Kimi K3 לפני המתחרה בשימוש בכלים (30.8 לעומת 19.6), סוכנים (38.3 לעומת 29.6) וקידוד (42.3 לעומת 34.8). אלה המדדים המשולבים של LLM Stats עצמה לפי השוקלול שלה, על מערך משותף שאינו גדול, ולכן יש להתייחס אליהם כאל אישוש ולא כתוצאת מעבדה. אחד עשר מתוך אחד עשר הוא עדיין לא תוצאה צמודה.
קידוד
אותו כיוון, פער קטן יותר. בהערכות הקידוד ש-Artificial Analysis מדרגת לשניהם, Kimi K3 מוביל ב-SciCode 59% מול 51%; בסט המשותף של LLM Stats הוא מנצח ב-DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench ו-Terminal-Bench 2.1. המספרים המחמיאים של GLM-5.2 — 99.2% ב-AIME 2026, 94.4% ב-HMMT 2025, 91.2% ב-GPQA כפי שמובאים על ידי אגרגטורים של צד שלישי — הם דיווחי ספק ולא שוחזרו, ורובם מודדים מתמטיקה תחרותית ולא הנדסת תוכנה.
הקריאה המעשית: עבור סוכן קוד שפועל לאורך זמן רב, עורך קבצים רבים וצריך להתאושש מהטעויות של עצמו, היתרון הסוכני של Kimi K3 הוא האות הרלוונטי יותר מאשר ציוני המתמטיקה של מי מהמודלים. עבור עוזר קוד מהיר, זול ובעיקרו חד-פעמי, יתרון התפוקה של GLM-5.2 שווה יותר מעלות פער הבנצ'מרק.
כאשר הם מספיק קרובים כך שזה לא משנה
• מחיר קלט במטמון — $0.26 לעומת $0.30 למיליון, פער של 15% לעומת פער של פי 3.4 בפלט
• חלון הקשר — 1,000,000 לעומת 1,048,576 טוקנים
• זמן p95 לאסימון הראשון — 10.00 שניות לעומת 10.00 שניות בניתוב שלנו
• CritPt — 23% לעומת 21%
• מתמטיקה — LLM Stats מציב את GLM-5.2 ביתרון זעום במדד המתמטיקה המשולב שלו (41.4 לעומת 40.9), בעוד Kimi K3 מוביל במתמטיקה עם תמונות; על סמך הראיות הזמינות, אף אחד מהמודלים אינו שולט בחשבון
כל מי שאומר לך שאחד מהמודלים האלה הוא פי שניים מהשני בכל התחומים קורא שורה אחת מתוך הטבלה.
בחרו ב-GLM-5.2 אם…
אתה משלם את החשבון, והחשבון הוא האילוץ. GLM-5.2 עולה בערך שליש ממחיר הפלט, זול יותר גם במסלול המטמון, ברישיון MIT בלי טריגר הכנסות שצריך לבדוק כנגדו, מהיר יותר בחציון ומהיר בהרבה כשמזרימים, וחלון מיליון הטוקנים שלו קרוב מספיק לזה של Kimi K3 כך שההבדל לעולם לא יכריע דבר. אם עומס העבודה שלך הוא טקסט נכנס וטקסט יוצא, והוא בעיקרו קריאה ולא שרשראות ארוכות של קריאות לכלים, נקודות הבנצ'מרק הנוספות של Kimi K3 הן נקודות שהאפליקציה שלך לעולם לא תאסוף.
בחר ב-Kimi K3 אם…
העבודה היא סוכנית וארוכה. פער של 30 נקודות ב-AutomationBench, היתרונות ב-GDPval וב-AA-Briefcase, פער של 11 נקודות בהסקה בהקשר ארוך והניצחון המוחלט של הסט המשותף של LLM Stats — כולם מצביעים לאותו כיוון: Kimi K3 הוא המודל הטוב יותר למסור לו משימה מרובת שלבים ולהמשיך הלאה. הוא גם היחיד מבין השניים שמקבל תמונות. תשלמו על כך בערך פי שניים לכל משימה, ואם סט העבודה שלכם שמור במידה רבה במטמון, תשלמו פחות מפי שניים — אבל הטיעון בעדו אינו המחיר, וגם לא המהירות.
שניהם ניתנים לניתוב ב-OrcaRouter ממפתח אחד מול נקודת קצה אחת תואמת OpenAI, במחירי המחירון של הספקים בלי שום תוספת מעל, ושניהם יושבים מאחורי אותו מעבר אוטומטי במקרה כשל. זו הדרך הזולה ביותר לגלות איזה מהם עומס העבודה שלך באמת רוצה, כי מעבר ביניהם הוא מחרוזת מודל ולא חוזה.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
