
Qwen 3.8 מול Kimi K3: שתי ענקיות סיניות, ואחת מהן עכשיו זולה יותר
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 177 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
אלה הם שני מודלי הגבול הסיניים המשפיעים ביותר של 2026, והם בני דודים קרובים: שניהם מערכות Mixture-of-Experts דלילות ענקיות, שניהם עם חלון הקשר של 1M-token, שניהם מולטי-מודאליים, ושניהם מבטיחים משקלים פתוחים. Kimi K3 של Moonshot הוא למעשה הגדול מבין השניים, עם 2.8T פרמטרים בסך הכול, לעומת 2.4T של Qwen — תזכורת שימושית לכך שספירת הפרמטרים אינה דירוג.
עד 3 באוגוסט 2026 ההשוואה הזו הייתה חד-צדדית בצורה ספציפית: ל-Kimi K3 היה מדד Artificial Analysis Intelligence Index מבוקר של 57.1, דירוג #1 בקטגוריית frontend-code של LMArena, מחירון שפורסם, ומשקלים ששוחררו, בעוד Qwen3.8-Max היה לו רק כותרת של 2.4T ושום דבר אחר. GA שינתה את הכלכלה באופן מכריע. כעת Qwen מפרסמת $2 / $6 למיליון טוקנים, לעומת $3 / $15 של Kimi — מה שהופך את המודל הגדול והמוכח יותר ליקר יותר בפער ניכר.
הערה למפתחים — הדרך המהירה ביותר להכריע את זה היא להריץ את שניהם על הפרומפטים שלכם. OrcaRouter מציע 200+ מודלים דרך נקודת קצה אחת תואמת OpenAI, כך שתוכלו להעמיד את Qwen 3.8 Max מול Kimi K3 על אותה משימה בלי לחבר שני SDKים.
פסק הדין בקצרה.Kimi K3 עדיין מנצחת בהוכחה: מבוקר AA Intelligence Index של 57.1 (מקום 3), המקום הראשון בקוד חזיתי של LMArena עם 1679, ומודלים עם משקלים פתוחים שבאמת מוכנים. Qwen3.8-Max נותרה ללא ציון על ידי כל מעריך בלתי תלוי. אבל GA העניקה ל-Qwen שני יתרונות אמיתיים. במחיר, היא כעת זולה משמעותית — $2 / $6 לעומת $3 / $15, כלומר 2.5× פחות בפלט. ובבדיקת הצד-השלישי ראש בראש היחידה שקיימת, Qwen הפסידה בכותרת 80 ל-83, בעוד שהיא הייתה הסוכן בעל ההתנהגות הטובה יותר בעליל: 354 ציטוטים ב-repo לעומת 274, 22 בקשות gateway לעומת 53, ואפס קריאות כלי שנכשלו לעומת שתיים. Kimi לאיכות מבוקרת; Qwen לביצועים סוכניים זולים ונקיים יותר.
נקודות עיקריות
• Kimi K3 הוא המודל הגדול יותר — 2.8T MoE לעומת 2.4T של Qwen, בערך 400B יותר — וזו טענה טובה נגד התייחסות למספר הפרמטרים כמדד ליכולת.
• Qwen3.8-Max זמין כללית מאז 3 באוגוסט 2026 במחיר $2 / $6 למיליון בתעריף שטוח, לעומת המחיר של Kimi K3: $3 / $15 (AA משוקלל ~$2.31). Qwen הוא עכשיו זול פי 2.5 בפלט.
• Kimi K3 מחזיק בדירוג המאומת: AA Intelligence Index 57.1 (#3), כשהוא אחרי רק Fable 5 ו-GPT-5.6 Sol, ובנוסף LMArena frontend-code #1 (1679). Qwen3.8-Max הוא עדיין לא קיבל ציון.
• במבחן הישיר היחיד (Trilogy AI), קימי גבר במעט על קוון 83 ל-80 בסך הכול — אבל קוון עשה יותר ציטוטי מאגרים (354 לעומת 274), פחות בקשות שער (22 לעומת 53), והיו לו אפס קריאות כלים שנכשלו (לעומת שתיים), עם דירוג שימוש בכלים של 9/10 לעומת 8/10 של קימי.
• Qwen מדווחת כעת על ציוני סוכנות וקידוד: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (מ-40.7 של קודמו) — הכול דווח על ידי Alibaba.
• תזמון הפתיחות עדיין לטובת קימי:המשקלים שלו מוכנים למעשה; אלה של Qwen מובטחים בתוך השבוע, ועדיין אין רישיון או מאגר.
הערת דיוק: כל נתוני האיכות של Qwen3.8-Max מדווחים על ידי עליבאבא ואינם מאומתים על ידי צדדים שלישיים. נתוני Kimi K3 מגיעים מ-Artificial Analysis ו-LMArena. ההשוואה הישירה היא בדיקה בודדת של Trilogy AI ויש לקרוא אותה כנקודת נתונים אחת, ולא כדירוג כללי. התמחור של Qwen הוא מחירון GA והוא גובר על הנחת התצוגה המקדימה של יולי.
המפרטים והמחיר, זה לצד זה
הנה הנתונים הקשים, כל נתון מיוחס למקורו.
• יצרן / סטטוס — Qwen3.8-Max: Alibaba; GA (3 באוגוסט 2026); Kimi K3: Moonshot; שחרור במשקלים פתוחים
• ארכיטקטורה — Qwen3.8-Max: ~2.4T סה"כ, MoE דליל (פרמטרים פעילים טרם פורסמו); Kimi K3: MoE 2.8T, ראייה מובנית (Artificial Analysis)
• חלון הקשר — Qwen3.8-Max: 1M טוקנים (983,616 עם חשיבה; פלט מקסימלי 131,072); Kimi K3: 1M טוקנים (Artificial Analysis)
• AA Intelligence Index — Qwen3.8-Max: עדיין ללא ניקוד; Kimi K3: 57.1 — #3 (Artificial Analysis)
• זירה / לוח דירוג — Qwen3.8-Max: לא דורג בפומבי; Kimi K3: Frontend-code #1, 1679 (LMArena)
• ציונים המדווחים על ידי הספק — Qwen3.8-Max: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1 (דווח על ידי Alibaba); Kimi K3: הדירוג נמדד על ידי צד שלישי
• תמחור (קלט / פלט) — Qwen3.8-Max: $2.00 / $6.00 לכל 1M, תעריף קבוע; קלט שמור במטמון $0.25; Kimi K3: $3 / $15 לכל 1M (AA משוקלל ~$2.31), פגיעות מטמון $0.30
• משקלים פתוחים — Qwen3.8-Max: הובטח תוך השבוע (אין עדיין רישיון); Kimi K3: משקלים פתוחים; המשקלים מוכנים
• מהירות — Qwen3.8-Max: p50 TTFT 1.64 שניות (טלמטריה של 7 ימים מ-OrcaRouter); Kimi K3: מילולי ואיטי (~34 שניות TTFT, לפי AA)
שני דברים ממסגרים את ההשוואה הזאת, ואחד מהם התהפך לחלוטין ב-3 באוגוסט.
ראשית, יחסי המחירים התהפכו. עד יולי, Kimi K3 היה הדגם עם מחיר אמיתי ו-Qwen היה הדגם עם קופון הנחה. כעת שניהם מפרסמים תעריפים, והדגם המוכח יותר והגדול יותר הוא היקר יותר: $3 / $15 לעומת $2 / $6. בפלט — שבו חשיבה ויצירת קוד מוציאות את הכסף — Kimi יקר פי 2.5. Qwen גם גובה תעריף אחיד על פני כל הקונטקסט של 1M טוקנים, וקלט מאוחסן במטמון ב-$0.25 נמוך במעט ממחיר פגיעת המטמון של Kimi, $0.30. עבור כל עומס עבודה בנפח גבוה, הכלכלה של Qwen טובה יותר כעת בבירור.
שנית, פער ההוכחה לא השתנה, וזו הסיבה ש-Kimi עדיין מנצחת. מדד האינטליגנציה 57.1 של Kimi K3 מציב אותו במקום השלישי הכללי, אחרי רק Fable 5 ו-GPT-5.6 Sol — זו הערכתו של מעריך ניטרלי. התוצאה שלה ב-LMArena frontend-code #1 עם 1679 היא תוצאה שמקורה בקהל, מהשוואות עיוורות רבות. התוצאות של Qwen ב-Terminal-Bench 86.6 וב-GPQA Diamond 92.6 הן מספרים אמיתיים, אבל הן של Alibaba עצמה, על מתקן בדיקה שאף אחד אחר לא השתמש בו. נקודת עיגון שימושית: קודמו של Qwen, Qwen3.7-Max, קיבל ציון 46 במדד ה-AA לעומת 57.1 של Kimi, כך ש-Qwen צריך קפיצה דורית גדולה רק כדי להגיע לשוויון.
יש כאן גם קמט בהשהיה שכדאי לציין, כי הוא סותר את הסיפור הרגיל. Artificial Analysis מודדת את Kimi K3 בכ-34 שניות עד לאסימון הראשון — איטי באמת. הטלמטריה של OrcaRouter ב-GA מראה ש-Qwen3.8-Max נמצא ב-p50 TTFT של1.64 שניות. המדידות הללו מגיעות ממקורות שונים ואינן השוואה מבוקרת, אבל הן מסבכות את ההנחה מתקופת התצוגה המקדימה שקוון הוא האיטי מבין השניים.

מבחן הראש-בראש היחיד, קרא בעיון
זהו המפגש היחיד בסדרה שבו צד שלישי הריץ את שני המודלים זה מול זה על אותה משימה, מה שהופך אותו לראוי לקריאה מדוקדקת ולא לסיכום של מי המנצח.
Trilogy AI ביצעה משימת הבנת ארכיטקטורה — להבין מאגר קוד אמיתי ולהגיע למסקנה ארכיטקטונית נכונה — ודירגה את התוצאות:
• ציון כולל — Qwen3.8-Max: 80 / 100; Kimi K3: 83 / 100
• ציטוטי ריפו — Qwen3.8-Max: 354; Kimi K3: 274
• בקשות Gateway — Qwen3.8-Max: 22; Kimi K3: 53
• קריאות כלי שנכשלו — Qwen3.8-Max: 0; Kimi K3: 2
• דירוג שימוש בכלים — Qwen3.8-Max: 9 / 10; Kimi K3: 8 / 10
• שיעור פגיעות במטמון — Qwen3.8-Max: >90%; Kimi K3: >90%
קימי זכתה בכותרת בשלוש נקודות. אבל הסתכלו על עמודות התהליך, כי עבור הנדסת סוכנים הן חשובות יותר מהניקוד. Qwen הגיעה לאותה מסקנה ארכיטקטונית מרכזית באמצעות פחות ממחצית בקשות ה-gatewayתוך הפקת 29% יותר ציטוטי ביסוסו— הפרט שאמור לעניין כל מי שבונה סוכנים — אפס קריאות כלים שנכשלו לעומת שתיים של קימי.
קריאות כלים כושלות הן מה שבאמת שובר סוכני ייצור. הן מתגלגלות: קריאה לא תקינה מייצרת שגיאה שהמודל חייב לפרש, מה שמבזבז סבבים, וזה מעלה את הסיכון לשגיאות נוספות. מודל שמבצע 22 בקשות נקיות בעוד אחר מבצע 53 עם שתי כשלונות הוא זול יותר וצפוי יותר לתפעול, גם אם הוא מקבל שלוש נקודות פחות בתשובה. יחד עם קצב הפלט של Qwen שזול פי 2.5, הכלכלה התפעולית של אותו ריצה מעדיפה את Qwen באופן משמעותי.
האזהרה היא שזה משימה אחת, מעריך אחד, ריצה אחת. זה אינו סט מבחני השוואה ואינו מכליל. המדד 57.1 של Kimi והדירוג #1 בפרונטאנד נשענים על כמות ראיות גדולה בהרבה מזו של מבחן יחיד זה. המסקנה הנכונה היא צרה: במשימה אגנטית ריאלית אחת לפחות, Qwen היה משתמש הכלים הממושמע יותר, תוך שהוא מפסיד מעט באיכות הפלט.

עלות בפועל: סוכנים פועלים בקנה מידה
קח סוכן לניתוח מאגר קוד: 250,000 אסימונים של הקשר קוד לכל ריצה, 12,000 אסימונים של פלט.
• Qwen3.8-Max: 0.25M × $2 = $0.50, ועוד 0.012M × $6 = $0.072. ≈ $0.57 לריצה.
• Kimi K3: 0.25M × $3 = $0.75, ועוד 0.012M × $15 = $0.18. ≈ $0.93 לריצה.
• ב-1,500 ריצות/יום: Qwen ≈ $858/יום; Kimi ≈ $1,395/יום — בפער של כ-$16,000/חודש.
• עם הפעלת מטמון על מאגר יציב: הקלט המאוחסן של Qwen ב-$0.25/1M מביא את ההרצה ל-≈ $0.14; שיעור פגיעות המטמון של Kimi ב-$0.30 מביא אותה ל-≈ $0.26.
הפער אמיתי בשני הקצוות, ותוצאת ה-Trilogy מעצימה אותו: אם Qwen אכן משתמשת בפחות ממחצית מבקשות ה-gateway כדי להשלים עבודה דומה, הפער בעלות האפקטיבית עבור משימות אייג'נטיות רחב יותר ממה שמרמז כרטיס התעריף לבדו.
שני המודלים מחייבים אסימוני חשיבה כפלט, ולכן תצורות עתירות חשיבה עולות יותר מההערכה הנאיבית משני הצדדים — אבל התעריף של Qwen, 6 דולר, מקטין את הקנס הזה פי 2.5.
פתיחות: כמעט שוויון, תזמון שונה
זה הציר שבו השניים הכי דומים, וההבדל הוא אך ורק במוכנות. המשקלים של Kimi K3 פתוחים ולמעשה מוכנים. המשקלים של Qwen3.8-Max מובטחים תוך שבוע, אך עדיין אין טקסט רישיון, כרטיס מודל או מאגר — והרישיון הוא מה שקובע אם בכלל ניתן להשתמש במודל לשימוש מסחרי.
מעשית, אף אחד מדגמי הדגל אינו בר-אירוח עצמי על ידי צוות רגיל. Qwen עם 2.4T הוא בערך 1.2TB ב-4-bit, לעומת כ-141GB ל-H200; Kimi עם 2.8T גדול עוד יותר. שניהם דורשים שמונה מאיצים מתקדמים או יותר, ומספר הפרמטרים הפעילים שלא פורסם של Alibaba אומר שאי אפשר אפילו למודל את התפוקה של Qwen.
זו הסיבה לכך שהמודל שהוכרז במקבילQwen3.8-27B חשוב כאן. כמו כן, הוא עובר למשקלים פתוחים ולפי הדיווחים רץ בכ-17GB של VRAM, זה נותן למשפחת Qwen סיפור פריסה מקומית אמיתי שאף דגם דגל 2.4T או 2.8T לא מספק. אם משקלים פתוחים הם הסיבה האמיתית שלך לבחירה בין השניים, ה-27B משנה את המשוואה יותר מכל אחד מהענקיים.
שאלות נפוצות
האם Qwen 3.8 טוב יותר מ-Kimi K3?
לא על סמך ראיות מבוקרות. ל-Kimi K3 יש מדד אינטליגנציה עצמאי AA של 57.1 (מקום #3) ואת המקום הראשון (#1) של LMArena בקוד frontend, בעוד Qwen3.8-Max נותר ללא ציון על ידי כל מעריך חיצוני. במבחן הישיר היחיד הזמין, Kimi ניצח 83 מול 80. היתרונות של Qwen הם המחיר (פלט זול פי 2.5) ובאותו מבחן, שימוש נקי יותר בכלים.
איזה דגם גדול יותר?
ל-Kimi K3 יש 2.8T פרמטרים בסך הכול, לעומת 2.4T של Qwen3.8-Max — בערך 400B יותר. עם זאת, אף אחת מהחברות לא חושפת מספיק מידע כדי שזה יהיה משמעותי: Alibaba מעולם לא פרסמה את מספר הפרמטרים הפעילים של Qwen, שהוא הנתון שבפועל קובע את עלות ההפעלה במודל Mixture-of-Experts.
מה יותר זול?
Qwen3.8-Max, בבירור, מאז GA. הוא מציג $2 / $6 לכל 1M לעומת $3 / $15 של Kimi K3 — 33% פחות בקלט ו-2.5× פחות בפלט. התעריף של Qwen קבוע על פני כל הקונטקסט של 1M, וקלט המטמון שלו במחיר של $0.25 נמוך במעט משיעור פגיעות המטמון של $0.30 של Kimi.
מה הראה למעשה המבחן ראש בראש?
משימת הבנת הארכיטקטורה של Trilogy AI העניקה ל-Kimi ציון 83 ול-Qwen ציון 80. אבל Qwen הפיק 354 ציטוטי ריפו לעומת 274 של Kimi, השתמש ב-22 בקשות שער לעומת 53, רשם אפס קריאות כלים שנכשלו לעומת שתיים, וקיבל 9/10 על שימוש בכלים לעומת 8/10 של Kimi. Kimi סיפק תשובה טובה יותר; Qwen היה הסוכן הממושמע יותר. זוהי משימה אחת, אז התייחסו אליה כנקודת נתונים ולא כדירוג.
האם Qwen 3.8 Max עזב את מצב התצוגה המקדימה?
כן, ב-3 באוגוסט 2026, עם כרטיס תעריפים מפורסם ונקודת קצה תואמת OpenAI ו-DashScope. קמפיין הקרדיטים של Qoder של יולי כבר לא מתאר כיצד הוא נמכר.
איזה מהם מהיר יותר?
ייתכן שעכשיו זה Qwen, מה שהופך את ההנחה מתקופת התצוגה המקדימה. Artificial Analysis מודדת את Kimi K3 בכ-34 שניות של זמן-עד-לאסימון-הראשון; הטלמטריה של OrcaRouter ל-7 ימי GA מראה ש-Qwen3.8-Max בעל p50 TTFT של 1.64 שניות. אלה מקורות שונים ולא השוואה מבוקרת, אבל לשני הדגמים יש מוניטין של מילוליות, וה-TTFT שנמדד עבור Kimi איטי באמת.
האם אני יכול להפעיל בעצמי אחת מהן?
לא באופן מציאותי בקנה מידה של דגמי דגל — דגמי 2.4T ו-2.8T דורשים שמונה GPUs או יותר מסוג H200-class. המשקולות של Kimi מוכנות היום; אלה של Qwen מובטחות בתוך שבוע, אך ללא רישיון עדיין. לאפשרות מקומית (on-premise) אמיתית, ה-Qwen3.8-27B שהוכרז במקביל (לפי הדיווחים ~17GB של VRAM) הוא הבחירה המעשית במשפחת Qwen.
השורה התחתונה
Qwen 3.8 נגד Kimi K3 הוא ההתמודדות הקרובה ביותר בסדרה זו, והזמינות הכללית פיצלה אותה באופן ברור לשני צירים. Kimi K3 שומרת על כתר האיכות בזכות דברים שמדד שופט: 57.1 במדד האינטליגנציה, שלישית בסך הכל, והמקום הראשון של LMArena בקטגוריית קוד frontend. אלה לא טענות — אלה תוצאות, ול-Qwen אין שום דבר מקביל.
מה שקוון ניצחה ב-3 באוגוסט הוא ההיבט הכלכלי, והיא ניצחה בו נחרצות: $2/$6 מול $3/$15, במחיר שטוח על פני מיליון טוקנים, עם קאשינג זול במעט. הוסיפו לכך את ממצא Trilogy, שלפיו קוון השלימה משימה אייג'נטית דומה עם מחצית מבקשות ה-Gateway ואפס קריאות כלים שנכשלו, וקוון נראית כמו המודל היעיל יותר מבחינה תפעולית, אפילו במקרים שבהם היא המודל הפחות מדויק. צפו בשני אירועים: ציון ה-Intelligence Index העצמאי הראשון עבור Qwen3.8-Max, ושחרור המשקלים עם רישיון. אם קוון תשיג ציון בקרבת ה-57.1 של Kimi, פער המחירים מקשה מאוד להצדיק את Kimi לעבודה בנפח גדול. עד אז, Kimi היא המודל שאתם סומכים עליו, וקוון היא המודל שאתם יכולים להרשות לעצמכם להריץ — והדרך הכנה לבחור היא על המאגרים שלכם.

השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
