
Kimi K3 מול Fable 5, GPT-5.6 ו-Opus 4.8: בדקנו את ההייפ
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
Kimi K3הוא הדגל החדש של Moonshot AI, ובמשך כמה ימים ביולי 2026 הוא היה המודל הנבדק ביותר באינטרנט. הוא הופיע לראשונה באתר ההערכה Arena כמודל מסתורי בשם הקוד "Kivine" — שתואר בעצמו כ"מ-Moonshot labs" עם חתך ידע מינואר 2025 — לפני ש-Moonshot הכריזה עליו רשמית ב16 ביולי 2026, תוך הבטחה למשקלים פתוחים לפני 27 ביולי. הכותרת החוזרת מהבודקים: Kimi K3 נמצא איפשהו סביב Claude Fable 5, ולעתים קרובות לפני GPT-5.6 בעבודה יצירתית ותלת-ממדית. סקירת הרושם הראשוני הזו מרכזת את המפרטים, את עמוד השדרה של ההשוואות, ותריסר מבחני קהילה במקום אחד.
הערה לבנאים: אלו בדיקות קהילתיות מוקדמות ולא מבוקרות, לכן התייחסו אליהן כאל כיווניות, לא כאל ציונים. OrcaRouter מציגה מודלים זמינים דרך API מאחורי נקודת קצה אחת תואמת OpenAI, אז ברגע שKimi K3של API יהיה זמין, תוכל לנסות אותו מול Fable 5 ו‑GPT‑5.6 ללא חיבור מספר SDKs.
TL;DR – פסק דין.Kimi K3 הוא מודל בעל משקל פתוח שהגיע בצורה אמינה לטווח Fable 5 בחזית, תלת-ממד ו-one-shots יצירתיים – הוא מוביל את לוח המובילים של Arena בחזית ומדורג #4 במדד Artificial Analysis. אבל הוא ארוך ואיטי (בניית חזית אחת ארכה 35 דקות), נופל מ-Fable בקידוד סוכני, ופסקי הדין "ניצחון" הם רשמים מוקדמים מ-Arena, לא ביצועי אמת מבוקרים. מרשים, לא מוכרע.
נקודות עיקריות
• Kimi K3 הוא 2.8T-parameter MoE, המוצב כמודל הפתוח הגדול ביותר עד כה, עם משקלים פתוחים שצפויים לפני 27 ביולי.
• בהערכות צד שלישי ניטרליות, הוא מדורג #4 of 189 on the AA Intelligence Index (57) ו #1 on Arena's frontend-code board (1679), מעל 1631 של Fable 5.
• מתומחר ב-$3 / $15 ל-1M אסימונים — המודל היקר ביותר אי פעם של Moonshot, אך עדיין בערך שליש מה-10$ / 50$ של Fable 5.
• הבודקים מכנים אותו שוב ושוב "Fable level"; הספקנים אומרים שההשוואות הישירות נבחרו בקפידה ועדיין הוא מפגר במשימות סוכנות רב-שלביות.
• שימו לב לאזהרות: פלט מפורט (~2x peer-median tokens), ~34s השהיה לטוקן ראשון, והוא עדיין מאחורי Fable ב-FrontierSWE וב-DeepSWE.
המפרטים ועמוד השדרה של המדדים
הנה הנתונים הקשים, כל נתון מיוחס למקור שלו.
• ארכיטקטורה — Kimi K3: 2.8T MoE (896 מומחים, 16 פעילים), Kimi Delta Attention, 1M context, ראייה טבעית; נקודת השוואה: המודל הגדול ביותר במשקל פתוח עד כה (Moonshot, דיווח ספק)
• גרסאות — Kimi K3: K3 Max (צ'אט/סוכן), K3 Swarm Max (מקביל); נקודת השוואה: —
• תמחור (פנים / חוץ) — Kimi K3: $3 / $15 ל-1M; cache-hit ~$0.30; נקודת השוואה: Fable 5 ב$10 / $50 (~3.3x יותר)
• AA Intelligence Index — Kimi K3: 57 — #4 מתוך 189; נקודת השוואה: מאחורי שתי תצורות Fable 5 + GPT-5.6 Sol; מעל Opus 4.8, Sonnet 5, GLM-5.2 (Artificial Analysis)
• Arena frontend-code — Kimi K3: #1 ב-1679, ניצח ב-6 מתוך 7 קטגוריות; נקודת השוואה: מעל 1631 של Fable 5; עלייה מ-#18 של K2.6 (Arena / LMArena)
• GDPval-AA v2 / AA-Briefcase — Kimi K3: 1687 (#3) / 1527 (#2); נקודת השוואה: Artificial Analysis
• GPQA Diamond — Kimi K3: 93.5% (המודל הפתוח החזק ביותר); נקודת השוואה: דווח על ידי הספק
• BrowseComp / HLE עם כלים — Kimi K3: 91.2% / 56.0%; נקודת השוואה: דווח על ידי הספק
• Agentic SWE — Kimi K3: FrontierSWE 81.2, DeepSWE 67.5; נקודת השוואה: מתחת ל-86.6 / 70.0 של Fable 5
• Terminal-Bench 2.1 — Kimi K3: 88.3; נקודת השוואה: מעל 84.6 של Fable 5 (אזהרת ערבוב רתמה למטה)
שני דברים ממתנים את הניצחונות. ראשית, יתרון המחיר נאכל חלקית על ידי רב-מילוליות — K3 פולטת בערך פי שניים מתפוקת הטוקנים החציונית של עמיתים במשימות דומות — בתוספת איחור טוקן ראשון של ~34 שניות. שנית, היתרון ב-Terminal-Bench מגיע עם אזהרה מ-@ChrissGPT: אמות המידה של Moonshot "לעיתים קרובות אוהבות להשתמש ב-Terminal 2 במקום ב-2.1," לכן התייחסו להשוואות בין-כלי בזהירות. באופן עצמאי, לפני שהמדד הרשמי ירד, @teortaxesTex העריך "~55ish AA… בסביבת Opus 4.8 או GPT 5.5."

סיכום מבחני הקהילה
הראיות שהפכו את Kimi K3 לסיפור הן מבול של Arena one-shots. הנה קטע מייצג — בודק, משימה ופסק דין, כל אחד מקושר לפוסט המקורי.
• @synthwavedd — משימה: בדיקת מאמץ כללית; פסק דין: "עוד רגע של DeepSeek R1… לרוב ברמת Fable, אולי קצת גרוע יותר, אבל באופן עקבי טוב יותר מ-5.6. חיה."
• @chetaslua — משימה: קידוד, ראש בראש מול Fable; פסק דין: "מנצח כל מודל קוד פתוח… ברמה של Fable, לפעמים איכות טובה יותר"
• @Gc_qube — משימה: תלת-ממד / משחקים מול Fable 5; פסק דין: "Kimi K3 ניצחה... הדגם הראשון שהדביק את Fable"
• @abhinavflac — משימה: עיבוד בונסאי סאקורה; פסק דין: "הביס את קלוד פייבל — הצליח בגזע המעוות ובחופה השכבתית"
• @testingcatalog — משימה: Universe-sim vs Fable 5; מסקנה: "Fable סיימה מהר יותר עם UX חזק יותר; K3 הרבה יותר מורכב ומושך מבחינה חזותית… קרוב מאוד"
• @israfill — משימה: אותו פרומפט (הנחיה) של סימולציית יקום; מסקנה: "K3 מנצח בתפוקה יצירתית צפופה ורגעים של 'איך הוא בנה את זה'… מופתע עד כמה זה קרוב"
• @mirochill — משימה: Frontend one-shot (צרפתית); פסק דין: "שווה ל-5.6 Pro, טוב יותר מ-Fable 5, בניסיון בודד" (צוינו בעיות תאורה)
• @jun_song — משימה: Flappy Bird לעומת Opus 4.8; פסק דין: "טוב משמעותית מ-Opus… רמת Opus-5"
• @JustinGorya — משימה: מיינקראפט בקובץ HTML יחיד; חוות דעת: "אבן דרך חדשה… מדהים בתלת‑ממד ובחזית" (תגובה: "זה שוט אחד. מטורף")
• @redkendl— משימה: משחק מטוס נייר תלת-ממדי; פסק דין: "הודח בניסיון אחד… Fable 5 / פלט ברמת GPT-5.6. מעבדות סיניות אינן בפיגור של 8 חודשים יותר"
• @noctus91 — משימה: חוויות תלת-ממד אינטראקטיביות; חוות דעת: "רמת הפירוט, הליטוש והאיכות הכוללת היא באמת מטורפת"
• @Lentils80 — משימה: דף פרונט‑אנד; חוות דעת: "איטי מאוד — לקח 35 דקות — אבל אחד התפוקות הטובות ביותר שראיתי אי פעם מהפרומפט הזה"

מעודדים מול ספקנים
המקרה האופטימי הוא פשוט: מודל במשקל פתוח התואם למוביל גבול סגור בעבודה יצירתית ובחזית, בשליש מהמחיר, הוא באמת חדש. @notjazii כינה פלט מוקדם "מודל SOTA חדש שיורד היום, moonshot cooked," ו-@chetaslua הגדיר זאת כ"רגע deepseek שוב עבור OSS."
הספקנים דוחפים חזרה בחוזקה, וההתנגדויות שלהם הן תמיד אותן שלוש:
• דמואים שנבחרו בקפידה.במבחן הבונסאי, @Heeseon השיב "כל אחד יכול לראות ש-Fable 5 ניצח," ו-@sebuzdugan ציין "דגימת בונסאי אחת מראה שליטה בסגנון, לא אמינות על פני זרעים."
• Fable פשוט טוב יותר. בשרשור של Gc_qube, @victor_vibing אמר בפשטות: "Fable הוא הרבה יותר טוב. באופן שאין להשוות."
• אסתטיקה זהה, לא טווח אמיתי. @_everythingism טען שהפלטים "לכולם יש את ה-'Claude aesthetic'… מייצרים שוב ושוב סוג מסוים של עיצוב," ובבדיקות Opus @MCharles10581 פשוט אמר "נראה ש-opus טוב יותר."
המסגרת השימושית ביותר מגיעה מ-@teortaxesTex, שאפילו לא בדק את K3 בעצמו. הנקודה שלו היא על פער מאמץ/טעם, לא חומת יכולת: "אפילו Fable ו-Sol עושים כל כך הרבה SLOP… Kimi לא כל כך נכשל בדברים אלא שהוא מייצר דברים פחות מעניינים ופחות מפורטים, לא הולך את המייל הנוסף." לקידוד אייג'נטי עם אדם בלולאה במשימות אובייקטיביות, הוא מצפה ש-K3 "צריך להתקרב בצורה בלתי סבירה." והקיק האסטרטגי: "כל מודל סיני שרק *שומר* על הפער… הוא הישג הרואי." זו הקריאה הכנה — K3 מקטין את הפער במשימות מדידות ומפסיד קצת בטעם, וזה בדיוק מה שהבנצ'מרקים שלו מראים.
שאלות נפוצות
האם Kimi K3 טוב כמו Fable 5?
בצד של פרונטאנד ו-one-shots תלת־ממדיים, הבודקים אומרים כן — הוא עוקף את לוח הפרונטאנד של Arena (1679 לעומת 1631) ובשורת התמודדויות ראש־בראש הוא הוכרז כניצחון או תיקו. בצד של קודינג אייג׳נטי הוא עדיין מפגר (FrontierSWE 81.2 לעומת 86.6), והספקנים טוענים שלFable יש יתרון בליטוש ובאמינות על פני סידים שונים.
האם Kimi K3 הוא קוד פתוח?
זהו מודל במשקל פתוח: Moonshot הבטיחה לשחרר את המשקולות לפני 27 ביולי 2026. בהשקה הוא היה זמין רק ב-API/אינטרנט. בתור מודל המשקל הפתוח הגדול ביותר עד כה (2.8T MoE), השחרור הזה הוא האירוע המרכזי.
כמה עולה Kimi K3?
$3 / $15 לכל מיליון אסימוני קלט/פלט, עם פגיעות מטמון בסביבות $0.30. זהו הדגם היקר ביותר של Moonshot אי פעם (K2.6 היה $0.95/$4), אבל עדיין כשליש מ-$10 / $50 של Fable 5 — אם כי פלט מפורט מצמצם את הפער בעולם האמיתי.
האם Kimi K3 טוב יותר מ-GPT-5.6?
בודקים נוטים להסכים לגבי עבודה יצירתית ותלת-ממדית — @synthwavedd כינה אותה "טובה באופן עקבי מ-5.6" ו-@mirochill השווה אותה ל-5.6 Pro. אבל במדד AA, GPT-5.6 Sol עדיין מדורג מעל K3, ו-Fable 5 ו-5.6 Sol מובילים ב-Terminal 2.1.
מתי שוחרר Kimi K3?
הוכרז רשמית ב-16 ביולי 2026, לאחר שהופיע ב-Arena בשם "Kivine" בסביבות ה-14 ביולי. משקלים פתוחים הובטחו לפני 27 ביולי 2026.
השורה התחתונה
Kimi K3 הוא הרושם הראשוני החזק ביותר שדגם עם משקלים פתוחים יצר מאז רגע DeepSeek המקורי: תפוקה יצירתית ופרונטאנד ברמה של Fable-5, בראש לוח הפרונטאנד של Arena, במחיר של כשליש מ- Fable. אבל כדאי לרסן את ההתלהבות ל"כיוונית" – הוא מפורט, איטי, עדיין מפגר בתכנות סוכני, וכל "ניצחון" לעיל הוא רושם ראשוני מ- Arena, לא מדד מבוקר. כשהמשקלים יורדים לפני 27 ביולי, הבדיקות המבוקרות יראו אם ההייפ היה מוצדק.

השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
