
Claude Fable 5.1 מול Kimi K3: תקרת החשיבה לעומת התקרה שבבעלותך
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
Claude Fable 5.1 ו-Kimi K3 מכוונים לאותו קונה — צוותים שמפעילים סוכנים ארוכי טווח המשתמשים בכלים על פני מאגרי קוד ומערכי מסמכים גדולים — והם מגיעים מקצוות מנוגדים של השוק. Claude Fable 5.1 הוא דגם הדגל הסגור של Anthropic, שוחרר ב-1 בספטמבר 2026, במחיר של $10.00 למיליון אסימוני קלט ו-$50.00 למיליון אסימוני פלט, ונמדד על ידי Artificial Analysis על 53 במדד ה-Intelligence Index הנוכחי: ראשון מבין 201 הדגמים שמדד זה עוקב אחריהם. Kimi K3, מודל תערובת המומחים בעל 2.8 טריליון פרמטרים של Moonshot AI, פתח את המשקלים שלו ב-27 ביולי וממוקם על 44 באותו מדד — שני מבין 112 דגמי המשקלים הפתוחים בקטגוריה שלו. הקריאה הברורה היא פער של תשע נקודות באינטליגנציה מול פער מחיר של פי שלושה בערך. הקריאה השימושית יותר היא שלשני הדגמים יש מקסימומים שונים, ורק אחד מהמקסימומים האלה יכול להיות מועלה על ידי האדם שמשתמש בו.
בנוגע למקורות: Artificial Analysis עדכנה את מדד האינטליגנציה שלה בספטמבר, ולכן הציונים, הדירוגים, המהירויות ועלויות המשימה כאן לקוחים מהגרסה הנוכחית, שנלכדה ב-10 בספטמבר 2026, ואינם ניתנים להשוואה למספרים שפורסמו בהשקת כל אחד מהמודלים. תוצאות האמות-מידה של Moonshot ותוצאות אלה של Anthropic מסומנות היכן שהן מופיעות, ואף אחת מהן לא שוחזרה על ידי המעבדה האחרת. Claude Fable 5.1 הוא בן תשעה ימים, כך שלטענות הספק שלו כמעט שלא היה ניסוי חיצוני; ל-Kimi K3 היו שישה שבועות של ניסוי כזה.
אותו חלון, מקסימומים שונים
שני המודלים תומכים בחלון הקשר של 1,048,576 טוקנים, ואף אחד מהם לא גובה פרמיה על מילוי שלו — Moonshot מתמחרת את Kimi K3 במחיר שטוח של $3.00 / $0.30 עבור מטמון / $15.00 למיליון, ו-Claude Fable 5.1 מתמחרת את החלון שלה במחיר שטוח של $10.00 / $0.25 עבור מטמון / $50.00. חלון משותף זה הוא בדיוק הסיבה שבגללה משווים בין שני אלה מלכתחילה: הם בנויים לאותה צורת עבודה, שבה משימה בודדת צוברת מאגר קוד, חדר נתונים או שבוע של פלט כלים.
הפער נמצא בקצה השני של הצינור. Kimi K3 יכול לפלוט עד 1,048,576 טוקנים בתגובה אחת — ספקים בדרך כלל מגדירים אותו כברירת מחדל ל־131,072, אבל התקרה היא מיליון מלא, המשווק על ידי Moonshot כ"קריאה בודדת יכולה לפלוט מאגר קוד." Claude Fable 5.1 מגביל תגובה ל־128K טוקני פלט. לשיחת צ'אט, המגבלה הזו אינה רלוונטית. ליצירת מאגר קוד שלם, הגירה בכמות גדולה או מערך מסמכים ארוך, זה ההבדל בין קריאה אחת ללולאת סוכן שאתה צריך לבנות, לפקח ולשלם עליה תגובה אחר תגובה.
המספרים, מימד אחר מימד
• מחיר לכל מיליון טוקנים — Claude Fable 5.1: 10.00$ קלט / 50.00$ פלט לעומת Kimi K3: 3.00$ קלט / 15.00$ פלט.
• קלט שמור במטמון — Claude Fable 5.1 $0.25 לכל 1M לעומת Kimi K3 $0.30, ש-Artificial Analysis הופך להנחת מטמון אפקטיבית של 98% כנגד 90%.
• ציון עצמאי, מהירות ועלות — Claude Fable 5.1 עומד על 53 ב-Intelligence Index הנוכחי (#1 מתוך 201) עם 67.2 טוקני פלט לשנייה ו-$7.63 למשימת מדד; Kimi K3 עומד על 44 (#2 מתוך 112 מודלים עם משקלים פתוחים) עם 35.5 טוקנים לשנייה ו-$2.00 למשימה, והמדד מציין שהוא איטי במיוחד ומילולי במקצת — 160M טוקני פלט לכל ריצת מדד לעומת 190M של מודל Claude.
• תקרת הקשר והפלט — 1M אסימונים בכניסה ועד 128K ביציאה לעומת 1M אסימונים בכניסה ועד 1M ביציאה.
• משקלים — סגורים, רק API, לעומת פתוחים וניתנים לאירוח עצמי, שפורסמו על ידי Moonshot כרישיון Kimi K3, גרסה מותאמת של MIT עם תנאים מסחריים למשווקים גדולים מאוד, עם המשקלים ב-Hugging Face.
• ראייה — Claude Fable 5.1 מקבל קלט של טקסט, תמונה וקבצים דרך ה-API; Kimi K3 מקבל קלט של טקסט ותמונה דרך ה-API, אבל ראייה מקורית היא תכונה של שכבת השרת ואינה חלק מהמשקולות ששוחררו.
• נראות חשיבה — Kimi K3 מזרים את עקבות החשיבה שלו ב-API; Claude Fable 5.1 מחזיר בלוקי חשיבה שאת תצוגתם אתה בוחר — מסוכמים או מושמטים — כששרשרת החשיבה הגולמית לעולם לא נחשפת.
• ארכיטקטורה — מספר הפרמטרים של Claude Fable 5.1 לא פורסם; Kimi K3 הוא תערובת דלילה של מומחים (sparse mixture of experts) עם 2.8 טריליון פרמטרים בסך הכול וכ-104 מיליארד פעילים.
• שוחרר — Claude Fable 5.1 ב-1 בספטמבר 2026; ה-API של Kimi K3 ב-16 ביולי 2026, עם משקלים פתוחים ב-27 ביולי.

מהו פער תשע הנקודות, ומה אינו.
במדד הנוכחי, Claude Fable 5.1 מוביל עם 53 נקודות, ו-Kimi K3 שני עם 44, כששאר שדה המשקלים הפתוחים מאחוריו. תשע נקודות הן פער אמיתי, לא רעש, אך המדד הוא מדד מורכב — עבודה סוכנותית, קידוד, חשיבה מדעית ויכולת כללית, משוקללים — ומספר יחיד מסתיר את המקומות שבהם המודל הפתוח חזק באמת. במדידות עצמאיות מתחילת ספטמבר, Kimi K3 ישב בראש או בסמוך לראש התחום הפתוח בעבודת סוכנים ארוכת טווח: ראשון ב-AutomationBench, שני בחבילת ה-Briefcase הסוכנותית של Artificial Analysis, ושלישי ב-GDPval-AA v2 מבין המודלים שנבדקו. נתוני זירה עצמאית מעריכים את מיומנות פיתוח האתרים שלו בכ-1,679 Elo בלוח ה-Web Dev של Code Arena, בסמוך לפסגת התחום הזה במהלך תחילת ספטמבר. אלה הם עומסי העבודה שבהם המודל הפתוח אינו מפגר אחרי תשע נקודות.
כדי היכן שקלוד פייבל 5.1 נפרד מהשאר הוא תקרת ההיגיון הקשה. אנתרופיק מדווחת על 52.6% ב-Terminal-Bench-Science 0.1, יותר מכפול מה-24.7% של דור הקלאוד הקודם, ובנוסף 55.8% ב-Terminal-Bench 4.0 — שניהם מדווחים על ידי הספק וללא שכפול חיצוני. אלה המספרים שעומדים מאחורי הטענה שמהדורת ספטמבר הזיזה את הרף עבור עבודה מדעית ועבודת אופק ארוך. הסיכום הכנה הוא ש-Kimi K3 תחרותית ברוחב הסוכני ובפיתוח אתרים, והמודל הסגור מקדים במקום שבו ההיגיון מעמיק ביותר; הפרש של תשע נקודות במדד אחד דוחס את שתי העובדות לשורה אחת.
נקודת נתונים אחת ראויה לאזכור מיוחד משום שהיא חריגה: הנתון של Moonshot עצמה ל-Terminal-Bench 2.1 עבור Kimi K3 עומד על 88.3%, לעומת מדידה בלתי-תלויה של 85.0%. מספרים של ספק ששורדים מדידה ניטרלית כמעט ללא שינוי הם נדירים, ופער כה קטן, לטובת הספק, אומר יותר על המודל מאשר כל ציון מדד בודד.

פיצול הבעלות, מתומחר בכנות
משקלים פתוחים הם הסיבה להעדיף את Kimi K3, והם גם הסיבה לקרוא את האותיות הקטנות. Kimi K3 הוא מודל תערובת דלילה של מומחים עם 2.8 טריליון פרמטרים; הרצה עצמית שלו היא הצהרה של אשכול GPU מרובה צמתים, לא עניין של אחר צהריים על תחנת עבודה, ורישיון Kimi K3 כולל שער מסחרי שמכוון למשווקים גדולים מאוד. מה שקונים עם התשתית הזו הוא אמיתי: ללא מגבלות קצב, ללא מדידת תשלום לפי טוקן, כיוונון עדין על הנתונים שלכם, יכולת ביקורת מלאה, ופרומפטים שלעולם לא עוזבים את הרשת שלכם — הדרישות שהופכות API סגור לבלתי רלוונטי בעבודה מוסדרת ובעבודה המשיקה לתחום הביטחון.
שתי הסתייגויות יש לצרף לכך. אירוח עצמי מוותר על היכולת הראייתית המקורית של ה-API, שכן קלט תמונה הוא תכונה של שכבת השירות ולא משהו שנמצא במשקלים ששוחררו; והמודל איטי, נמדד ב-35.5 אסימוני פלט לשנייה על המדד הנוכחי — התוצאה הטבעית של תערובת מומחים עם 2.8T פרמטרים וחשיבה תמידית. על השלמה של 20,000 אסימונים מדובר בדקות של יצירה, ועל האשכול שלך מדובר בדקות של ה-GPUs שלך.
הגרסאות המושכרות קרובות יותר מכפי שמשתמע משאלת הבעלות. Kimi K3 ב-API של Moonshot עולה $3.00 / $15.00 עם קלט במטמון של $0.30 — כשליש מתעריפי הטוקנים של Claude Fable 5.1 — בעוד שבצד של Claude הורידו את מחיר קריאת המטמון ב-75% בספטמבר, ל-$0.25 למיליון, נמוך מזה של Kimi. וזה קריטי דווקא לסשנים הסוכניים הארוכים ששני הדגמים מכוונים אליהם, שבהם אותו פלט של כלי נקרא שוב ושוב עשרות פעמים. במדד העצמאי של עלות-למשימה, הפער עומד על $2.00 עבור Kimi K3 לעומת $7.63 עבור Claude Fable 5.1: גורם של כמעט ארבעה, ולא גורם של שלושה שמחירי הטוקנים מרמזים עליו, משום שהמודל של Anthropic כותב כ-190M טוקנים לעומת 160M של Kimi עבור אותה עבודת אינדוקס.
חשיבה שאפשר לצפות בה
ישנו הבדל בחוויית מפתח שלא מופיע באף טבלת benchmark. Kimi K3 מזרים את עקבות החשיבה שלו דרך ה-API, מה שהופך שלב סוכן כושל למשהו קריא במקום למשהו שצריך להסיק. Claude Fable 5.1 נוקט בגישה ההפוכה: החשיבה תמיד פעילה, שרשרת המחשבה הגולמית לעולם לא מוחזרת, והגדרת התצוגה קובעת רק אם מקבלים סיכום קריא או כלום. סיכומים מספיקים לרוב הלוגים בייצור; עקבות טובות יותר לניפוי באגים של סוכן שממשיך לבחור בענף הלא נכון. אם אתה בונה תשתית סוכנים במקום רק לצרוך אותה, ההבדל הזה ניכר תוך שעות.
הערת השוליים בנושא הרכש
עבור ארגונים אמריקאיים, משתנה אחד לא-טכני מתלווה להתמודדות זו. Moonshot AI היא מעבדה שמרכזה בבייג'ינג, אשר הייתה מושא לבדיקה של ממשלת ארה"ב: מזכיר האוצר איים בפומבי להוסיף את החברה לרשימה שחורה מסחרית, פקידים אמריקאיים טענו כי היא זיקקה יכולות ממודלים אמריקאיים — טענה ש-Moonshot מכחישה — ודיווחים עיתונאיים מתארים שיחות ראשוניות עם Microsoft, Amazon ו-Google לאירוח Kimi K3 בתנאי חלוקת הכנסות, לצד הגשה חסויה של IPO בהונג קונג בתחילת ספטמבר. שום דבר מזה לא משנה את ההשוואה הטכנית, ופריסה של משקלים פתוחים המאוחסנת בארה"ב בתוך התשתית שלך שונה באופן מהותי מניתוב פניות ל-API בחו"ל. זאת אומרת שהחלטת רכש בנוגע ל-Kimi K3 היא החלטה בעלת ממד מדיניות, וצריכה להתקבל על ידי אנשים שיודעים זאת.
להריץ את ההשוואה במקום להתווכח עליה
שני הדגמים זמינים ב־OrcaRouter במחירי המחירון של הספקים שלהם ללא תוספת מחיר, מה שהופך את זה להשוואה שתוכל להכריע עם הנתונים שלך במקום טבלת אמות מידה: Kimi K3 של Moonshot במחיר $3.00 / $15.00, Claude Fable 5.1 של Anthropic במחיר $10.00 / $50.00, עם מפתח אחד וחשבונית אחת, בלי חוזה שני לחתימה וללא שינוי קוד כדי לעבור. הפעל את אותו מערך בדיקה על שניהם, מדוד עלות לכל משימה שהושלמה על עומסי העבודה בפועל שלך, ותן ל-Failover האוטומטי לשמור על נתיב הייצור בזמן שדגם מועמד עדיין מוערך. אם עומס העבודה הוא חשיבה עמוקה או חי בתוך Claude Code, דגם הדגל הסגור בדרך כלל מנצח; אם מדובר ביצירה בנפח גבוה, שבה פלט של מיליון טוקנים או פריסה עצמית משנה את הכלכלה, Kimi K3 הוא היחיד מבין השניים שניתן להחזיק בבעלות, ושכבת הניתוב היא המקום שבו שומרים על שתי האפשרויות פתוחות.

מה שכדאי לעקוב אחריו בהמשך הוא סימטרי. Anthropic משחררת בקצב חודשי בערך, וכעת הוכיחה שתקצץ את מחירי הקאש בלי לגעת בתעריפים המוצהרים, כך שצד העלות של ההשוואה הזו יכול לנוע בלי מודל חדש. עתידה של Moonshot עצמה קשור עכשיו ברישום שלה למסחר ובשיחות הענן האמריקאיות הללו, וכל אחד מאלה יכול לשנות איך — והיכן — מוגש Kimi K3. אף אחד מאלה אינו סיבה לחכות: שני המודלים עושים היום את מה שהמספרים שלמעלה אומרים שהם עושים, וההחלטה שתחזיק מעמד הכי טוב היא זו ששומרת על מזהה המודל כערך קונפיגורציה במקום כשיכתוב.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
