
Claude Sonnet 5.5 לעומת Kimi K3: אף אחד מהמודלים לא יקבל את הגדרת הטמפרטורה שלך
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 984 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 195 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
הנה השוואה שבה שני המודלים מסכימים על משהו שכך או כך ישבור את הקוד שלכם. Claude Sonnet 5.5, שיצא לאור ב-28 בספטמבר 2026, דוחה כל בקשה שמגדירה temperature, top_p או top_k לערך שאינו ברירת המחדל, עם שגיאת 400. Kimi K3, שזמין לשימוש כללי מ-Moonshot AI מאז אמצע יולי 2026, אינו מקבל כלל פרמטרי דגימה — לא temperature, לא top_p, לא seed — וחושף את עומק החשיבה רק דרך reasoning_effort — בקרה. שתי מעבדות שונות, שתי ארכיטקטורות שונות, ומסקנה משותפת אחת: מתגי הדגימה שרוב האינטגרציות עדיין מגדירות מתוך הרגל נעלמו בשניהם.
זו לא ההשוואה שמישהו כותב עליה. ההשוואה שכולם כותבים עליה היא מחיר: Kimi K3 במחיר 3 דולר למיליון טוקני קלט ו-15 דולר לפלט, לעומת Claude Sonnet 5.5 במחיר 2 דולר ו-10 דולר, וזה ניצחון ברור עבור Anthropic במחירון. אבל Kimi K3 הוא מודל במשקלים פתוחים מסוג תערובת מומחים עם 2.8 טריליון פרמטרים, שאפשר להוריד ולהריץ בתוך הגבול שלך, ו-Claude Sonnet 5.5 הוא מודל סגור שזמין בארבעה עננים. בין מודל סגור זול יותר למודל יקר יותר שניתן להוריד, ההחלטה כלל לא מבוססת על מחיר לטוקן.
מה כל אחד מהם, פסקה אחת לכל אחד
Claude Sonnet 5.5 הוא המודל השני בדור 5.5 של Anthropic, לאחר ש-Claude Opus 5.5 הגיע אל Claude API חמישה ימים לאחר אותה השקה. הוא מושק בתור claude-sonnet-5-5 ברחבי Claude API, Amazon Bedrock, Google Cloud ו-Microsoft Foundry, שומר על חלון הקשר של מיליון טוקנים ותקרת פלט סינכרוני של 128K, ומחזיק בדיוק בתמחור של Claude Sonnet 5: $2 קלט, $10 פלט, $0.20 למיליון עבור קריאות מטמון. חשיבה אדפטיבית פועלת כברירת מחדל במאמץ גבוה. הוא זמין עם אפס שמירת נתונים, ו-Artificial Analysis מעניקה לו מדד אינטליגנציה של 56 בגרסת v4.3.2 שלה — שלישי מבין 216 המודלים שהיא מודדת.

Kimi K3 הוא דגל המוצר של Moonshot AI: מודל תערובת-מומחים (mixture-of-experts) עם 2.8 טריליון פרמטרים, שמפעיל כ-104 מיליארד פרמטרים לכל טוקן, עם חלון הקשר של מיליון טוקנים והבנה חזותית מקורית. הוא נבנה לקידוד בטווח ארוך ולעבודת ידע רב-שלבית, ו-Moonshot ממקמת אותו בשמו למסגרות של סוכני תכנות. הוא מדבר בפורמט ה-API של OpenAI, חושף reasoning_effort כבקרת החשיבה היחידה שלו, והוא בעל משקולות פתוחות תחת רישיון Kimi K3 — וזה לא אותו דבר כמו קוד פתוח, וההבדל הזה הוא החלק שכדאי לקרוא לפני שבונים עליו.
כרטיס התעריפים, והמספר שמתחתיו
השוו בין השניים זה מול זה לפי הקריטריונים שקובעים הצעת חוק ולא כותרת:
• מחיר קלט — Claude Sonnet 5.5 $2 למיליון לעומת Kimi K3 $3 למיליון
• מחיר פלט — Claude Sonnet 5.5 10$ למיליון לעומת Kimi K3 15$ למיליון
• קריאות מטמון — $0.20 למיליון לעומת $0.30 למיליון
• חלון הקשר — 1,000,000 טוקנים לעומת 1,048,576 טוקנים
• משקלים — קנייניים, ארבע פלטפורמות מתארחות לעומת משקלים פתוחים תחת רישיון Kimi K3
• מדד האינטליגנציה — Claude Sonnet 5.5 56 לעומת Kimi K3 44 באותה גרסה v4.3.2
• עלות לכל משימת Intelligence Index — Claude Sonnet 5.5 $7.60 לעומת Kimi K3 $2.00
• מילוליות במדד — Claude Sonnet 5.5 410M טוקנים בפלט לעומת Kimi K3 160M
הזוג האחרון הזה הוא ההיפוך שכדאי להתעכב עליו. המודל של Anthropic זול ב-50% בקלט וזול בשליש בפלט, ובכל זאת עולה פי 3.8 להשלים את אותה הערכה, מפני שהוא מוציא פי 2.6 טוקנים כדי להגיע לשם. בציון המשולב הוא גם גבוה בשתים עשרה נקודות, כך שאין מדובר במודל בזבזני שלא משיג דבר. מדובר בשני מודלים שאי אפשר להשוות את התנהגות העלויות שלהם באמצעות קריאת שני כרטיסי תעריפים, וזו הסיבה שקיים נתון משימת האינדקס.
אף אחד ממנייני הטוקנים האלה לא יהיה מניין הטוקנים שלך. התיעוד של Moonshot עצמו מציין שעומק החשיבה של K3 נקבע על ידי reasoning_effort ולא על ידי דגימה, ואותו הדבר נכון למעשה גם לגבי פרמטר המאמץ של Claude Sonnet 5.5 — כך שבשני המודלים המנוף הבודד הגדול ביותר על החשבון שלך הוא הגדרת מאמץ, לא משא ומתן על מחיר.

שגיאות ה-400, בפירוט

הסירוב המשותף לפרמטרי דגימה הוא החפיפה המעשית ביותר כאן, משום שזהו הכשל שמתגלה בבוקר שאחרי החלפת מודל.
ב-Claude Sonnet 5.5, החוקים מפורשים ובלתי מתפשרים. ערך שאינו ברירת מחדל של temperature, top_p או top_k מחזיר 400. שליחת thinking: {"type": "disabled"} מחזירה 400 שמצביעה על between_tools, הגדרת החשיבה החדשה והנמוכה ביותר, שמתקבלת ברמות מאמץ low, medium ו-high אך נדחית ב-xhigh או max. שימוש מאולץ בכלי — tool_choice מוגדר ל-"any" או לכלי בעל שם — מחזיר 400 עם ההודעה "tool_choice: type \"tool\" and \"any\" are not supported for this model", והתיקון הוא auto בתוספת שימוש קפדני בכלים או פלטים מובנים. ועוד: בלוקי חשיבה כעת כבולים למודל ולחשבון שיצרו אותם, כך שניתן להעביר שיחה מ-Claude Sonnet 5 אל Sonnet 5.5 כשהחשיבה שלה שלמה, אך לא ניתן להעביר את החשיבה הזו למשפחת מודלים אחרת, וקידומת שנערכה יכולה להפוך הרצה חוזרת ל-400.
ב-Kimi K3 המשטח קטן יותר אך ההשלכות דומות. אין פרמטרי דגימה לשלוח, כך שכל לקוח שמקודד פרמטר כזה באופן קשיח כבר שולח פרמטר שהמודל אינו קורא. עומק החשיבה הוא שדה reasoning_effortברמה העליונה במקום.
שתי השינויים מצביעים לאותו כיוון: הגישה של כפתור דטרמיניסטי לשליטה בפרומפט מוחלפת בחוגת מאמץ בצד המודל. כל pipeline שכיוון את עצמו עם temperature 0.2 וזרע קבוע צריך לעבור כיוונון מחדש לפי רמת מאמץ בשני המודלים האלה, והכיוונון מחדש הוא ההגירה.
מה משקלים פתוחים בעצם נותנים לך כאן
הסיבה לשקול את Kimi K3 לעומת מודל סגור זול יותר ובעל ציון גבוה יותר אינה היכולת ואינה המחיר. זה הגבול.
הרצת K3 בתוך התשתית שלך עצמך משמעה שפרומפטים, מסמכים ופלטים לעולם אינם יוצאים מרשת שנמצאת בשליטתך, וזהו דיון שונה לחלוטין מהסכם אי-שמירת נתונים עם ספק. זה גם אומר שאיש לא יכול להוציא את המודל מכלל שימוש מאחורי הגב שלך — Claude Sonnet 5.5 מגיע עם התחייבות של Anthropic שלפיה הוא לא ייצא מכלל שימוש לפני 28 בספטמבר 2027, ולצ'קפוינט שהורד אין תאריך כזה. וזה אומר שעקומת העלות השולית משתטחת: אחרי החומרה, הטוקנים הם בחינם, וזה המבנה היחיד שבו מודל עם 2.8 טריליון פרמטרים יכול בכלל להפוך לאפשרות הזולה.
הרישיון הוא מה שאתם בעצם חותמים עליו. Kimi K3 הוא מודל במשקולות פתוחות, לא קוד פתוח, ו-Moonshot אינה משתמשת במונח האחרון. רישיון Kimi K3 הוא רחב עבור רוב השימושים, אך עסק של מודל כשירות (model-as-a-service) שמעל סף הכנסות מתגלגל זקוק להסכם מסחרי נפרד, ומוצרים שחוצים ספי משתמשים או הכנסות גדולים חייבים להציג ייחוס "Kimi K3". לקרוא לו "בעל רישיון MIT" זה אי-דיוק מתקופת K2 שעדיין נפוץ. אם אתם מתכננים לבנות על המשקולות ולא לקרוא ל-API, מדובר בבדיקה משפטית ולא בהערת שוליים.
והמשקלים גדולים מספיק כדי שאירוח עצמי יהיה החלטה הונית. מודל MoE בעל 2.8T פרמטרים ועם כ־104B פרמטרים פעילים אינו פריסה של שרת בודד, והמאמץ הנדרש להקים אותו הוא העלות האמיתית של האפשרות — כזו שמגמדת את הפער של 5$ למיליון בתעריפי הפלט.
היכן OrcaRouter מתאים
רוב הצוותים שבוחנים את שני אלה לא רוצים לבחור בין API מנוהל לרכישת חומרה. הם רוצים לנתב.
OrcaRouter הוא נקודת קצה אחת תואמת OpenAI מעל יותר מ-200 מודלים, עם מחיר המחירון של הספקים כפי שהוא וללא תוספת, כך ששינוי בתעריף של ספק באחד הצדדים נכנס לתוקף באותו יום ולא במחזור החיוב הבא. Kimi K3 נמצא בקטלוג מאז יולי במחיר של Moonshot עצמה 3$ / 15$, עם זמן p50 מדוד לטוקן ראשון של כשמונה שניות וכ-371.9 מיליון טוקנים שעברו דרכו בשבוע האחרון. Claude Sonnet 5 — המודל שרוב התעבורה של Claude API עדיין פועלת עליו, בקצב מדוד של 150 טוקני פלט לשנייה — ניתן לנתב אליו מאז 30 ביוני במחיר של Anthropic, 2$ / 10$.
Claude Sonnet 5.5 עדיין אינו בקטלוג שלנו. היכן שזה נכון, אמרו זאת ועקפו את זה: ה-API של הספק עצמו הוא הדרך אליו, והדרך לבדוק אותו בלי להתחייב היא אחוז מהתעבורה מאחורי מעבר אוטומטי לגיבוי, עם Claude Sonnet 5 או Kimi K3 כגיבוי. אם הסיבה שלך לבחון את K3 היא הגבול ולא התעריף, המשקלים ניתנים להורדה היום וה-API הוא פתרון זמני — שזו החלטה לגבי התשתית שלך, לא לגבי השוואת מודלים.
המסקנה, מחולקת לפי מה שאתם בעצם קונים
בחרו ב-Claude Sonnet 5.5 כשהעבודה היא בעלת הקשר ארוך ועמוסת פלט, כשהדבר שנרכש הוא שנים-עשר נקודות של מדד משולב, וכשממשק API מנוהל עם אפס שמירת נתונים עובר את הסקירה שלכם. הקצו תקציב להרגל הטוקנים — 410 מיליון טוקנים במדד לעומת 160 מיליון של K3 הוא מכפיל של ממש — והקצו יום עבור השינויים בשימוש בכלים ובבלוקי החשיבה.
בחרו ב-Kimi K3 כשהגבול הוא הדרישה, כשאתם רוצים נקודת ביקורת שאיש מהספקים לא יכול להוציא מכלל שימוש, או כשעומס העבודה שלכם הוא קידוד סוכני בהיקף גבוה, שבו ההפרש בין $2.00 למשימת אינדוקס ל-$7.60 הולך ומצטבר. השלימו עם העובדה שמדובר במודל בעל 2.8T פרמטרים שאתם צריכים לארח, שהרישיון שלו כולל סעיפי ייחוס והכנסות, ושהוא מדורג מתחת לדרג של Anthropic במדד המשולב.
מה שאף אחת מהאפשרויות לא חומקת ממנו הוא הפסקה הראשונה: פרמטרי הדגימה נעלמו בשתיהן, וחוגת המאמץ היא הבקרה שהחליפה אותם. איזו משתי האפשרויות האלה שתבחר, זה השינוי שהקוד שלך צריך.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
