כרטיס Hero שכותרתו Claude Sonnet 5.5 מול Kimi K3, כתובית משנה: אף אחד מהמודלים לא יקבל את הגדרת הטמפרטורה שלך, עם תגיות המציגות $2 / $10 סגור מול $3 / $15 משקולות פתוחות, Index 56 מול 44, ואף אחד מהם לא מקבל טמפרטורה, ובכיתוב תחתון ציטוט של Artificial Analysis v4.3.2 ותמחור ספקים.
Guides & Insights

Claude Sonnet 5.5 לעומת Kimi K3: אף אחד מהמודלים לא יקבל את הגדרת הטמפרטורה שלך

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הנה השוואה שבה שני המודלים מסכימים על משהו שכך או כך ישבור את הקוד שלכם. Claude Sonnet 5.5, שיצא לאור ב-28 בספטמבר 2026, דוחה כל בקשה שמגדירה temperature, top_p או top_k לערך שאינו ברירת המחדל, עם שגיאת 400. Kimi K3, שזמין לשימוש כללי מ-Moonshot AI מאז אמצע יולי 2026, אינו מקבל כלל פרמטרי דגימה — לא temperature, לא top_p, לא seed — וחושף את עומק החשיבה רק דרך reasoning_effort — בקרה. שתי מעבדות שונות, שתי ארכיטקטורות שונות, ומסקנה משותפת אחת: מתגי הדגימה שרוב האינטגרציות עדיין מגדירות מתוך הרגל נעלמו בשניהם.

זו לא ההשוואה שמישהו כותב עליה. ההשוואה שכולם כותבים עליה היא מחיר: Kimi K3 במחיר 3 דולר למיליון טוקני קלט ו-15 דולר לפלט, לעומת Claude Sonnet 5.5 במחיר 2 דולר ו-10 דולר, וזה ניצחון ברור עבור Anthropic במחירון. אבל Kimi K3 הוא מודל במשקלים פתוחים מסוג תערובת מומחים עם 2.8 טריליון פרמטרים, שאפשר להוריד ולהריץ בתוך הגבול שלך, ו-Claude Sonnet 5.5 הוא מודל סגור שזמין בארבעה עננים. בין מודל סגור זול יותר למודל יקר יותר שניתן להוריד, ההחלטה כלל לא מבוססת על מחיר לטוקן.

מה כל אחד מהם, פסקה אחת לכל אחד

Claude Sonnet 5.5 הוא המודל השני בדור 5.5 של Anthropic, לאחר ש-Claude Opus 5.5 הגיע אל Claude API חמישה ימים לאחר אותה השקה. הוא מושק בתור claude-sonnet-5-5 ברחבי Claude API, Amazon Bedrock, Google Cloud ו-Microsoft Foundry, שומר על חלון הקשר של מיליון טוקנים ותקרת פלט סינכרוני של 128K, ומחזיק בדיוק בתמחור של Claude Sonnet 5: $2 קלט, $10 פלט, $0.20 למיליון עבור קריאות מטמון. חשיבה אדפטיבית פועלת כברירת מחדל במאמץ גבוה. הוא זמין עם אפס שמירת נתונים, ו-Artificial Analysis מעניקה לו מדד אינטליגנציה של 56 בגרסת v4.3.2 שלה — שלישי מבין 216 המודלים שהיא מודדת.

Two-column scoreboard for Claude Sonnet 5.5 and Kimi K3 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, closed weights on four clouds. Right column Kimi K3: input $3.00 per million, output $15.00 per million, 1M-token context, AA Intelligence Index 44, cost per Index task $2.00, open weights under the Kimi K3 License. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Kimi K3 הוא דגל המוצר של Moonshot AI: מודל תערובת-מומחים (mixture-of-experts) עם 2.8 טריליון פרמטרים, שמפעיל כ-104 מיליארד פרמטרים לכל טוקן, עם חלון הקשר של מיליון טוקנים והבנה חזותית מקורית. הוא נבנה לקידוד בטווח ארוך ולעבודת ידע רב-שלבית, ו-Moonshot ממקמת אותו בשמו למסגרות של סוכני תכנות. הוא מדבר בפורמט ה-API של OpenAI, חושף reasoning_effort כבקרת החשיבה היחידה שלו, והוא בעל משקולות פתוחות תחת רישיון Kimi K3 — וזה לא אותו דבר כמו קוד פתוח, וההבדל הזה הוא החלק שכדאי לקרוא לפני שבונים עליו.

כרטיס התעריפים, והמספר שמתחתיו

השוו בין השניים זה מול זה לפי הקריטריונים שקובעים הצעת חוק ולא כותרת:

• מחיר קלט — Claude Sonnet 5.5 $2 למיליון לעומת Kimi K3 $3 למיליון

• מחיר פלט — Claude Sonnet 5.5 10$ למיליון לעומת Kimi K3 15$ למיליון

• קריאות מטמון — $0.20 למיליון לעומת $0.30 למיליון

• חלון הקשר — 1,000,000 טוקנים לעומת 1,048,576 טוקנים

• משקלים — קנייניים, ארבע פלטפורמות מתארחות לעומת משקלים פתוחים תחת רישיון Kimi K3

• מדד האינטליגנציה — Claude Sonnet 5.5 56 לעומת Kimi K3 44 באותה גרסה v4.3.2

• עלות לכל משימת Intelligence Index — Claude Sonnet 5.5 $7.60 לעומת Kimi K3 $2.00

• מילוליות במדד — Claude Sonnet 5.5 ‏410M טוקנים בפלט לעומת Kimi K3 ‏160M

הזוג האחרון הזה הוא ההיפוך שכדאי להתעכב עליו. המודל של Anthropic זול ב-50% בקלט וזול בשליש בפלט, ובכל זאת עולה פי 3.8 להשלים את אותה הערכה, מפני שהוא מוציא פי 2.6 טוקנים כדי להגיע לשם. בציון המשולב הוא גם גבוה בשתים עשרה נקודות, כך שאין מדובר במודל בזבזני שלא משיג דבר. מדובר בשני מודלים שאי אפשר להשוות את התנהגות העלויות שלהם באמצעות קריאת שני כרטיסי תעריפים, וזו הסיבה שקיים נתון משימת האינדקס.

אף אחד ממנייני הטוקנים האלה לא יהיה מניין הטוקנים שלך. התיעוד של Moonshot עצמו מציין שעומק החשיבה של K3 נקבע על ידי reasoning_effort ולא על ידי דגימה, ואותו הדבר נכון למעשה גם לגבי פרמטר המאמץ של Claude Sonnet 5.5 — כך שבשני המודלים המנוף הבודד הגדול ביותר על החשבון שלך הוא הגדרת מאמץ, לא משא ומתן על מחיר.

Anthropic Claude Platform documentation page for Claude Sonnet 5.5 showing the summary line the best combination of speed and intelligence, the model ID claude-sonnet-5-5, a 1M-token context window, a 128K maximum output, an input price of $2 per million tokens and an output price of $10 per million tokens, with links to the What is new and Migration guide pages.

שגיאות ה-400, בפירוט

OrcaRouter model page for kimi/kimi-k3, attributed to MoonshotAI and dated 2026-07-15, showing a 1M-token context window, text and image input, Vision, Tools, JSON and Reasoning capability tags, an input price of $3.00 and output price of $15.00 per million tokens, a p50 time to first token of 8.20 seconds, and 371.9M tokens of traffic in the last seven days.

הסירוב המשותף לפרמטרי דגימה הוא החפיפה המעשית ביותר כאן, משום שזהו הכשל שמתגלה בבוקר שאחרי החלפת מודל.

ב-Claude Sonnet 5.5, החוקים מפורשים ובלתי מתפשרים. ערך שאינו ברירת מחדל של temperature, top_p או top_k מחזיר 400. שליחת thinking: {"type": "disabled"} מחזירה 400 שמצביעה על between_tools, הגדרת החשיבה החדשה והנמוכה ביותר, שמתקבלת ברמות מאמץ low, medium ו-high אך נדחית ב-xhigh או max. שימוש מאולץ בכלי — tool_choice מוגדר ל-"any" או לכלי בעל שם — מחזיר 400 עם ההודעה "tool_choice: type \"tool\" and \"any\" are not supported for this model", והתיקון הוא auto בתוספת שימוש קפדני בכלים או פלטים מובנים. ועוד: בלוקי חשיבה כעת כבולים למודל ולחשבון שיצרו אותם, כך שניתן להעביר שיחה מ-Claude Sonnet 5 אל Sonnet 5.5 כשהחשיבה שלה שלמה, אך לא ניתן להעביר את החשיבה הזו למשפחת מודלים אחרת, וקידומת שנערכה יכולה להפוך הרצה חוזרת ל-400.

ב-Kimi K3 המשטח קטן יותר אך ההשלכות דומות. אין פרמטרי דגימה לשלוח, כך שכל לקוח שמקודד פרמטר כזה באופן קשיח כבר שולח פרמטר שהמודל אינו קורא. עומק החשיבה הוא שדה reasoning_effortברמה העליונה במקום.

שתי השינויים מצביעים לאותו כיוון: הגישה של כפתור דטרמיניסטי לשליטה בפרומפט מוחלפת בחוגת מאמץ בצד המודל. כל pipeline שכיוון את עצמו עם temperature 0.2 וזרע קבוע צריך לעבור כיוונון מחדש לפי רמת מאמץ בשני המודלים האלה, והכיוונון מחדש הוא ההגירה.

מה משקלים פתוחים בעצם נותנים לך כאן

הסיבה לשקול את Kimi K3 לעומת מודל סגור זול יותר ובעל ציון גבוה יותר אינה היכולת ואינה המחיר. זה הגבול.

הרצת K3 בתוך התשתית שלך עצמך משמעה שפרומפטים, מסמכים ופלטים לעולם אינם יוצאים מרשת שנמצאת בשליטתך, וזהו דיון שונה לחלוטין מהסכם אי-שמירת נתונים עם ספק. זה גם אומר שאיש לא יכול להוציא את המודל מכלל שימוש מאחורי הגב שלך — Claude Sonnet 5.5 מגיע עם התחייבות של Anthropic שלפיה הוא לא ייצא מכלל שימוש לפני 28 בספטמבר 2027, ולצ'קפוינט שהורד אין תאריך כזה. וזה אומר שעקומת העלות השולית משתטחת: אחרי החומרה, הטוקנים הם בחינם, וזה המבנה היחיד שבו מודל עם 2.8 טריליון פרמטרים יכול בכלל להפוך לאפשרות הזולה.

הרישיון הוא מה שאתם בעצם חותמים עליו. Kimi K3 הוא מודל במשקולות פתוחות, לא קוד פתוח, ו-Moonshot אינה משתמשת במונח האחרון. רישיון Kimi K3 הוא רחב עבור רוב השימושים, אך עסק של מודל כשירות (model-as-a-service) שמעל סף הכנסות מתגלגל זקוק להסכם מסחרי נפרד, ומוצרים שחוצים ספי משתמשים או הכנסות גדולים חייבים להציג ייחוס "Kimi K3". לקרוא לו "בעל רישיון MIT" זה אי-דיוק מתקופת K2 שעדיין נפוץ. אם אתם מתכננים לבנות על המשקולות ולא לקרוא ל-API, מדובר בבדיקה משפטית ולא בהערת שוליים.

והמשקלים גדולים מספיק כדי שאירוח עצמי יהיה החלטה הונית. מודל MoE בעל 2.8T פרמטרים ועם כ־104B פרמטרים פעילים אינו פריסה של שרת בודד, והמאמץ הנדרש להקים אותו הוא העלות האמיתית של האפשרות — כזו שמגמדת את הפער של 5$ למיליון בתעריפי הפלט.

היכן OrcaRouter מתאים

רוב הצוותים שבוחנים את שני אלה לא רוצים לבחור בין API מנוהל לרכישת חומרה. הם רוצים לנתב.

OrcaRouter הוא נקודת קצה אחת תואמת OpenAI מעל יותר מ-200 מודלים, עם מחיר המחירון של הספקים כפי שהוא וללא תוספת, כך ששינוי בתעריף של ספק באחד הצדדים נכנס לתוקף באותו יום ולא במחזור החיוב הבא. Kimi K3 נמצא בקטלוג מאז יולי במחיר של Moonshot עצמה 3$ / 15$, עם זמן p50 מדוד לטוקן ראשון של כשמונה שניות וכ-371.9 מיליון טוקנים שעברו דרכו בשבוע האחרון. Claude Sonnet 5 — המודל שרוב התעבורה של Claude API עדיין פועלת עליו, בקצב מדוד של 150 טוקני פלט לשנייה — ניתן לנתב אליו מאז 30 ביוני במחיר של Anthropic, 2$ / 10$.

Claude Sonnet 5.5 עדיין אינו בקטלוג שלנו. היכן שזה נכון, אמרו זאת ועקפו את זה: ה-API של הספק עצמו הוא הדרך אליו, והדרך לבדוק אותו בלי להתחייב היא אחוז מהתעבורה מאחורי מעבר אוטומטי לגיבוי, עם Claude Sonnet 5 או Kimi K3 כגיבוי. אם הסיבה שלך לבחון את K3 היא הגבול ולא התעריף, המשקלים ניתנים להורדה היום וה-API הוא פתרון זמני — שזו החלטה לגבי התשתית שלך, לא לגבי השוואת מודלים.

המסקנה, מחולקת לפי מה שאתם בעצם קונים

בחרו ב-Claude Sonnet 5.5 כשהעבודה היא בעלת הקשר ארוך ועמוסת פלט, כשהדבר שנרכש הוא שנים-עשר נקודות של מדד משולב, וכשממשק API מנוהל עם אפס שמירת נתונים עובר את הסקירה שלכם. הקצו תקציב להרגל הטוקנים — 410 מיליון טוקנים במדד לעומת 160 מיליון של K3 הוא מכפיל של ממש — והקצו יום עבור השינויים בשימוש בכלים ובבלוקי החשיבה.

בחרו ב-Kimi K3 כשהגבול הוא הדרישה, כשאתם רוצים נקודת ביקורת שאיש מהספקים לא יכול להוציא מכלל שימוש, או כשעומס העבודה שלכם הוא קידוד סוכני בהיקף גבוה, שבו ההפרש בין $2.00 למשימת אינדוקס ל-$7.60 הולך ומצטבר. השלימו עם העובדה שמדובר במודל בעל 2.8T פרמטרים שאתם צריכים לארח, שהרישיון שלו כולל סעיפי ייחוס והכנסות, ושהוא מדורג מתחת לדרג של Anthropic במדד המשולב.

מה שאף אחת מהאפשרויות לא חומקת ממנו הוא הפסקה הראשונה: פרמטרי הדגימה נעלמו בשתיהן, וחוגת המאמץ היא הבקרה שהחליפה אותם. איזו משתי האפשרויות האלה שתבחר, זה השינוי שהקוד שלך צריך.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית