כרטיס הירו שכותרתו Claude Sonnet 5.5 מול Grok 4.6, עם כתובית משנה: כרטיס התעריפים אומר דבר אחד וחשבון הטוקנים אומר דבר אחר, עם תגיות שקוראות פלט $10 מול $6, עלות למשימה $7.60 מול $1.86, ו-Index 56 מול 44, וכותרת תחתונה המציינת את Artificial Analysis v4.3.2 ותמחור ספקים.
Guides & Insights

Claude Sonnet 5.5 מול Grok 4.6: המחירון אומר דבר אחד, חשבון הטוקנים אומר אחר

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

החשבון בכותרת נראה סגור עוד לפני שהמאמר מתחיל. Grok 4.6 עולה 2 דולר למיליון טוקני קלט ו-6 דולר למיליון טוקני פלט; Claude Sonnet 5.5 עולה 2 דולר ו-10 דולר. המודל של Space​XAI זול יותר בפלט ב-40%, משתווה בקלט, וזמין באופן כללי מאז 12 באוגוסט 2026 — מספיק זמן כדי שהמוזרויות שלו מתועדות ולא בגדר שמועות. המודל של Anthro​pic הגיע ב-28 בספטמבר 2026, יום לפני כתיבת השורות האלה, והוא החדש ביותר בקטגוריה בפער ניכר.

ואז אתה מגיע לנתוני היעילות הבלתי־תלויים והסדר מתהפך. Artificial Analysis מודדת מודלים בדרגת GPT ו-Claude על בסיס עלות לכל משימה, לצד ה-Intelligence Index שלה, ובגרסת v4.3.2 שני המודלים כאן הם 1.86 דולר למשימת מדד עבור Grok 4.6 ו-7.60 דולר עבור Claude Sonnet 5.5. המודל עם כרטיס התעריפים הזול יותר הוא היקר להפעלה, פי ארבעה. להבין למה, ומתי ההיפוך הזה מתקיים ומתי לא — זה כל ההשוואה.

שני דגמים, שני מיקומים במשפחותיהם

Grok 4.6 הוא ספינת הדגל הנוכחית של סדרת Grok — התיעוד למפתחים של SpaceXAI עצמה מפרט אותו כעדכני ביותר, והוא החליף את Grok 4.5 עם אותו חלון הקשר של 500,000 טוקנים, אותם משטחי קלט של טקסט, תמונה וקבצים, ואותו תמחור בסיס. הוא תומך במאמץ חשיבה ניתן להגדרה, בקריאה מובנית לכלים, בפלטים מובנים ובמלוא משטח הדגימה, ובהיותו מודל OpenAI Responses מהשורה הראשונה הוא משתלב במסגרות סוכנים קיימות בלי שכבת תרגום. ב-Artificial Analysis הוא מופיע עם מדד אינטליגנציה של 44, מדורג במקום ה-31 מתוך 216 המודלים שהיא מודדת, עם נתון GPQA Diamond של 94.9%.

Two-column scoreboard for Claude Sonnet 5.5 and Grok 4.6 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, verbosity 410M output tokens. Right column Grok 4.6: input $2.00 per million, output $6.00 per million, 500K-token context, AA Intelligence Index 44, cost per Index task $1.86, verbosity 94M output tokens. A footer line reads Index, cost per task and verbosity per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 הוא המוצר השני בדור ה-5.5 של Anthropic, והמודל שהחברה מציבה כשילוב הטוב ביותר של מהירות ואינטליגנציה בהיצע שלה. הוא מוצע בתור claude-sonnet-5-5/ ב-Claude API ובשלושת העננים הגדולים, כולל חלון הקשר של מיליון טוקנים עם תקרת פלט סינכרוני של 128K, שומר על התעריפים של 2$ / 10$ של Claude Sonnet 5 עבור קלט, פלט ומטמון, וזמין עם אפס שמירת נתונים. באותה גרסת אינדקס הוא מקבל ציון 56 ומדורג שלישי מתוך 216.

אז השניים לא ממש נמצאים באותו שוק. האחד הוא מודל חזית של 500,000 טוקנים שמוצע למכירה כבר שבעה שבועות בתעריף חסכוני. האחר הוא דרג שימוש כללי של 1M טוקנים שלא עולה יותר לטוקן מקודמו ומקבל ציון גבוה בשתים עשרה נקודות במדד המשולב. בכל זאת שווה לערוך את ההשוואה, מפני ששניהם מודלים שעלות הקלט שלהם היא $2, וזו הנקודה שבה החלטות רכש מתחילות בפועל.

הפער של פי ארבעה שאיש לא שם על שקופית

כרטיסי תעריפים מתמחרים טוקנים. חשבונות נקובים במשימות, ומספר הטוקנים שמודל מוציא כדי להגיע לתשובה הוא בחירה עיצובית ולא קבוע. שם שני אלה נפרדים, והמספרים שנמדדו חדים:

• תעריף פלט — Claude Sonnet 5.5 $10 למיליון לעומת Grok 4.6 $6 למיליון

• עלות לכל משימה של Intelligence Index — Claude Sonnet 5.5 $7.60 לעומת Grok 4.6 $1.86

• רמת הפירוט במדד — Claude Sonnet 5.5 ‏410M טוקני פלט לעומת Grok 4.6 ‏94M

• מדד האינטליגנציה — Claude Sonnet 5.5 56 לעומת Grok 4.6 44, שניהם על v4.3.2

• מהירות פלט — Grok 4.6 נמדד ב-67.7 טוקנים לשנייה לעומת חציון של 82.7; Anthropic מדווחת ש-Claude Sonnet 5.5 מייצר פלט מהיר ביותר מ-30% מ-Claude Sonnet 5, שאותו מדדה Artificial Analysis ב-78.7 טוקנים לשנייה

קו המילוליות הוא המנגנון. מודל שפולט פי ארבעה טוקנים לא זקוק לקצב פלט גבוה ב-67% כדי לעלות פי ארבעה לכל משימה — אבל זה עוזר, ושתי ההשפעות מצביעות לאותו כיוון כאן. המסגור של Anthropic עצמה תומך בפרשנות הזו ולא סותר אותה: חומר ההשקה טוען ש-Claude Sonnet 5.5 "עולה עד 30% פחות לכל משימה" מ-Claude Sonnet 5 במחירים זהים לכל טוקן, וזו טענה לגבי מספרי טוקנים, לא תעריפים. מול בסיס חיצוני רזה בהרבה, אותה תכונה הופכת לסיכון העלות הגדול ביותר של המודל.

שום דבר מזה לא מעלים את פער המדד. שתים עשרה נקודות במדד משולב הן הבדל אמיתי ביכולת, ומשימה זולה יותר שנכשלת אינה זולה יותר. זה כן אומר שהשאלה הכנה אינה "איזה תעריף נמוך יותר" אלא "כמה טוקנים דורשת המשימה הקשה יותר", ומספר כזה קיים רק אחרי שאתה מריץ את עומס העבודה שלך עצמך.

Artificial Analysis model page for Claude Sonnet 5 (Adaptive Reasoning, Max Effort), released June 2026, showing an Intelligence Index of 38, an output speed of 78.7 tokens per second against an average of 83, a cost of $2.00 per million input tokens and $10.00 per million output tokens, $5.09 per Intelligence Index task, a verbosity of 370M output tokens, and a 1M-token context window.

הקשר, מאמץ וצורת האינטגרציה

ההבדל השני הוא ארכיטקטוני, והוא קובע איזו מהשתיים תוכל לאמץ מבלי לשכתב דבר.

OrcaRouter model page for grok/grok-4.6, attributed to SpaceXAI and dated 2026-08-12, showing a 500K-token context window, text, image and file input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 3.00 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

Claude Sonnet 5.5 משנה שישה היבטי התנהגות לעומת Claude Sonnet 5, וחמישה מהם שוברי תאימות. שליחת thinking: {"type": "disabled"}/ מחזירה כעת 400 ויש להחליף אותה ב-between_tools/. שימוש כפוי בכלי — tool_choice/ של "any"/ או של כלי בעל שם — נדחה על הסף, כך שלולאה שמאלצת קריאה תקפה-לסכימה חייבת לעבור ל-auto/ עם שימוש קפדני בכלים או פלטים מובנים. הכלי הישן יותר computer_20251124/ לשימוש במחשב נדחה ב-Claude API וב-Google Cloud. בלוקי חשיבה כרוכים כעת במודל ובחשבון שיצרו אותם, כך ששיחה יכולה לשאת את הנמקתה קדימה מ-Claude Sonnet 5 אך לא לצדדים אל משפחת מודלים אחרת. וכלי היועץ אינו מקבל עוד את Claude Opus 4.8, Claude Opus 4.7 או Claude Sonnet 5 כיועצים מאחורי מריץ Sonnet 5.5.

Grok 4.6 לא דורש דבר מכל זה. זהו מודל בפורמט OpenAI ששומר על משטח הדגימה במלואו, והמעבר מ-Grok 4.5 הוא שינוי במחרוזת המודל. עם זאת, למבנה העלויות שלו יש עוקץ, והוא תמונת ראי של זה של Anthropic: תעריף ה-$2 / $6 חל עד 200,000 אסימוני קלט, וכל מה שמעבר לכך מחויב ב-$4 / $12. Claude Sonnet 5.5 גובה את התעריף הסטנדרטי לאורך כל חלון ה-1M.

הצב את שני המבנים זה לצד זה, והבחירה מפסיקה להיות בשאלה איזה ספק זול יותר:

• פרומפטים קצרים, פלט צפוף — הרגל הטוקנים החסכני יותר וקצב הפלט הנמוך יותר של Grok 4.6 מנצחים באופן מכריע

קלטים ארוכים מאוד — התעריף הקבוע של 1M של Claude Sonnet 5.5 מתחיל לגבור על מדרגה מכפילה הרבה לפני מגבלת ההקשר

• פלטים בודדים גדולים — תקרת ה-128K של Sonnet 5.5 תואמת לזו של Grok 4.6, והיא מגיעה ל-300K ב-Message Batches API מאחורי ה-output-300k-2026-03-24/ כותרת

• קוד קיים בצורת OpenAI — ‏Grok 4.6 אינו דורש שינויים; ‏Sonnet 5.5 דורש את עבודת השימוש בכלים והחשיבה שלמעלה

להעביר את שניהם לאישור אחד

להחזיק השוואה בין שני ספקים בראש זה קל. להריץ אותה זה המקום שבו העלות מסתתרת: שני חשבונות, שתי מערכות מגבלות, שני ממשקי חיוב, וספירת טוקנים שצריכה להימדד פעמיים לפני שהיא בכלל אומרת משהו.

OrcaRouter מכניס את כל זה לנקודת קצה אחת תואמת OpenAI שמכסה יותר מ-200 מודלים, כאשר מחיר המחירון של הספק מועבר כמו שהוא וללא תוספת מחיר, כך ששינוי בתעריפים של הספק — בין בצד של Grok ובין בצד של Claude — נכנס לתוקף כאן באותו היום, ולא בחידוש החוזה הבא. כל סדרת Grok 4.x נמצאת בקטלוג בתעריפים של הספק עצמו, וניתן לנתב אל Claude Sonnet 5 מאז 30 ביוני בתעריפי 2$ / 10$ של Anthropic — המודל שעליו עדיין עוברת רוב התעבורה של Claude API, עם קצב של 150 טוקני פלט לשנייה וזמן p50 של כחמש שניות לטוקן הראשון.

Claude Sonnet 5.5 ספציפית עדיין אינו בקטלוג שלנו. עד שכן, הדרך אליו היא ה-API של הספק עצמו, והדרך לבדוק אותו בלי להמר על עומס עבודה על מודל שאף אחד לא בחן באופן עצמאי מעבר למדד משולב אחד היא לשלוח אליו אחוז מהתעבורה מאחורי מעבר אוטומטי בעת כשל, כאשר Grok 4.6 או Claude Sonnet 5 תופסים את מה שהוא מפיל. לנסות דרגה חדשה לגמרי הוא החלטת ניתוב, לא פרויקט הגירה.

מה לעשות עם המספרים

Grok 4.6 הוא המודל הטוב יותר לפנות אליו כשהמשימה קצרה, התפוקה צפופה, והאינטגרציה כבר מדברת בשפת OpenAI. הוא חסכני יותר באופן מדיד לכל משימה מכל דבר אחר בטווח המחירים הזה, בקרות הדגימה שלו נותרו שלמות, ושבעה שבועות של זמינות פירושם שדפוסי הכשל שלו כבר התגלו בידי אנשים אחרים.

Claude Sonnet 5.5 הוא המודל הטוב יותר כאשר הקלט עצום, כאשר הציון המשולב הוא הדבר שאתם קונים, או כאשר העבודה אייג'נטית מספיק כך שפער של שתים־עשרה נקודות במדד ותקרת פלט של 128K חשובים יותר מהבדל של פי ארבעה בעלות לכל משימה. רשימת הבדיקה למעבר אמיתית, והיא יום עבודה ולא עריכת מחרוזת מודל.

מה שיכריע את זה הוא מדידת טוקנים למשימה על התעבורה שלך, שתבוצע על שניהם. כל מספר במאמר הזה שמכריע את התוצאה — $1.86 מול $7.60, 94M מול 410M — הוא פרוקסי לאותו נתון, והוא היחיד מביניהם שאתה יכול להפיק בעצמך.

השוואות במאמר הזה4

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית