כרטיס הירו שכותרתו Claude Sonnet 5.5 מול Qwen3.8 Max, עם כותרת משנה: שישה שבועות, שתי דרגות, פסק דין אחד לגבי העלות, עם תגיות המציינות קלט $2 לשניהם, פלט $10 מול $6, ומדד 56 מול 45, ופוטר המציין את Artificial Analysis v4.3.2 ומחירי ספקים.
Guides & Insights

Claude Sonnet 5.5 לעומת Qwen3.8 Max: שישה שבועות, שתי רמות, הכרעה אחת בנושא עלות

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הריצו את החשבון על שלושה פרומפטים וההשוואה ברובה נפתרת עוד לפני שאתם מגיעים לבנצ'מרקים. קריאה קצרה לתשובת תמיכה: 2,000 טוקני קלט, 500 פלט. ב-Qwen3.8 Max במחיר $2 למיליון בקלט ו-$6 למיליון בפלט זה ארבע עשיריות של סנט; ב-Claude Sonnet 5.5 במחיר $2 ו-$10 זה תשע עשיריות. ריפקטור של מאגר קוד: 400,000 קלט, 30,000 פלט — ארבעים ושלושה סנט לעומת שמונים ושלושה. סשן סוכני ארוך שבאמת מנצל את התקציב שלו: שני מיליון טוקנים בקלט, 200,000 בפלט, כך ש-$5.20 לעומת $6.30 ברגע שהמספרים גדולים מספיק כדי שצד הקלט ישלוט.

הפער שמתחיל כהבדל של פי 2.25 במחיר הפלט מצטמצם לכ-פי 1.2 בקנה מידה אג'נטי, וההתרחבות הזו אינה קוריוז. Qwen3.8 Max ו-Claude Sonnet 5.5 הם שניהם מודלים של מיליון טוקנים עם תקרות פלט גבוהות במיוחד, שניהם מתומחרים ב-2 דולר למיליון בקלט, ושניהם שוחררו בתוך שמונה שבועות זה מזה — של הספק ב-3 באוגוסט 2026 עם רענון מתוארך ל-2 בספטמבר, ושל Anthro​pic ב-28 בספטמבר. ההבדל ביניהם אינו במחירון. הוא במה שכל אחד מהם מוציא כדי לסיים.

מה שוחרר, ומתי

Qwen3.8 Max הוא הדרג בעל היכולות הגבוהות ביותר של Alibaba עד היום. Alibaba ממקמת אותו ישירות מול GPT-5.5, Claude Opus 4.7 ו-Gemini 3.1 Pro במדריך ההגירה שלה, וממליצה עליו בכל פעם שמשימה דורשת את יכולות ההסקה החזקות ביותר הזמינות. הוא כולל חלון הקשר של 1M אסימונים, מקבל קלט טקסט, תמונה וווידאו, ופולט טקסט — אפשרות קלט הווידאו היא היכולת היחידה כאן שאין ל-Claude Sonnet 5.5. התמחור הוא 2 דולר למיליון קלט ו-6 דולר למיליון פלט, עם קריאות מטמון ב-0.25 דולר וכתיבות מטמון ב-2.50 דולר. לרשומה מ-3 באוגוסט בקטלוג שלנו מצטרפת גרסה מרעננת מ-2 בספטמבר, המסומנת כ-Qwen3.8 Max (0902), אשר נושאת את אותם תעריפים עיקריים ותקרת פלט של 131K.

Two-column scoreboard for Claude Sonnet 5.5 and Qwen3.8 Max across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, text and image input, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column Qwen3.8 Max: input $2.00 per million, output $6.00 per million, text image and video input, AA Intelligence Index 45, cost per Index task $5.41, September 2 2026 refresh. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 הוא המודל השני בדור 5.5 של Anthropic, שיצא ב-28 בספטמבר 2026, שישה ימים אחרי Claude Opus 5.5. הוא מושק בתור claude-sonnet-5-5 ב-Claude API וב-Amazon Bedrock, Google Cloud ו-Microsoft Foundry, עם חלון של 1M טוקנים, תקרת פלט סינכרוני של 128K שמתרחבת ל-300K ב-Message Batches API מאחורי output-300k-2026-03-24 הכותרת, והתעריפים של Claude Sonnet 5 נשמרו בדיוק: $2 קלט, $10 פלט, $0.20 קריאות מטמון, $2.50 כתיבות מטמון. אפס שמירת נתונים מההשקה, ופרישה לא לפני 28 בספטמבר 2027.

אז תעריף הקלט זהה, חלונות ההקשר באותו גודל, ושתי הספקיות התעדכנו בהפרש של חודש זו מזו. כל מה שמפריד ביניהן נמצא בצד הפלט של החשבון או בבנצ'מרקים.

מבחני ביצועים: טבלת ספקים לעומת מדד עצמאי

קיימים כאן שני סוגי ראיות והם אינם ניתנים להחלפה.

טבלת ההשקה של Anthropic מדווחת על ידי הספק, לא שוחזרה על ידי שום צד שלישי, ומכסה שמונה הערכות. השורות שחשובות

• Terminal-Bench 4.0 — Claude Sonnet 5.5 70.6% לעומת 10.3% של Claude Sonnet 5

• CursorBench 4.0 — 55.5% לעומת 34.1% של Claude Sonnet 5

• GDPval-AA v2.1 — 1844 לעומת 1449 עבור Claude Sonnet 5, 1846 עבור Claude Opus 5.5 ו-1487 עבור GPT-6 Sol

• Humanity's Last Exam, עם כלים — 64.5% לעומת 54.9%; Claude Opus 5.5 עומד על 67.7%

• OSWorld 2.1, חלקי — 80.1% לעומת 57.0%

• קרטוגרפיה, ללא כלים — 61.6% לעומת 15.6%

Alibaba אינה מפרסמת טבלה מקבילה ישירות בת ארבעה טורים, ולכן הנתונים היחידים שניתן להציב על אותו ציר הם העצמאיים. Artificial Analysis, מהדורת v4.3.2

• מדד האינטליגנציה המשולב — Claude Sonnet 5.5 56 במקום ה-3 מתוך 216; Qwen3.8 Max 45 במקום ה-27

• עלות לכל משימת Intelligence Index — $7.60 לעומת $5.41

• מהירות פלט — המודל של Anthropic פועל מול קו בסיס של Claude Sonnet 5 שנמדד ב־78.7 טוקנים לשנייה; Qwen3.8 Max נמדד ב־39.1

• אריכות — 410M טוקני פלט ב-Index לעומת 190M

הציונים של Qwen3.8 Max עצמו בכל הערכה הם מכובדים ולא שוליים: 92.8% ב-GPQA Diamond, 88.8% ב-Terminal-Bench 2.1, 80.3% בשחזור בהקשר ארוך, 47.8% ב-tau-banking. הוא מפגר במדד המשולב מכיוון שהוא אינו מנצח בשום דבר באופן מכריע, והשכבה החדשה יותר של Anthropic מנצחת בכמה דברים באופן מוחלט. שימו לב גם שהדף העצמאי של Qwen3.8 Max נושא תאריך יציאה של 2 בספטמבר 2026 וקריאת הקשר של 984K — הוא מתאר את רענון (0902), לא את בניית אוגוסט, וערבוב נתונים בין השניים יהיה טעות.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

מה שחסר משתי העמודות חשוב במידה שווה למה שיש בהן. איש לא שחזר באופן בלתי תלוי את המספרים של Anthropic עבור OSWorld או Terminal-Bench. אף אחד לא פרסם נתון של Chartography או CursorBench עבור Qwen3.8 Max. הציון המשולב הוא המספר היחיד שנמדד באותה דרך בשני המודלים, וזו בדיוק הסיבה שהנתון של עלות-למשימה שמתחתיו נושא משקל כה רב.

המספר שמכריע, והוא אינו מופיע באף אחד משני כרטיסי התעריפים

Artificial Analysis מחייבת את שני המודלים באותו אופן: מריצה את עשר ההערכות באינדקס, סופרת את הטוקנים, ומכפילה במחיר המחירון. Claude Sonnet 5.5 יוצא 7.60 דולר למשימה ו-Qwen3.8 Max יוצא 5.41 דולר, תוספת של 40% עבור המודל של Anthropic למרות ציון משולב גבוה יותר. נתוני האריכות מסבירים את הכיוון — 410 מיליון טוקנים לעומת 190 מיליון — ונתוני המהירות מסבירים את השאר: מודל שפולט פחות טוקנים ולוקח יותר זמן לכל טוקן אינו זה שמשלם על פלט בתעריף כפול.

טענת היעילות של Anthropic עצמה מתאימה לאותו סיפור ולא סותרת אותו. החברה אומרת ש-Claude Sonnet 5.5 מפיק פלט מהיר יותר ב-30%+ מ-Claude Sonnet 5 ועולה "עד 30% פחות לכל משימה" במחירים זהים — טענה על טוקנים לכל משימה, לא על תעריפים. השאלה אם היא מחזיקה מול מודל שצורך פחות ממחצית מספר הטוקנים היא בדיוק מה שהנתון של 7.60$ שואל, והרצה עצמאית אחת היא נקודת נתונים אחת.

ההשלכה המעשית: תעריף הפלט של 6 דולר לעומת 10 דולר הוא המספר שהרכש יסתכל עליו, והוא המספר בעל הערך הניבויי הנמוך ביותר במאמר. זה שכן מנבא הוא מספר הטוקנים לכל משימה בפרומפטים שלכם, ואף אחד מהספקים לא ימסור לכם אותו.

קלטים, וידאו, ומלכודת המיגרציה

ההבדל ביכולות שמתגלה מיד הוא המודאליות. Qwen3.8 Max מקבל וידאו לצד טקסט ותמונות; Claude Sonnet 5.5 מקבל טקסט ותמונות. עבור ניתוח הקלטות מסך, צינורות עיבוד של צילומי פגישות או כל דבר שמתייחס לווידאו כקלט מן השורה הראשונה, זה אינו פער בנצ'מרק — זוהי שאלת כשירות בינארית, ורק אחד מהמודלים הללו עובר אותה.

OrcaRouter model page for qwen/qwen3.8-max, attributed to Qwen and dated 2026-08-03, showing a 1M-token context window, text, image and video input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 2.25 seconds, and 53.0M tokens of traffic in the last seven days.

ההבדל שמתגלה כעבור שבוע הוא התנהגותי. Claude Sonnet 5.5 מבצע חמישה שינויים שוברי תאימות בקוד שרץ על Claude Sonnet 5. ערך לא־ברירת־מחדל של temperature, top_p או top_k מחזיר כעת 400. שליחת thinking: {"type": "disabled"} מחזירה 400 שמצביעה על between_tools, הגדרת ה-thinking החדשה והנמוכה ביותר, שמתקבלת ב-effort low, medium ו-high ונדחית ב-xhigh או max. שימוש מאולץ בכלי — tool_choice של "any" או כלי בעל שם — מחזיר 400 באופן מוחלט. הכלי הישן יותר computer_20251124 computer-use נדחה ב-Claude API וב-Google Cloud. ובלוקי thinking משויכים למודל ולחשבון שהפיקו אותם, כך שניתן להעביר reasoning הלאה מ-Claude Sonnet 5 אך לא אל משפחה אחרת, וקידומת שיחה שנערכה יכולה להפוך replay לשגיאה.

Qwen3.8 Max לא דורש דבר מכל זה. זהו מודל בפורמט OpenAI עם משטח בקשה קונבנציונלי, ומעבר אליו משכבה אחרת של Qwen הוא שינוי במחרוזת המודל.

שקול את שתי העלויות בכנות. בחירה במודל Qwen עולה לך את פער מצרף של אחת-עשרה נקודות ואת מספרי הספק של Anthropic שממילא אינך יכול לאמת באופן עצמאי. בחירה במודל Anthropic עולה לך קלט וידאו ורשימת בדיקה של ארבעה שינויים ב-API שכל אחד מהם ייכשל בקול רם עם 400 בפעם הראשונה שנוגעים בהם — שזה הסוג הטוב של כישלון, אבל יום עבודה בכל מקרה.

היכן OrcaRouter משתלב

הסיבה לנתב ולא לבחור היא שהמספר המכריע — עלות לכל משימה בתעבורה שלך — לא ניתן לחשב מתוך התיעוד של אף אחד מהספקים.

OrcaRouter הוא נקודת קצה אחת תואמת OpenAI על פני יותר מ-200 מודלים, כשמחיר המחירון של הספקים מועבר הלאה ללא תוספת, כך שהורדת מחיר או שינוי מדרג באחד הצדדים נכנסים לתוקף באותו יום שבו הם מוכרזים. שתי הגרסאות של Qwen3.8 Max נמצאות בקטלוג במחיר של עליבאבא עצמה — 2$ / 6$ — גרסת אוגוסט וגרסת הרענון (0902) — לצד Claude Sonnet 5, המודל שעליו עדיין רץ רוב התעבורה של Claude API, ניתן לניתוב מאז 30 ביוני במחיר של Anthropic — 2$ / 10$ עם 150 אסימוני פלט לשנייה במדידה. Claude Sonnet 5.5 עצמו עדיין לא נמצא בקטלוג שלנו; וכל עוד זה כך, הדרך הישרה אליו היא ה-API של הספק עצמו ושלושת העננים ש-Anthropic מפרטת, והדרך לנסות אותו בלי להעביר עומס עבודה היא פרוסה של תעבורה מאחורי מעבר אוטומטי בין שרתים אל Claude Sonnet 5 או Qwen3.8 Max.

איזה אחד, לאיזו עבודה

Qwen3.8 Max מנצח בקלט וידאו, בקצב פלט, בעלות מדודה לכל משימת אינדקס ובמאמץ אינטגרציה. זוהי ברירת המחדל הנכונה לעבודה בהיקף גבוה ומוגדרת היטב, שבה פער מרוכב של שתים־עשרה נקודות אינו מתבטא באיכות הפלט.

Claude Sonnet 5.5 מנצח במדד המשולב העצמאי, בהערכות קידוד מבוססות סוכנים שבהן נתוני הספק של Anthropic הראו זינוק של 60 נקודות לעומת קודמו ב-Terminal-Bench 4.0, בתקרת פלט האצווה של 300K, ובהחלטה בעלת אופי של עבודה שמחירון לא יכול לקבל: זה המודל שכדאי לבחור בו כשהמשימה קשה מספיק כך שלהיות צודק חשוב יותר מלהיות זול.

מה שישנה את התשובה עבור כל אחד מהם הוא אותו הדבר, והוא אינו פרסום של בנצ׳מרק חדש. מדובר בספירת טוקנים לכל משימה על הפרומפטים שלך, בהגדרות המאמץ שלך, עבור שני המודלים. פרמטר המאמץ של Anthropic ותקרת הפלט של Qwen הם שניהם מנופים על המספר הזה, ושניהם נקבעים על ידך ולא לפי מחירון הספק.

הדבר היחיד שההשוואה הזו כן מכריעה: במחיר של 2 דולר למיליון בקלט, צד הקלט של החשבון אינו עוד גורם מבדיל בין דגם דגל סיני לבין דגם הביניים של Anthropic. המירוץ הזה עבר לצד הפלט ולמספר הטוקנים כבר לפני חודשים.

השוואות במאמר הזה3

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית