כרטיס כותרת הירואי שכותרתו 'דרג הפלאש הסיני, מבוקר' עם תגית בדיקת טענות 'אוקטובר 2026', שלושה תגי מחיר המציינים Claude Haiku 5.5 $0.10 קלט / $0.50 פלט לכל מיליון טוקנים, GLM 5.3 Flash $0.15 / $0.50 ו-DeepSeek V4.1 Flash $0.30 / $1.20, שורה המציינת 'Terminal Bench 4.0 0.32828 - תיקו', ושורת Index v4.3.2 המציינת 43.40 - 41.81 - 39.46.
Guides & Insights

Claude Haiku 5.5 כוון אל שכבת ה-Flash של סין. רק מחצית מהטענה הזו עומדת בבדיקה.

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

קורא שכתב בסינית העלה טיעון חד השבוע: Claude Haiku 5.5נראה שנבנה כדי לכבוש את השוק הסיני בדרג הביניים, מכיוון שהוא מתמחר נמוך יותר מDeepSeek V4.1 Flash ו-GLM 5.3 Flash במחיר ומשיג ציון גבוה יותר מ-GLM 5.3 Flash ב-Terminal Bench 4.0 ובמדד הבינה של Artificial Analysis. זהו ניתוח חד יותר מרוב פרשנויות ההשקה. זה גם שתי טענות העוטות מעיל אחד, והן אינן נושאות את אותה מידת אמת.

Anthropic השיקה את Claude Haiku 5.5 ב-7 באוקטובר 2026 — השקה ציבורית מלאה עם הודעה מתוארכת, כרטיס מערכת וכרטיס תעריפים מפורסם. זה נותן לטענה משהו שפרשנות שוק מיד שנייה רק לעתים רחוקות זוכה לו: מספרים שאפשר לבדוק.

הביקורת שלהלן מוצאת שמחצית אחת חזקה יותר ממה שהקורא אמר, ושהמחצית האחרת שגויה לגבי המדד הספציפי שהיא מצטטת. כדאי להכיר את שני הממצאים, משום שהם מצביעים בכיוונים מנוגדים.

הטענה, בניסוח מדויק

כשמפרקים אותו לרכיביו, הטיעון מורכב משלושה חלקים.

• מחיר — Claude Haiku 5.5 זול יותר מ-DeepSeek V4.1 Flash וזול יותר מ-GLM 5.3 Flash.

• ציון עצמאי — הוא גבוה בכנקודה אחת בערך מ-GLM 5.3 Flash במדד Artificial Analysis Intelligence Index.

• מדד קידוד — הוא גם משיג נקודה אחת מעל GLM 5.3 Flash ב-Terminal Bench 4.0.

שניים מאלה ניתנים לבדיקה כנגד טבלאות מפורסמות, והם מחזיקים מעמד, עם התאמות. השלישי ניתן לבדיקה כנגד אותה טבלה, והתוצאה שונה מזו שתוארה.

A three-column scoreboard titled 'The claim, audited - Claude Haiku 5.5 against the flash tier' comparing Claude Haiku 5.5, GLM 5.3 Flash and DeepSeek V4.1 Flash across six rows: input price, output price, Intelligence Index v4.3.2 (43.40, 41.81 and 39.46), Terminal Bench 4.0 (0.32828, 0.32828 and 0.2677), cost per finished task ($0.21, $0.25 and $0.27) and weights (proprietary, MIT open, MIT open), footed 'Vendor list rates; Index and benchmark figures per Artificial Analysis v4.3.2.'

החצי של המחיר: נכון, ובכיוון אחד מוצג בחסר, ובכיוון אחר מוגזם.

התעריף המפורסם של Anthropic עבור Claude Haiku 5.5 הוא $0.10 למיליון טוקני קלט ו-$0.50 למיליון טוקני פלט עד לפרומפט של 100,000 טוקנים, ועולה ל-$0.50 ול-$2.50 מעל לסף זה. קריאות קלט במטמון ב-$0.01 וכתיבות ב-$0.125. חלון ההקשר הוא מיליון טוקנים; הפלט המרבי הוא 128,000.

GLM 5.3 Flash, מבית Z.ai, רשום במחיר $0.15 ו-$0.50, עם קלט במטמון ב-$0.026. DeepSeek V4.1 Flash רשום במחיר $0.30 ו-$1.20, עם קלט במטמון ב-$0.006.

בתעריף הכותרתי הקורא צודק. תעריף קלט של $0.10 נמוך בשליש מ-GLM 5.3 Flash ובשני שלישים מ-DeepSeek V4.1 Flash, ותעריף פלט של $0.50 תואם בדיוק את זה של GLM 5.3 Flash, בעודו מסתכם בהרבה פחות ממחצית מזה של DeepSeek. זו נחיתה שנראית מכוונת: להשתוות ליריב הזול יותר בפלט, לנצח אותו בקלט, ולתת ליחס לדבר.

הנקודה שבה זה מיטיב עם הטענה היא העלות הנמדדת לכל משימה שהושלמה. במדד Intelligence Index v4.3.2 של Artificial Analysis, עלות העבודה כולה יוצאת $0.21 עבור Claude Haiku 5.5, $0.25 עבור GLM 5.3 Flash ו-$0.27 עבור DeepSeek V4.1 Flash. כרטיס התעריפים אומר ש-Claude Haiku 5.5 זול פי 1.5 מ-GLM 5.3 Flash בקלט; המדידה אומרת שהעבודה המוגמרת זולה בערך בשישית. עדיין הזול מבין השלושה — רק לא בפער שהמחיר הנקוב מרמז עליו.

הסיבה היא זו שרוב השוואות המחירים מדלגות עליה. Claude Haiku 5.5 מרבה במילים. Artificial Analysis תיעדה עבורו 162,164 טוקני פלט בזמן הרצת ה-Index, לעומת 68,673 עבור GLM 5.3 Flash ו-88,574 עבור DeepSeek V4.1 Flash. התיעוד של Anthropic עצמה מוסיף אפקט שני: המודל משתמש בטוקנייזר החדש יותר המשותף ל-Claude 4.7 ואילך, כך שאותו טקסט נספר ככ-30% יותר טוקנים מאשר במודל שאותו הוא מחליף. תעריף זול יותר שמוחל על יותר טוקנים הוא תעריף זול יותר שמוחל על יותר טוקנים.

נקודה אחת בעייתית שמופיעה רק בחשבונית מנותבת: הקטלוג שלנו מציג את DeepSeek V4.1 Flash במחיר $0.15 לקלט ו-$0.60 לפלט, עם מכפיל 2× שמוחל במהלך שני חלונות יומיים, 01:00–04:00 ו-06:00–10:00 UTC. בשמונה עשרה שעות ביום זהו התעריף הבסיסי; בשש שעות ביום תעריף הפלט הוא $1.20. תעבורת באצ'ים שניתן לתזמן מחוץ לחלונות האלה מקבלת מחיר DeepSeek טוב יותר באופן מהותי ממה שתעריף המחירון הרשמי של הספק מרמז, ואילו תעבורה אינטראקטיבית לא. אם אתם מדמים את ההשוואה הזו בפועל, ללוח השנה חשיבות שווה לזו של כרטיס התעריפים.

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

חצי הניקוד: "בערך נקודה" הוא 1.6

במדד Artificial Analysis Intelligence Index v4.3.2, ‏Claude Haiku 5.5 נמדד ב-43.40 בתצורת Max שלו. ‏GLM 5.3 Flash נמדד ב-41.81. ‏DeepSeek V4.1 Flash עומד על 39.46.

אז החלק העוסק במדד בטענה נכון מבחינת הכיוון ומתעגל כלפי מטה: הפער הוא 1.59 נקודות, ולא נקודה אחת. זהו יתרון ממשי במדד שנע בטווח השישים, וזה המספר שמצוטט בכל סיכום של ההתמודדות הזו.

מה שזה לא, זו טענה על מדדי הבנצ'מרק שמתחת. שני הספקים מפרסמים סטי הערכה משלהם, ואלה אינם אותם סטים — Anthropic מדווחת על GDPval-AA v2.1, ‏OSWorld 2.1, ‏Terminal-Bench 4.0 ו-FrontierCode עבור Claude Haiku 5.5; ‏Z.ai מדווחת על חבילה משלה עבור GLM 5.3 Flash. הלוח העצמאי הוא השורה היחידה שמאפשרת השוואה תפוחים-לתפוחים, וזו בדיוק הסיבה שנשענים כל כך חזק על פער המדד ושהיא גם הסיבה לכך שהפרק הבא חשוב.

חצי הקידוד: זה תיקו מוחלט, לא ניצחון

Terminal Bench 4.0, במדידה העצמאית המשותפת, מציג 0.32828 עבור Claude Haiku 5.5 ו-0.32828 עבור GLM 5.3 Flash. זהה עד חמש ספרות אחרי הנקודה העשרונית.

זהו המספר שהכי כדאי לצטט בהשוואה הזו, והטענה לגביו שגויה. המקור הסביר לבלבול הוא השורה הסמוכה: ה-GLM-5.3 המלא, האח שאינו Flash, משיג 0.4192 באותו מבחן. אם ראית את "GLM" ואת "Terminal Bench" במשפט אחד לצד מספר שגבוה בנקודה אחת מ-Claude Haiku 5.5, זה האח, לא ה-Flash.

שלוש השורות האחרות ש-Artificial Analysis מפרסמת עבור שני המודלים מעניינות יותר מהתיקו, והן אינן מצביעות לכיוון אחד:

• SciCode — 0.5498 עבור Claude Haiku 5.5 לעומת 0.5162 עבור GLM 5.3 Flash. יתרון של 3.4 נקודות ל-Anthropic.

• Humanity's Last Exam — 0.4439 לעומת 0.3985. יתרון של 4.5 נקודות ל-Anthropic.

‏AutomationBench, ציון חלקי — 0.3541 לעומת 0.6037. יתרון של 25 נקודות ל-GLM 5.3 Flash, וזה הפער הגדול ביותר בקבוצה, בפער ניכר.

השורה האחרונה היא זו שצוותי רכש ייחסו לה את החשיבות הרבה ביותר, מפני שאוטומציה סוכנית היא התחום שבו דגמי הביניים נפרסים בפועל. במדד הבוחן אם המודל מסוגל להביא משימה מרובת-שלבים לידי השלמה, המודל בעל המשקולות הפתוחות שזול יותר להפעלה מנצח בפער שמגמד את הפרש המדד של 1.6 נקודות בכיוון ההפוך.

המהירות מתפצלת באותו אופן כמו המחיר, רק יותר. Artificial Analysis מדדה 424.6 שניות לכל משימת Index עבור Claude Haiku 5.5 לעומת 1035.4 שניות עבור GLM 5.3 Flash. המודל של Anthropic מגיע לשם בפחות ממחצית מזמן השעון בפועל, שבלולאת סוכן הוא נתון תפעולי גדול יותר מקצב הטוקנים.

מה שהטענה משמיטה לחלוטין

ההשוואה ממוסגרת כסיפור של מחיר וציון, שמדלג בשקט על הממד שבו שני המודלים הכי פחות דומים. GLM 5.3 Flash הוא בעל משקלים פתוחים, שפורסם תחת MIT, עם 320 מיליארד פרמטרים בסך הכול ו-18 מיליארד פעילים. DeepSeek V4.1 Flash הוא גם כן בעל משקלים פתוחים עם 552 מיליארד בסך הכול ו-16 מיליארד פעילים. Claude Haiku 5.5 הוא קנייני, API בלבד, ללא מספר פרמטרים מפורסם וללא מאגר.

זו אינה הערת שוליים עבור קונים רבים; זוהי השורה הראשונה במסמך הדרישות. צוות שצריך להריץ הסקה בטננסי משלו, לבצע כיוונון עדין, או להחזיק גרסת מודל קבועה למשך שנים לא בוחר בין שלושת אלה לפי נקודות מדד בכלל — שניים מהשלושה נפסלים עוד לפני שקוראים את עמודת המחיר. המסגור של הקורא הוא תצפית על מיצוב בשוק והיא הוגנת; רק יוצא שההבדל המבני פועל נגד המודל שאותו המסגור מגן עליו.

הרצת ההשוואה בעצמך

GLM 5.3 Flash ו-DeepSeek V4.1 Flash נמצאים שניהם בקטלוג של OrcaRouter במחיר המחירון של הספק עם 0% תוספת, מה שהופך את הצד הסיני של ההשוואה הזו למשהו שאפשר להריץ כבר היום במקום למדל בגיליון אלקטרוני. מכיוון שהתעריף מועבר כפי שהוא ולא ממוזג, שינוי מחיר של ספק נוחת אצלנו באותו יום שבו הוא נוחת אצלם — וחלון DeepSeek מבוסס לוח השנה שתואר לעיל גלוי באותו בלוק תמחור שמולו היית מנתב. מפתח אחד, SDK אחד, מעבר אוטומטי לגיבוי מתחת, וה-routing DSL אם תעדיף לבטא תקרת עלות בנתיב במקום בקוד האפליקציה.

Claude Haiku 5.5 אינו בקטלוג שלנו. אפשר להגיע אליו דרך ה-API של Anthropic עצמה, ומוטב לומר זאת במפורש מאשר להשאיר זאת במשתמע.

A capture of the OrcaRouter models index, headed 'Models' with the subtitle '207 models, 16 providers - one API key, one bill' and an OpenAI-compatible cURL example showing a POST to the chat completions endpoint with the model field.

מה הקורא הבין נכון, ומה לעשות עם זה

האינסטינקט נכון. אם רצית שהגל של מודלים סיניים זולים ומוכשרים בדרג הביניים ייראה יקר, זה בערך הקלף שהיית משחק: להשוות את קצב הפלט של המתחרה הזול יותר, לחצות את קצב הקלט שלו, להשיג יתרון של 1.6 נקודות מדד, ולתת לנתון המחיר לכל משימה שהושלמה לשאת את הטיעון. Claude Haiku 5.5 עושה זאת, והוא עושה זאת בעודו מהיר יותר מפי שניים לכל משימה מהמודל שאליו הוא מכוון.

מה שהקורא טעה בו הוא צר יותר ומעניין יותר. Terminal Bench 4.0 אינו ניצחון; זהו תיקו מוחלט. יתרון המחיר, כשמחייבים על העבודה כולה ולא לפי הטוקן, הוא כשישית בערך ולא פי 1.5 כפי שמרמז מחירון התעריפים. והבנצ'מרק היחיד שבו שני המודלים הכי רחוקים זה מזה הוא מבחן הסוכנים, שבו GLM 5.3 Flash מוביל ב-25 נקודות.

אז הגרסה הכנה של הטענה היא זו: Claude Haiku 5.5 מכוון אל דרג ה-Flash הסיני, הוא מנצח בהשוואה הזו במדד המשולב, בעלות לכל משימה שהושלמה ובלטנטיות, הוא לא מנצח בה באוטומציה סוכנית או בפתיחות, והיתרון הספציפי בבנצ'מרק לקידוד שהפך את הטיעון לכאורה למכריע — אינו קיים.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית