
Claude Haiku 5.5 כוון אל שכבת ה-Flash של סין. רק מחצית מהטענה הזו עומדת בבדיקה.
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
קורא שכתב בסינית העלה טיעון חד השבוע: Claude Haiku 5.5נראה שנבנה כדי לכבוש את השוק הסיני בדרג הביניים, מכיוון שהוא מתמחר נמוך יותר מDeepSeek V4.1 Flash ו-GLM 5.3 Flash במחיר ומשיג ציון גבוה יותר מ-GLM 5.3 Flash ב-Terminal Bench 4.0 ובמדד הבינה של Artificial Analysis. זהו ניתוח חד יותר מרוב פרשנויות ההשקה. זה גם שתי טענות העוטות מעיל אחד, והן אינן נושאות את אותה מידת אמת.
Anthropic השיקה את Claude Haiku 5.5 ב-7 באוקטובר 2026 — השקה ציבורית מלאה עם הודעה מתוארכת, כרטיס מערכת וכרטיס תעריפים מפורסם. זה נותן לטענה משהו שפרשנות שוק מיד שנייה רק לעתים רחוקות זוכה לו: מספרים שאפשר לבדוק.
הביקורת שלהלן מוצאת שמחצית אחת חזקה יותר ממה שהקורא אמר, ושהמחצית האחרת שגויה לגבי המדד הספציפי שהיא מצטטת. כדאי להכיר את שני הממצאים, משום שהם מצביעים בכיוונים מנוגדים.
הטענה, בניסוח מדויק
כשמפרקים אותו לרכיביו, הטיעון מורכב משלושה חלקים.
• מחיר — Claude Haiku 5.5 זול יותר מ-DeepSeek V4.1 Flash וזול יותר מ-GLM 5.3 Flash.
• ציון עצמאי — הוא גבוה בכנקודה אחת בערך מ-GLM 5.3 Flash במדד Artificial Analysis Intelligence Index.
• מדד קידוד — הוא גם משיג נקודה אחת מעל GLM 5.3 Flash ב-Terminal Bench 4.0.
שניים מאלה ניתנים לבדיקה כנגד טבלאות מפורסמות, והם מחזיקים מעמד, עם התאמות. השלישי ניתן לבדיקה כנגד אותה טבלה, והתוצאה שונה מזו שתוארה.

החצי של המחיר: נכון, ובכיוון אחד מוצג בחסר, ובכיוון אחר מוגזם.
התעריף המפורסם של Anthropic עבור Claude Haiku 5.5 הוא $0.10 למיליון טוקני קלט ו-$0.50 למיליון טוקני פלט עד לפרומפט של 100,000 טוקנים, ועולה ל-$0.50 ול-$2.50 מעל לסף זה. קריאות קלט במטמון ב-$0.01 וכתיבות ב-$0.125. חלון ההקשר הוא מיליון טוקנים; הפלט המרבי הוא 128,000.
GLM 5.3 Flash, מבית Z.ai, רשום במחיר $0.15 ו-$0.50, עם קלט במטמון ב-$0.026. DeepSeek V4.1 Flash רשום במחיר $0.30 ו-$1.20, עם קלט במטמון ב-$0.006.
בתעריף הכותרתי הקורא צודק. תעריף קלט של $0.10 נמוך בשליש מ-GLM 5.3 Flash ובשני שלישים מ-DeepSeek V4.1 Flash, ותעריף פלט של $0.50 תואם בדיוק את זה של GLM 5.3 Flash, בעודו מסתכם בהרבה פחות ממחצית מזה של DeepSeek. זו נחיתה שנראית מכוונת: להשתוות ליריב הזול יותר בפלט, לנצח אותו בקלט, ולתת ליחס לדבר.
הנקודה שבה זה מיטיב עם הטענה היא העלות הנמדדת לכל משימה שהושלמה. במדד Intelligence Index v4.3.2 של Artificial Analysis, עלות העבודה כולה יוצאת $0.21 עבור Claude Haiku 5.5, $0.25 עבור GLM 5.3 Flash ו-$0.27 עבור DeepSeek V4.1 Flash. כרטיס התעריפים אומר ש-Claude Haiku 5.5 זול פי 1.5 מ-GLM 5.3 Flash בקלט; המדידה אומרת שהעבודה המוגמרת זולה בערך בשישית. עדיין הזול מבין השלושה — רק לא בפער שהמחיר הנקוב מרמז עליו.
הסיבה היא זו שרוב השוואות המחירים מדלגות עליה. Claude Haiku 5.5 מרבה במילים. Artificial Analysis תיעדה עבורו 162,164 טוקני פלט בזמן הרצת ה-Index, לעומת 68,673 עבור GLM 5.3 Flash ו-88,574 עבור DeepSeek V4.1 Flash. התיעוד של Anthropic עצמה מוסיף אפקט שני: המודל משתמש בטוקנייזר החדש יותר המשותף ל-Claude 4.7 ואילך, כך שאותו טקסט נספר ככ-30% יותר טוקנים מאשר במודל שאותו הוא מחליף. תעריף זול יותר שמוחל על יותר טוקנים הוא תעריף זול יותר שמוחל על יותר טוקנים.
נקודה אחת בעייתית שמופיעה רק בחשבונית מנותבת: הקטלוג שלנו מציג את DeepSeek V4.1 Flash במחיר $0.15 לקלט ו-$0.60 לפלט, עם מכפיל 2× שמוחל במהלך שני חלונות יומיים, 01:00–04:00 ו-06:00–10:00 UTC. בשמונה עשרה שעות ביום זהו התעריף הבסיסי; בשש שעות ביום תעריף הפלט הוא $1.20. תעבורת באצ'ים שניתן לתזמן מחוץ לחלונות האלה מקבלת מחיר DeepSeek טוב יותר באופן מהותי ממה שתעריף המחירון הרשמי של הספק מרמז, ואילו תעבורה אינטראקטיבית לא. אם אתם מדמים את ההשוואה הזו בפועל, ללוח השנה חשיבות שווה לזו של כרטיס התעריפים.

חצי הניקוד: "בערך נקודה" הוא 1.6
במדד Artificial Analysis Intelligence Index v4.3.2, Claude Haiku 5.5 נמדד ב-43.40 בתצורת Max שלו. GLM 5.3 Flash נמדד ב-41.81. DeepSeek V4.1 Flash עומד על 39.46.
אז החלק העוסק במדד בטענה נכון מבחינת הכיוון ומתעגל כלפי מטה: הפער הוא 1.59 נקודות, ולא נקודה אחת. זהו יתרון ממשי במדד שנע בטווח השישים, וזה המספר שמצוטט בכל סיכום של ההתמודדות הזו.
מה שזה לא, זו טענה על מדדי הבנצ'מרק שמתחת. שני הספקים מפרסמים סטי הערכה משלהם, ואלה אינם אותם סטים — Anthropic מדווחת על GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 ו-FrontierCode עבור Claude Haiku 5.5; Z.ai מדווחת על חבילה משלה עבור GLM 5.3 Flash. הלוח העצמאי הוא השורה היחידה שמאפשרת השוואה תפוחים-לתפוחים, וזו בדיוק הסיבה שנשענים כל כך חזק על פער המדד ושהיא גם הסיבה לכך שהפרק הבא חשוב.
חצי הקידוד: זה תיקו מוחלט, לא ניצחון
Terminal Bench 4.0, במדידה העצמאית המשותפת, מציג 0.32828 עבור Claude Haiku 5.5 ו-0.32828 עבור GLM 5.3 Flash. זהה עד חמש ספרות אחרי הנקודה העשרונית.
זהו המספר שהכי כדאי לצטט בהשוואה הזו, והטענה לגביו שגויה. המקור הסביר לבלבול הוא השורה הסמוכה: ה-GLM-5.3 המלא, האח שאינו Flash, משיג 0.4192 באותו מבחן. אם ראית את "GLM" ואת "Terminal Bench" במשפט אחד לצד מספר שגבוה בנקודה אחת מ-Claude Haiku 5.5, זה האח, לא ה-Flash.
שלוש השורות האחרות ש-Artificial Analysis מפרסמת עבור שני המודלים מעניינות יותר מהתיקו, והן אינן מצביעות לכיוון אחד:
• SciCode — 0.5498 עבור Claude Haiku 5.5 לעומת 0.5162 עבור GLM 5.3 Flash. יתרון של 3.4 נקודות ל-Anthropic.
• Humanity's Last Exam — 0.4439 לעומת 0.3985. יתרון של 4.5 נקודות ל-Anthropic.
AutomationBench, ציון חלקי — 0.3541 לעומת 0.6037. יתרון של 25 נקודות ל-GLM 5.3 Flash, וזה הפער הגדול ביותר בקבוצה, בפער ניכר.
השורה האחרונה היא זו שצוותי רכש ייחסו לה את החשיבות הרבה ביותר, מפני שאוטומציה סוכנית היא התחום שבו דגמי הביניים נפרסים בפועל. במדד הבוחן אם המודל מסוגל להביא משימה מרובת-שלבים לידי השלמה, המודל בעל המשקולות הפתוחות שזול יותר להפעלה מנצח בפער שמגמד את הפרש המדד של 1.6 נקודות בכיוון ההפוך.
המהירות מתפצלת באותו אופן כמו המחיר, רק יותר. Artificial Analysis מדדה 424.6 שניות לכל משימת Index עבור Claude Haiku 5.5 לעומת 1035.4 שניות עבור GLM 5.3 Flash. המודל של Anthropic מגיע לשם בפחות ממחצית מזמן השעון בפועל, שבלולאת סוכן הוא נתון תפעולי גדול יותר מקצב הטוקנים.
מה שהטענה משמיטה לחלוטין
ההשוואה ממוסגרת כסיפור של מחיר וציון, שמדלג בשקט על הממד שבו שני המודלים הכי פחות דומים. GLM 5.3 Flash הוא בעל משקלים פתוחים, שפורסם תחת MIT, עם 320 מיליארד פרמטרים בסך הכול ו-18 מיליארד פעילים. DeepSeek V4.1 Flash הוא גם כן בעל משקלים פתוחים עם 552 מיליארד בסך הכול ו-16 מיליארד פעילים. Claude Haiku 5.5 הוא קנייני, API בלבד, ללא מספר פרמטרים מפורסם וללא מאגר.
זו אינה הערת שוליים עבור קונים רבים; זוהי השורה הראשונה במסמך הדרישות. צוות שצריך להריץ הסקה בטננסי משלו, לבצע כיוונון עדין, או להחזיק גרסת מודל קבועה למשך שנים לא בוחר בין שלושת אלה לפי נקודות מדד בכלל — שניים מהשלושה נפסלים עוד לפני שקוראים את עמודת המחיר. המסגור של הקורא הוא תצפית על מיצוב בשוק והיא הוגנת; רק יוצא שההבדל המבני פועל נגד המודל שאותו המסגור מגן עליו.
הרצת ההשוואה בעצמך
GLM 5.3 Flash ו-DeepSeek V4.1 Flash נמצאים שניהם בקטלוג של OrcaRouter במחיר המחירון של הספק עם 0% תוספת, מה שהופך את הצד הסיני של ההשוואה הזו למשהו שאפשר להריץ כבר היום במקום למדל בגיליון אלקטרוני. מכיוון שהתעריף מועבר כפי שהוא ולא ממוזג, שינוי מחיר של ספק נוחת אצלנו באותו יום שבו הוא נוחת אצלם — וחלון DeepSeek מבוסס לוח השנה שתואר לעיל גלוי באותו בלוק תמחור שמולו היית מנתב. מפתח אחד, SDK אחד, מעבר אוטומטי לגיבוי מתחת, וה-routing DSL אם תעדיף לבטא תקרת עלות בנתיב במקום בקוד האפליקציה.
Claude Haiku 5.5 אינו בקטלוג שלנו. אפשר להגיע אליו דרך ה-API של Anthropic עצמה, ומוטב לומר זאת במפורש מאשר להשאיר זאת במשתמע.

מה הקורא הבין נכון, ומה לעשות עם זה
האינסטינקט נכון. אם רצית שהגל של מודלים סיניים זולים ומוכשרים בדרג הביניים ייראה יקר, זה בערך הקלף שהיית משחק: להשוות את קצב הפלט של המתחרה הזול יותר, לחצות את קצב הקלט שלו, להשיג יתרון של 1.6 נקודות מדד, ולתת לנתון המחיר לכל משימה שהושלמה לשאת את הטיעון. Claude Haiku 5.5 עושה זאת, והוא עושה זאת בעודו מהיר יותר מפי שניים לכל משימה מהמודל שאליו הוא מכוון.
מה שהקורא טעה בו הוא צר יותר ומעניין יותר. Terminal Bench 4.0 אינו ניצחון; זהו תיקו מוחלט. יתרון המחיר, כשמחייבים על העבודה כולה ולא לפי הטוקן, הוא כשישית בערך ולא פי 1.5 כפי שמרמז מחירון התעריפים. והבנצ'מרק היחיד שבו שני המודלים הכי רחוקים זה מזה הוא מבחן הסוכנים, שבו GLM 5.3 Flash מוביל ב-25 נקודות.
אז הגרסה הכנה של הטענה היא זו: Claude Haiku 5.5 מכוון אל דרג ה-Flash הסיני, הוא מנצח בהשוואה הזו במדד המשולב, בעלות לכל משימה שהושלמה ובלטנטיות, הוא לא מנצח בה באוטומציה סוכנית או בפתיחות, והיתרון הספציפי בבנצ'מרק לקידוד שהפך את הטיעון לכאורה למכריע — אינו קיים.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
