
הסיפור האמיתי של Claude Haiku 5.5 הוא צוק ה-100K: מה ה-Haiku החדש גובה מעבר ל-100,000 טוקנים
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
Claude Haiku 5.5 הגיע ב-7 באוקטובר 2026 עם מחיר מוצהר של 0.10 דולר למיליון טוקני קלט ו-0.50 דולר למיליון טוקני פלט, והמספר שצוטט בכל מקום היה זה ש-Anthropic עצמה הציבה בהכרזה: קיצוץ של 90 אחוז לעומת התעריף של Haiku 4.5 עבור אותם שני סעיפי חיוב. 90 האחוזים אמיתיים. הם גם מוגבלים למחצית מממד אחד של החשבון, וברגע שבקשה חוצה 100,000 טוקנים כל תעריף בה עושה משהו שסיקור ההשקה בעיקר פסח עליו. הכתבה הזו עוסקת בקו הגבול הזה — כמה הוא עולה, אילו עומסי עבודה באמת מגיעים אליו, ולמה "זול ב-90 אחוז" הוא טענה על פרוסה של החשבון ולא על החשבון שלכם.
שני המחירים, והיכן הם מתחלפים
Anthropic מפרסמת שני טורים עבור המודל, והמעבר ביניהם מבוסס על סף יחיד של גודל הבקשה ולא על הגדרת מודל כלשהי שאתם בוחרים:
• מסלול קצר, של 100,000 טוקנים או פחות — $0.10 למיליון טוקני קלט, $0.50 למיליון טוקני פלט (Anthropic list) • מסלול ארוך, מעל 100,000 טוקנים — $0.50 למיליון טוקני קלט, $2.50 למיליון טוקני פלט (Anthropic list) • קריאות מטמון — $0.01 למיליון (מסלול קצר) ו-$0.05 למיליון (מסלול ארוך) • Batch API — 50 אחוז הנחה על כל עמודה, ואורך פלט מקסימלי של 300,000 טוקנים • פלט מקסימלי סטנדרטי — 128,000 טוקנים, עם חלון הקשר של מיליון טוקנים בשני המסלולים

אלה התעריפים שפרסמה Anthropic בעצמה, ולא תעריפים שנמדדו, והם המחירון הנוכחי: לתמחור של מודל חדש כל כך לא היה זמן להשתנות, אם כי Anthropic אינה מחויבת להשאירם.
קראו את ארבעת המספרים האלה לפי הסדר, וצורת הדבר ברורה. כל תעריף במדרג ההקשר הארוך הוא בדיוק פי חמישה מתעריף ההקשר הקצר, והסף הוא אותם 100,000 טוקנים עבור כולם בבת אחת. אין עקומה הדרגתית, אין אינטרפולציה, אין רצועת ביניים — בקשה בת 99,000 טוקנים ובקשה בת 101,000 טוקנים נבדלות פי חמישה בכל טוקן בחשבון, ולא רק ב-2,000 הטוקנים שחצו את הקו. זה החלק שהופך את זה לצוק ולא למדרון, וזה החלק שהמסגור של "זול יותר ב-90 אחוז" לא מצליח לראות.

למה החתך נראה גדול יותר ממה שהוא
לעומת Haiku 4.5, ההשוואה ש-Anthropic ערכה, הדרגה הקצרה היא הפחתה אמיתית של 90 אחוז בקלט ובפלט כאחד — Haiku 4.5 עלה $1.00 ו-$5.00 למיליון עבור אותן שתי עמודות. הדרגה הארוכה היא סיפור אחר: $0.50 ו-$2.50 לעומת אותם $1.00 ו-$5.00 הם קיצוץ של 50 אחוז, לא של 90 אחוז. אז הגרסה הכנה של הצהרת ההשקה היא ש-Claude Haiku 5.5 זול ב-90 אחוז מ-Haiku 4.5 מתחת ל-100,000 טוקנים וב-50 אחוז מעל זה, וזה בדיוק הפיצול שהתיעוד של Anthropic עצמו מספק ברגע שקוראים את שתי העמודות ולא אחת. האחוז הבודד אינו שגוי; זהו אחוז הדרגה הקצרה, שמוצג בלי התנאי שלו.
יש דבר שני שמושך בכיוון ההפוך, והוא המעניין יותר כי קל לפספס אותו וקשה לעקוף אותו. Claude Haiku 5.5 מגיע עם טוקנייזר חדש, וההנחיות של Anthropic עצמה קובעות שמספר הטוקנים עבור קטע טקסט נתון גבוה בכ-30 אחוז ממה ש-Haiku 4.5 הפיק עבור אותו תוכן. מה ששילמת עבור כל טוקן ירד, ומה שאתה משלם עבור כל טוקן של *הטקסט שלך* עלה בכשליש, ביחס לחשבונאות של המודל הישן. הנתון הנקי המוצהר של Anthropic, שהמודל זול יותר להפעלה בממוצע בכ-75 אחוז, כבר מגלם זאת — קיצוץ של 90 אחוז במחיר המחירון פחות אינפלציית טוקנים של כ-30 אחוז נוחת בסביבה הזו בתעבורה עם הקשר קצר — אבל שתי ההשפעות ניתנות להפרדה וראויות להפרדה. מהלך המחיר הוא שינוי במחיר המחירון שאפשר לקרוא מהדף; מהלך הטוקנייזר משנה כמה יחידות מהמחיר הזה צורכים הפרומפטים הקיימים שלך, והוא נראה בספירת הטוקנים שלך לפני שהוא נראה בכל מקום אחר.
עבור עומס עבודה שכבר היה בנוחות מתחת ל-100,000 טוקנים לכל קריאה, ההשפעה המעשית היא הפחתה ישירה בעלות לכל קריאה, שמקוזזת חלקית על ידי הטוקנייזר. עבור עומס שלא עמד בכך, החשבון פועל בכיוון ההפוך פעמיים בחצי הארוך.
מה באמת נמצא מעל 100,000 טוקנים?
הרפלקס הוא לסווג תמחור של הקשר ארוך תחת "קידוד אג'נטי ו-RAG, לא אנחנו". זו החלטה מהירה מדי, מפני שגבול 100,000 הטוקנים הוא גבול לכל בקשה, וגודל לכל בקשה אינו אותו דבר כמו גודל משימה. כמה דפוסים חוצים אותו באופן שגרתי:
• סוכן שקורא קוד־בסיס (codebase) ושומר מערך עבודה גדול בהקשר לאורך הסשן, במקום לשלוף אותו מחדש בכל שלב
• ניתוח מסמכים וחוזים שבו הקלט הוא PDF ארוך בתוספת ההוראות שלו ודוגמאות few-shot — סוג הפרומפט שהיה 60,000 טוקנים לפני שמישהו הוסיף את הדוגמאות
• צינורות קליטה שמקבצים פריטים קטנים רבים לקריאה אחת כדי לפרוס את התקורה לכל קריאה, ובכך מעבירים את כל האצווה מעל הסף
• מוצרי צ'אט ששומרים היסטוריית שיחה מלאה בתוך ההקשר במקום לסכם אותה, שבהם הבקשה גדלה באופן מונוטוני עד שמשהו קוטע אותה
• קלטים בסגנון תמלול של אודיו ווידאו ארוך, שהם בדיוק סוג התעבורה שחלון של מיליון טוקנים מפורסם כמאפשר
חלון ההקשר של מיליון טוקנים הוא החלק בגיליון המפרט שהופך את הצוק למשהו ששווה לדבר עליו. Anthropic מוכרת את היכולת למסור למודל בקשה גדולה מאוד, והתמחור בנוי כך ש-900,000 הטוקנים האחרונים של אותה בקשה עולים פי חמישה ממה שעלו 100,000 הראשונים. שתי העובדות מכוונות; הן פשוט מוכרזות במקומות שונים. אם חלון ההקשר הארוך הוא הסיבה שאתה בכלל מסתכל על המודל הזה, עמודת ההקשר הארוך היא העמודה שלך, ואחוז ההשקה הוא של מישהו אחר.
הלחץ שהמחיר מפעיל על שכבת ה-Flash
הכוונה המוצהרת של Anthropic מאחורי המודל היא להחזיק בקצה הזול ובעל התפוקה הגבוהה של הסטאק, ורשימת המחירים משקפת את הכוונה הזו בבירור. הדיווח של בלומברג על ההשקה הציג אותה כניסיון של Anthropic להגן על עמדת העלות הנמוכה שלה מול מתחרים זולים יותר עם משקלים פתוחים, והמסגור מצד הספק הרחיק לכת — שלפיו המחיר של Haiku החדש נקבע כך שיהיה נמוך מזה של יריביו הישירים בפער ניכר.
ההשוואה נקייה רק בדרג הקצר, שבו $0.10 ו-$0.50 נמוכים באופן אגרסיבי. מעל 100,000 טוקנים, התעריפים של $0.50 ו-$2.50 כבר לא חותכים מתחת לדרג הקצר של אף אחד; הם מספרים רגילים של דרג בינוני. הטענה של הספק בדבר "מרווח רחב" היא אמירה על העמודה הראשונה של לוח התעריפים, ו-Anthropic רשאית לטעון זאת שם — זהו פירוש מדויק של המספרים שהיא מפרסמת. זו אינה טענה על מה שמשלמים עבור עומס עבודה עם הקשר ארוך, ואין לצטט אותה ככזו.
שאר המודל, בקצרה
Claude Haiku 5.5 שומר על התכונות שנשלחו בקו Sonnet וב-Opus במקום לקצץ בהן עבור מחלקת הגודל. חשיבה אדפטיבית עם הגדרת מאמץ ברירת מחדל של medium נוכחת, והוא המודל הראשון במחלקת Haiku עם חוגת מאמץ מתכווננת הנעה בין Low ל-Max. תאריך הידע האחרון הוא יוני 2026 ומזהה המודל הוא claude-haiku-5-5. Anthropic מציינת תאריך פרישה שלא לפני 7 באוקטובר 2027 — אותו תאריך כמו ההשקה, שנה קדימה — והמודל רשום ב-Amazon Bedrock, ב-Google Cloud וב-Microsoft Azure לצד ה-API של Anthropic עצמה.

בצד הבנצ'מרקים, כל מה שכתוב בפוסט ההשקה נושא את אותה תווית מקור, ובצדק: אלה מספרים שדווחו על ידי הספק, שנמדדו על ידי החברה שמוכרת את המודל, בלי שפורסם שחזור בלתי תלוי בזמן כתיבת הדברים.
• GDPval-AA v2.1 — 1,620 לפי דיווח הספק עבור Claude Haiku 5.5, לעומת 735 עבור Haiku 4.5 באותו הרנס
• AA-Briefcase v1.1 — 1,578 לפי דיווח הספק, לעומת 614 בדור הקודם
• OSWorld 2.1 — 72.4 אחוז לפי דיווח הספק, לעומת 15.7 אחוז
• Terminal-Bench 4.0 — דווח על ידי הספק 39.2, 0.0
• Humanity's Last Exam — לפי דיווח הספק 45.9 אחוז, או 57.4 עם שימוש בכלים
גודל הפערים האלה הוא הסיבה לסמן אותם ולא לצטט אותם. זינוק מ-15.7 ל-72.4 במדד OS-agent, שנמדד על ידי הספק של המודל עצמו, הוא מספר שכדאי להחזיק בעירבון מוגבל עד שצד שלישי יריץ את אותה מערכת בדיקות. Artificial Analysis פרסמה אינדקס משלה למודל נכון לתחילת אוקטובר 2026 — נתון בלתי תלוי של 43.395, עם 0.329 ב-Terminal-Bench Hard ו-0.444 ב-HLE — והסט הזה הוא זה שיש לצטט כשהטענה צריכה לעמוד בפני ערעור. המספרים של הספק והמספרים הבלתי תלויים אינם בסתירה; הם פשוט מערכות בדיקות שונות, וערבוב שלהם למשפט אחד הוא הדרך שבה פוסט בבלוג מגיע להצהיר שהערכה של ספק היא עובדה.
הערת התשתית, מכיוון שאנחנו מפעילים אחת
Anthropic מוכרת את Claude Haiku 5.5 דרך ה-API שלה ודרך Bedrock, Google Cloud ו-Azure. אם אתם מתלבטים למי מהם לפנות, או שאתם מוסיפים אותו לצד שאר המודלים שכבר נמצאים אצלכם בסטאק, שימו לב שמחיר המחירון של הספק זהה בכל מקום שבו הוא נמכר, ו-OrcaRouter בנויה כך שתעביר את מחיר המחירון הזה הלאה ללא תוספת רווח — כך ששינוי מחיר של Anthropic במודל הזה מתעדכן אצלנו באותו יום ולא בעיכוב. הקטלוג שלנו כולל גם את qwen/qwen3.8-flash ב-$0.15 ו-$0.47 למיליון וכן z-ai/glm-5.3-flash ב-$0.15 ו-$0.50, הצמד שלרוב מגיע למשבצת שלצד מודל בדרגת Haiku, על אותו מפתח ואותו חשבון — מה שהופך סטאק מעורב לעלות של חוזה אחד במקום שלושה. אנחנו לא מספקים את Claude Haiku 5.5 עצמו; לשם כך, פנו ישירות ל-Anthropic.
מסקנה מעשית נלווית אחת של הצוק, אם אתה מנתב יותר ממודל אחד: גבול 100,000 האסימונים הוא מקום שבו בקשה שהייתה זולה הופכת ליקרה בלי ששום דבר בבקשה משתנה באופן מהותי. אם שכבת הניתוב שלך יכולה לעבור לגיבוי, הצורה ההגיונית היא להשאיר את תעבורת ההקשר הארוך מכוונת למודל שבאמת זול מעל הסף, ולתת לתעבורת ההקשר הקצר ליפול לזה שזול מתחתיו, במקום להניח שהתעריף המוצהר של מודל אחד חל על שניהם.
מה לקחת מההשקה
הוזלת המחיר אמיתית והיא גדולה, מתחת ל-100,000 טוקנים. המודל הוא ה-Haiku הראשון עם סט תכונות שהושלם במלואו ומחוג מאמץ, וזה חשוב יותר לשימוש סוכני מאשר המחיר. פערי הבנצ'מרק מדווחים מטעם הספק וצריך לתייג אותם ככאלה בכל פעם שהם מוזכרים שוב. ולמחירון יש מדרגה ב-100,000 טוקנים שמכפילה כל תעריף בחמש בבת אחת — וזה הדבר האחד בהשקה הזאת שמי שקורא את הסטאק שלך, ולא את ההודעה לעיתונות, הכי צריך לדעת לפני שתקציב הטוקנים של הספרינט הבא נקבע.
אם ברצונך לבדוק את החישוב מול התעבורה שלך, שני המספרים שצריך לשלוף הם האחוזון ה-95 של גודל הבקשה שלך והחלק שלך בהוצאות על בקשות מעל 100,000 טוקנים. אם הראשון מתחת לקו, ה-90 אחוז חל עליך והסיקור של ההשקה צדק לגבי המצב שלך. אם השני מהווה נתח משמעותי מהחשבון, המספר שקובע הוא ה-50, וכדאי להריץ מחדש את אומדן העלות עבור איזה מודל מהמחסנית שבחרת בהנחה של ה-90.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
