
Claude Haiku 5.5 נגד Gemini 3.5 Flash-Lite: זול יותר לטוקן, יקר יותר לתשובה
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
Claude Haiku 5.5 עולה $0.10 למיליון טוקני קלט ו-$0.50 למיליון טוקני פלט. Gemini 3.5 Flash-Lite עולה $0.30 ו-$2.50 לפי שני אותם מדדים. המודל של Anthropic עולה שליש מהמחיר בקלט וחמישית מהמחיר בפלט, והוא מקבל ציון 43.40 לעומת 22.2 במדד Artificial Analysis Intelligence Index v4.3.2 — פער של יותר מעשרים נקודות בתחום שבו עשר נקודות נחשבות לקפיצת דור. מבחינת המחירון זו לא השוואה צמודה, ומבחינת היכולת גם זו לא השוואה צמודה.
על החשבונית זו השוואה צמודה, והיא הולכת בכיוון ההפוך. הציבו את שני המודלים על אותו לוח מבחן בלתי תלוי וחייבו כל אחד מהם עבור משימה שהושלמה ולא עבור טוקן, ו-Gemini 3.5 Flash-Lite יוצא זול יותר לכל תשובה. Artificial Analysis מציבה את Claude Haiku 5.5 על $0.21 לכל משימת Intelligence Index ואת Gemini 3.5 Flash-Lite על $0.1235 — יתרון של 1.7 לאחד למודל שמשלם פי חמישה יותר עבור כל טוקן שהוא פולט.
ההיפוך הזה הוא כל מהותה של ההשוואה הזו. Claude Haiku 5.5 מחליף את השכבה הזולה ביותר ש-Anthropic אי פעם הוציאה, ומנצח כל מה שקרוב אליו בלוח המשותף. Gemini 3.5 Flash-Lite שוחרר ב-21 ביולי 2026 והוא הבחירה המשתלמת בטווח הזה מאז הקיץ. השאלה שבאמת עומדת בפני קונה היא לא איזה מהם טוב יותר, כי התשובה לכך כבר נחרצה. היא איזה מהם להציב לפני בקשה שצריכה לחזור בזול.
כל מה שלהלן הוא לכל מיליון טוקנים בדולרים אמריקאיים. מחירי המחירון הם התעריפים המפורסמים של הספקים עצמם. הציונים הבלתי־תלויים, נתוני העלות לכל משימה ומדידות המהירות המיוחסים ל-Artificial Analysis הם של אותו מעריך. נתוני ההשהיה עבור Gemini 3.5 Flash-Lite מגיעים מהתעבורה המדודה שלנו. כאשר מספר מופיע ברשומת המודל שברשותנו ולא נקרא מהעמוד של המעריך באותו היום, התייחסנו לאותו מעריך כמקור ולא לעצמנו.
המדבקה והחשבונית אינן תואמות
פער העלות-למשימה אינו מוסבר על ידי מחירון התעריפים, וכדאי לדעת מדוע הוא קיים לפני שאחד מהמודלים מתקרב לשלב הייצור.
Claude Haiku 5.5 הוא מפורט מדי, והמעריך אומר זאת במפורש. בהרצת מדד ה-Intelligence Index, Artificial Analysis תיעדה 440 מיליון טוקני פלט מהמודל לעומת חציון כללי של 100 מיליון, וסימנה אותו כמפורט מאוד. חשיבה מחויבת כפלט, חשיבה מופעלת כברירת מחדל עם חוגת מאמץ שמתחילה בבינוני, ותעריף קלט זול לא עוזר לעומס עבודה שעיקר החשבון שלו הוא פלט.
Gemini 3.5 Flash-Lite גם אינו לקוני, אך הוא פחות יקר באופן מדיד לכל עבודה. אותו לוח מתעד עבורו 17,507 אסימוני פלט לכל משימת אינדקס שהושלמה — 10,405 מהם חשיבה ו-7,102 תשובה. הצב זאת מול נפח האסימונים של מודל Anthropic והחשבון מתבהר: יתרון של חמישה לאחד בקצב הפלט נצרך חלקית על ידי מודל שפולט את התגובה הגדולה יותר, ומה ששורד ברמת המשימה הוא חיסרון קטן ולא יתרון גדול.
יש אפקט שני, שקט יותר, שפועל באותו אופן. התיעוד של Anthropic אומר ש-Claude Haiku 5.5 משתמש בטוקנייזר המשותף עם Claude 4.7 ואילך, כך שאותו טקסט נספר כבערך 30% יותר טוקנים מכפי שנספר במודל שזה מחליף. התעריף ירד פי שלושה לעומת המסלול של Google. ספירת הטוקנים לא ירדה, ובאותו טקסט היא עלתה.
שני הדגמים, במספרים שחשובים
תעריפים ומחירי מחירון שמורים במטמון מתוך התיעוד של Anthropic ו-Google עצמם; נתונים בלתי תלויים המיוחסים ל-Artificial Analysis; השהיה בזמן אמת מחלון התעבורה שלנו בן שבעת הימים. נשמר במטמון 2026-10-08.

• קלט — Claude Haiku 5.5 $0.10 עד 100,000 טוקנים ו-$0.50 מעל; Gemini 3.5 Flash-Lite $0.30 אחיד על פני חלון של 1,048,576 טוקנים.
• פלט — Claude Haiku 5.5 $0.50 עד 100,000 טוקנים ו-$2.50 ומעלה; Gemini 3.5 Flash-Lite $2.50 אחיד.
• קלט שמור במטמון — Claude Haiku 5.5 $0.01 עד 100,000 אסימונים ו-$0.05 מעל; Gemini 3.5 Flash-Lite $0.03. כתיבות מטמון הן $0.125 ו-$0.625 למיליון אסימונים עבור Claude Haiku 5.5.
• הקשר ופלט — מיליון טוקנים לכל אחד. הפלט המרבי הוא 128,000 טוקנים עבור Claude Haiku 5.5 לעומת 65,536 עבור Gemini 3.5 Flash-Lite, כך שהתקרה של Anthropic היא בערך כפולה.
• אופני קלט — טקסט ותמונות עבור Claude Haiku 5.5; טקסט, תמונות, וידאו, אודיו וקבצים עבור Gemini 3.5 Flash-Lite. שניהם מחזירים טקסט.
• ציון בלתי תלוי — 43.40 עבור Claude Haiku 5.5 (Max), שני מתוך 182 מודלים במדד Intelligence Index v4.3.2, לעומת 22.2 עבור Gemini 3.5 Flash-Lite, התשעים ושישה מתוך 147 ובאחוזון השלושים וארבעה של אותו לוח.
• עלות עצמאית לכל משימה — $0.21 לעומת $0.1235 על אותו לוח.
• תפוקה — 241.9 אסימוני פלט לשנייה נמדדו עבור Claude Haiku 5.5 על ידי Artificial Analysis, לעומת 280.0 עבור Gemini 3.5 Flash-Lite שנמדדו בפלייאונד שלנו במהלך שבעת הימים האחרונים. אלה שתי ערכות בדיקה נפרדות, ולא אחת, ולכן יש לקרוא אותם כסדר גודל ולא כמירוץ.
עשרים ואחת נקודות, וממה הן עשויות
פער של עשרים ואחת נקודות במדד שמגיע לשנות השישים אינו מרווח. זה ההבדל בין מודל שיכול להריץ לולאה סוכנית לבין מודל שצריך להעביר לו קריאה אחת מוגדרת היטב.
שני הספקים אינם מודדים את הרתמות אחד של השני, ולכן אי אפשר להשוות את הסוויטות שלהם זו לזו. Anthropic מפרסמת תוצאות GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 ו-FrontierCode עבור Claude Haiku 5.5; Google מפרסמת סט משלה עבור דרגת Flash-Lite; אף אחד מהשניים לא הריץ את זה של האחר. ההשוואה היחידה בתנאים זהים שזמינה היא לוח הדירוג העצמאי, ושם המודל של Anthropic מוביל בפער שאינו צמוד.
תתי-הציונים של המעריך עבור Gemini 3.5 Flash-Lite מעלים על הכתב את הצורה של אותה דרגה. הוא רושם 83.8% ב-GPQA Diamond ו-54.2% ב-SWE-Bench Pro, 54% ב-Terminal-bench 2.1, 41.3% ב-SciCode ו-39.2% ב-MLE-Bench, עם 18.8% ב-Humanity's Last Exam. אלה המספרים של דרגה מוכשרת, זולה וכלל-תכליתית — חזקה בשאלות ידע, אבל נמצאת בבירור מאחור בהערכות ההיסק והמחקר הקשות ביותר. Claude Haiku 5.5 עם 43.40 בציון המשולב נמצא ברצועה אחרת לגמרי, והקריאה המעשית היא שעבודה שדורשת תכנון רב-שלבי על פני אופק ארוך אינה משימה של דרגת Google כלל.
מיליון טוקנים של חלון, ו־65,536 של תשובה
שני חלונות ההקשר הם באותו גודל והם אינם אותו מוצר.
הקשר ארוך ב-Gemini 3.5 Flash-Lite נשחק עם המרחק באופן שכדאי לתמחר אותו לפני שסומכים עליו. ב-GDM-MRCR v2, הערכת שליפת שמונה המחטים, הוא מגיע בממוצע ל-72.2% כאשר המחטים נמצאות בתוך 128,000 טוקנים, ול-21.3% בווריאנט ה-pointwise של מיליון טוקנים. נתון ה-Long-Context Recall שלו הוא 76%, ו-CharXiv Reasoning מגיע ל-74.5% ללא כלים ול-76.5% איתם. חלון של מיליון טוקנים הוא יכולת אמיתית; שליפה אמינה מהקצה הרחוק שלו היא יכולת קטנה יותר, ושני המספרים שלמעלה הם המרחק ביניהן. החלון של מודל Claude לא נמדד באותה צורה על אותו לוח, ולכן אין עבורו נתון מקביל, והמאמר הזה לא ימציא אחד.
תקרות הפלט הן המובהקות יותר באופן מיידי. Claude Haiku 5.5 יפלוט 128,000 טוקנים בתגובה אחת; Gemini 3.5 Flash-Lite נעצר ב-65,536. אם התוצר שאתם רוצים בחזרה הוא קובץ ארוך, מיגרציה מלאה, חבילת בדיקות מיוצרת או שכתוב בהיקף של תמלול, אחד משני המודלים האלה מסוגל להפיק אותו בקריאה אחת והשני לא — ועבודה שמפוצלת לשתי קריאות עולה יותר מפי שניים מקריאה אחת, מפני שהקידומת המשותפת נשלחת פעמיים.

אודיו ווידאו זה לא שאלה של מחיר
Gemini 3.5 Flash-Lite מקבל וידאו באותו תעריף כמו טקסט. Gemini 3.5 Flash-Lite מקבל תמונות.
עבור פייפליין שקולט שיחות מוקלטות, צילום מסך או צילומי מעקב, הפער ביכולות שמשנה אינו עשרים ואחת נקודות המדד. אלא שאחד מהמודלים האלה מקבל את הקלט ישירות, והאחר זקוק לשלב תמלול או חילוץ פריימים לפניו — מודל שני, חשבון שני, ומצב כשל חדש שיושב בין המקור לתשובה. צוותים במצב כזה לא בוחרים בין שתי דרגות זולות. הם בוחרים בין מודל אחד לבין פייפליין.
ההפך נכון לגבי תמונות ומסמכים. שני המודלים קוראים תמונות באופן נייטיבי, ו-Claude Haiku 5.5 עושה זאת ב-43.40 בציון המשולב, כך שעומס עבודה של חילוץ תמונות עמוד או הבנת תרשימים, בלי אודיו בו, שייך לצד של Anthropic לפי המספרים ולא לפי טיעון מודאליות.
מריץ אחד מהשניים מכאן
Gemini 3.5 Flash-Lite נמצא בקטלוג של OrcaRouter במחיר המחירון של Google עם 0% תוספת, כלומר תעריף הספק מועבר כמו שהוא ולא ממוזג, ושינוי בכרטיס של Google מגיע לחשבונית שלך ביום שבו הוא מגיע לשלהם. זהו מפתח אחד ו-SDK אחד עבור השכבה של Google לצד Claude Sonnet 5.5 ו-Claude Opus 5.5, שגם הם נמצאים בקטלוג — כך ש-A/B בין רגל של Google Flash-Lite לרגל של Anthropic הוא כבר קונפיגורציה ולא פרויקט אינטגרציה. failover אוטומטי נמצא, כך שאף אחת מהרגליים אינה נקודת כשל בודדת, ו-ה-DSL של הניתוב יבטא את ההסלמה בנתיב אם זה המקום שאליו שייכת הלוגיקה.
פרופיל זמן ההשהיה של הקטע הזה מבוסס על המדידה שלנו ולא על זו של הספק. לאורך שבעת הימים האחרונים של תעבורה חיה, Gemini 3.5 Flash-Lite שמרה על p50 של 2,426 מילישניות ו-p95 של 8,600 מילישניות בקצב של 280 אסימוני פלט לשנייה, עם שיעור שגיאות של 0.313%. יש לקרוא זאת כחלון מתגלגל ולא כהבטחה: הוא משתנה ככל שהתעבורה ותנאי הספק משתנים, והמספר שכדאי לסמוך עליו עבור pipeline נתון הוא זה שתמדדו בעצמכם לאחר שבוע.

Claude Haiku 5.5 אינו בקטלוג. הוא שוחרר ב-7 באוקטובר 2026 — יום לפני שנכתבו הדברים האלה — והוא אינו ניתן לניתוב דרכנו היום, כך שהצד של Anthropic בהשוואה הזו נגיש כיום רק אצל Anthropic. לומר זאת במפורש עדיף מלהשאיר זאת משתמע. פער בין שחרור מודל לבין היכולת להפעיל אותו דרכנו הוא דבר רגיל, הוא אינו הבטחה מתי הוא ייסגר, וקורא שמתכנן מיגרציה צריך לתכנן לפי לוח השנה שהוא רואה ולא לפי זה שהוא היה מעדיף.
איזה אחד, ולמי?
אם העבודה היא טקסט נכנס וטקסט יוצא, אם הפרומפטים נכנסים מתחת ל-100,000 טוקנים, ואם המשימה דורשת תכנון רב-שלבי או סוכנים לטווח ארוך, Claude Haiku 5.5 הוא המודל החזק יותר בעשרים ואחת נקודות והזול יותר לכל טוקן בפי שלושה עד חמישה. תקצב לפי עלות למשימה ולא לפי כרטיס התעריפים, צפה לכ-$0.21 בערך עבור סוג העבודה שהמועצה העצמאית מודדת, וספור מחדש את הפרומפטים שלך לפני שאתה מנבא משהו, כי שינוי הטוקנייזר מזיז את הספירה בכ-30 אחוזים בעצמו.
אם העבודה קצרה, בעלת נפח גבוה ובעלת צורת תשובה — תג, קטגוריה, חילוץ, החלטת מחסום — אז החשבון מעדיף את Gemini 3.5 Flash-Lite, וזאת מסיבה לא זוהרת. החשבון עבור קריאה שמייצרת מעט מאוד נשלט על ידי הקלט, שני תעריפי הקלט הם $0.30 מול $0.10, וטביעת הרגל הקצרה בהרבה של המשימה של מודל Google פירושה שהתעריף הזול מנצח בעבודה המוגמרת למרות שהוא מפסיד במחיר הנקוב. הוסף קלט וידאו, אודיו או קובץ והבחירה מפסיקה להיות עניין של מחיר בכלל.
מה שהציוות הזה בעצם קובע הוא צר יותר מ"ה-Haiku החדש זול". הוא קובע שהתעריף המוצהר במסלול זול הוא מדריך גרוע לכמה אותו מסלול עולה לך, ושהמודל שנראה יקר פי שלושה בעמוד התמחור יכול לשלוח לך את החשבונית הקטנה יותר. בכל דרך שתבחר, מדוד את הטוקנים שאתה מפיק ולא את אלה שאתה שולח, כי בשני המודלים האלה זה המונה שלפיו החשבון באמת נכתב.
