
Claude Haiku 5.5 לעומת Gemini 3.7 Flash: אחד מהשניים הללו כבר הוצא משירות
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
ישנה עובדה מביכה שמסתתרת מתחת לכל השוואה של Claude Haiku 5.5 לעומת Gemini 3.7 Flash שנכתבת היום: Gemini 3.7 Flash הוצא משימוש. הספק הוציא אותו ב-13 באוגוסט 2026, החליף אותו ב-Gemini 3.8 Flash ב-2 בספטמבר, ו-Artificial Analysis מציגה כעת את עמוד 3.7 עם סימון התיישנות עליו. לעומת זאת, Claude Haiku 5.5 הושק ב-7 באוקטובר 2026 ונושא התחייבות לפרישה שלא לפני אוקטובר 2027.
זה לא הופך את ההשוואה לחסרת תועלת. זה משנה את השאלה. זו כבר לא "איזה משני אלה כדאי לי לקרוא" — עבור רוב הצוותים התשובה לכך היא אף אחד מהם, כי סדרת 3.7 הוחלפה בתוך המשפחה של עצמה. מה שכן יש בה תועלת הוא משהו עדין יותר, ואולי שימושי יותר: תמונה ברורה של כמה מהר שכבת ה-Flash של Google התקדמה בשלושה שבועות, ושל אילו חלקים במפרט של מודל בשכבת Flash בעצם קובעים אם משתמשים בו.
מה אתה עדיין יכול למדוד
שני המודלים הורצו על אותו לוח עצמאי, שהוא המקום היחיד שבו ניתן בכלל להשוות בין השניים. ב-Artificial Analysis Intelligence Index v4.3.2, Claude Haiku 5.5 משיג 43.40 בתצורת Max שלו, לעומת 39.06 של Gemini 3.7 Flash בתצורת High שלו — פער של 4.33 נקודות.
שני הספקים גם מפרסמים מערכי הערכה משלהם, והם אינם חופפים באופן שמאפשר השוואה ישירה. השורות העצמאיות המשותפות הן ארבע אלה ש-Artificial Analysis הריצה על שניהם:
• Terminal Bench 4.0 — 0.3283 עבור Claude Haiku 5.5 לעומת 0.1364 עבור Gemini 3.7 Flash. פער מוחלט של 19 נקודות, והאסימטריה הרחבה ביותר בקבוצה.
• SciCode — 0.5498 לעומת 0.5718. Gemini 3.7 Flash גובר עליו ב-2.2 נקודות.
• Humanity's Last Exam — 0.4439 לעומת 0.4787. Gemini 3.7 Flash בפער של 3.5 נקודות.
• AutomationBench, ניקוד חלקי — 0.3541 מול 0.6203. Gemini 3.7 Flash ב-27 נקודות.
קראו את הסט הזה בעיון, כי הוא מכיל את התוצאה המעניינת. Gemini 3.7 Flash מנצח בשלושה מתוך ארבעת מבחני הבנצ'מרק המשותפים ובכל זאת מפסיד במדד המשולב ב-4.3 נקודות. מדד הוא שילוב משוקלל, והשקלול מציב את שורות הטרמינל והקוד — שבהן הפער נע בכיוון ההפוך בפער גדול בהרבה — לפני המצרף של האחרים. זה אינו כל כך ארטיפקט של ניקוד אלא הצהרה על מה שהמדד נועד לו: הוא מנסה לחזות אם מודל יכול לסיים משימה, ובשאלה הזאת סדרת 3.7 הייתה חלשה באופן שציוני הבנצ'מרק המדעיים המכובדים שלה לא הסתירו.

במה סדרת 3.7 הייתה בעצם גרועה
שתי שורות מספרות את הסיפור טוב יותר מאשר האינדקס.
Terminal Bench 4.0 בציון 0.1364 הוא מספר נמוך, והוא יושב לצד 0.8577 בדור הקודם של Terminal Bench מאותו מודל. זה לא מודל שנעשה גרוע יותר; זהו מבחן ששינה את מה שהוא מודד, ו-Gemini 3.7 Flash לא ביצע את המעבר. Claude Haiku 5.5, באותו מבחן מתוקן, משיג 0.3283 — לא מרשים במונחים מוחלטים, אבל כמעט פי שניים וחצי מהנתון של 3.7 Flash, בשורה שמנבאת באופן הישיר ביותר ביצועי קידוד סוכני.
השורה השנייה היא Tau-Bench Banking, שבה Gemini 3.7 Flash משיג 0.3278. אמינות השימוש בכלים בתחום מובנה היא בדיוק הדבר שמודל זול נפרס בשבילו, וציון מתחת ל-0.33 הוא סוג המספר שבשקט הורג פיילוט. ל-Claude Haiku 5.5 אין נתון Tau-Bench מפורסם באותה טבלה, כך שאין שם השוואה זמינה — הדבר הישר הוא לומר זאת במקום להסיק נתון כזה.
במקום שבו Gemini 3.7 Flash החזיק מעמד, זה המקום שבו הוא תמיד החזיק מעמד: GPQA ב-0.9455 ו-MMMU-Pro ב-0.8549 הם שניהם חוזקות אמיתיות, והקלט הרב-מודלי שלו מעולם לא היה מוטל בספק. הכשל היה בחלק של גיליון המפרט שמכריע אם לולאת סוכן עובדת, לא בחלק שזוכה בשורות טבלת המובילים.
מה השתנה בשלושת השבועות שאחרי זה
Gemini 3.8 Flash הושק ב-2 בספטמבר 2026, והתזוזה בתוך שכבת ה-Flash של גוגל עצמה היא ההשוואה השימושית יותר לכל מי שמתכנן פייפליין ל-2027.
באותו מדד, Gemini 3.8 Flash מודד 40.93 לעומת 39.06 של קו 3.7 — שיפור של 1.87 נקודות בשלושה שבועות. Terminal Bench 4.0 עבר מ-0.1364 ל-0.1970. Tau-Bench Banking עבר מ-0.3278 ל-0.4495. אלה בדיוק השורות שבהן מודל 3.7 היה הגרוע ביותר, מה שמרמז שהיורש כוון בדיוק לחולשה הזו ולא לשיפור יכולת כללי.
המחיר לא זז כלל. Gemini 3.7 Flash הוצע במחיר של $0.75 לקלט ו-$3.75 לפלט למיליון טוקנים, ו-Gemini 3.8 Flash הושק באותם $0.75 ו-$3.75 — אותה טבלת מחירים בדיוק, כשהיא צמודה למודל שטוב בשתי נקודות מדד בשורות שחשובות לסוכנים.

כרטיס התעריפים הוא המקום שבו ההשוואה הזו באמת מקבלת תפנית.
לעומת Claude Haiku 5.5, המחיר של Google הוא כל הסיפור, וזה בכלל לא צמוד.
• קלט — Claude Haiku 5.5 $0.10 למיליון טוקנים עד 100,000, $0.50 מעבר לכך; Gemini 3.7 Flash $0.75 אחיד, או פי שבעה וחצי מתעריף Anthropic בתוך השכבה הראשונה.
• פלט — $0.50 עבור Claude Haiku 5.5 בתוך השכבה הראשונה, $2.50 מעליה; $3.75 עבור Gemini 3.7 Flash.
• קלט במטמון — $0.01 ו-$0.125 עבור Claude Haiku 5.5; $0.075 לקריאה ו-$0.75 לכתיבה עבור Gemini 3.7 Flash.
• הקשר — מיליון טוקנים לשניהם. פלט מקסימלי — 128,000 טוקנים עבור Claude Haiku 5.5 לעומת 65,536 עבור Gemini 3.7 Flash.
• מודאליות קלט — טקסט ותמונות עבור Claude Haiku 5.5; טקסט, תמונות, דיבור וווידאו עבור Gemini 3.7 Flash. זוהי עדיין השורה היחידה שבה המפרט של Google ארוך יותר ממש, והיא שרדה ללא שינוי את המעבר ל-3.8.
• עלות עצמאית לכל משימת Index שהושלמה — $0.21 עבור Claude Haiku 5.5 לעומת $0.93 עבור Gemini 3.7 Flash. פער של פי 4.4, רחב יותר ממה שיחס הקלט של שבעה וחצי לאחד היה מרמז, מכיוון שהמודל של Anthropic הוא זה שמרבה במילים כאן: 162,164 אסימוני פלט לכל משימת Index לעומת 58,387 עבור Gemini 3.7 Flash. Anthropic גם מתעדת טוקנייזר משותף עם Claude 4.7 ואילך, שסופר כ-30% יותר אסימונים עבור אותו טקסט, מה שדוחף לאותו כיוון.
• מהירות — 212.3 שניות לכל משימת Index עבור Gemini 3.7 Flash לעומת 424.6 עבור Claude Haiku 5.5. המודל של Google הוא המהיר מבין השניים, פי שניים, וזו השורה היחידה בקטע הזה שבה המודל הזול יותר אינו גם הטוב יותר.
מה זה אומר אם אתם בוחרים היום
המשמעות המעשית היא שאף אחד מהשניים האלה אינו התשובה הנכונה, מסיבות שונות.
Gemini 3.7 Flash הוצא מכלל שימוש, מתומחר באותו תעריף כמו היורש שלו, וגרוע מאותו יורש בדיוק באותן שורות שמודל ייצור זול צריך. להמליץ עליו יהיה להמליץ על מחירון שמצורף למודל שהוחלף — היורש עולה אותו דבר ועושה יותר. אף אחד שבוחר בין השניים באוקטובר 2026 לא צריך לנחות על קו 3.7, והעובדה שמחירון שלו לא השתנה היא מה שמכריע.
Claude Haiku 5.5 הוא המודל הפעיל, ובעבודה של קלט טקסט ופלט טקסט הוא זול יותר בכל מדד, גבוה יותר במדד המשולב, והרבה יותר טוב בשני השורות שמנבאות הצלחה אג'נטית. הוא גם האיטי יותר והוא לא יכול לקלוט דיבור או וידאו. האם זה משנה — זו שאלה לגבי הפייפליין שלך, לא לגבי המודלים.
האפשרות השלישית, שהפער בנקודות המדד בין 3.8 ל-3.7 מבליט, היא ששכבת ה-flash של גוגל נעה מהר מספיק עד כדי כך שהשוואה בת שלושה שבועות היא כבר היסטורית. התייחס לכל השוואה ראש בראש בשכבת flash כבעלת חיי מדף הנמדדים בשבועות, לא ברבעונים.
להריץ את הצד שתנחת עליו
Gemini 3.8 Flash — היורש, ולא 3.7 שהוצא משימוש — נמצא בקטלוג של OrcaRouter במחיר המחירון של Google עם 0% תוספת, כך שהתעריף ש-Google מפרסמת הוא התעריף שמגיע לחשבון שלך, ושינוי מצדם נכנס לתוקף אצלנו באותו היום. Claude Sonnet 5.5 ו-Claude Opus 5.5 נמצאים גם הם בקטלוג, מה שהופך בדיקת ניתוב בין שני ספקים לקונפיגורציה ולא לפרויקט: API אחד ליותר מ-200 מודלים, מפתח אחד, מעבר אוטומטי לגיבוי מתחת למכסה, ו-DSL של הניתוב כשאתה מעדיף להחזיק את ההסלמה בנתיב ולא בקוד.
Gemini 3.7 Flash עצמו אינו בקטלוג שלנו, וגם Claude Haiku 5.5 אינו. שניהם עדיין נגישים דרך ממשקי ה-API של הספקים שלהם, ובמקרה של Google, דרך כמה פלטפורמות צד-שלישי. ראוי לומר זאת בבירור במקום להשאיר לקורא לגלות זאת.

המספר שיש לגרוע
זה לא פער המדד של 4.33 נקודות. זה ש-Gemini 3.7 Flash ניצח בשלושה מבין ארבעת המדדים המשותפים ובכל זאת הפסיד בציון המשולב בארבע נקודות, מפני שהמדד שהאינדקס נותן לו את המשקל הכבד ביותר היה זה שעליו קיבל ציון 0.1364. ציוני המדע של מודל בדרגת Flash יכולים להיראות טובים בזמן שהוא נכשל בדבר שלשמו קונים מודלים זולים.
המסקנה הנלווית היא שהיורש תיקן בדיוק את אותן שורות בתוך שלושה שבועות, במחיר שלא השתנה. על סמך ראיות אלה, הלחץ התחרותי בשכבה הזו אינו המחיר. הוא האם המודל יכול להשלים משימה רבת-שלבים, וזה נע כעת מהר יותר מכרטיסי תעריפים.
