
Claude Haiku 5.5 לעומת Ling 3.1 Flash: מודל בעל 560 מיליארד פרמטרים שעולה פי ארבעה לכל תשובה
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
שישה ימים מפרידים ביניהם. InclusionAI שלחה את Ling 3.1 Flash ב-1 באוקטובר 2026; הספק שלח את Claude Haiku 5.5 ב-7 באוקטובר. שניהם נמכרים כדגמי רמת פלאש, לשניהם חלון הקשר של מיליון טוקנים, ובשורות ההיסק של הלוח העצמאי היחיד שהריץ את שניהם הם כל כך קרובים שההבדל נמצא בתוך הרעש. ואז מגיעים לשורה שמודדת אם סוכן באמת מסיים את העבודה, והם במרחק 26 נקודות זה מזה — ולשורה שמודדת כמה עולה עבודה שהושלמה, שבה המודל עם 560 מיליארד פרמטרים עולה פי ארבעה וחצי מהמודל שאף אחד לא פרסם את מספר הפרמטרים שלו.
אף אחד משני המחירונים לא חוזה זאת. Ling 3.1 Flash מופיע במחיר $0.30 למיליון טוקני קלט ו-$0.90 למיליון טוקני פלט. Claude Haiku 5.5 מופיע במחיר $0.10 ו-$0.50 עבור פרומפטים של עד 100,000 טוקנים, ועולה ל-$0.50 ו-$2.50 מעל לכך. כשקוראים זאת כמחיר לכל טוקן, Ling יקר פי שלושה בקלט וקצת פחות מפי שניים בפלט, וזה סוג הפער שמסיים השוואה בשורה אחת.
זה לא מסיים את זה, מפני שכרטיס התעריפים מתומחר לפי טוקן וההחלטה מתומחרת לפי משימה. שני המספרים האלה יוצאים מההתמודדות הזו בסימנים מנוגדים, והסיבה אינה מילוליות.
מה עולה משימה שהושלמה, לא מה עולה טוקן
ב-Artificial Analysis Intelligence Index v4.3.2, העלות הנמדדת של השלמת משימת אינדקס מלאה אחת היא 0.21 דולר עבור Claude Haiku 5.5 ו-0.99 דולר עבור Ling 3.1 Flash. זהו פער של פי 4.6 — רחב יותר מיחס הקלט של פי 3, ובאותו כיוון.
ההסבר המובן מאליו — שהמודל היקר מדבר יותר — הוא השגוי. Ling 3.1 Flash הפיק 100,671 אסימוני פלט לכל משימת אינדקס; Claude Haiku 5.5 הפיק 162,164. המודל הזול יותר הוא הפטפטן יותר, ביותר מ־60%. אז גם הכסף לא הולך לאן שכרטיס התעריפים מרמז.
פצלו את העלות לכל משימה והיא נוחתת במקום שבו מתודולוגיית האינדקס באמת מוציאה אותה. מתוך $0.21 של Claude Haiku 5.5, כ-62% הם בצד הקלט; מתוך $0.99 של Ling 3.1 Flash, כ-91% הם כך. אלה הרצות הסקה עתירות מטמון, ושני הספקים מתמחרים טוקן קלט שמור במטמון באופן שונה מאוד: $0.01 למיליון עבור Claude Haiku 5.5 לעומת $0.06 למיליון עבור Ling 3.1 Flash — פער של פי 6 בשורה היחידה ששולטת בחשבון. כרטיס התעריפים המפורסם משווה $0.10 מול $0.30. השורה שמכריעה את החשבונית משווה $0.01 מול $0.06.
הקטלוג שלנו מעביר את מחירי המחירון של הספקים הלאה במרווח של 0%, וכך אפשר להבדיל בין שני המצבים בחשבונית חיה ולא בכזו שמבוססת על מודל. Ling 3.1 Flash אינו נמצא בקטלוג בשום איות של נתיב הספק שהצלחנו לפענח — לא תחת InclusionAI, לא תחת Ling, ולא תחת אף אחת משמונה הצורות שניסינו — ולכן ה-$0.30 וה-$0.90 שלמעלה הם התעריפים המפורסמים של הספק עצמו, וזה לא משהו שאנחנו יכולים לנתב עבורך היום. גם Claude Haiku 5.5 אינו בקטלוג; הוא פועל דרך ה-API של Anthropic עצמה. מה שכן נמצא בקטלוג מהסביבה של ההשוואה הזו הוא GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen3.8 Flash ו-Gemini 3.8 Flash, כל אחד במחיר המחירון של הספק עם מרווח של 0%, כך ששינוי בתעריף של ספק מגיע לצד שלנו באותו יום שבו הוא מגיע לשלהם. אם הממצא שלהלן הוא שהפרופיל הסוכני של Ling 3.1 Flash הוא מה שנדרש לעומס העבודה שלך, הצעד המעשי הבא הוא השוואה ראש בראש מול המודלים בעלי היכולות הסוכניות שאנחנו כן מנתבים, על מפתח אחד עם מעבר אוטומטי לגיבוי מתחתיו, ואת ה-DSL של הניתוב כשתקרת העלות צריכה להיות בנתיב ולא בקוד האפליקציה.

שבע שורות שבהן שניהם נמדדו
Artificial Analysis הוא הלוח היחיד שהריץ את שני המודלים, והחפיפה צרה אך מאלפת. השורות אינן מסכימות זו עם זו, וכיוון אי‑ההסכמה אינו אקראי.
• מדד האינטליגנציה v4.2.3 — 43.40 עבור Claude Haiku 5.5 (Max) לעומת 41.09 עבור Ling 3.1 Flash. יתרון של 2.31 נקודות ל-Anthropic.
• עלות לכל משימת Index שהושלמה — $0.21 לעומת $0.99 באותו לוח.
• זמן לכל משימת אינדקס — 424.6 שניות עבור Claude Haiku 5.5 לעומת 360.4 שניות עבור Ling 3.1 Flash. זו השורה שבה הציפייה נשברת: המודל בעל 560 מיליארד הפרמטרים הוא המהיר מבין השניים בכל האינדקס ככלל, בכ-15%.
• Terminal Bench 4.0 — 0.3283 לעומת 0.3333. Ling 3.1 Flash מקדים בחצי נקודה, ובמדד ששני הספקים מצטטים אותו מדובר בתיקו.
• SciCode — 0.5498 לעומת 0.5405. Claude Haiku 5.5 בפער של 0.9 נקודות. גם תיקו.
• Humanity's Last Exam, ללא כלים — 0.443 לעומת 0.3943. Claude Haiku 5.5 בפער של 5 נקודות, ההפרדה האמיתית הראשונה.
• AutomationBench, ציון חלקי — 0.3541 לעומת 0.6174. Ling 3.1 Flash ב-26 נקודות, ובפער גדול יותר מכל שאר הפערים ברשימה הזו גם יחד.
שתי שורות נוספות נמצאות מחוץ לקבוצה המשותפת הזו וכדאי לכלול אותן, מפני שהן אלה שהקונים שמים לב אליהן ביותר. ב-GDPval-AA, ש-Artificial Analysis מפעילה ב-44 מקצועות, השתיים הן 1620.05 ו-1621.75 — תיקו סטטיסטי. ב-AA-Briefcase v1.1, הערכה מקצועית ארוכת-טווח בדירוג Elo, Claude Haiku 5.5 מציג 1577.72 לעומת 1400.35 של Ling 3.1 Flash, פער של 177 נקודות לטובת Anthropic. זהו הפער הלא-סוכני הרחב ביותר ביניהם בכל הלוח.
השורה היחידה שאמורה להכריע את רוב השיחות האלה
ממוצעים ברמת האינדקס מסתירים היכן שהזמן והכסף באמת הושקעו, והזוג הזה הוא המקרה הברור ביותר לכך באצווה. המספרים לפי כל הערכה ב-Terminal Bench 4.0 אינם קרובים באף ממד מלבד הציון.
• Terminal Bench 4.0, Ling 3.1 Flash — 0.3333 ב-5.49 דולר למשימה ו-1,283 שניות למשימה.
• Terminal Bench 4.0, Claude Haiku 5.5 — 0.3283 ב-0.65 דולר למשימה ו-908 שניות למשימה.
חמש אלפיות של נקודת ציון מפרידות ביניהם. העלות היא פי 8.4 וזמן שעון הקיר הוא פי 1.4. צוות שקורא את טבלת הבנצ'מרק ובוחר במודל שמקבל ציון 0.3333, לפי החישוב של Artificial Analysis עצמה, בחר לשלם פי שמונה כדי להגיע שליש דקה מאוחר יותר עם אותה תשובה.
זו אינה טענה שהציון חסר משמעות; זו טענה שציון הוא יחס בין עבודה שבוצעה לעבודה שנעשה ניסיון לבצע, והוא אינו אומר דבר על המשאבים שנצרכו כדי להגיע לשם. בנצ'מרקים של השלמה אג'נטית הם בדיוק ההקשר שבו ההבחנה הזו נושכת הכי חזק, כי סוכן שמנסה שוב הוא סוכן שמשלם מחיר מלא על כל ניסיון חוזר, ומודל שעולה פי שמונה בכל ניסיון הופך לולאת ניסיונות חוזרים לסעיף תקציבי.

560 מיליארד פרמטרים בלי להוריד דבר
הנה החלק בדף המפרט של Ling 3.1 Flash שהוא באמת יוצא דופן, וזה לא הגודל.
Ling 3.1 Flash הוא מודל תערובת מומחים דליל — 560 מיליארד פרמטרים בסך הכול, 25 מיליארד פעילים לכל טוקן — ו-Artificial Analysis מסווגת אותו כקנייני. אין משקולות, אין קובץ רישיון ואין מאגר. מודל דליל גדול בצורה כזו היה מגיע בדרך כלל כהפצה פתוחה, כי זה מה ששאר הדרג הזה עושה: GLM 5.3 Flash מגיע עם משקולות MIT ב-320 מיליארד בסך הכול ו-18 מיליארד פעילים, ו-DeepSeek V4.1 Flash מגיע עם משקולות MIT ב-552 מיליארד בסך הכול ו-16 מיליארד פעילים. Ling 3.1 Flash הוא מאותה מחלקה של ארכיטקטורה ובאותו סדר גודל, אך פורסם כ-API בלבד.
לבחירה הזו יש תוצאה ששורות הבנצ'מרק לא מציגות. מודל עם 25 מיליארד פרמטרים פעילים חייב להיות מוגש במקום כלשהו, ואם אינך יכול להחזיק את הצ'קפוינט, אינך יכול לבחור היכן או באיזה מרווח — אתה שוכר את ההגשה של הספק. מחיר המשימה של 5.49 דולר ב-Terminal Bench לעיל אינו בעיקר תוצר של תעריף טוקנים; זה מה שעולה לשכור מודל דליל גדול מהצד היחיד שיכול להריץ אותו. האחים עם המשקולות הפתוחות בדרג הזה נותנים לך את האפשרות להזיז את המספר הזה בעצמך.
זה עובד גם בכיוון ההפוך, ואותה כנות חלה גם כאן. גרסה פתוחה היא לא בהכרח המוצר הטוב יותר: אתה יורש את נטל ההגשה, את בחירות הכימות ואת מרוץ ההשדרוגים יחד עם המשקלים, וקובץ רישיון אינו חוזה תמיכה. Anthropic מפרסמת התחייבות לפרישה עבור Claude Haiku 5.5 שלא לפני 7 באוקטובר 2027, ב-API של צד ראשון עם כרטיס מערכת. איזה משני ההסדרים האלה תרצה — זו שאלה לגבי הצוות שלך, לא לגבי אף אחד מהמודלים.
למה מיועד Ling 3.1 Flash
קרא את הפרופיל במלואו והוא מתאר מוצר קוהרנטי ולא מוצר פשרה: מודל גדול, דליל ובעל הקשר ארוך, שמסיים תהליכי עבודה אוטונומיים מרובי-שלבים טוב יותר מכל דבר אחר שנמדד ברצועת המחיר הזו, אינו יוצא דופן בחשיבה חד-פעמית קשה, ועושה זאת בתעריף אחיד ללא צוק באורך הפרומפט. ב-AutomationBench הוא מקדים את Claude Haiku 5.5 ב-26 נקודות, וציון ה-AA-Briefcase שלו הוא הנקודה היחידה בהשוואה הזו שבה הוא נופל מאחורי אמצע השדה ולא בחזיתו.
זהו תיאור מוצדק של עובד סוכני אצווה: כוון אותו אל תור של משימות מובנות שכל אחת מהן חייבת להיות מושלמת, קבל את העובדה שהמשימה נמדדת בדקות, שמור על הפרומפט ארוך מספיק כך ששלב סף יהיה עונשי, והערך אמינות בקו הסיום מעל העלות של כל טוקן בודד. מה שהוא לא טוב בו הוא הדבר שדגמי דרגת פלאש נקנים בדרך כלל בשבילו. הוא מקבל טקסט בלבד — בלי קלט תמונות בכלל, בעוד ש-Claude Haiku 5.5 מקבל טקסט ותמונות. זמן משימת האינדקס שלו קצר יותר, אבל זמן משימת ה-Terminal Bench שלו ארוך יותר, ובתעריף של 0.99 דולר למשימת אינדקס שהושלמה לעומת 0.21 דולר הוא מוציא פי ארבעה וחצי כדי להגיע לאותו ציון משולב כמעט.

איזה מהשניים, על סמך הראיות הקיימות
אם העבודה שלך היא טקסט נכנס, טקסט יוצא, בתמחור לפי טוקן בכמויות, Claude Haiku 5.5 מנצח בהשוואה הזו בכל שורה שמגיעה לחשבונית: עלות משימה נמוכה יותר במדד, עלות משימה אמיתית נמוכה יותר בבנצ'מרק החשוב ביותר לסוכנים, ציון משולב גבוה יותר, ציונים טובים יותר בעבודה מקצועית ארוכת טווח, נאמנות טובה יותר, וקלט תמונות שהמודל האחר אינו מציע כלל.
אם העבודה שלך היא סוכן ללא השגחה שצריך להשלים תהליך עבודה רב-שלבי, Ling 3.1 Flash משיג 26 נקודות יותר מ-Claude Haiku 5.5 במדד המשותף היחיד שמודד בדיוק את זה, וכדאי לבדוק אותו במקום לפסול אותו על סמך מחיר. בדוק אותו על הטרייס שלך, לא על הטבלה הזו — ותמחר את הבדיקה לפי עבודה שהושלמה, כי זה המספר שמשתנה כשסוכן מנסה שוב.
אם אתה צריך להחזיק את המשקולות, אף אחד משני אלה אינו המודל שלך. Ling 3.1 Flash הוא קנייני עם 560 מיליארד פרמטרים; Claude Haiku 5.5 הוא קנייני ללא מספר שפורסם. השחרורים הפתוחים בשכבה זו נמצאים במקום אחר בלוח, וההשוואה הזו מתחילה מקבוצה שונה לחלוטין של שורות.
הציון המשולב אומר 2.31 נקודות. הבנצ'מרק הסוכני אומר 26 בכיוון ההפוך. כרטיס התעריפים אומר פי 3 על קלט; עלות המשימה המוגמרת אומרת פי 4.6 באותו כיוון כמו הכרטיס. ארבעה מספרים, שני כיוונים — ולכן הדרך האמינה היחידה להכריע בכך היא להריץ את שניהם מול עקבה של העבודה שלך ולקרוא את העלות מהמשימות שהושלמו ולא מהטוקנים.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
