כרטיס הירו מיוצר עבור 'Claude Haiku 5.5 לעומת Ling 3.0 Flash' עם שני פאנלים המופרדים בקו דק: השמאלי המסומן 'Claude Haiku 5.5' נושא 'אינדקס 43' ו'נוכחי', הימני המסומן 'Ling 3.0 Flash' נושא 'אינדקס 20' ו'מיושן'. בשורת פוטר כתוב 'ציונים לפי Artificial Analysis.' הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Engineering & Research

Claude Haiku 5.5 לעומת Ling 3.0 Flash: לאחד מהמודלים האלה כבר יש יורש

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

נתחיל בעובדה המוזרה, כי היא זו שאמורה לעצב את ההחלטה. Ling 3.0 Flash — המודל במשקולות פתוחות בעל 124 מיליארד הפרמטרים של Ant Group, שיצא באוגוסט 2026 תחת רישיון MIT — מסומן כעת כמיושן, כאשר Ling 3.1 Flash מוגדר כמחליפו. Claude Haiku 5.5 הגיע ב-7 באוקטובר 2026, יומיים לפני כתיבת שורות אלה, ו-Anthropic התחייבה שלא להוציא אותו משימוש לפני אוקטובר 2027. שני מודלים באותו טווח מחירים, ואחד מהם כבר מכוון אל מחליפו שלו.

האסימטריה הזו אינה פסק דין על איכות. Ling 3.0 Flash הוא מודל מהיר באמת, עם משקלים פתוחים וארכיטקטורה יוצאת דופן, ובכמה מישורים הוא גובר לחלוטין על שכבת Anthropic. אבל זה כן אומר שלהשוואה הזו יש חיי מדף, וכל מאמר שמתייחס לשניים כבעלי עמידות שווה מוכר לך את החלק שפג תוקפו.

שתי מהדורות, שני גילאים שונים מאוד

הנתונים הבלתי־תלויים כאן הם מ-Artificial Analysis; הטענות הספציפיות לספקים הן מכרטיסי המודל והתיעוד, והן מסומנות.

• שחרור — Ling 3.0 Flash ב-4 באוגוסט 2026, עם מאגר Hugging Face המתוארך ל-2 באוגוסט. Claude Haiku 5.5 ב-7 באוקטובר 2026.

• רישיון — MIT עבור Ling 3.0 Flash, שהוא בערך הכי מתירני שמשקלים פתוחים מגיעים אליו. Claude Haiku 5.5 הוא קנייני, API בלבד.

• סטטוס — Ling 3.0 Flash נושא דגל התיישנות המצביע על Ling 3.1 Flash. Claude Haiku 5.5 הוא העדכני, עם התחייבות לאי-פרישה עד אוקטובר 2027.

• אימוץ — המאגר של Ling 3.0 Flash צבר 11,797 הורדות ו-427 לייקים. זהו טביעת רגל אמיתית אך צנועה, והיא מהווה מדד סביר למידת הצמיחה של כלים של צד שלישי סביב המודל.

פער הגילאים חשוב יותר ממה שמרמזים שישה שבועות. Ling 3.0 Flash הושק לתוך תקופה שבה המשפחה שלו עצמה כבר נעה; Claude Haiku 5.5 הושק כחבר החדש ביותר בסדרה שאין לה יורש מוכרז.

הארכיטקטורה היא החלק ששווה לקרוא פעמיים

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash, showing 427 likes, the 'TextGeneration', 'Safetensors', 'conversational' and 'custom_code' tags, and the introduction text describing the model as a native hybrid reasoning model operating with 124B total and 5.1B active parameters (about 12.4% and 8.1% of the previous 1T-class flagship Ring-2.6-1T) built on a native hybrid linear attention architecture.

Ling 3.0 Flash הוא מודל תערובת מומחים עם 124 מיליארד פרמטרים בסך הכל ו-5.1 מיליארד פעילים לכל טוקן. היחס הזה הוא כל הטיעון הכלכלי: אתה מתאים את טביעת הזיכרון של מודל גדול ומשלם את החישוב של מודל קטן. התצורה שפורסמה היא ספציפית, והיא לא עטיפה מחדש של טרנספורמר סטנדרטי:

• ריבוד — 35 שכבות KDA עם 7 שכבות Gated MLA ביחס 5:1, בתוספת 2 שכבות צפופות. מתכון האימון שפורסם מעביר את חלון ההקשר מ-8K ל-32K ל-256K בשלבים, במקום לאמן את החלון הארוך מאפס.

• מומחים — 512 מומחים מנותבים עם מומחה משותף אחד, 8 מופעלים לכל אסימון, על גודל נסתר של 2,560, גודל ביניים של מומחה של 768 וגודל ביניים צפוף של 6,144. אוצר המילים הוא 157,184 אסימונים.

• הגשה — פריסת הייחוס של הכרטיס משתמשת ב-SGLang עם --context-length 262144, ומדווחת ש-HiCache עם מטמון Mooncake מקצר את הזמן לאסימון הראשון ב-60–80% או יותר בקלטים ארוכים. זהו נתון מדווח על ידי ספק והוא מוצהר ככזה.

שום דבר מזה אינו גימיק. טביעת רגל פעילה של 5.1B היא הסיבה לכך שניתן לשרת את Ling 3.0 Flash בתפוקה שאליה הוא מגיע, ועבודת המטמון היא הסיבה לכך שזמן ההשהיה של האסימון הראשון שלו בהנחיות ארוכות נשאר שמיש. הגישה של Claude Haiku 5.5 היא ההפוכה: מודל קנייני צפוף אחד מאחורי API, עם חלון של 1,000,000 אסימונים וחשיבה אדפטיבית שמחליטה עבור כל בקשה כמה עבודה לבצע. שתי תשובות קוהרנטיות לאותה שאלת עלות.

המספרים, זה לצד זה

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.0 Flash - the scoreboard'. The Claude Haiku 5.5 column reads independent score 43 (AA, #2 of 182), weights Proprietary API, context 1,000,000 tokens, input price $0.10 / 1M, output price $0.50 / 1M and throughput 240.4 tok/s. The Ling 3.0 Flash column reads independent score 20 (AA, #3 of 65), weights MIT open weights, context 262,000 tokens, input price $0.075 / 1M, output price $0.22 / 1M and throughput 333.6 tok/s. A footer line reads 'Independent figures per Artificial Analysis; pricing per each vendor.'

• ציון עצמאי — Claude Haiku 5.5 עם 43 במדד Intelligence Index, שני מתוך 182. Ling 3.0 Flash עם 20, שלישי מתוך 65 בקטגוריה שלו.

• מחיר קלט למיליון טוקנים — Claude Haiku 5.5 $0.10 עד 100,000 טוקנים, $0.50 מעל. Ling 3.0 Flash $0.075, עם הנחת מטמון של 80%.

• מחיר פלט למיליון טוקנים — Claude Haiku 5.5 $0.50 עד 100,000 טוקנים, $2.50 ומעלה. Ling 3.0 Flash $0.22.

• עלות משולבת — $0.05 למיליון טוקנים עבור Ling 3.0 Flash, לעומת $0.08 עבור Claude Haiku 5.5 לפי החישוב המשולב של הלוח עצמו.

• מהירות — 333.6 אסימוני פלט בשנייה עבור Ling 3.0 Flash, הראשון מבין 65 בקטגוריה שלו, לעומת 240.4 עבור Claude Haiku 5.5. הזמן עד לאסימון הראשון הוא כמעט תיקו: 2.50 שניות לעומת המדידה של טבלת הדירוג עבור המודל של Anthropic.

• הקשר — 262,000 טוקנים עבור Ling 3.0 Flash; 1,000,000 עבור Claude Haiku 5.5.

• מודאליות קלט — טקסט בלבד עבור Ling 3.0 Flash. טקסט ותמונות עבור Claude Haiku 5.5.

• משקלים — MIT וניתנים להורדה עבור Ling 3.0 Flash. קנייני עבור Claude Haiku 5.5.

הטיעון של Ling הוא מהירות ומחיר, לא עומק

פער המדד של 23 נקודות בין 43 ל-20 הוא הכותרת, והוא מצביע לאותו כיוון כמו בכל השוואה מסוג זה: Claude Haiku 5.5 הוא המודל החזק יותר, והפער אינו קטן. אבל העמודה של Ling מנצחת בשתי שורות באופן מובהק, ושתיהן מהסוג שמופיע בחשבונית או בתקציב השהיה.

ראשית, תפוקה. 333.6 טוקנים לשנייה הוא המהיר ביותר בקטגוריה שלו בלוח, בערך 39% מקדים את Claude Haiku 5.5, ובשילוב עם עלות משולבת נמוכה יותר זה אומר שייצור בכמות גדולה — סריקות סיווג, תיוג נתונים, חילוץ מובנה בנפח גבוה — זול יותר באופן מדיד להפעלה על Ling 3.0 Flash. כאשר המשימה מוגדרת היטב ואופן הכשל ברור, מודל שמפגר ב-23 נקודות Index עדיין יכול להיות הבחירה הנכונה.

שנית, הנחת המטמון של 80%. עבור עומס עבודה עם קידומת יציבה גדולה וזנב משתנה קטן, שיעור הקלט האפקטיבי ב-Ling 3.0 Flash יורד הרבה מתחת למחיר הנקוב, ועיצוב המטמון של כרטיס המודל מכוון בדיוק לדפוס הזה. שיעור הקריאה מהמטמון של Claude Haiku 5.5, $0.01, זול יותר במונחים מוחלטים, אך כתיבת המטמון שלו עולה $0.125 והמודל מתומחר עם מדרגה ב-100,000 אסימוני קלט, שאין ל-Ling.

הגורם המאזן הוא וורבוזיות, והוא זהה לזה שחל על המודל של Anthropic. Artificial Analysis תיעדה 260 מיליון אסימוני פלט בהרצת ה-Index על Ling 3.0 Flash לעומת חציון של 100 מיליון, ומסמנת אותו כוורבוזי. במודל שמתומחר לפי אסימון זה שוחק את יתרון התעריף — תעריף פלט זול פי 2.3 שנצרך בחלקו על ידי מודל שכותב יותר אסימונים הוא יתרון קטן יותר ממה שהכרטיס מרמז.

מה שהבנצ'מרקים של הספקים טוענים, ומה שהם לא

הכרטיס של Ling 3.0 Flash עצמו מדווח על סט חזק: MathArena AIME 2026 ב-93.2, HMMT פברואר 2026 ב-87, SWE-Bench Pro ב-56.6, SWE-Bench Multilingual Resolved ב-72.4, ו-Humanity's Last Exam ב-22.7. כל אחד מאלה מדווח על ידי הספק, ואף אחד מהם לא שוחזר כאן באופן בלתי תלוי. הם גם לא נמדדים מול Claude Haiku 5.5 על אותה תשתית הרצה — Anthropic מפרסמת סט משלה (GDPval-AA v2.1 ב-1620, OSWorld 2.1 ב-72.4%, Terminal-Bench 4.0 ב-39.2%), ושני הספקים הריצו חבילות בדיקות שונות. המדד המשותף היחיד הוא לוח התוצאות העצמאי, ושם התשובה חד-משמעית.

ראוי לציין, לצד ציוני המתמטיקה: נתון ה-HLE של 22.7 נמוך בהרבה מה-45.9 ללא כלים שעליו מדווחת Anthropic עבור Claude Haiku 5.5. מדובר במערכות בדיקה שונות, כך שזו אינה השוואה ישירה, אבל גם לא פער שאפשר לתרץ בבחירת מערכת הבדיקה.

A screenshot of the Artificial Analysis page for Ling 3.0 Flash carrying a deprecation notice that the model is deprecated and that only the default 10k-input-token workload is still benchmarked, and that InclusionAI has launched a newer release, Ling 3.1 Flash, which it suggests considering instead. Beneath the notice the page shows the model as an open-weights release from August 2026 with an Intelligence rank of 3 of 65 and a speed rank of 1 of 65.

בעיית היורש

זה החלק שקובע את ההשוואה עבור כל מי שמתכנן מעבר לרבעון הנוכחי, ואין לו שום קשר לבנצ'מרקים.

Ling 3.0 Flash הוצא משימוש לטובת Ling 3.1 Flash. זה לא אומר שהוא מפסיק לעבוד — משקלים פתוחים אינם פגים, ורישיונות MIT אינם ניתנים לביטול. אבל זה כן אומר שהמערכת האקולוגית סביבו תיסחף: תמיכה במסגרות הסקה, מהדורות כימות, תיקוני באגים וכלי קהילה — כולם עוקבים אחרי המודל הנוכחי, ומודל שהוצא משימוש מקבל את זנב תשומת הלב הזה. אם אתם בונים על Ling 3.0 Flash היום, אתם בונים על משקלים שמוקפאים וגמורים, וזה בסדר לעומס עבודה יציב אבל לא נוח לכל דבר שאתם מצפים שישתפר.

ל-Claude Haiku 5.5 יש מערכת ערבויות שהיא תמונת ראי: אתם לא מקבלים את המשקולות, אבל אתם מקבלים ספק שהאינטרס המסחרי שלו הוא לשמור על המודל מהיר, מתוקן וזמין לשירות, בתוספת התחייבות שלא להפסיק את השירות עד אוקטובר 2027 ונתיב הגירה מפורסם לכשזה יסתיים.

שני הצדדים של המסלול הזה, באמצעות מפתח אחד

שורת הזמינות הכנה: OrcaRouter אינו מספק את Ling 3.0 Flash, וגם אינו מספק את Claude Haiku 5.5. Ling 3.0 Flash מוגש דרך ההפצה של הספק עצמו ומספר פלטפורמות צד שלישי; Claude Haiku 5.5 נמצא ב-API של Anthropic ובפלטפורמות הענן המובילות.

מה שנשאר הוא שאלת הניתוב ששני המודלים מעלים. Claude Haiku 5.5 עם 43 וחלון של 1M הוא יעד הסלמה טבעי; Ling 3.0 Flash ב-333 טוקנים לשנייה הוא רגל נפח טבעית. מסלול ששולח עבודה עתירת נפח ומוגדרת היטב לשכבה מהירה ומסלים כל דבר שנכשל בבדיקת אורך או איכות לשכבה חזקה יותר הוא בדיוק הסידור שראוטר מרכיב — ב-OrcaRouter, Claude Haiku 4.5, Claude Sonnet 5.5 ו-Claude Opus 5.5 של Anthropic נמצאים בקטלוג היום, לצד אפשרויות גדולות עם משקלים פתוחים כמו DeepSeek V4.1 Flash ו-GLM 5.3 Flash, כך שאפשר לבנות ולבדוק בעומס כעת גם את רגל ההסלמה וגם את רגל הנפח. מפתח אחד, מעבר אוטומטי בעת כשל מתחת, מחירי המחירון של הספקים מועברים הלאה בתוספת של 0%, כך ששינוי מחיר נכנס לתוקף באותו יום.

איזה מהשניים, ולכמה זמן?

קח את Claude Haiku 5.5 אם העבודה פתוחה מקצה לקצה, אם אתה צריך תמונות או חלון של מיליון טוקנים, אם אתה רוצה ספק שנשא באחריות לזמינות, או אם אתה מתכנן מעבר לרבעון הבא. הוא מקדים ב-23 נקודות Index, הוא עדכני ולא מיושן, והפער במחיר קטן מספיק כדי שפער הציונים יכריע.

קח את Ling 3.0 Flash אם עומס העבודה הוא בכמויות גדולות, מוגדר היטב ורגיש להשהיה, אם רישיון MIT או המשקולות הפתוחות הם העיקר, או אם הנחה של 80% על מטמון עבור קידומת יציבה היא המקום שבו החשבון שלך באמת נמצא. זהו המודל המהיר יותר והזול יותר לכל טוקן, והוא באמת טוב במשימות שמודל 20-Index יכול להתמודד איתן. רק תיכנס לזה בידיעה שאתה מאמץ מודל מוגמר ולא מודל מתוחזק, ושהמחליף שהוא מצביע עליו כבר קיים.