
Ling-3.1-flash משיג 41 במדד Artificial Analysis Intelligence Index: ה-MoE 560B מכפיל את קודמו
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
Ling-3.1-flash, מודל mixture-of-experts עם 560 מיליארד פרמטרים של Ant Group, נושא כעת מספר שהמעבדה שלו עצמה לא כתבה: 41 במדד Artificial Analysis Intelligence Index. את המדד מריץ המעריך העצמאי, על חומרה שהמעריך שולט בה, מול סוללת מבחנים קבועה — והוא מציב את המודל 21 נקודות מעל קודמו הישיר, Ling-3.0-flash, שעדיין עומד על 20 באותו מדד. Ant הכריזה על Ling-3.1-flash בסוף ספטמבר 2026, Artificial Analysis מתארכת את מועד ההשחרור ל-1 באוקטובר, והוא צעיר בשלושה חודשים מהמודל שהוא מכפיל את ציונו.
הפער הזה הוא הסיפור. תנועה של 21 נקודות במדד מורכב שעשרה מבחנים שונים מזינים אותו היא לא מסוג הדברים שתרשים של ספק יכול לזייף, והיא לא מסוג הדברים שהבלוג הזה יכול היה לכתוב עליהם לפני שבועיים, כאשר המדידה היחידה שהייתה קיימת ל-Ling-3.1-flash הייתה כרטיס הבנצ'מרק של Ant עצמה: 1,673 Elo ב-GDPval-AA v2.1, 75.16 ב-FrontierSWE, 65.35 ב-HealthBench Professional. המספרים האלה היו טענות אמיתיות של מעבדה אמיתית, אך לא שוחזרו. ה-41 שונה בסוגו. זהו הנתון הראשון במהדורה הזו שאפשר לחייב צד שלישי לעמוד מאחוריו.
מה שה־41 בעצם מודד
Artificial Analysis Intelligence Index v4.3.2 הוא צירוף משוקלל של עשר הערכות: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience ו-AA-LCR v1.1. קריאה של צירוף משוקלל בבידוד היא טעות, לכן שורות לפי הערכה חשובות יותר מהנתון הכולל:
• GDPval-AA — 1,621.75 עבור Ling-3.1-flash לעומת 948.35 עבור Ling-3.0-flash. זהו הזינוק הבודד הגדול ביותר בקבוצה, וזה שרוב תנועת המדד נשענת עליו.
• GDP.pdf — 0.100 all-pass, עלייה מ-0.054. עדיין נמוך במונחים מוחלטים, אך כמעט הכפלה.
• AA-LCR v1.1 הסקה בהקשר ארוך — 0.83 לעומת 0.73 אצל קודמו, ובשוויון עם DeepSeek V4.1 Flash (Max) ב-0.84.
• SciCode — 0.541 לעומת 0.420. שיפור במדעי הקידוד, לא שיפור באיכות הצ׳אט.
• הסקה פיזיקלית ב-CritPt — 0.180, לעומת 0.017 לפני כן. פי עשרה מהקודם על בסיס קטן.
• AA-Omniscience — +2.22, לעומת −17.88 עבור Ling-3.0-flash. על כך נדון בהמשך, משום שזה מנוגד לכותרת.
Ling-3.0-flash לא רק הפסיד ל-Ling-3.1-flash בשורות האלה; הוא קרס בשתיים מהן. הוא השיג 0.032 ב-AutomationBench-AA ובדיוק 0.000 ב-Terminal-Bench 4.0. זהו ההקשר שבו יש לקרוא את ה-41 — קודמו היה מודל יעיל, זול ובעל משקולות פתוחות, שלמעשה לא הייתה לו כל יכולת סוכנית-טרמינלית כלל.

מאיפה הגיע הרווח: עבודה אג'נטית, לא שיחה
השוו את תרומות המדד של Ling-3.1-flash לאלה של שני המודלים מרמת Flash שאיתם הוא מוצב לרוב זה לצד זה, ותתגלה תבנית שהנתון המצרפי מסתיר. DeepSeek V4.1 Flash (Max) רושם 39 באותו מדד ו-GLM 5.3 Flash רושם 42, כך שכל השלושה נופלים בתוך טווח של שלוש נקודות. אבל הם מגיעים לשם ממקומות שונים.
• עבודת טרמינל אג'נטית — Ling-3.1-flash 0.333 ב-Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0.268, GLM 5.3 Flash 0.328.
• עבודה אג'נטית בעולם האמיתי — Ling-3.1-flash 1,621.75 Elo ב-GDPval-AA, DeepSeek V4.1 Flash (Max) 1,600, GLM 5.3 Flash 1,646.86.
• AutomationBench-AA — Ling-3.1-flash 0.617, DeepSeek V4.1 Flash (Max) 0.689, GLM 5.3 Flash 0.604.
• מדעי הקידוד — Ling-3.1-flash 0.541 ב-SciCode, DeepSeek V4.1 Flash (Max) 0.519, GLM 5.3 Flash 0.516.
הקריאה הצרה היא ש־Ling-3.1-flash תחרותי בבנצ'מרקים אג'נטיים ומעט לפני ב־SciCode. הקריאה השימושית היא שהוא החזק מבין השלושה בשני מדדי הטרמינל האג'נטיים שרוב האנשים מתכוונים אליהם כשהם אומרים "האם הוא יכול להניע לולאת כלים" — והוא מאחורי שניהם במדד מהימנות הידע. זהו צורה ספציפית, לא ניצחון כללי, וכדאי לתת לזה שם לפני שמישהו קונה עומס עבודה על סמך מספר המדד בלבד.
החשבון שמגיע עם מודל גדול יותר
Ling-3.0-flash תומחר ב-$0.07 למיליון טוקני קלט וב-$0.22 למיליון טוקני פלט ב-API של Ant עצמה, והוא הופץ עם משקולות פתוחות תחת MIT. Ling-3.1-flash עדיין אינו אף אחד מהדברים האלה. Artificial Analysis רושם את עלות ההפעלה שלו ב-$0.30 למיליון קלט וב-$0.90 למיליון פלט — עם תעריף של $0.06 לפגיעת מטמון, הנחה של 80% על הקלט — כפי שנמדד מול ה-API של InclusionAI עצמה כספק השירות. זו עלייה של בערך פי ארבעה במחיר הקלט לעומת הדגם שהוא מחליף, עבור עלייה של 21 נקודות במדד.
האם העסקה הזו משתלמת תלוי לחלוטין בעומס העבודה, והמדד עצמו יכול לתמחר אותה: הרצת כל עשרת ההערכות של Intelligence Index מול Ling-3.1-flash עולה כ-$960 לפי התעריפים האלה, לעומת כ-$477 עבור DeepSeek V4.1 Flash (Max) ו-$280 עבור GLM 5.3 Flash. הסיבה אינה רק לוח התעריפים. Ling-3.1-flash הוא מודל חשיבה פטפטן מאוד — הוא שרף 220 מיליון טוקנים של פלט בעבודה על המדד, הרבה מעל החציון של שכבת המחיר שלו, והרצות ההערכה שלו נמשכות בממוצע כ-357 שניות למשימה לעומת 285 שניות עבור DeepSeek V4.1 Flash (Max) ו-979 שניות עבור GLM 5.3 Flash. על בסיס לכל משימה, Ling-3.1-flash עולה כ-$0.99 לעומת $0.27 של DeepSeek ו-$0.25 של GLM 5.3 Flash.
שום דבר מזה לא נראה מכביש 41, וכל זה נוחת על החשבונית. מודל יכול לנצח במדד ולאבד תקציב.
שני המספרים שסותרים את הכותרת
הראשון הוא אמינות הידע. Ling-3.1-flash מקבל ציון +2.22 ב-AA-Omniscience, שמודד אם מודל יודע מה הוא יודע: תשובות נכונות מזכות בנקודות, הזיות עולות בנקודות, וסירובים אינם עולים דבר. שיעור הדיוק שלו הוא 29.1% ושיעור ההזיות שלו הוא 37.9%. בהשוואה לעמיתיו לדור, זהו הפרופיל החלש ביותר בקבוצה — GLM 5.3 Flash מקבל ציון +7.47 עם שיעור הזיות של 27.6%, ו-DeepSeek V4.1 Flash (Max) מקבל ציון −5.30 עם שיעור הזיות מדהים של 96.5% מבין השאלות שנענו. הציון המשולב מתגמל את Ling-3.1-flash על היכולת שהוא מפגין, לא על האמינות שבה הוא מפגין אותה, ומודל שממציא שליש ממה שהוא טוען זקוק לאחזור מידע סביבו בפרודקשן.
השני הוא הקשר. Artificial Analysis מציג את Ling-3.1-flash עם חלון הקשר של 1,000,000 טוקנים. חומרי ההשקה של Ant עצמה גם מציינים 1M כיעד. אבל תיעוד המפתחים של Ant, שמפרט את חלונות המשפחה דגם אחר דגם, מעניק ל-Ling-3.0-flash 256K מקורי שניתן להרחבה ל-1M, ואינו מכיל עדיין ערך עבור Ling-3.1-flash כלל. השורה הייחודית של הקשר ארוך שאכן נמדדה — AA-LCR ב-0.83 — היא ציון של הסקה על פני הקשר ארוך, לא מדידת חלון מוגש. התייחס ל-1M כתקרה המוצהרת, ואמת את החלון שנמסר באמצעות בקשת הקשר ארוך משלך לפני שאתה מתכנן סביבו.
איך זה משתווה בדף המפרט
התמונה ממד אחר ממד, הנושא ראשון, בכל שורה:
• סך כל הפרמטרים — Ling-3.1-flash 560B לעומת DeepSeek V4.1 Flash (Max) 552B לעומת GLM 5.3 Flash 320B.
• פרמטרים פעילים לכל טוקן — Ling-3.1-flash 25B מול DeepSeek V4.1 Flash (Max) 16B מול GLM 5.3 Flash 18B. Ling-3.1-flash מפעיל את המספר הרב ביותר, וזו אחת הסיבות לכך שעלות השירות שלו נמצאת במקום שבו היא נמצאת.
• משקלים ורישיון — Ling-3.1-flash לא פורסם (קנייני, אין טקסט רישיון) לעומת DeepSeek V4.1 Flash (Max) פתוח תחת MIT לעומת GLM 5.3 Flash פתוח תחת MIT.
• הקשר מוצהר — Ling-3.1-flash 1M לעומת DeepSeek V4.1 Flash (Max) 1M לעומת GLM 5.3 Flash 1M. שלושתם טוענים לאותה תקרה; רק לשניים מהם יש צ'קפוינט להורדה שאפשר לאמת אותו מולו.
• מודאליות — Ling-3.1-flash קלט טקסט, פלט טקסט לעומת DeepSeek V4.1 Flash (Max) קלט טקסט ותמונה לעומת GLM 5.3 Flash קלט טקסט, תמונה וווידאו. זהו הציר היחיד שבו Ling-3.1-flash פשוט מפגר מאחור, ואף שורת בנצ'מרק אינה מפצה על כך.
• מחיר ב-API של הספק — Ling-3.1-flash $0.30 / $0.90 למיליון קלט / פלט לעומת DeepSeek V4.1 Flash (Max) $0.30 / $1.20 לעומת GLM 5.3 Flash $0.15 / $0.50.
• ציון מדד — 41 מול 39 מול 42. פער של שלוש נקודות בהשוואה תלת-כיוונית אינו דירוג; זהו תיקו שנשבר לפי ההערכה שאליה עומס העבודה של הקורא במקרה דומה.
איפה אפשר לקרוא לזה
Ling-3.1-flash אינו נמצא בקטלוג של OrcaRouter היום — חיפוש מול ה-API הציבורי שלנו למודלים עבור המודל תחת InclusionAI מחזיר not-found, ולא נרמוז אחרת. כיום הוא פועל על ה-API של Ant עצמה ועל פלטפורמות צד שלישי שנושאות את המהדורה, וזו המידה הכנה של זמינותו. מה שכדאי לציין לכל מי שמשווה את שלושת המודלים לעיל הוא ששני האחרים ניתנים לניתוב כבר עכשיו: DeepSeek V4.1 Flash ו-GLM 5.3 Flash נמצאים שניהם בקטלוג של OrcaRouter במחירי המחירון של הספקים שלהם עם אפס תוספת, מאחורי מפתח API יחיד, עם מעבר אוטומטי בין השניים. אם ההשוואה לעיל אומרת שעומס העבודה שלך מעדיף אמינות ידע על פני עבודת טרמינל סוכנית, GLM 5.3 Flash הוא זה שכדאי לנסות — ותוכל לנסות אותו מול DeepSeek V4.1 Flash עם אותו מפתח בלי חוזה נוסף או שורת קוד לקוח חדשה.
מה ה-41 משנה, ומה לא
מה שזה משנה הוא מעמדו של השחרור. Ling-3.1-flash אינו עוד מפרט עם תרשים ספק מצורף; זהו מודל עם מיקום שנמדד באופן עצמאי, ומיקום זה הוא קפיצת דור אמיתית ביכולת הסוכנית לעומת Ling-3.0-flash — סוג הקפיצה שנובע משינוי תכנון ולא מיותר מחשוב על אותו מתכון. מה שזה לא משנה הוא דבר בנוגע לרכש. המשקלים עדיין סגורים, הרישיון עדיין לא נכתב, המודאליות עדיין טקסטואלית בלבד, והמחיר הוא בערך פי ארבעה מזה של קודמו עבור רווח שמתרכז במשימות סוכן ומסוף.
אם העבודה שלך היא לולאות סוכנים, הנעת כלים ושרשראות כלים ארוכות, ה-41 הוא המספר המשמעותי ביותר שפורסם על המודל הזה עד כה, והוא ראוי לבחינה רצינית כל עוד הזמינות עוד מתרחבת. אם העבודה שלך היא מולטימודלית, או מענה על שאלות קריטיות מבחינת ידע, או הסקה בנפח גבוה רגישת תקציב, ה-41 לא מגיע לבעיה שלך — ו-GLM 5.3 Flash, שכבר ניתן לנתב אליו וכבר פתוח תחת MIT במחצית ממחיר הפלט, הוא המודל הממוקם טוב יותר מבין השלושה. המדד אומר לך היכן ניצב Ling-3.1-flash. הוא לא אומר לך אם כדאי שיהיה לך אכפת, ואת השאלה הזו עונה מה שאתה בונה.


השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
