כרטיס כותרת ראשי עבור 'Ling-3.1-flash מגיע ל-41 במדד ה-AA Intelligence Index', עם כותרת משנה '560B סה"כ / 25B פעילים MoE מ-Ant Group'. כרטיס מעוגל גדול נושא את המספר '41' עם התווית 'Artificial Analysis Intelligence Index v4.3.2'; מתחתיו כרטיס קטן שני מציג 'לעומת 20' עם התווית 'Ling-3.0-flash'. שורת כותרת תחתונה מציינת 'נתון המדד נמדד באופן עצמאי על ידי Artificial Analysis; המודל שוחרר ב-2026-10-01.' הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

Ling-3.1-flash משיג 41 במדד Artificial Analysis Intelligence Index: ה-MoE 560B מכפיל את קודמו

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Ling-3.1-flash, מודל mixture-of-experts עם 560 מיליארד פרמטרים של Ant Group, נושא כעת מספר שהמעבדה שלו עצמה לא כתבה: 41 במדד Artificial Analysis Intelligence Index. את המדד מריץ המעריך העצמאי, על חומרה שהמעריך שולט בה, מול סוללת מבחנים קבועה — והוא מציב את המודל 21 נקודות מעל קודמו הישיר, Ling-3.0-flash, שעדיין עומד על 20 באותו מדד. Ant הכריזה על Ling-3.1-flash בסוף ספטמבר 2026, Artificial Analysis מתארכת את מועד ההשחרור ל-1 באוקטובר, והוא צעיר בשלושה חודשים מהמודל שהוא מכפיל את ציונו.

הפער הזה הוא הסיפור. תנועה של 21 נקודות במדד מורכב שעשרה מבחנים שונים מזינים אותו היא לא מסוג הדברים שתרשים של ספק יכול לזייף, והיא לא מסוג הדברים שהבלוג הזה יכול היה לכתוב עליהם לפני שבועיים, כאשר המדידה היחידה שהייתה קיימת ל-Ling-3.1-flash הייתה כרטיס הבנצ'מרק של Ant עצמה: 1,673 Elo ב-GDPval-AA v2.1, 75.16 ב-FrontierSWE, 65.35 ב-HealthBench Professional. המספרים האלה היו טענות אמיתיות של מעבדה אמיתית, אך לא שוחזרו. ה-41 שונה בסוגו. זהו הנתון הראשון במהדורה הזו שאפשר לחייב צד שלישי לעמוד מאחוריו.

מה שה־41 בעצם מודד

Artificial Analysis Intelligence Index v4.3.2 הוא צירוף משוקלל של עשר הערכות: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience ו-AA-LCR v1.1. קריאה של צירוף משוקלל בבידוד היא טעות, לכן שורות לפי הערכה חשובות יותר מהנתון הכולל:

• GDPval-AA — 1,621.75 עבור Ling-3.1-flash לעומת 948.35 עבור Ling-3.0-flash. זהו הזינוק הבודד הגדול ביותר בקבוצה, וזה שרוב תנועת המדד נשענת עליו.

• GDP.pdf — 0.100 all-pass, עלייה מ-0.054. עדיין נמוך במונחים מוחלטים, אך כמעט הכפלה.

• AA-LCR v1.1 הסקה בהקשר ארוך — 0.83 לעומת 0.73 אצל קודמו, ובשוויון עם DeepSeek V4.1 Flash (Max) ב-0.84.

• SciCode — 0.541 לעומת 0.420. שיפור במדעי הקידוד, לא שיפור באיכות הצ׳אט.

• הסקה פיזיקלית ב-CritPt — 0.180, לעומת 0.017 לפני כן. פי עשרה מהקודם על בסיס קטן.

• AA-Omniscience — +2.22, לעומת −17.88 עבור Ling-3.0-flash. על כך נדון בהמשך, משום שזה מנוגד לכותרת.

Ling-3.0-flash לא רק הפסיד ל-Ling-3.1-flash בשורות האלה; הוא קרס בשתיים מהן. הוא השיג 0.032 ב-AutomationBench-AA ובדיוק 0.000 ב-Terminal-Bench 4.0. זהו ההקשר שבו יש לקרוא את ה-41 — קודמו היה מודל יעיל, זול ובעל משקולות פתוחות, שלמעשה לא הייתה לו כל יכולת סוכנית-טרמינלית כלל.

A single-column generated scoreboard titled 'Ling-3.1-flash — the scoreboard' with six rows: 'AA Index: 41', 'Predecessor index: 20', 'Terminal-Bench 4.0: 0.333', 'SciCode: 0.541', 'Price: $0.30 / $0.90', 'Weights: not published', and a footer reading 'All figures per Artificial Analysis, independently measured.' The OrcaRouter logo is composited in the bottom-right corner.

מאיפה הגיע הרווח: עבודה אג'נטית, לא שיחה

השוו את תרומות המדד של Ling-3.1-flash לאלה של שני המודלים מרמת Flash שאיתם הוא מוצב לרוב זה לצד זה, ותתגלה תבנית שהנתון המצרפי מסתיר. DeepSeek V4.1 Flash (Max) רושם 39 באותו מדד ו-GLM 5.3 Flash רושם 42, כך שכל השלושה נופלים בתוך טווח של שלוש נקודות. אבל הם מגיעים לשם ממקומות שונים.

• עבודת טרמינל אג'נטית — Ling-3.1-flash 0.333 ב-Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0.268, GLM 5.3 Flash 0.328.

• עבודה אג'נטית בעולם האמיתי — Ling-3.1-flash 1,621.75 Elo ב-GDPval-AA, DeepSeek V4.1 Flash (Max) 1,600, GLM 5.3 Flash 1,646.86.

• AutomationBench-AA — Ling-3.1-flash 0.617, DeepSeek V4.1 Flash (Max) 0.689, GLM 5.3 Flash 0.604.

• מדעי הקידוד — Ling-3.1-flash 0.541 ב-SciCode, DeepSeek V4.1 Flash (Max) 0.519, GLM 5.3 Flash 0.516.

הקריאה הצרה היא ש־Ling-3.1-flash תחרותי בבנצ'מרקים אג'נטיים ומעט לפני ב־SciCode. הקריאה השימושית היא שהוא החזק מבין השלושה בשני מדדי הטרמינל האג'נטיים שרוב האנשים מתכוונים אליהם כשהם אומרים "האם הוא יכול להניע לולאת כלים" — והוא מאחורי שניהם במדד מהימנות הידע. זהו צורה ספציפית, לא ניצחון כללי, וכדאי לתת לזה שם לפני שמישהו קונה עומס עבודה על סמך מספר המדד בלבד.

החשבון שמגיע עם מודל גדול יותר

Ling-3.0-flash תומחר ב-$0.07 למיליון טוקני קלט וב-$0.22 למיליון טוקני פלט ב-API של Ant עצמה, והוא הופץ עם משקולות פתוחות תחת MIT. Ling-3.1-flash עדיין אינו אף אחד מהדברים האלה. Artificial Analysis רושם את עלות ההפעלה שלו ב-$0.30 למיליון קלט וב-$0.90 למיליון פלט — עם תעריף של $0.06 לפגיעת מטמון, הנחה של 80% על הקלט — כפי שנמדד מול ה-API של InclusionAI עצמה כספק השירות. זו עלייה של בערך פי ארבעה במחיר הקלט לעומת הדגם שהוא מחליף, עבור עלייה של 21 נקודות במדד.

האם העסקה הזו משתלמת תלוי לחלוטין בעומס העבודה, והמדד עצמו יכול לתמחר אותה: הרצת כל עשרת ההערכות של Intelligence Index מול Ling-3.1-flash עולה כ-$960 לפי התעריפים האלה, לעומת כ-$477 עבור DeepSeek V4.1 Flash (Max) ו-$280 עבור GLM 5.3 Flash. הסיבה אינה רק לוח התעריפים. Ling-3.1-flash הוא מודל חשיבה פטפטן מאוד — הוא שרף 220 מיליון טוקנים של פלט בעבודה על המדד, הרבה מעל החציון של שכבת המחיר שלו, והרצות ההערכה שלו נמשכות בממוצע כ-357 שניות למשימה לעומת 285 שניות עבור DeepSeek V4.1 Flash (Max) ו-979 שניות עבור GLM 5.3 Flash. על בסיס לכל משימה, Ling-3.1-flash עולה כ-$0.99 לעומת $0.27 של DeepSeek ו-$0.25 של GLM 5.3 Flash.

שום דבר מזה לא נראה מכביש 41, וכל זה נוחת על החשבונית. מודל יכול לנצח במדד ולאבד תקציב.

שני המספרים שסותרים את הכותרת

הראשון הוא אמינות הידע. Ling-3.1-flash מקבל ציון +2.22 ב-AA-Omniscience, שמודד אם מודל יודע מה הוא יודע: תשובות נכונות מזכות בנקודות, הזיות עולות בנקודות, וסירובים אינם עולים דבר. שיעור הדיוק שלו הוא 29.1% ושיעור ההזיות שלו הוא 37.9%. בהשוואה לעמיתיו לדור, זהו הפרופיל החלש ביותר בקבוצה — GLM 5.3 Flash מקבל ציון +7.47 עם שיעור הזיות של 27.6%, ו-DeepSeek V4.1 Flash (Max) מקבל ציון −5.30 עם שיעור הזיות מדהים של 96.5% מבין השאלות שנענו. הציון המשולב מתגמל את Ling-3.1-flash על היכולת שהוא מפגין, לא על האמינות שבה הוא מפגין אותה, ומודל שממציא שליש ממה שהוא טוען זקוק לאחזור מידע סביבו בפרודקשן.

השני הוא הקשר. Artificial Analysis מציג את Ling-3.1-flash עם חלון הקשר של 1,000,000 טוקנים. חומרי ההשקה של Ant עצמה גם מציינים 1M כיעד. אבל תיעוד המפתחים של Ant, שמפרט את חלונות המשפחה דגם אחר דגם, מעניק ל-Ling-3.0-flash 256K מקורי שניתן להרחבה ל-1M, ואינו מכיל עדיין ערך עבור Ling-3.1-flash כלל. השורה הייחודית של הקשר ארוך שאכן נמדדה — AA-LCR ב-0.83 — היא ציון של הסקה על פני הקשר ארוך, לא מדידת חלון מוגש. התייחס ל-1M כתקרה המוצהרת, ואמת את החלון שנמסר באמצעות בקשת הקשר ארוך משלך לפני שאתה מתכנן סביבו.

איך זה משתווה בדף המפרט

התמונה ממד אחר ממד, הנושא ראשון, בכל שורה:

• סך כל הפרמטרים — Ling-3.1-flash 560B לעומת DeepSeek V4.1 Flash (Max) 552B לעומת GLM 5.3 Flash 320B.

• פרמטרים פעילים לכל טוקן — Ling-3.1-flash 25B מול DeepSeek V4.1 Flash (Max) 16B מול GLM 5.3 Flash 18B. Ling-3.1-flash מפעיל את המספר הרב ביותר, וזו אחת הסיבות לכך שעלות השירות שלו נמצאת במקום שבו היא נמצאת.

• משקלים ורישיון — Ling-3.1-flash לא פורסם (קנייני, אין טקסט רישיון) לעומת DeepSeek V4.1 Flash (Max) פתוח תחת MIT לעומת GLM 5.3 Flash פתוח תחת MIT.

• הקשר מוצהר — Ling-3.1-flash 1M לעומת DeepSeek V4.1 Flash (Max) 1M לעומת GLM 5.3 Flash 1M. שלושתם טוענים לאותה תקרה; רק לשניים מהם יש צ'קפוינט להורדה שאפשר לאמת אותו מולו.

• מודאליות — Ling-3.1-flash קלט טקסט, פלט טקסט לעומת DeepSeek V4.1 Flash (Max) קלט טקסט ותמונה לעומת GLM 5.3 Flash קלט טקסט, תמונה וווידאו. זהו הציר היחיד שבו Ling-3.1-flash פשוט מפגר מאחור, ואף שורת בנצ'מרק אינה מפצה על כך.

• מחיר ב-API של הספק — Ling-3.1-flash $0.30 / $0.90 למיליון קלט / פלט לעומת DeepSeek V4.1 Flash (Max) $0.30 / $1.20 לעומת GLM 5.3 Flash $0.15 / $0.50.

• ציון מדד — 41 מול 39 מול 42. פער של שלוש נקודות בהשוואה תלת-כיוונית אינו דירוג; זהו תיקו שנשבר לפי ההערכה שאליה עומס העבודה של הקורא במקרה דומה.

איפה אפשר לקרוא לזה

Ling-3.1-flash אינו נמצא בקטלוג של OrcaRouter היום — חיפוש מול ה-API הציבורי שלנו למודלים עבור המודל תחת InclusionAI מחזיר not-found, ולא נרמוז אחרת. כיום הוא פועל על ה-API של Ant עצמה ועל פלטפורמות צד שלישי שנושאות את המהדורה, וזו המידה הכנה של זמינותו. מה שכדאי לציין לכל מי שמשווה את שלושת המודלים לעיל הוא ששני האחרים ניתנים לניתוב כבר עכשיו: DeepSeek V4.1 Flash ו-GLM 5.3 Flash נמצאים שניהם בקטלוג של OrcaRouter במחירי המחירון של הספקים שלהם עם אפס תוספת, מאחורי מפתח API יחיד, עם מעבר אוטומטי בין השניים. אם ההשוואה לעיל אומרת שעומס העבודה שלך מעדיף אמינות ידע על פני עבודת טרמינל סוכנית, GLM 5.3 Flash הוא זה שכדאי לנסות — ותוכל לנסות אותו מול DeepSeek V4.1 Flash עם אותו מפתח בלי חוזה נוסף או שורת קוד לקוח חדשה.

מה ה-41 משנה, ומה לא

מה שזה משנה הוא מעמדו של השחרור. Ling-3.1-flash אינו עוד מפרט עם תרשים ספק מצורף; זהו מודל עם מיקום שנמדד באופן עצמאי, ומיקום זה הוא קפיצת דור אמיתית ביכולת הסוכנית לעומת Ling-3.0-flash — סוג הקפיצה שנובע משינוי תכנון ולא מיותר מחשוב על אותו מתכון. מה שזה לא משנה הוא דבר בנוגע לרכש. המשקלים עדיין סגורים, הרישיון עדיין לא נכתב, המודאליות עדיין טקסטואלית בלבד, והמחיר הוא בערך פי ארבעה מזה של קודמו עבור רווח שמתרכז במשימות סוכן ומסוף.

אם העבודה שלך היא לולאות סוכנים, הנעת כלים ושרשראות כלים ארוכות, ה-41 הוא המספר המשמעותי ביותר שפורסם על המודל הזה עד כה, והוא ראוי לבחינה רצינית כל עוד הזמינות עוד מתרחבת. אם העבודה שלך היא מולטימודלית, או מענה על שאלות קריטיות מבחינת ידע, או הסקה בנפח גבוה רגישת תקציב, ה-41 לא מגיע לבעיה שלך — ו-GLM 5.3 Flash, שכבר ניתן לנתב אליו וכבר פתוח תחת MIT במחצית ממחיר הפלט, הוא המודל הממוקם טוב יותר מבין השלושה. המדד אומר לך היכן ניצב Ling-3.1-flash. הוא לא אומר לך אם כדאי שיהיה לך אכפת, ואת השאלה הזו עונה מה שאתה בונה.

Screenshot of the Artificial Analysis model page for Ling 3.1 Flash, in English, captured 2026-10-07, headed 'Ling 3.1 Flash Intelligence, Performance & Price Analysis' and marked 'Proprietary model' and 'Released October 2026'. The page shows an Intelligence Index of 41, 211 output tokens per second, a cost of $0.99 per Intelligence Index task, 220M output tokens generated across the index, input $0.30 and output $0.90 per 1M tokens with an 80% cache discount, a 1M context window, text input and text output, and the summary line that the model 'scores 41 on the Artificial Analysis Intelligence Index, placing it well above average among comparable models (median: 13)'.Screenshot of the Artificial Analysis model page for Ling 3.0 Flash, in English, captured 2026-10-07, headed 'Ling 3.0 Flash Intelligence, Performance & Price Analysis' and marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 20, 332 output tokens per second, input $0.075 with an 80% cache discount and output $0.22 per 1M tokens, a 262k context window, and 124B total parameters with 5.1B active parameters.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית