
Ling-3.0-flash: מה שאנחנו יודעים כעת על ה-MoE בעל המשקלים הפתוחים והדרג המהיר של Ant Group
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
מעבדת ה-InclusionAI של Ant Group שחררה רשמית את Ling-3.0-flash — שהוכרז ב-24 ביולי 2026, וקוד המקור שלו נפתח תחת רישיון MIT ב-7 באוגוסט — והתמונה השתנתה מאוד מאז התצוגה המקדימה שפרסמנו כאן ביולי. זהו מודל MoE (תערובת מומחים) ילידי עם חשיבה היברידית, עם 124B פרמטרים בסך הכול ורק 5.1B פעילים לכל טוקן, שנבנה כשכבה המהירה והזולה של משפחת Ling. שני המספרים ששינו הכל: Artificial Analysis מעניקה לו כעת ציון 38 במדד האינטליגנציה (עלייה של 24 נקודות לעומת דור השכבה המהירה הקודם, Ling-2.6-flash) וממקמת אותו בחזית פארטו של המשקלים הפתוחים מבחינת אינטליגנציה מול סך הפרמטרים. המשקלים זמינים ב-Hugging Face וב-ModelScope.
כשסיקרנו לראשונה את הדגם הזה ב-24 ביולי, הסיכום הכנה היה: API בלבד, אין משקלים, אין הצהרת רישיון, אין אמת מידה עצמאית. כל ארבע ההצהרות הללו אינן עדכניות כעת. Ant פרסמה את המשקלים ברישיון MIT ב-7 באוגוסט, ומאז Artificial Analysis פרסמה הערכה עצמאית מלאה. עדכון זה מתקן בהתאם את התקציר המקורי — התוויות "לא מאומת" ששלטו בפוסט של יולי חלות כעת על קבוצה מצומצמת בהרבה של טענות, בעיקר נתוני מהירות השיא של Ant, ולא על הדגם כולו.
בקיצור.Ling-3.0-flash הוא דגם MoE מהיר עם משקלים פתוחים של Ant Group: סך הכול 124B פרמטרים / 5.1B פעילים, רישיון MIT, קונטקסט מקורי של 256K (262K בגרסה המוגשת). Artificial Analysis מעניק לו מדד אינטליגנציה של 38 — עלייה של 24 נקודות לעומת Ling-2.6-flash מהדור הקודם — והוא נמצא בחזית פארטו של המשקלים הפתוחים מבחינת אינטליגנציה מול סך הפרמטרים, עם פלט נמדד של כ-368 אסימונים בשנייה. המשקלים זמינים ב-Hugging Face וב-ModelScope תחת רישיון MIT. עדיין בלעדיים לספק: טענת תפוקת השיא של 1,100+ אסימונים בשנייה, נתון הזמן עד לאסימון ראשון של מתחת ל-100 אלפיות השנייה, וטבלת מדדי הביצועים בכרטיס המודל. תמחור ה-API הרשמי הוא 0.075$ כניסה / 0.22$ יציאה למיליון אסימונים (80% הנחה במקרה של פגיעת מטמון); מכסת החינם להשקה הסתיימה ב-3 באוגוסט.
נקודות עיקריות
• זה הדרגה המהירה/הזולה, לא מודל הדגל.מודל הדגל של הדור הקודם, עם טריליון פרמטרים, נשאר המודל הגדול ביותר של InclusionAI; Ling-3.0-flash הוא האח הקטן והמהיר יותר, המיועד לכמויות גדולות של טקסט ולקריאות לכלים.
• המשקלים פתוחים כעת תחת רישיון MIT. המשקלים הופיעו ב-Hugging Face (inclusionAI/Ling-3.0-flash) וב-ModelScope ב-7 באוגוסט תחת רישיון MIT — היפוך של תמונת “API בלבד” מיולי.
• סוף סוף יש לו ציון עצמאי. Artificial Analysis מודדת מדד אינטליגנציה של 38, עלייה של 24 מ-Ling-2.6-flash, ומציבה את המודל על גבול פארטו של משקלים פתוחים לאינטליגנציה לעומת סך הפרמטרים.
• המהירות נמדדת כעת חלקית. AA רושמת תפוקה של כ-368 אסימונים/שנייה וזמן של ~1.98 שניות עד לאסימון הראשון; נתון השיא של Ant של 1,100+ אסימונים/שנייה הוא עדיין רק מטעם הספק.
• התמחור נקבע, ושלב ההשקה החינמי הסתיים. ה-API הרשמי מציג $0.075 לקלט / $0.22 לפלט לכל מיליון אסימונים, עם הנחה של 80% על פגיעות מטמון; מסלול ההשקה החינמי הסתיים ב-3 באוגוסט.
• זהו חלק ממשפחה של שלושה דגמים. InclusionAI מחלקת את סדרת הדגמים שלה ל-Ling (MoE לשימוש כללי לטקסט ולכלים, הדגם הזה), Ring (חשיבה), ו-Ming (מולטי-מודאלי).
הערה כיצד לקרוא עדכון זה: זהו תיקון של התצוגה המקדימה מ-24 ביולי, שנכתב לאחר שהמשקלים הפכו לזמינים והציונים העצמאיים הראשונים הופיעו. כל מפרט, מדד ומחיר להלן מסומן לפי מקורו. כאשר Ant Group היא המקור היחיד — טענות מהירות השיא וטבלת מדדי כרטיס המודל — אנו אומרים זאת במפורש. כאשר Artificial Analysis מדדה משהו באופן עצמאי, אנו מצטטים זאת.
מה שאנחנו באמת יודעים
הארכיטקטורה מתועדת כעת במלואה בכרטיס המודל. Ling-3.0-flash משתמשת בערמת קשב היברידית-לינארית מקורית — שכבות Kimi Delta Attention (KDA) ו-Gated MLA לסירוגין ביחס 5:1 (35 KDA + 7 MLA), עם אבחון אלכסוני עדין של KDA — על גבי MoE דליל של 1/64 (512 מומחים מנותבים, 8 מופעלים לכל טוקן). כך היא מגיעה ל-124B פרמטרים בסך הכול עם רק 5.1B פעילים. חלון ההקשר הוא 256K באופן טבעי, מוגש ב-262,144 טוקנים במתכוני ההסקה, ו-Ant טוענת שהארכיטקטורה מתאימה ל-1M. אורך הפלט המרבי לא פורסם. המודל הוא טקסט בלבד עם תמיכה בקריאה לכלים; קלט מולטימודאלי נמצא בקו הנפרד Ming.
שני פורמטי משקל מפורסמים על ידי המעבדה — BF16 (בערך 255GB) ו-FP8 (בערך 128GB) — וגרסאות קוונטיזציה של הקהילה כבר מקושרות מכרטיס המודל. מתכוני הפריסה של המעבדה עצמה מכוונים ל-SGLang ול-vLLM.
זמינות: משקלים פתוחים תחת MIT
ב-7 באוגוסט, צוות InclusionAI של Ant Group פרסם את המשקולות (weights) בקוד פתוח תחת רישיון MIT ב-Hugging Face (inclusionAI/Ling-3.0-flash) וב-ModelScope. זהו רישיון מתירני, שמיש לשימוש מסחרי — אותו רישיון שבו הופצו Ling 2.0 ו-Ling 2.6 — ומשמעותו שאתה יכול לארח, לכוונן ולפרוס את Ling-3.0-flash בעצמך במקום לשכור אותו דרך API. המודל ניתן לקריאה גם דרך ה-API למפתחים של Ant עצמה וכמה פלטפורמות צד שלישי. עבור מודל בדרגת מהירות במחיר הזה, השאלה המעניינת יותר היא האם לארח בעצמך (FP8 רץ בכ-128GB) או להישאר על API.

ציונים עצמאיים: מדד אינטליגנציה AA של 38
השינוי הגדול ביותר לעומת הפוסט מיולי הוא שעכשיו קיימים מספרים עצמאיים. Artificial Analysis כוללת דף עבור Ling-3.0-flash ומודדת אותו על מדד האינטליגנציה (Intelligence Index) ב-38 נקודות — 24 נקודות מעל הדור הקודם של רמת ה-flash, Ling-2.6-flash (14), ובשורה אחת עם MiMo-V2.5 ו-Qwen 3.6 27B, תוך הפעלת חלק זעום מהפרמטרים שלהן. Artificial Analysis גם ממקמת את המודל על גבול פארטו (Pareto frontier) עבור משקלים פתוחים, במונחים של אינטליגנציה לעומת סך הפרמטרים: אף מודל עם משקלים פתוחים וסך פרמטרים נמוך יותר לא משיג ציון גבוה יותר. המובילה ברמת ה-flash עם משקלים פתוחים לפי AA, DeepSeek V4 Flash, עדיין משיגה ציון גבוה יותר (מדד 52 במאמץ חשיבה מירבי).
התוצאות בתחום הסוכנות (agentic) ובהקשר הארוך חזקות בכיוון הנכון גם כן. בסוויטת τ3-Bench Banking של AA, Ling-3.0-flash משיג 27% — מקום שני בין מודלי הקוד הפתוח בדרגת flash, אחרי DeepSeek V4 Flash (39%). ב-GDPval-AA v2 הוא מגיע ל-Elo של 1108, לעומת 545 עבור Ling-2.6-flash. Ant אימנה את המודל על פני 10,000+ סביבות אינטראקטיביות (לפי דיווח הספק) ומציעה אותו כצומת ביצוע לזרימות עבודה של agent — מהיר, זול וחד-פעמי, כשהחשיבה הכבדה נותרת לדגם דגל גדול יותר.
אזהרה אחת בנוגע למקור: טבלת ההשוואה בכרטיס המודל של Ant — SWE-Bench Pro 56.6, SWE-bench Multilingual 72.4, MathArena AIME 2026 93.2, HLE 22.7 — היא דיווח של הספק וטרם שוחזרה באופן עצמאי. יש להתייחס אליה כאל טענות המעבדה עצמה, באותה קטגוריה כמו נתוני מהירות השיא להלן.
מהירות: נמדדה, ואז הוצהרה
סיפור המהירות הוא עכשיו שני סיפורים שונים. באופן בלתי תלוי, Artificial Analysis מודדת כ-368 אסימונים/שנייה בפלט וזמן עד לאסימון ראשון של כ-1.98 שניות ב-API הרשמי — מהיר באמת עבור MoE עם 5.1B פרמטרים פעילים, ומספיק כדי לדרג את המודל קרוב לצמרת הקטגוריה שלו מבחינת מהירות. בנפרד, Ant Group טוענת לקצב פלט ממוצע של מעל 1,100 אסימונים/שנייה בתצורות GPU מוגדרות וזמן עד לאסימון ראשון של פחות מ-100 מילישניות, עם שכבת מטמון היררכית ברמת אשכול הבנויה על SGLang HiCache ו-Mooncake. קבוצת המספרים השנייה הזו היא מפי הספק בלבד — נמדדה על חומרה ותצורות אצווה שבשליטת Ant, ללא ריצה חוזרת בלתי תלויה שפורסמה. לצורך תכנון, השתמשו בנתון של AA; התייחסו ל-1,100+ אסימונים/שנייה כתקרת שיווק שעליכם לאמת על עומס העבודה שלכם.

מחיר: זול, והמבצע נגמר.
Artificial Analysis מפרטת את ה-API של הצד הראשון במחיר של 0.075$ לכל מיליון טוקנים בקלט ו-0.22$ למיליון בפלט, עם פגיעות מטמון ב-0.015$ (80%-) — כל זאת במחירים שנקבעו על ידי הספק. שכבת החינם של ההשקה (500 אלף טוקנים חינם ליום, גישת API חינמית) הסתיימה ב-3 באוגוסט, ואנט הפעילה תקופת הנחה זמנית של 75% על Ling Studio שלה עד 31 באוגוסט 2026, ולאחר מכן חלים המחירים הרשמיים. אפילו במחיר מלא, 0.075$/0.22$ ממקמים את Ling-3.0-flash היטב בדרגה הזולה עבור מודל עם מדד של 38.
במחירים כה נמוכים, עלות המעבר חשובה יותר ממחיר לכל טוקן. OrcaRouter נועד להפוך את המעבר הזה לזול: API אחד ל־200+ מודלים, מחירי הספקים מועברים בדיוק כפי שהם עם 0% תוספת, ו-failover אוטומטי בין ספקים — כך שכאשר מודל שזה עתה נחשף, כמו זה, נראה טוב על הנייר, תוכלו לבדוק אותו מול העומס האמיתי שלכם בלי חוזה נוסף, ולחזור למודל אחר מאחורי אותו מפתח אם הוא לא עומד בציפיות במשימה מסוימת.
משפחת לינג / רינג / מינג
Ling-3.0-flash אינו קיים לבדו — InclusionAI מארגנת את השחרורים שלה לשלוש משפחות בעלות שמות, שכל אחת מהן מיועדת לתפקיד אחר. Ling הוא קו ה-MoE לשימוש כללי ליצירת טקסט יומיומית והפעלת כלים, ו-Ling-3.0-flash יושב בקצה המהיר/הזול שלו, מדרגה אחת מתחת לדגם הדגל של הדור הקודם עם 1T פרמטרים. Ring הוא הקו המתמקד בחשיבה, הבנוי לשרשרת חשיבה רב-שלבית. Ming הוא הקו הרב-מודאלי. אם המשימה שלך דורשת חשיבה כבדה יותר או קלט תמונה, המודל הנכון של InclusionAI הוא כנראה לא Ling-3.0-flash — הוא בנוי לנפח ומהירות במסלול של טקסט וכלים.
למי זה מיועד: שלושה תרחישים
1. צינורות עיבוד טקסט או קריאת כלים בנפח גבוה ורגישים להשהיה
זה השטח הביתי של המודל. עם מדד עצמאי של 38, רישיון MIT, וכ־368 אסימונים לשנייה שנמדדו, ההימור על השכבה המהירה הוא כעת ניתן לבדיקה ולא היפותטי — אתה יכול להריץ עליו מערך הערכה משלך, או להוריד את המשקלים ולארח בעצמך. רק אל תבנה על תקרת ה־1,100+ אסימונים לשנייה של הספק לפני שמדדת אותה על עומס העבודה שלך.
2. צוותים שרוצים הקשר ארוך בתקציב מוגבל
הקשר מקורי של 256K (מוגש כ-262K) עם נתיב מוצהר ל-1M, במחיר של $0.075/$0.22, הוא שילוב אטרקטיבי לעבודה מרובת-אחזור או לעיבוד מסמכים. הנתונים לגבי הקשר ארוך בכרטיס המודל מדווחים על ידי הספק, לכן כלול את המודל ברשימה קצרה מול אפשרויות מבוססות להקשר ארוך, וודא על הקורפוס שלך לפני שמתחייבים.
3. משקיפים העוקבים אחר נוף ה-MoE של סין ומפת הדרכים של InclusionAI
שאלת יולי — האם InclusionAI תישאר פתוחה? — קיבלה כעת תשובה: כן, MIT, ובמהירות. הנחיתה של Ling-3.0-flash על גבול פארטו של AA עם 5.1B פרמטרים פעילים היא נקודת נתונים לכל מי שעוקב אחר האופן שבו מעבדות סיניות מתחרות על יעילות ולא על מספר פרמטרים גולמי.
מה עוד לא אומת?
רשימה קצרה, עכשיו שהפערים הגדולים נסגרו. טענות שיא המהירות של הספק (1,100+ tok/s, TTFT מתחת ל-100ms) אינן מגובות במדידה חוזרת בלתי תלויה. טבלת אמות המידה בכרטיס המודל היא דיווח עצמי של הספק. גרסאות FP4/INT4 ונתיב הפריסה של DGX-Spark בודד מוצהרים על ידי הספק. ובנוגע לידע, מדד Omniscience של AA מראה שהשיפור לעומת הדור הקודם הגיע בעיקר באמצעות הימנעות — ההזיה ירדה (97% → 44%) בעוד הדיוק עלה רק במעט (16% → 18%) — לכן אל תטעו לפרש את הקפיצה במדד הראשי כקפיצת ידע כוללת.
מתי לא להשתמש בזה
{{1}}דלג על Ling-3.0-flash לעבודה מולטימודלית — זה הקו של Ming.{{/1}} {{2}}דלג עליו אם אתה צריך דגל לחשיבה כבדה במקום מבצע מהיר — זה הנתיב של Ring.{{/2}} {{3}}אם אתה מתכנן אירוח עצמי, תכנן תקציב לחומרה האמיתית: BF16 הוא בערך 255GB, ו-FP8 בערך 128GB.{{/3}} {{4}}ואם טענה חשובה לך, אמת אותה — נתוני מהירות השיא וההקשר הארוך הם של Ant עד שמעבדה בלתי תלויה תריץ אותם מחדש.{{/4}}
שאלות נפוצות
האם Ling-3.0-flash הוא בעל משקל פתוח?
כן. המשקולות פורסמו בקוד פתוח ב-7 באוגוסט תחת רישיון MIT, ב-Hugging Face (inclusionAI/Ling-3.0-flash) וב-ModelScope. זהו רישיון מתירני לשימוש מסחרי — אותו רישיון שבו שוחררו Ling 2.0 ו-Ling 2.6.
איך Ling-3.0-flash מתפקד במבחני ביצועים?
Artificial Analysis מודדת מדד אינטליגנציה של 38, עלייה של 24 נקודות לעומת Ling-2.6-flash, וממקמת את המודל על גבול פארטו של משקלים פתוחים עבור אינטליגנציה מול סך פרמטרים. טבלת הביצועים בכרטיס המודל של Ant (למשל SWE-Bench Pro 56.6) היא דיווח של הספק ולא שוכפלה באופן בלתי תלוי.
כמה מהר זה באמת?
Artificial Analysis מודדת פלט של כ-368 tokens/sec עם זמן-עד-טוקן-ראשון של ~1.98 שניות ב-API הרשמי. Ant טוענת לתפוקת שיא של 1,100+ tokens/sec וזמן TTFT מתחת ל-100ms בתצורות GPU מסוימות — אלה נתוני ספק ללא מדידה חוזרת בלתי תלויה.
כמה עולה Ling-3.0-flash?
AA מפרטת את ה-API הקנייני במחיר של $0.075 לכל מיליון אסימוני קלט ו-$0.22 לכל מיליון פלט, עם הנחה של 80% על פגיעת מטמון. שכבת החינם הראשונית הסתיימה ב-3 באוגוסט, ותקופת הנחה זמנית של 75% על Ling Studio נמשכת עד 31 באוגוסט 2026.
מה גודל חלון ההקשר?
256K במקור, מוגש ב-262,144 טוקנים; אנט טוענת שהארכיטקטורה ניתנת להרחבה ל-1M. אורך הפלט המרבי לא פורסם.
מה ההבדל בין Ling, Ring, ו-Ming?
Ling הוא קו ה-MoE הכללי לטקסט וקריאה לכלים של InclusionAI, ו-Ling-3.0-flash נמצא בקצה המהיר/הזול שלו. Ring הוא הקו הממוקד בהסקה. Ming מטפל במשימות מולטי-מודאליות. הם משפחות נפרדות למשימות שונות, לא דרגות של מודל אחד.
האם Ling-3.0-flash זהה לדגם הדגל הקודם בגודל 1T?
לא. Ling-3.0-flash הוא המודל החדש והקטן יותר בדרג המהיר (124B סה"כ / 5.1B פעילים). מודל הדגל של הדור הקודם עם 1T פרמטרים נשאר המודל הגדול יותר.
האם עלי להשתמש ב-Ling-3.0-flash בסביבת ייצור היום?
מוצדק יותר ממה שהיה ביולי, עכשיו כשיש ציון עצמאי ורישיון MIT. הרץ תחילה ערכת הערכה משלך, אמת את טענות המהירות של הספק מול עומס העבודה שלך, והחליט בין ה-API לבין אירוח עצמי (FP8 רץ בכ-128GB). המספרים הנותרים שרק הספק מספק צרים מספיק כדי לתכנן סביבם.
השורה התחתונה
Ling-3.0-flash עבר מ-{{1}}גיליון מפרטים וטענות ספק{{/1}} אל {{2}}משקל פתוח וניקוד עצמאי{{/2}} תוך שבועיים. {{3}}מדד אינטליגנציה AA של 38 עם 5.1B פרמטרים פעילים{{/3}} — על {{4}}גבול פארטו של משקלים פתוחים{{/4}}, ברישיון MIT, במחיר $0.075/$0.22 — הופך אותו ל-{{5}}אחד מדגמי המשקל הפתוח היעילים ביותר שתוכלו להצביע עליהם כרגע, וגם כזה שתוכלו ממש להריץ בעצמכם{{/5}}. ההסתייגויות מצומצמות יותר משהיו: {{6}}נתוני מהירות השיא ונתוני כרטיס הדגם{{/6}} עדיין מטעם Ant עד שמעבדה עצמאית תשחזר אותם. עבור {{7}}טקסט בנפח גבוה וקריאות לכלים במחיר הזה{{/7}}, הוא זכאי ל-{{8}}הערכה אמיתית{{/8}}.

