
Ling-3.0-flash: מה שאנחנו באמת יודעים על ה-MoE החדש של Ant Group בשכבה המהירה (ומה שאנחנו לא יודעים)
- qwenחדשQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 לכל 1M טוקנים · 56 tok/s
- deepseekחדשDeepSeek: DeepSeek V4 Flash 07312026-07-3150אינטליגנציה69כתיבת קוד
- qwenחדשQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 199 tok/s
- orcaחדשOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicחדשAnthropic: Claude Opus 52026-07-2461אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2150אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1651אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1557אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0951אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0955אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0959אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0854אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0641אינטליגנציה59כתיבת קוד
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232אינטליגנציה42כתיבת קוד
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226אינטליגנציה39כתיבת קוד
- anthropicAnthropic: Claude Sonnet 52026-06-3053אינטליגנציה72כתיבת קוד
- klingKling: Kling 3.0 Turbo2026-06-1757אינטליגנציה52כתיבת קוד57מתמטיקה
- z-aiZ.ai: GLM 5.22026-06-1651אינטליגנציה69כתיבת קוד60מתמטיקה
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242אינטליגנציה61כתיבת קוד61מתמטיקה
המעבדה של Ant Group, InclusionAI, שחררה את Ling-3.0-flash בסביבות ה-23 ביולי 2026 — מה שאומר שהיא בת ימים ספורים נכון לסקירה זו. מדובר במודל שפה מסוג mixture-of-experts (MoE) עם 124B פרמטרים בסך הכל וכ-5.1B פרמטרים פעילים לכל טוקן (יחס דלילות של בערך 24:1), המיועד ליצירת טקסט ולהפעלת כלים. היא ממוקמת כשכבה המהירה והזולה של משפחת Ling; מקום הדגל עדיין שייך ל-Ling-2.6-1T הגדולה בהרבה (1T סך הכל / 63B פעילים). הגישה כיום היא דרך API בלבד — דרך פורטל המפתחים של Ant, דרך OpenRouter בתור inclusionai/ling-3.0-flash, ודרך ZenMux.
זאת התמונה המלאה המאושרת, וכדאי להיות כנים לגבי הסיבה שהסקירה הזו נשמעת זהירה יותר מאשר תיאור מודל טיפוסי. אין משקלים של Hugging Face, אין מאגר GitHub עבור Ling-V3, ואין הצהרת רישיון ברורה – שינוי משמעותי לעומת Ling 2.0 ו-Ling 2.6, ששתיהן שוחררו כמשקלים פתוחים תחת רישיון MIT. אין גם נתוני אמת מידה עצמאיים מכל סוג: Artificial Analysis, הגוף המבקר העצמאי הנפוץ ביותר למודלים מסוג זה, עדיין אין לו דף עבורו. כל נתוני הביצועים והמהירות שמסתובבים כרגע מקורם בקבוצת Ant Group עצמה.
בקיצור.Ling-3.0-flash הוא מודל MoE בגודל 124B/5.1B-active של Ant Group's InclusionAI, שוחרר בימים האחרונים, זמין רק דרך API ללא משקלים ב-Hugging Face ורישיון לא מאושר. טענות הספק — תפוקת שיא של 1000 טוקנים לשנייה, זמן עד לטוקן ראשון מתחת ל-100ms — עדיין לא אומתו באופן עצמאי, ואין ציון Artificial Analysis למודל הספציפי הזה. הדור הקודם Ling-2.6-flash קיבל ציון אינדקס אינטליגנציה של Artificial Analysis של 14 בלבד (Ling-2.6-1T קיבל 26), שזה הקשר שימושי אך לא תחליף ליכולת האמיתית של 3.0-flash. התמחור (¥0.40 כניסה / ¥1.20 יציאה לכל מיליון טוקנים, כרגע חינם בשבוע ההשקה עם 500,000 טוקנים חינם ליום) הוא במפורש קידומי וצפוי להשתנות. התייחסו לכל זה כתצוגה מקדימה, לא כפסק דין.
נקודות עיקריות
• זוהי השכבה המהירה/הזולה, לא הדגל.Ling-2.6-1T נשאר המודל הגדול ביותר של InclusionAI; Ling-3.0-flash הוא אח קטן, זול ומהיר יותר המיועד לשימוש בנפח גבוה.
• עדיין אין בנצ'מרק עצמאי. ל-Artificial Analysis אין דף עבור Ling-3.0-flash. הנתונים הציבוריים היחידים הם של Ant Group עצמו, והמסמכים של Ant כרגע אינם מציגים טבלת בנצ'מרק כלשהי עבור מודל זה כלל.
• טענות מהירות הן של ספק בלבד. שיא של 1000 אסימונים לשנייה וזמן עד לאסימון ראשון מתחת ל-100ms מגיעים מ-Ant Group, ללא בדיקת תפוקה של צד שלישי שתאשר אף אחד מהנתונים הללו.
• אין משקלים פתוחים, רישיון לא מאושר. אין מאגר Hugging Face ואין פרויקט Ling-V3 ב-GitHub. דורות Ling קודמים היו ברישיון MIT; לא ידוע אם 3.0-flash ימשיך כך.
• תמחור הוא מבצע לשבוע ההשקה. ¥0.40/¥1.20 לכל מיליון טוקנים בפלטפורמת Ant מבוטל כעת, עם 500k טוקנים חינם ליום ורישום חינם ל-OpenRouter — אין להניח שדברים אלה יימשכו לאחר סיום המבצע.
• זהו חלק אחד מתוך משפחה של שלושה דגמים. InclusionAI מחלקת את המבחר שלה ל-Ling (MoE לשימוש כללי, הדגם הזה), Ring (ממוקד חשיבה) ו-Ming (רב-מודאלי).
הערה כיצד לקרוא תקציר זה: כל מפרט, מדד ומחיר להלן מסומן לפי מקור. כאשר אנט גרופ היא המקור היחיד, אנו מציינים זאת במפורש ומסתייגים בהתאם. כאשר למודלים מסוג Ling מהדור הקודם יש ציונים עצמאיים, אנו מצטטים אותם לשם הקשר — לא כחלופה לנתונים על Ling-3.0-flash עצמו, שעדיין לא קיימים. ככל הנראה יידרש מעקב לאחר שבדיקות עצמאיות ישיגו את הפער.
מה שאנחנו באמת יודעים
מבחינה ארכיטקטונית, Ling-3.0-flash הוא מודל MoE דליל: סה"כ 124B פרמטרים, כאשר כ-5.1B פעילים בכל טוקן נתון, וזה מה שהופך אותו לזול ומהיר להרצה ביחס לגודלו הכולל. חלון ההקשר הוא 256K טוקנים לפי התיעוד של Ant עצמה, עם טענה של הספק שניתן להרחיבו ל-1M; הרישום של OpenRouter מראה 262,144 טוקנים, מה שמתיישב עם הנתון של 256K. אורך הפלט המקסימלי לא פורסם בשום מקום שמצאנו. המודל תומך ביצירת טקסט סטנדרטית ובקריאה לכלים, אך לא הוזכרה יכולת קלט או פלט מולטי-מודלית – יכולת זו שוכנת בקו המוצרים הנפרד Ming.
בזמינות, התמונה היא דרך API בלבד ועקבית בין שלושת המסלולים שמצאנו: פלטפורמת המפתחים של Ant Group עצמה, OpenRouter (רשום כ-inclusionai/ling-3.0-flash), ו-ZenMux. אף אחד מאלה לא חושף משקלים להורדה. אין דף ארגון ב-GitHub עבור פרויקט "Ling-V3", והתיעוד של Ant לא מציין רישיון עבור מודל ספציפי זה — פער משמעותי, שכן Ling 2.0 ו-Ling 2.6 שוחררו שניהם כמשקלים פתוחים תחת MIT. עד ש-InclusionAI תבהיר זאת, אל תניחו ש-Ling-3.0-flash יסתיים כפתוח, ואל תניחו שלא.

הפערים: מה שלא אומת
הפער הגדול ביותר הוא במבחני ביצועים. נכון לכתיבת שורות אלה, Artificial Analysis — המעריך העצמאי המצוטט ביותר עבור דגמים מסוג זה ממש — אין לו דף עבור Ling-3.0-flash; תבנית ה-URL שבדרך כלל מארחת אותו מחזירה שגיאה 404. משמעות הדבר היא שכרגע אין ציון צד שלישי להיגיון, קידוד או מתמטיקה עבור הדגם הזה, מ-Artificial Analysis או מכל מעריך עצמאי אחר שהצלחנו לאתר. התיעוד של Ant עצמו מחמיר את המצב: הוא לא מפרסם טבלת מבחני ביצועים עבור 3.0-flash כלל, לא של ספק ולא אחר, דבר שאינו אופייני להשקת דגם וראוי לציון כשלעצמו.
לצורך הקשר גס, לדגמי Ling מהדור הקודם יש ציונים עצמאיים. Ling-2.6-flash רשמה מדד Artificial Analysis Intelligence של 14, ו-Ling-2.6-1T הגדולה יותר השיגה 26 — שניהם הרחק מאחורי דגמי המשקל הפתוח המובילים שאחריהם עקבה Artificial Analysis באותו הזמן. המספרים של הספק עצמו של Ant עבור Ling-2.6-flash טענו ל-61.2% ב-SWE-bench Verified ו-73.85% ב-AIME2026. אין להשליך אף אחד מהמספרים הללו ישירות על Ling-3.0-flash; דור חדש עם ארכיטקטורה חדשה יכול לנוע לכל כיוון, ועד שמעריך עצמאי יריץ אותו בפועל, כל טענת יכולת עבור 3.0-flash היא ניחוש המחופש לעובדה.
טענות מהירות של הספק: מהיר על הנייר, לא מאומת בפועל
הצגת הביצועים המרכזית של Ant Group עבור Ling-3.0-flash אינה איכות ההסקה — אלא מהירות גולמית. הספק טוען לתפוקת שיא של 1000 אסימונים לשנייה וזמן עד לאסימון ראשון מתחת ל-100 מילישניות, שניהם יהיו מהירים באמת אם יאושרו. אבל "אם יאושרו" עושה עבודה אמיתית במשפט הזה: המספרים הללו מגיעים אך ורק מחומרים של Ant Group עצמה, הנמדדים בתנאים ש-Ant שולטת בהם ולא חשפה במלואם (חומרה, גודל אצווה, אורך הנחיה ועומס משנים את נתוני התפוקה באופן משמעותי). אף מעבדה עצמאית לא פרסמה מדידה חוזרת. עד שמישהו מחוץ ל-Ant יריץ בדיקה דומה, יש להתייחס ל-1000 אסימונים/שנייה ול-TTFT מתחת ל-100 אלפיות שנייה כאל נתונים שיווקיים שכדאי לבדוק מול עומס העבודה שלכם, לא כעובדות מוכחות.

תמחור, ולמה זה מטרה נעה
בפלטפורמה של Ant Group עצמה, המחירון עבור Ling-3.0-flash עומד על ¥0.40 לכל מיליון טוקני קלט ו-¥1.20 לכל מיליון טוקני פלט – זול בתכנון, בהתאם למיצובו כשכבה המהירה/הזולה. אבל המחירון הזה אינו משקף למעשה מה מישהו משלם כרגע: Ant מריצה מבצע קידום מכירות חינמי לשבוע ההשקה, ובנפרד מציעה 500,000 טוקנים חינם ליום בפלטפורמה שלה. הרישום של OpenRouter מציג גרסה ling-3.0-flash:free במחיר $0/$0. אין לטעות באף אחד מאלה כמחיר יציב. מבצעי השקה פגים, שכבות חינם מוגבלות, וגם הנתונים ¥0.40/¥1.20 עצמם עשויים להשתנות ברגע שייכנסו נתוני שימוש אמיתיים. אם אתה מתכנן הוצאות ייצור סביב המודל הזה, תקצב מול המחירון, לא מול המבצעי, ובדוק שוב לפני ההתחייבות.
משפחת לינג / רינג / מינג
לינג-3.0-flash לא קיים בבידוד — InclusionAI מארגנת את הגרסאות שלה לשלוש משפחות בעלות שמות, כל אחת מיועדת למשימה אחרת. Ling היא קו המטרה הכללי של MoE, המכסה יצירת טקסט יומיומית וקריאת כלים; לינג-3.0-flash יושבת בקצה המהיר/זול שלה, כאשר Ling-2.6-1T עדיין הדגל הגדול יותר. Ring היא קו הממוקד בהיגיון של InclusionAI, הבנוי למשימות הנשענות על chain-of-thought רב-שלבי במקום על תפוקה גולמית. Ming היא הקו הרב-מודאלי, המטפל בתמונה ובמודאליות שאינן טקסט שלינג עצמה לא נוגעת בהן. אם המשימה שלך דורשת היגיון כבד יותר או קלט רב-מודאלי, המודל הנכון של InclusionAI הוא כנראה לא Ling-3.0-flash — הוא בנוי לנפח ומהירות במסלול הטקסט והכלים, לא להתרחב לשטח של שתי המשפחות האחרות.
למי זה מיועד: שלושה תרחישים
1. צינורות טקסט או קריאת כלים בעלי נפח גבוה ורגישות השהיה — כפיילוט, לא כהתחייבות
אם עומס העבודה שלך נשלט על ידי יצירת טקסט רגישה לתפוקה או קריאת כלים — צ'אט, סוכנים קלים, קריאות API בתדירות גבוהה — המיצוב של Ling-3.0-flash (מספר קטן של פרמטרים פעילים, TTFT מתחת ל-100ms לפי הטענות, תמחור השקה כמעט חינמי) הופך אותו לכדאי לניסוי. המלכוד הוא ש"כדאי לניסוי" שונה מ"כדאי להעביר אליו תעבורת ייצור." עם אפס נתוני מדד עצמאיים, אתה המדד כרגע: הרץ מערך הערכה משלך דרכו לפני שתבטח בו בכל דבר שפונה ללקוחות, ואל תבנה מודלים עלות סביב התמחור הקידומי הנוכחי.
2. צוותים שזקוקים להקשר ארוך בתקציב מוגבל
חלון הקשר של 256K (בטענת ספק שניתן להרחיבו ל-1M) במחיר מחירון נמוך באמת הוא שילוב אטרקטיבי עבור מקרי שימוש עתירי שליפה או עיבוד מסמכים, בתנאי שאיכות ההיגיון בפועל של המודל מחזיקה מעמד לאורך אורך ההקשר הזה — ששוב, אף גורם בלתי תלוי לא בדק. זוהי מועמדת סבירה לרשימה קצרה לצד אפשרויות זולות בעלות הקשר ארוך מבוססות, אבל יש להעריך אותה זה לצד זה עימן ולא לאמץ אותה על סמך דף המפרט של Ant בלבד.
3. משקיפים העוקבים אחר נוף ה-MoE של סין ומפת הדרכים של InclusionAI
לצוותים שעוקבים אחר נוף התחרות של מעבדות מודלים סיניות פתוחות ופתוחות-למחצה, במקום לפרוס מודל יחיד בייצור, Ling-3.0-flash היא נקודת נתונים שימושית: היא מסמנת ש-InclusionAI חוזרת במהירות על השכבה המהירה שלה, עלולה לסגת ממשקלים פתוחים (לפחות לעת עתה), וממשיכה להמר על מבנה של שלוש משפחות (Ling/Ring/Ming) במקום על מודל גנרי אחד. כדאי לסמן ולהתעדכן ברגע שיתבהרו נתוני benchmark ורישיון.
מתי לא להשתמש בזה
דלגו על Ling-3.0-flash בכל מקרה שבו צריך לצטט טענת יכולת מאומתת — אין בנמצא מדד בלתי תלוי להצביע עליו, ולכן כל הצהרה לגבי יכולות ההיגיון, התכנות או המתמטיקה שלו היא כרגע בלתי ניתנת להפרכה. דלגו עליו אם אתם צריכים משקלים פתוחים לאירוח עצמי, כיוונון עדין או סיבות ציות; אין כאלה זמינים, והרישיון למודל הספציפי הזה אפילו לא פורסם, שלא לדבר על אושר כמתירני. דלגו עליו למשימות רב־מודליות — זה התפקיד של סדרת Ming, לא של Ling. והיזהרו בבניית מודל עלויות סביב התמחור הנוכחי: שבוע ההשקה החינמי, 500,000 האסימונים החינמיים היומיים והשכבה החינמית של OpenRouter הם כולם קידומיים, והמחירון של ¥0.40/¥1.20 שאליו הוא צפוי לחזור טרם נבחן מול דפוסי שימוש בעולם האמיתי.
שאלות נפוצות
האם Ling-3.0-flash הוא בעל משקל פתוח?
לא כרגע. אין מאגר Hugging Face ואין פרויקט Ling-V3 ב-GitHub נכון לכתיבת שורות אלה. גרסאות Ling קודמות (2.0 ו-2.6) שוחררו תחת רישיון MIT כמשקלים פתוחים, אבל שום דבר לא מאשר ש-Ling-3.0-flash תעקוב אחרי התבנית הזו — או שלא.
איך Ling-3.0-flash מתפקד במבחני ביצועים?
אין עדיין מדד בלתי תלוי עבורו — ל-Artificial Analysis אין דף עבור הדגם הזה. גם התיעוד של Ant Group עצמו לא מפרסם טבלת מדדים עבורו. לצורך הקשר היסטורי גס, הדור הקודם Ling-2.6-flash קיבל ציון של 14 במדד Artificial Analysis Intelligence Index, ו-Ling-2.6-1T קיבל 26, אך אין להניח שאף אחד מהמספרים הללו עובר לדור החדש הזה.
כמה מהר זה באמת?
Ant Group טוענת לתפוקת שיא של 1000 טוקנים לשנייה וזמן עד לטוקן הראשון של פחות מ-100 אלפיות שנייה. שני הנתונים הם נתונים של הספק בלבד ללא מדידה מחודשת עצמאית שפורסמה עד כה. התייחס אליהם כאל טענות לאימות בעומס העבודה שלך, לא ביצועים מאושרים.
כמה עולה Ling-3.0-flash?
תמחור רשום בפלטפורמה של Ant הוא ¥0.40 למיליון אסימוני קלט ו-¥1.20 למיליון אסימוני פלט, אך כרגע הוא חינם במהלך מבצע שבוע ההשקה, עם 500 אלף אסימונים חינם ליום גם כן. OpenRouter מציעה גם גרסה חינמית. צפו שהתנאים המבצעיים הללו ישתנו.
מה גודל חלון ההקשר?
256K אסימונים לפי התיעוד של Ant, עם טענת ספק שניתן להרחיב ל-1M. הרישום של OpenRouter מציג 262,144 אסימונים, בהתאם לנתון של 256K. אורך הפלט המקסימלי לא נחשף.
מה ההבדל בין לינג, רינג ומינג?
לינג היא סדרת ה-MoE הכללית לטקסט ולקריאת כלים של InclusionAI, ו-Ling-3.0-flash נמצאת בקצה המהיר/הזול שלה. רינג היא הסדרה המתמקדת בחשיבה אנליטית. מינג מטפלת במשימות מולטי-מודאליות. אלה משפחות דגמים נפרדות שנבנו למשימות שונות, לא רמות של אותו דגם.
האם Ling-3.0-flash זהה ל-Ling-2.6-1T?
לא. Ling-2.6-1T הוא דגל הדגל הגדול יותר של InclusionAI (1T סך הכל / 63B פרמטרים פעילים) והוא נשאר מודל נפרד וגדול יותר. Ling-3.0-flash (124B סך הכל / ~5.1B פעילים) הוא השחרור החדש, הקטן והמהיר יותר.
האם עלי להשתמש ב-Ling-3.0-flash בסביבת ייצור היום?
רק לאחר שתבצע הערכה משלך. ללא אמת מידה עצמאית, רישיון לא מאושר, ומחיר שכרגע הוא מבצעי, סביר לבצע פיילוט אך מוקדם מדי להתחייב לעומסי עבודה קריטיים לייצור או רגישים לציות, ללא בדיקות משלך ותכנית למה יקרה כשהתנאים המבצעיים יסתיימו.
השורה התחתונה
Ling-3.0-flash היא גרסה חדשה באמת שכדאי לעקוב אחריה — מודל MoE של 124B/5.1B-active שמיועד ישירות לעבודה מהירה, זולה ובנפח גבוה של טקסט וקריאות לכלים, ממעבדה ששלחה בעבר מודלים אמינים. אבל כרגע זה גיליון מפרט וסט של טענות ספק, לא מוצר מאומת: אין אמת מידה עצמאית, אין משקלים פתוחים, אין רישיון מאושר, ותמחור שהוא במפורש קידומי. זו לא סיבה לבטל אותו — זו סיבה לבחון אותו בזהירות, לאמת את הטענות שחשובות לך ישירות, ולבקר מחדש בסיכום זה ברגע ש-Artificial Analysis או מעריך עצמאי אחר יפרסם מספרים אמיתיים.

