כרטיס הירו עריכתי שנוצר בכותרת "Ling-3.1-flash זמין ובחינם לשבועיים" עם כתובית המשנה "מה ש-560B MoE באמת מספק היום". ארבעה כרטיסים מעוגלים מציגים "פרמטרים: 560B סה״כ / ~25B פעילים", "הקשר: 262,144 טוקנים", "תקרת פלט: 32,768 טוקנים" ו"משקלים: לא פורסמו", מעל שורת כותרת תחתונה שאומרת "מפרטים לפי הצהרת הספק; לא פורסם מחיר לאחר תקופת הניסיון."
Guides & Insights

Ling-3.1-flash זמין ובחינם למשך שבועיים: מה ה-560B MoE באמת מספק

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Ling-3.1-flash, תערובת המומחים בעל כ-560 מיליארד פרמטרים שמעבדת inclusionAI של Ant Group הכריזה עליו ב-29–30 בספטמבר 2026, חדל השבוע להיות הודעה לעיתונות: כעת הוא עונה לבקשות ב-API מסחרי פעיל. המודל פועל כניסיון חינם של שבועיים בשער הסקה של צד שלישי, והוא מופיע גם במוצר Ling Studio של Ant עצמה — מה שמעביר את השאלה מ"האם הוא קיים" ל"מה הוא בעצם מספק". התשובה צרה יותר מכפי שמספרי הכותרות מרמזים. Ling-3.1-flash הוא טקסט-נכנס, טקסט-יוצא; הוא מספק חלון הקשר של 262,144 טוקנים (256K) למרות שההודעה מציינת 1M כיעד הסופי; הפלט שלו מוגבל ל-32,768 טוקנים; ואף אחד לא פרסם את המחיר שתשלמו ביום החמישה עשר, כשחלון החינם נסגר והמשקלים אמורים לבוא בעקבותיו.

הפער הזה בין כרטיס ההכרזה לנקודת הקצה הפעילה הוא הדבר שכדאי להיאחז בו, מפני שרוב הסיקור של ההשקה הזו קורא את המפרטים כאילו המודל כבר מספק אותם היום. הוא לא. Ling-3.1-flash הוא המודל השני מהמעבדה הזו מזה שלושה חודשים שמגיע בתור מה שהעוקב העצמאי LLM Releases מסווג באופן בוטה תחת "משקלים לא משוחררים", וההבדל בין מה ש-Ant אומרת שהמודל הוא לבין מה שמפתח יכול לפנות אליו כרגע הוא המקום שבו תקציב או פיילוט יכולים להשתבש בשקט.

מה השתנה בין ההכרזה להיום

ההכרזה עצמה הייתה פוסט מפרט: כ־560B פרמטרים בסך הכול, כ־25B פעילים לכל טוקן, עד 1M טוקנים של הקשר, שלושה מספרי הערכה עיקריים, והבטחה — "אנחנו מתכננים להוציא את המודל בקוד פתוח בקרוב." שום דבר מזה לא השתנה. מה שכן השתנה הוא הזמינות. בתוך יום מההכרזה המודל היה נגיש בקצה מסחרי, והניסוי החינמי חושף את אותה נקודת קצה אמיתית שניסוי בתשלום היה חושף: אותו משטח API, אותה מודאליות של טקסט בלבד, אותו מתג מצב חשיבה לעבודת סוכנים בטווח ארוך.

לכל מי ששוקל אם להשקיע בזה זמן הנדסי, תקופת הניסיון היא כל הסיפור השבוע, והיא פועלת לשני הכיוונים. הסקה חינמית לשבועיים היא דרך ממש זולה לראות איך המודל מתנהג עם הפרומפטים שלכם — דבר נדיר במודל בגודל הזה. אבל חינם הוא מצב פרסומי, לא מחיר. עדיין אין בשום מקום מחירון מפורסם שלאחר תקופת הניסיון עבור Ling-3.1-flash, כך שכל מודל עלויות שתבנו על המסלול החינמי הוא מציין מקום עד שאנט והמארחים שלה יצמידו לו מספרים.

דף המפרט, ושלושת הנתונים שהם עדיין בגדר הבטחות

• פרמטרים — 560B סה"כ, ~25B פעילים לכל טוקן. כפי שהצהיר הספק, ובערך פי ארבעה מהדור הקודם: 124B סה"כ / 5.1B פעילים. יחס הדלילות נשמר קרוב ל-1 מתוך 22, כך שההפעלה אינה רזה באופן דרמטי — המודל פשוט גדול בהרבה מזה שהוא מחליף.

• הקשר — מסופק כיום בחלון של 262,144 טוקנים. "עד 1M" הוא היעד לאחר שהחלון יופעל; זה לא מה שנקודת הקצה הניסיונית נותנת לך, וזו הקריאה השגויה הנפוצה ביותר של הגרסה הזו.

• פלט — מקסימום 32,768 טוקנים. סביר ללולאות סוכן, מצומצם אם בכוונתך להפיק מסמכים ארוכים במעבר אחד.

• מודאליות — טקסט נכנס, טקסט יוצא. זהו מודל טקסט. ראייה, אודיו וקלט קבצים אינם חלק מההשקה, ולא נמסר תאריך עבורם.

• הסקה — סטאק היברידי עם מתג מפורש למצב חשיבה, אותו דפוס שבו השתמש הדור הקודם, המיועד לעבודה רב-שלבית עם סוכנים וקריאה לכלים ולא לשיחת סבב בודד.

• משקלים ורישיון — לא פורסמו. זהו הנתון החשוב ביותר, וזה שאין לו עדיין שום ערך: אין מאגר Hugging Face, אין טקסט רישיון, ואין צ'קפוינט שניתן להוריד נכון להיום.

Ant Group's own Ling-3.1-flash benchmark chart, published 30 September 2026. Twelve bar-chart panels cover GDPval-AA v2.1 (1,673 for Ling-3.1-flash), tau-squared Banking (47.60), SkillsBench (69.70), Automationbench public (52.50), Terminal-Bench 4.0 (40.40), CyberGym (87.90), FrontierSWE (75.16), SWE Atlas Codebase QnA (55.92), Finance Agent v2 (57.87), HealthBench Professional (65.35), DRACO (85.49) and MultiChallenge (69.78), with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment and that Ling-3.1-flash's healthcare capabilities can currently be experienced only in AQ.

כרטיס הבנצ'מרק, בקריאה עם ההנחה הנדרשת

הדיווח של Ant עצמה ממקם את Ling-3.1-flash ב-81.0 מצטבר על פני חמישה בנצ'מרקים לסוכנים, עם 40.4% ב-Terminal-Bench 4.0, 55.9% ב-SWE-Atlas ו-65.35% ב-HealthBench Professional; הדיווח של החברה עצמה מוסיף 1,673 Elo ב-GDPVal-AA v2.1 ו-75.16 ב-FrontierSWE. כל אחד מהמספרים האלה הוא ממקור ראשון. אין הארנס, אין סט פרומפטים ואין משקולות כדי שמישהו אחר יוכל להריץ מחדש את הסוויטה, וזו ההסתייגות המקובלת ממודל בשלב הזה — וכאן ראוי לומר בפשטות: ציון של ספק שלא שוחזר הוא טענה על מודל, לא מדידה שלו.

הכרטיס גם מאלף בדרך שכותביו אולי לא התכוונו לה. תוצאת 40.4% ב-Terminal-Bench 4.0 נותרת הרחק מאחורי דרג החזית; Claude Sonnet 5.5, מודל במשקל בינוני ולא דגם דגל, משיג 70.6% באותה גרסה של אותו מבחן. הקריאה הכנה אינה ש-Ling-3.1-flash הוא חלש — 40.4% הוא מספר מכובד במשימות סוכן-טרמינל עבור מודל שממוצב בעיקר סביב עלות — אלא שהמסגור "קרוב לחזית במבחנים מרכזיים" שהופץ ברשתות החברתיות ביום ההכרזה אינו שורד מפגש עם השורות הספציפיות. המבחן שבו המודל נראה החזק ביותר, HealthBench Professional עם 65.35, הוא גם זה שנושא את הערת השוליים הלא-נוחה: Ant מציינת שהוא הוערך בסביבה שהיא מכנה AQ, ושאת יכולתו של המודל בתחום הבריאות "ניתן לחוות כיום רק ב-AQ", בלי להגדיר מהי AQ בשום מקום פומבי. ציון כותרת שאליו מצורפת סביבה חסרת שם הוא הדגמה, לא תוצאה ניתנת לשחזור.

למה מודל גדול שמגיע בתור ניסוי הוא הידיעה האמיתית

המהלך המעניין יותר כאן הוא הרצף, לא הפרמטרים. Ling-3.0-flash עבר ישירות למשקלים פתוחים. המודל הזה נוחת קודם כל כניסוי, כשהמשקלים, הרישיון והתמחור הרשמי כולם מוחזקים, והתחייבות פומבית לקוד פתוח רק לאחר תום תקופת החינם. זהו תסריט שחרור מסחרי הלבוש כהכרזה על מודל פתוח, וזה שינוי אמיתי שכדאי לעקוב אחריו: אם המשקלים יגיעו תחת רישיון מתירני, הקהילה תקבל מודל בסיס 560B לכוונון עדין ולזיקוק; אם הם יגיעו עם תנאים מסחריים, הניסיון של השבועיים היה המוצר והשורה על "קוד פתוח" הייתה שיווק. כך או כך, ההכרעה נופלת בתוך חלון הניסיון, וזה הדבר שכדאי לצפות בו, ולא כל שורת בנצ'מרק בודדת.

היכן זה רץ, והתמונה הכנה של הניתוב

כרגע, Ling-3.1-flash נגיש דרך משטח המוצר של הספק עצמו ודרך פלטפורמות הסקה של צד שלישי שמריצות את הניסוי — וזה גבול הגזרה. הוא אינו בקטלוג של OrcaRouter היום; חיפוש ב-API הציבורי שלנו למודלים אחר Ling-3.1-flash, Ling-3.0-flash וגרסת ה-vision של Ling-3.0 מחזיר not-found עבור כל אחד מהם, ולא נעמיד פנים אחרת. כאשר נקודת קצה של Ant אכן תגיע לזמינות כללית עם מחיר מחירון מפורסם, מודל ה-pass-through ש-OrcaRouter פועל לפיו — מחיר המחירון של הספק מועבר הלאה ללא תוספת רווח, כך שהורדת מחיר של הספק נכנסת לתוקף אצלנו באותו היום — הוא בדיוק ההסדר שמתאים למודל שתמחורו עדיין לא נכתב.

מה שאתה יכול לעשות היום, בלי לחכות להחלטת הרישיון, הוא להריץ את ההשוואה שבאמת חשובה למודל שטרם הוכח: למדוד אותו מול מודלים ברמת Flash שאתה יכול לקרוא להם כבר עכשיו. Gemini 3.8 Flash ו-DeepSeek-V4.1-Flash נמצאים שניהם בקטלוג שלנו במחירי המחירון של הספקים שלהם, מאחורי מפתח API אחד, עם failover אוטומטי ביניהם. עבור מודל בניסיון חינם, שמשקולותיו ומחירון התעריפים שלו אינם ידועים, זו הדרך ההגיונית להחזיק אותו — עוד מועמד אחד שאפשר לנתב אליו כל עוד הניסיון נמשך, ומסלול ייצור שלא תלוי במה שיקרה ביום החמישה עשר.

Headless capture of Ant's Ling Studio interface with Ling-3.1-flash selected in the model picker. The centre panel shows the model-experience card headed "Ling-3.1-flash Model Experience", describing the model as strong at general-purpose agents, search, routine office work and software/code development, above three starter tasks (Hot Spot Scout, Interaction Design Master, Product Assistant). The Model Settings panel on the right shows Max Length 262144, temperature 0.6, top_k 20, top_p 0.95 and Thinking enabled.

מה לעשות השבוע

אם המודל רלוונטי לעבודה שלך, תקופת הניסיון היא הסיבה לפעול עכשיו במקום להמתין לפתרון שאלת המשקולות הפתוחות — שבועיים של הסקה חינם על MoE של 560B הם ההערכה הזולה ביותר שתקבל, והתשובה לשאלה "האם הוא מחזיק מעמד בפרומפטים שלי" זמינה היום, גם אם התשובה לשאלה "האם אני יכול לארח אותו בעצמי" אינה. שלושה דברים לבדוק כל עוד החלון פתוח, לפי הסדר:

• הרץ את עומס העבודה שלך, לא את כרטיס הבנצ'מרק. המספרים שפורסמו הם המבחר של Ant מבין המשימות; הפרומפטים שלך הם אלו שקובעים את הסטאק שלך.

• בדקו את ההקשר שבו תשתמשו בפועל. נקודת הקצה מגישה 262,144 טוקנים, לא 1M. אם העיצוב שלכם תלוי בחלון הגדול יותר, אתם מתכננים על בסיס הבטחה.

• אל תבנה מודל עלויות על "חינם". "חינם" הוא מצב של שבועיים. עד שיפורסם מחירון, תכנן את המעבר חזרה למודל מתומחר ברמת Flash כברירת מחדל, והתייחס ל-Ling-3.1-flash כאל קיבולת נוספת.

ההכרזה אמיתית והמודל פועל, וזה יותר ממה שאפשר היה לומר לפני שבוע. אבל "משוחרר ופתוח" ו"פועל בניסוי" הם מצבים שונים, והמקרה הזה הוא בהחלט המצב השני — מפרט של 560B, נקודת קצה של 256K, כרטיס בנצ'מארק של הספק בלבד, ושעון של שבועיים שהוא המועד הקשיח היחיד בכל השחרור כולו.

Generated editorial card titled "Ling-3.1-flash on trial - what to verify this week" listing six rounded rows: "Your workload: run it, not the card"; "Context: 262,144 served, not 1M"; "Cost model: free is a two-week state"; "Weights: none published, promise only"; "Fallback: keep a priced Flash-tier route"; "Deadline: the trial window is the only firm date", above a footer reading "Vendor-stated specs; no published post-trial rate card."

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית