כרטיס הירו עריכתי שנוצר, שכותרתו "Ling-3.1-flash vs Qwen3.8-Flash" וכותרת המשנה שלו "שתי תשובות לאותה שאלה: איך בונים דרג מהיר?" הפאנל השמאלי, שכותרתו "להגדיל ולפרסם", נושא את הכיתוב "~560B סה"כ · ~25B פעילים · הקשר של 1M" ותג שעליו כתוב "משקלים: בקרוב". הפאנל הימני, שכותרתו "לכווץ ולשחרר", נושא "125B סה"כ · 6B פעילים · מציג תצוגה מקדימה של Qwen4" ותג שעליו כתוב "משקלים: ב-Hugging Face".
Engineering & Research

Ling-3.1-flash מול Qwen3.8-Flash: שתי דרכים לבנות שכבה מהירה, ורק אחת מהן יוצאת לשוק

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שתי מעבדות סיניות בחנו את אותה בעיה בסתיו הזה — איך בונים מודל זול ומהיר שטוב מספיק כדי לשבת בתוך לולאת סוכן — והגיעו לתשובות הפוכות. Ling-3.1-flash, שהוכרז על ידי Ant Group ב-30 בספטמבר 2026, הוא תערובת מומחים (mixture-of-experts) עם כ-560 מיליארד פרמטרים שמפעילה כ-25 מיליארד פרמטרים לכל טוקן, עם חלון הקשר שצוין כעד 1 מיליון טוקנים וכוונה מוצהרת לפתוח בקוד פתוח "בקרוב". Qwen3.8-Flash, ששוחרר על ידי צוות Qwen של Alibaba ב-26 באוגוסט 2026, הוא תערובת מומחים מולטימודלית עם 125 מיליארד פרמטרים שמפעילה כ-6 מיליארד פרמטרים לכל טוקן, עם משקולות שכבר נמצאות ב-Hugging Face תחת השם Qwen3.8-Flash-Next, מודל פרודקשן פעיל ב-API של QwenCloud במחיר $0.15 למיליון טוקני קלט ו-$0.47 למיליון טוקני פלט, ותמיכה מיום 0 ב-SGLang. מעבדה אחת הגדילה והכריזה. האחרת הצטמצמה והשיקה. ההבדל הזה מלמד יותר מכל בנצ'מרק שכל אחת מהמעבדות פרסמה.

זו גם הסיבה שצריך לקרוא את ההשוואה הזו בקפידה. ל-Ling-3.1-flash אין משקלים, אין רישיון, אין כרטיס מודל, אין מחיר API, ואין הערכה בלתי תלויה; כל התיעוד שפורסם הוא פוסט הכרזה, טבלת בנצ'מרק של ספק, ומשבצת במוצר Ling Studio של Ant עצמה. ל-Qwen3.8-Flash יש את כל הדברים האלה ויתרון התחלה של ארבעה שבועות בכך שאנשים שאינם עובדים ב-Alibaba מריצים אותו. להשוות בחירה ארכיטקטונית זה הוגן. להשוות יכולות זה עדיין לא.

שתי החלטות העיצוב, ומדוע הן מתפצלות

ההימור של Qwen הוא שהדרג המהיר צריך להיות שונה מבחינה מבנית מדגם הדגל, ולא רק קטן ממנו. Qwen3.8-Flash מפעיל 6 מיליארד מתוך 125 מיליארד הפרמטרים שלו — דלילות של כ-95% — ומקבל את היכולת שלו מהמקום שאליו מנותב החישוב ולא מרוחב גולמי. Alibaba הייתה מפורשת שהארכיטקטורה שמתחת, שמזווגת את Gated DeltaNet עם Qwen Sparse Attention וטבלת הטמעות N-gram, היא תצוגה מקדימה מוקדמת של דור Qwen4, שפורסמה מוקדם בכוונה כדי שמנועי הסקה, כלי כימות ותבניות פריסה יוכלו להתבגר סביבה לפני שהדגמים היקרים ייבנו מעליה. התוצאה היא מודל שזול לכל טוקן מעצם הבנייה: כ-6 מיליארד פרמטרים של עבודה על כל טוקן, במחיר ש-Alibaba קבעה של $0.15 לקלט ו-$0.47 לפלט למיליון טוקנים.

ההימור של Ant, ככל שההכרזה חושפת אותו, קרוב יותר לסקיילינג קונבנציונלי עם חלון הקשר ארוך מאוד. Ling-3.1-flash שומר על חלק פעיל גדול — כ-25 מיליארד פרמטרים לכל טוקן מתוך 560 מיליארד, כלומר בערך אחד מתוך עשרים ושניים — ומציין חלון של עד מיליון טוקנים, פי ארבעה ממה שדור Ling הקודם מספק. אפליקציית Ling Studio מתארת אותו כמיועד ל"סוכנים למטרות כלליות, חיפוש, עבודה משרדית שגרתית ופיתוח תוכנה/קוד", שזה מיצוב של שכבה מהירה, אבל כלכלת הפרמטרים היא של מודל כבד בהרבה. בקלט זהה, טוקן שעובר דרך 25B פרמטרים פעילים עולה בערך פי ארבעה בחישוב מטוקן שעובר דרך 6B, לפני ששיקול תמחור כלשהו נכנס לתמונה.

אף אחת מהגישות אינה שגויה, ושתיהן תשובות שאפשר להגן עליהן לשאלה "מה מגביל מודל זול". Qwen מהמרת שדלילות וסטאק קשב חדש הם התקרה. Ant מהמרת שהתקרה היא ההקשר והידע העולמי, ושהיא יכולה להרשות לעצמה את המחשוב. מה שמבדיל ביניהן בעיני הקורא הוא לא פילוסופיית העיצוב אלא אופן המסירה: עיצוב שאפשר להוריד ולמדוד לעומת עיצוב שאפשר רק לקרוא עליו.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Panels compare Ling-3.1-flash with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states HealthBench Professional was evaluated in the AQ environment.

מה כל אחד מהם עולה לך, ומה זה אומר בפועל

פער המחירים אינו עדין והוא אינו צמוד. Qwen3.8-Flash מפורסם ב-$0.15 למיליון טוקנים בקלט, $0.47 למיליון בפלט, ו-$0.018 למיליון בקריאות מטמון — אותם מספרים בהודעה של Alibaba, בכרטיס המודל הייצורי של הספק, ובעמוד המודל המנותב שאנחנו מגישים, וכך נראית העברה ללא תוספת של 0% כשאתם בודקים אותה מול שלושה מקורות. Ant לא פרסמה תעריף כלל עבור Ling-3.1-flash — לא מחיר API, לא הנחת מטמון, שום דבר להשוואה. הנתון המפורסם היחיד עבור סדרת Ling הוא של הדור הקודם, והוא רשום ב-$0.075 בקלט ו-$0.22 בפלט למיליון, בערך חצי מתעריף הקלט של Qwen ופחות מחצי מתעריף הפלט שלה. אם דרגת Ling החדשה תתומחר בסמוך למקום שבו עמדה הישנה, היא תתמחר מתחת ל-Qwen3.8-Flash על הנייר; אם היא תתומחר בכלל בקרבת המחשוב ש-25B הפרמטרים הפעילים שלה מרמזים עליו, זה לא יקרה. כך או כך, זה ניחוש, כי המספר לא קיים.

בתחום ההקשר, הטענה של Ling גדולה באמת. Ant מציינת עד מיליון טוקנים עבור Ling-3.1-flash; Qwen3.8-Flash מגיע עם הקשר ברירת מחדל של 1M טוקנים ב-API לפרודקשן ועם חלון מקורי של 262,144 טוקנים במשקלים הפתוחים, שניתן להרחבה. שתי הסתייגויות מונחות על הנתון של Ling, ואף אחת מהן אינה סגורה. ראשית, "עד 1M" הוא מפרט, לא מדידה — איש לא פרסם התנהגות שליפה בהקשר ארוך עבור מודל שאיש מחוץ ל-Ant לא יכול לקרוא לו. שנית, לדור הקודם של Ling היה בדיוק אותו פער בין החלון המפורסם לבין הסיפור הארכיטקטוני שמאחוריו, והתשובה הגיעה רק כשהמשקלים, הפורמט ומגבלות ההקשר פורסמו סוף סוף. ה-1M הכותרתי הוא הבטחה. ה-1M ב-Qwen3.8-Flash הוא ברירת מחדל מוגשת שאפשר להעמיד מולה את הטענה של Ant.

למה "תצוגה מקדימה" היא המילה הכנה בצד אחד של זה

המסגור של עליבאבא עצמה את Qwen3.8-Flash הוא שזהו תצוגה מקדימה של ארכיטקטורה המשוחררת תחת שם ייצור — המשקולות הפתוחות נושאות את הסיומת "Next" בדיוק כדי שאיש לא יתבלבל בין האב-טיפוס לבין מודל השירות המכוונן. המסגור הזה אומת על ידי אירועים ולא על ידי שיווק: SGLang סיפקה תמיכת יום-0 עבור Qwen3.8-Flash-Next ביום השחרור, כאשר המודל גם הוגדר עבור Transformers, vLLM ו-TokenSpeed, ומאז המשקולות נקלטו בקהילות קוונטיזציה. גרסאות הפכו במהרה לשגרתיות, וכך נראה מודל משוחרר.

להכרזה של Ant יש אותה צורה, צעד אחד מוקדם יותר: פרסום מפרט לפני ההשקה, עם הצהרה מפורשת שהמודל יעבור בקרוב לקוד פתוח. זוהי דרך לגיטימית להשיק — Ling-3.0-flash עברה בדיוק במסלול הזה ביולי, והמשקולות נחתו תחת MIT ב-7 באוגוסט, כשבועיים לאחר מכן. אבל מצבם של שני הפרויקטים כיום אינו דומה, ושום כמות של קריאת גרפים לא סוגרת את הפער. כדאי להיות ספציפיים לגבי מה שאדם מבחוץ יכול להביא לכל אחד מהם.

מה ניתן לאמת באופן בלתי תלוי עבור Ling-3.1-flash היום: שההכרזה קיימת ומתוארכת ל-30 בספטמבר; שנתוני הפרמטרים, הפרמטרים הפעילים וההקשר הם של Ant עצמה; שהמודל מופיע במוצר Ling Studio של Ant; ושלא פורסמו משקלים, רישיון או כרטיס מודל. מה ניתן לאמת באופן בלתי תלוי עבור Qwen3.8-Flash: שאת המשקלים ניתן להוריד ב-BF16 וב-FP8; שתנאי הרישיון ניתנים לקריאה; שמחיר ה-API מפורסם; ושטענות ה-benchmark של Alibaba פתוחות לשחזור מאז סוף אוגוסט. הרשימה השנייה ארוכה יותר, וזו כל ההשוואה בזעיר אנפין.

Headless capture of the OrcaRouter model page for Qwen3.8 Flash, showing the routed model ID qwen/qwen3.8-flash, a 1M-token context window, 131K maximum output, text, image and video input with text output, capability badges for Vision, Tools, JSON and Reasoning, a production date of 2026-08-26, a pricing block reading $0.15 per 1M input tokens, $0.47 per 1M output tokens, $0.018 cache read and $0.230 cache write, and a performance panel with a 4.47 s p50 time-to-first-token, 10.00 s p95, 105 tok/s output and a 2.9% error rate over the last seven days.

כיצד השניים היו מוערכים בפועל

Ant פרסמה כרטיס בנצ'מרק עם Ling-3.1-flash שמציב אותו מול GPT-5.6 Sol, Claude Opus 5, Kimi K3, שני וריאנטים של GLM ו-DeepSeek-V4.1-Flash, עם נתוני כותרת של 1,673 Elo ב-GDPVal-AA v2.1, 75.16 ב-FrontierSWE ו-65.35 ב-HealthBench Professional. שתי בעיות מונחות על הכרטיס הזה לפני שמישהו מתווכח על המספרים. הראשונה היא קבוצת ההשוואה: שני מודלי החזית ש-Ant בחרה הם דור אחד מאחור, מאחר ש-Claude Opus 5.5 ו-GPT-6 Sol עלו לאוויר ב-22 בספטמבר 2026 והם ניתנים לניתוב כעת, כלומר הכרטיס עורך בנצ'מרק למודל מאוקטובר מול חזית יולי ולא מול הנוכחית. השנייה היא הערת שוליים על הכרטיס עצמו, שאומרת שתוצאת HealthBench Professional הגיעה מ"סביבת AQ" ושניתן לחוות את יכולות הבריאות של המודל כרגע רק ב-AQ — סביבה שאף תיעוד ציבורי לא מגדיר. ציון כותרת שסביבת ההערכה שלו אינה נקובה בשם אינו ניתן לשחזור אפילו באופן עקרוני.

הטענות הדומות של Qwen3.8-Flash, לעומת זאת, הושמעו כשהמשקולות כבר היו בחוץ, ואליבאבא הימרה את מיצובה על טענה שכל אחד יכול לבחון: שיחס הדלילות, ולא מספר הפרמטרים, הוא מקור היכולת. ארבעה שבועות של שימוש אינם פסק דין, אך זה מספיק זמן כדי שהטענות הפסיקו להיות בלתי מעורערות — וזהו המצב המועיל עבור מודל.

מה בעצם לעשות עם זה, היום

עבור בונים, ההבחנה המעשית פשוטה. Ling-3.1-flash אינו רכיב שאפשר לאמץ השבוע: אין נקודת קצה לקרוא לה, אין משקלים שאפשר לארח, אין רישיון לבדוק, ואין מחיר לתקצב לפיו. יהיה אשר יהיה המודל הסופי, הצעד המועיל כעת הוא להגדיר טריגר — משקלים מפורסמים, רישיון מתירני, ציון עצמאי ב-FrontierSWE שמתקרב ל-75.16 — ולחזור לבדוק. ההיסטוריה של הדור הקודם עצמו מלמדת שהמשקלים יכולים להגיע שבועיים לאחר ההכרזה, כך שהטריגר הזה עשוי להתממש במהירות.

Qwen3.8-Flash הוא כבר רכיב. הוא זמין בקטלוג שלנו כמודל מנותב במחיר המחירון של הספק עם אפס תוספת — הכרטיס המנותב מציג $0.15 לקלט, $0.47 לפלט ו-$0.018 למיליון קריאות מטמון, אותם נתונים שאליבאבא מפרסמת, וזה מה שמשמעות מדיניות של 0% תוספת בפועל ולא בשקופית. מאחורי מפתח אחד הוא יושב לצד Claude Opus 5, GPT-5.6 Sol ו-DeepSeek-V4.1-Flash, כך שההשוואה שאנט מזמין — מועמד מול החזית הנוכחית — יכולה להתבצע על ידי הצבעת קונפיג לשני נתיבים במקום לתחזק שתי אינטגרציות, עם מעבר אוטומטי לכשל שמטפל בסוף השבוע שבו ספק מתערער. זה ההבדל בין דיון ארכיטקטוני לניסוי.

פסק הדין, ככל שאפשר לתת אותו: Qwen הלכו על ההימור הארכיטקטוני הנועז יותר, והיה להם הביטחון לפרסם אותו מוקדם ולתת לאנשים לפרק אותו לגורמים. Ant הלכו על ההימור הכבד יותר — יותר פרמטרים, יותר חישוב פעיל לכל טוקן, יותר הקשר — ועד כה פרסמו תרשים במקום מודל. התרשים נראה טוב. התרשים הוא גם הדבר היחיד שיש למישהו.

Generated three-lane information card. Lane one, "Shipped, priced, licensed", holds "Qwen3.8-Flash — weights on Hugging Face as Qwen3.8-Flash-Next" and "$0.15 in / $0.47 out per 1M tokens, cache $0.018". Lane two, "Announced, unpriced, unlicensed", holds "Ling-3.1-flash — no repository, no licence", "no published API price" and "no independent evaluation". Lane three, "What a reader should do", holds "test the shipped model this week" and "set a trigger for the announced one".

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית