
Ling-3.1-flash מול Qwen3.8-Flash: שתי דרכים לבנות שכבה מהירה, ורק אחת מהן יוצאת לשוק
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 262 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- xAISpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
שתי מעבדות סיניות בחנו את אותה בעיה בסתיו הזה — איך בונים מודל זול ומהיר שטוב מספיק כדי לשבת בתוך לולאת סוכן — והגיעו לתשובות הפוכות. Ling-3.1-flash, שהוכרז על ידי Ant Group ב-30 בספטמבר 2026, הוא תערובת מומחים (mixture-of-experts) עם כ-560 מיליארד פרמטרים שמפעילה כ-25 מיליארד פרמטרים לכל טוקן, עם חלון הקשר שצוין כעד 1 מיליון טוקנים וכוונה מוצהרת לפתוח בקוד פתוח "בקרוב". Qwen3.8-Flash, ששוחרר על ידי צוות Qwen של Alibaba ב-26 באוגוסט 2026, הוא תערובת מומחים מולטימודלית עם 125 מיליארד פרמטרים שמפעילה כ-6 מיליארד פרמטרים לכל טוקן, עם משקולות שכבר נמצאות ב-Hugging Face תחת השם Qwen3.8-Flash-Next, מודל פרודקשן פעיל ב-API של QwenCloud במחיר $0.15 למיליון טוקני קלט ו-$0.47 למיליון טוקני פלט, ותמיכה מיום 0 ב-SGLang. מעבדה אחת הגדילה והכריזה. האחרת הצטמצמה והשיקה. ההבדל הזה מלמד יותר מכל בנצ'מרק שכל אחת מהמעבדות פרסמה.
זו גם הסיבה שצריך לקרוא את ההשוואה הזו בקפידה. ל-Ling-3.1-flash אין משקלים, אין רישיון, אין כרטיס מודל, אין מחיר API, ואין הערכה בלתי תלויה; כל התיעוד שפורסם הוא פוסט הכרזה, טבלת בנצ'מרק של ספק, ומשבצת במוצר Ling Studio של Ant עצמה. ל-Qwen3.8-Flash יש את כל הדברים האלה ויתרון התחלה של ארבעה שבועות בכך שאנשים שאינם עובדים ב-Alibaba מריצים אותו. להשוות בחירה ארכיטקטונית זה הוגן. להשוות יכולות זה עדיין לא.
שתי החלטות העיצוב, ומדוע הן מתפצלות
ההימור של Qwen הוא שהדרג המהיר צריך להיות שונה מבחינה מבנית מדגם הדגל, ולא רק קטן ממנו. Qwen3.8-Flash מפעיל 6 מיליארד מתוך 125 מיליארד הפרמטרים שלו — דלילות של כ-95% — ומקבל את היכולת שלו מהמקום שאליו מנותב החישוב ולא מרוחב גולמי. Alibaba הייתה מפורשת שהארכיטקטורה שמתחת, שמזווגת את Gated DeltaNet עם Qwen Sparse Attention וטבלת הטמעות N-gram, היא תצוגה מקדימה מוקדמת של דור Qwen4, שפורסמה מוקדם בכוונה כדי שמנועי הסקה, כלי כימות ותבניות פריסה יוכלו להתבגר סביבה לפני שהדגמים היקרים ייבנו מעליה. התוצאה היא מודל שזול לכל טוקן מעצם הבנייה: כ-6 מיליארד פרמטרים של עבודה על כל טוקן, במחיר ש-Alibaba קבעה של $0.15 לקלט ו-$0.47 לפלט למיליון טוקנים.
ההימור של Ant, ככל שההכרזה חושפת אותו, קרוב יותר לסקיילינג קונבנציונלי עם חלון הקשר ארוך מאוד. Ling-3.1-flash שומר על חלק פעיל גדול — כ-25 מיליארד פרמטרים לכל טוקן מתוך 560 מיליארד, כלומר בערך אחד מתוך עשרים ושניים — ומציין חלון של עד מיליון טוקנים, פי ארבעה ממה שדור Ling הקודם מספק. אפליקציית Ling Studio מתארת אותו כמיועד ל"סוכנים למטרות כלליות, חיפוש, עבודה משרדית שגרתית ופיתוח תוכנה/קוד", שזה מיצוב של שכבה מהירה, אבל כלכלת הפרמטרים היא של מודל כבד בהרבה. בקלט זהה, טוקן שעובר דרך 25B פרמטרים פעילים עולה בערך פי ארבעה בחישוב מטוקן שעובר דרך 6B, לפני ששיקול תמחור כלשהו נכנס לתמונה.
אף אחת מהגישות אינה שגויה, ושתיהן תשובות שאפשר להגן עליהן לשאלה "מה מגביל מודל זול". Qwen מהמרת שדלילות וסטאק קשב חדש הם התקרה. Ant מהמרת שהתקרה היא ההקשר והידע העולמי, ושהיא יכולה להרשות לעצמה את המחשוב. מה שמבדיל ביניהן בעיני הקורא הוא לא פילוסופיית העיצוב אלא אופן המסירה: עיצוב שאפשר להוריד ולמדוד לעומת עיצוב שאפשר רק לקרוא עליו.

מה כל אחד מהם עולה לך, ומה זה אומר בפועל
פער המחירים אינו עדין והוא אינו צמוד. Qwen3.8-Flash מפורסם ב-$0.15 למיליון טוקנים בקלט, $0.47 למיליון בפלט, ו-$0.018 למיליון בקריאות מטמון — אותם מספרים בהודעה של Alibaba, בכרטיס המודל הייצורי של הספק, ובעמוד המודל המנותב שאנחנו מגישים, וכך נראית העברה ללא תוספת של 0% כשאתם בודקים אותה מול שלושה מקורות. Ant לא פרסמה תעריף כלל עבור Ling-3.1-flash — לא מחיר API, לא הנחת מטמון, שום דבר להשוואה. הנתון המפורסם היחיד עבור סדרת Ling הוא של הדור הקודם, והוא רשום ב-$0.075 בקלט ו-$0.22 בפלט למיליון, בערך חצי מתעריף הקלט של Qwen ופחות מחצי מתעריף הפלט שלה. אם דרגת Ling החדשה תתומחר בסמוך למקום שבו עמדה הישנה, היא תתמחר מתחת ל-Qwen3.8-Flash על הנייר; אם היא תתומחר בכלל בקרבת המחשוב ש-25B הפרמטרים הפעילים שלה מרמזים עליו, זה לא יקרה. כך או כך, זה ניחוש, כי המספר לא קיים.
בתחום ההקשר, הטענה של Ling גדולה באמת. Ant מציינת עד מיליון טוקנים עבור Ling-3.1-flash; Qwen3.8-Flash מגיע עם הקשר ברירת מחדל של 1M טוקנים ב-API לפרודקשן ועם חלון מקורי של 262,144 טוקנים במשקלים הפתוחים, שניתן להרחבה. שתי הסתייגויות מונחות על הנתון של Ling, ואף אחת מהן אינה סגורה. ראשית, "עד 1M" הוא מפרט, לא מדידה — איש לא פרסם התנהגות שליפה בהקשר ארוך עבור מודל שאיש מחוץ ל-Ant לא יכול לקרוא לו. שנית, לדור הקודם של Ling היה בדיוק אותו פער בין החלון המפורסם לבין הסיפור הארכיטקטוני שמאחוריו, והתשובה הגיעה רק כשהמשקלים, הפורמט ומגבלות ההקשר פורסמו סוף סוף. ה-1M הכותרתי הוא הבטחה. ה-1M ב-Qwen3.8-Flash הוא ברירת מחדל מוגשת שאפשר להעמיד מולה את הטענה של Ant.
למה "תצוגה מקדימה" היא המילה הכנה בצד אחד של זה
המסגור של עליבאבא עצמה את Qwen3.8-Flash הוא שזהו תצוגה מקדימה של ארכיטקטורה המשוחררת תחת שם ייצור — המשקולות הפתוחות נושאות את הסיומת "Next" בדיוק כדי שאיש לא יתבלבל בין האב-טיפוס לבין מודל השירות המכוונן. המסגור הזה אומת על ידי אירועים ולא על ידי שיווק: SGLang סיפקה תמיכת יום-0 עבור Qwen3.8-Flash-Next ביום השחרור, כאשר המודל גם הוגדר עבור Transformers, vLLM ו-TokenSpeed, ומאז המשקולות נקלטו בקהילות קוונטיזציה. גרסאות הפכו במהרה לשגרתיות, וכך נראה מודל משוחרר.
להכרזה של Ant יש אותה צורה, צעד אחד מוקדם יותר: פרסום מפרט לפני ההשקה, עם הצהרה מפורשת שהמודל יעבור בקרוב לקוד פתוח. זוהי דרך לגיטימית להשיק — Ling-3.0-flash עברה בדיוק במסלול הזה ביולי, והמשקולות נחתו תחת MIT ב-7 באוגוסט, כשבועיים לאחר מכן. אבל מצבם של שני הפרויקטים כיום אינו דומה, ושום כמות של קריאת גרפים לא סוגרת את הפער. כדאי להיות ספציפיים לגבי מה שאדם מבחוץ יכול להביא לכל אחד מהם.
מה ניתן לאמת באופן בלתי תלוי עבור Ling-3.1-flash היום: שההכרזה קיימת ומתוארכת ל-30 בספטמבר; שנתוני הפרמטרים, הפרמטרים הפעילים וההקשר הם של Ant עצמה; שהמודל מופיע במוצר Ling Studio של Ant; ושלא פורסמו משקלים, רישיון או כרטיס מודל. מה ניתן לאמת באופן בלתי תלוי עבור Qwen3.8-Flash: שאת המשקלים ניתן להוריד ב-BF16 וב-FP8; שתנאי הרישיון ניתנים לקריאה; שמחיר ה-API מפורסם; ושטענות ה-benchmark של Alibaba פתוחות לשחזור מאז סוף אוגוסט. הרשימה השנייה ארוכה יותר, וזו כל ההשוואה בזעיר אנפין.

כיצד השניים היו מוערכים בפועל
Ant פרסמה כרטיס בנצ'מרק עם Ling-3.1-flash שמציב אותו מול GPT-5.6 Sol, Claude Opus 5, Kimi K3, שני וריאנטים של GLM ו-DeepSeek-V4.1-Flash, עם נתוני כותרת של 1,673 Elo ב-GDPVal-AA v2.1, 75.16 ב-FrontierSWE ו-65.35 ב-HealthBench Professional. שתי בעיות מונחות על הכרטיס הזה לפני שמישהו מתווכח על המספרים. הראשונה היא קבוצת ההשוואה: שני מודלי החזית ש-Ant בחרה הם דור אחד מאחור, מאחר ש-Claude Opus 5.5 ו-GPT-6 Sol עלו לאוויר ב-22 בספטמבר 2026 והם ניתנים לניתוב כעת, כלומר הכרטיס עורך בנצ'מרק למודל מאוקטובר מול חזית יולי ולא מול הנוכחית. השנייה היא הערת שוליים על הכרטיס עצמו, שאומרת שתוצאת HealthBench Professional הגיעה מ"סביבת AQ" ושניתן לחוות את יכולות הבריאות של המודל כרגע רק ב-AQ — סביבה שאף תיעוד ציבורי לא מגדיר. ציון כותרת שסביבת ההערכה שלו אינה נקובה בשם אינו ניתן לשחזור אפילו באופן עקרוני.
הטענות הדומות של Qwen3.8-Flash, לעומת זאת, הושמעו כשהמשקולות כבר היו בחוץ, ואליבאבא הימרה את מיצובה על טענה שכל אחד יכול לבחון: שיחס הדלילות, ולא מספר הפרמטרים, הוא מקור היכולת. ארבעה שבועות של שימוש אינם פסק דין, אך זה מספיק זמן כדי שהטענות הפסיקו להיות בלתי מעורערות — וזהו המצב המועיל עבור מודל.
מה בעצם לעשות עם זה, היום
עבור בונים, ההבחנה המעשית פשוטה. Ling-3.1-flash אינו רכיב שאפשר לאמץ השבוע: אין נקודת קצה לקרוא לה, אין משקלים שאפשר לארח, אין רישיון לבדוק, ואין מחיר לתקצב לפיו. יהיה אשר יהיה המודל הסופי, הצעד המועיל כעת הוא להגדיר טריגר — משקלים מפורסמים, רישיון מתירני, ציון עצמאי ב-FrontierSWE שמתקרב ל-75.16 — ולחזור לבדוק. ההיסטוריה של הדור הקודם עצמו מלמדת שהמשקלים יכולים להגיע שבועיים לאחר ההכרזה, כך שהטריגר הזה עשוי להתממש במהירות.
Qwen3.8-Flash הוא כבר רכיב. הוא זמין בקטלוג שלנו כמודל מנותב במחיר המחירון של הספק עם אפס תוספת — הכרטיס המנותב מציג $0.15 לקלט, $0.47 לפלט ו-$0.018 למיליון קריאות מטמון, אותם נתונים שאליבאבא מפרסמת, וזה מה שמשמעות מדיניות של 0% תוספת בפועל ולא בשקופית. מאחורי מפתח אחד הוא יושב לצד Claude Opus 5, GPT-5.6 Sol ו-DeepSeek-V4.1-Flash, כך שההשוואה שאנט מזמין — מועמד מול החזית הנוכחית — יכולה להתבצע על ידי הצבעת קונפיג לשני נתיבים במקום לתחזק שתי אינטגרציות, עם מעבר אוטומטי לכשל שמטפל בסוף השבוע שבו ספק מתערער. זה ההבדל בין דיון ארכיטקטוני לניסוי.
פסק הדין, ככל שאפשר לתת אותו: Qwen הלכו על ההימור הארכיטקטוני הנועז יותר, והיה להם הביטחון לפרסם אותו מוקדם ולתת לאנשים לפרק אותו לגורמים. Ant הלכו על ההימור הכבד יותר — יותר פרמטרים, יותר חישוב פעיל לכל טוקן, יותר הקשר — ועד כה פרסמו תרשים במקום מודל. התרשים נראה טוב. התרשים הוא גם הדבר היחיד שיש למישהו.

השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
