
Ling-3.1-flash מול Gemini 3.8 Flash: מודל ניסיוני של 256K לעומת מודל חי של 1M טוקנים
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 219 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
הצב את Ling-3.1-flash ואת Gemini 3.8 Flash זה לצד זה, ואי-ההתאמה אינה עניין של אינטליגנציה — היא עניין של מצב. Ling-3.1-flash, מודל תערובת המומחים של Ant Group עם כ-560 מיליארד פרמטרים, שהוכרז ב-29–30 בספטמבר 2026, הוא ניסיון חינם בן שבועיים עם הקשר מוגש של 256K, תקרת פלט של 32,768 טוקנים, קלט טקסט בלבד, וללא משקלים, רישיון או מחיר שפורסמו. Gemini 3.8 Flash, מודל ההסקה בדרגת Flash של Google שיצא ב-2 בספטמבר 2026, הוא API בזמינות כללית עם חלון מלא של 1,048,576 טוקנים, פלט של 65,536 טוקנים, קלט רב-מודאלי, ומחירון פומבי. על הנייר זו השוואה בין שני מודלים; בפועל זו השוואה בין מודל שאפשר לבנות עליו היום לבין מודל שאפשר רק לנסות החודש.
זו אינה סיבה לפסול את Ling-3.1-flash. מודל MoE חופשי בנפח 560B עם נטייה אג'נטית שווה שבועיים מזמן ההערכה של כל אחד. אבל זה משנה לשם מה נועדה השוואה ראש בראש: לא "על איזה מודל כדאי לי לתקנן", אלא "האם מודל הניסוי טוב מספיק כדי שאגַדֵּר את התשובה בעוד חמישה עשר ימים". אלה שאלות שונות, ויש להן תשובות שונות בכל אחד מהצירים שלהלן.
שלושת הדברים שמכריעים את זה לפני שכל בנצ'מרק עושה זאת
רוב ההשוואות מתחילות בציונים. זו צריכה להתחיל בזמינות, כי הפער שם אינו עניין של מידה.
• תמחור — Ling-3.1-flash חינמית למשך תקופת הניסיון שלה ואין לה כלל מחירון מפורסם לאחר הניסיון. Gemini 3.8 Flash רשומה במחיר של $0.75 למיליון טוקנים בקלט ו-$3.75 למיליון בפלט במהלך תקופת המבצע שלה, ותחזור ל-$1.50 / $7.50 ב-1 בינואר 2027. מחירי מחירון לפי דיווח הספק; שניהם עשויים להשתנות.
• הקשר — Ling-3.1-flash מספק 262,144 טוקנים בניסוי, כאשר 1,000,000 מוזכר כיעד הסופי. Gemini 3.8 Flash מספק את מלוא 1,048,576 הטוקנים היום. אם עומס העבודה שלך תלוי בחלון של מיליון טוקנים, רק לאחד מהשניים האלה יש אותו כעת.
• משקלים — ל-Ling-3.1-flash אין כאלה שפורסמו: אין מאגר, אין רישיון, אין צ׳קפוינט, רק הצהרת כוונה לפתוח בקוד פתוח לאחר הניסוי. Gemini 3.8 Flash סגור ותמיד יהיה, אבל זהו API מנוהל שאפשר לפנות אליו היום בלי עמימות.
כאשר קוראים אותם יחד, שלושתם יוצרים נקודה אחת: היתרונות הבולטים של מודל Ling הם או פרסומיים (חינם) או עתידיים (הקשר של 1M, משקלים פתוחים), בעוד שהיתרונות של מודל Gemini הם חוזיים. האסימטריה הזו עוברת דרך כל מה שבא בהמשך.
היכן שמודל Ling באמת מנצח
שני מקומות, ושניהם אמיתיים.
הראשון הוא העלות במהלך ההערכה. ניסיון חינם של שבועיים על מודל בגודל כזה אינו גימיק שיווקי שמוחקים מעליו — זוהי הדרך הזולה ביותר לגלות אם mixture-of-experts בגודל 560B מתמודד עם הפרומפטים שלך. Gemini 3.8 Flash, יהא מחירו אשר יהא, אינו בחינם, והערכה רצינית על פני כמה אלפי קריאות עולה כסף אמיתי.
השני הוא מגמת הפתיחות. Ling-3.1-flash הוא היורש של מודל שכן שוחרר עם משקולות ברישיון MIT, ו-Ant הצהירה בפומבי שהיא מתכוונת לשחרר גם את זה כקוד פתוח. אם זה יגיע עם רישיון מתירני, תקבלו משהו ש-Gemini 3.8 Flash לעולם לא יוכל להציע: את האפשרות לארח בעצמכם, לכוונן עדין, או לזקק מודל בסיס של 560B. המלכוד הוא זה שהכי חשוב — אתם מהמרים על הבטחה, וההבטחה של הדור הקודם קוימה באיחור של שבועיים, לא כערובה.
היכן ש-Gemini 3.8 Flash לא קרוב להפסיד
הסר את המשפט ואת שאלת הפתיחות, וההשוואה התפעולית נוטה בבירור לטובת גוגל.
• קלט — Gemini 3.8 Flash מקבל טקסט, תמונה, וידאו, קובץ ואודיו. Ling-3.1-flash מקבל טקסט ומחזיר טקסט. עבור זרימות עבודה של מסמכים, צילומי מסך או וידאו זה לא העדפה, זה גבול יכולת.
• תקרת פלט — 65,536 טוקנים לעומת 32,768. רלוונטי ברגע שאתה מייצר דוחות, קבצי קוד, או פלט מובנה ארוך במעבר אחד.
• תפוקה — בדיקות בלתי תלויות ממקמות את מהירות הפלט החציונית של Gemini 3.8 Flash קרוב ל-249 אסימונים לשנייה, כאשר הטלמטריה בת שבעת הימים של OrcaRouter עצמה מודדת 552 אסימונים לשנייה ב-p50 של 4.95 שניות לאסימון הראשון. האירוח הניסיוני של Ling-3.1-flash דווח בכ-63 אסימונים לשנייה. מודל Gemini נמצא בדרגת מהירות שונה.
• עומק ייחוס — מאחורי Gemini 3.8 Flash עומד מערך של מדידות בלתי תלויות; המספרים של Ling-3.1-flash הם כולם ממקור ראשון, בנקודת קצה חדשה לגמרי, ואף צד שלישי עדיין לא הריץ אותם מחדש.
• סוכנים מולטימודליים — כל דבר שצריך לקרוא צילום מסך, קובץ PDF או שיחה מוקלטת הוא משימה של Gemini מעצם הגדרתה, ולא בשל איכות.

בנצ'מרקים, ולמה שתי הקבוצות לא ממש ברות השוואה
המקרה המדווח על ידי הספק עבור Ling-3.1-flash הוא ציון מצטבר של 81.0 בחמישה בנצ'מרקים של סוכנים, עם 40.4% ב-Terminal-Bench 4.0, 55.9% ב-SWE-Atlas, ו-65.35% ב-HealthBench Professional; הדיווח של Ant עצמה מוסיף 1,673 Elo ב-GDPVal-AA v2.1 ו-75.16 ב-FrontierSWE. כל אחד מאלה הוא מדידה של Ant עצמה. לא פורסם harness, ויותר מכך, אין משקולות שאפשר להריץ עליהן מחדש את הסוויטה.
התמונה של Gemini 3.8 Flash שונה במהותה. בבנייה הנוכחית של ה-Intelligence Index מבית Artificial Analysis (v4.3.2), הוא משיג 40.9 במאמץ הסקה גבוה, 39.8 בבינוני ו-33.5 בנמוך — וכדאי לציין שהמדד עודכן לאחרונה, כך שנתונים שפורסמו על המודל הזה מוקדם יותר בסתיו חושבו בבנייה שונה ואינם ניתנים להשוואה ישירה לאלה. ההצהרות של Google עצמה לגבי המודל כוללות 54.9 ב-HLE-Verified ותוצאות חזקות ב-Terminal-Bench 2.1 בטווח הגבוה של שנות ה-80. נתונים עצמאיים ונתוני ספק, זה לצד זה, שניהם לגיטימיים, ואין להחליף ביניהם.
יש השוואה צולבת אחת נקייה ששווה לערוך, מפני ששניהם נמצאים באותה משפחת בנצ'מרקים. ב-Terminal-Bench 4.0, נתון הספק של Ling-3.1-flash הוא 40.4%. Claude Sonnet 5.5 — מודל בדרג ביניים, לא מודל דגל — משיג 70.6% באותה גרסה. השורה הבודדת הזו היא הטיעון החזק ביותר נגד קריאת הכרטיס של Ant כ"סמוך לחזית": המודל תחרותי במדדים האג'נטיים ש-Ant בחרה להדגיש, ובבירור מאחור במדד הקידוד בטרמינל שבו קיים נתון חיצוני.

הצורה המעשית של הבחירה
אם אתם צריכים לבנות משהו בשבועיים הקרובים, התשובה אינה צמודה, וזה לא בא להמעיט בערכו של Ling-3.1-flash. Gemini 3.8 Flash הוא היחיד מבין השניים שנותן לכם נקודת קצה יציבה, מחיר מפורסם, חלון מלא של מיליון טוקנים, קלט מולטימודלי, ורישיון שאפשר לקרוא. זהו מודל ברמת Flash לייצור.
Ling-3.1-flash הוא יעד הערכה. הערך שלו כרגע הוא בכך שההערכה חינמית והמודל מעניין: מודל MoE בן 560B שרק ~25B ממנו פעילים לכל טוקן הוא הימור על דלילות, ו-Ant מיצבה אותו בדיוק עבור עומסי העבודה של סוכנים, חיפוש ואוטומציה משרדית — אותם עומסים שמודלים בדרגת Flash מתחרים עליהם. הרצת הפרומפטים שלך דרכו במהלך חלון הניסוי כדאית בדיוק משום שאיש מחוץ ל-Ant עוד לא עשה זאת — אתה תהיה בין הראשונים להחזיק בדעה שאינה מטעם הספק.
עץ ההחלטות ההגיוני החודש: להפנות את הייצור אל Gemini 3.8 Flash, לנצל את תקופת הניסיון החינמית כדי להריץ את Ling-3.1-flash מול הפרומפטים הקשים ביותר שלך, ולהשאיר את שאלת המשקולות הפתוחות כהסתעפות האמיתית. אם המשקולות יגיעו מתירניות ומחיר ינחת בקרבת דרגת ה-Flash, Ling-3.1-flash הופך לאפשרות שנייה של ממש — כזו שאפשר לארח בעצמך, מה ש-Gemini לעולם לא יהיה. אם הן יגיעו עם תנאים, תקופת הניסיון תסתיים, וכך גם ההשוואה.
להריץ את שניהם ממפתח אחד, ולהיות כנים לגבי מה שחסר
Gemini 3.8 Flash נמצא כיום בקטלוג של OrcaRouter תחת מזהה המודל google/gemini-3.8-flash, במחיר המחירון של Google עצמה ללא כל תוספת — כך שכאשר התעריף המבצעי יסתיים בינואר, המחיר שאתם משלמים כאן יתעדכן אוטומטית בהתאם, במקום שתצטרכו חוזה חדש. DeepSeek-V4.1-Flash, מודל ה-Flash הזול האחר ששווה למדוד באותו ניסוי, מופיע באותו קטלוג במחיר המחירון של הספק שלו, כך שבדיקה תלת-כיוונית של מודל הניסיון מול אפשרויות Flash-tier מבוססות רצה מאחורי מפתח API יחיד עם מעבר אוטומטי במקרה של כשל ביניהן.
Ling-3.1-flash אינו נמצא בקטלוג שלנו, ובדיקה מול ה-API הציבורי שלנו למודלים מחזירה "לא נמצא" עבורו ועבור הדור הקודם — כך שההצגה הכנה היא שהניסיון פועל היכן שהוא פועל, דרך המשטח של הספק עצמו ופלטפורמות הסקה של צדדים שלישיים, ואנחנו לא טוענים שאנחנו מארחים אותו. זה החלק בהשוואה הזו שעשוי להשתנות הכי מהר: מודל בתקופת ניסיון חינמית עם מחיר שלא הוכרז הוא בדיוק מסוג הדברים שנוחתים בשכבת ניתוב ברגע ש-Ant והמארחים שלה מפרסמים מחירון, והעברה ישירה ללא תוספת מחיר פירושה שביום שזה יקרה, המחיר כאן הוא המחיר שם.
אז המסקנה צרה יותר ממה שמספרי הפרמטרים מרמזים. Ling-3.1-flash הוא המודל השאפתני יותר והתוצאה המחקרית המעניינת יותר; Gemini 3.8 Flash הוא זה שאפשר להשיק על גביו. עד שיהיו רישיון ומחיר, זה כל ההבדל — וזה לא הבדל ששורת בנצ'מרק תכריע בו.

השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
