כרטיס גיבור עריכתי שנוצר בכותרת "Ling-3.1-flash נגד Gemini 3.8 Flash" עם כותרת משנה "ניסיון חינם של 256K מול API ייצור של 1M טוקנים". שתי שורות השוואה מציינות "Ling-3.1-flash: ניסיון חינם של שבועיים, חלון הקשר של 262,144 טוקנים, לא פורסמו משקלים" ו-"Gemini 3.8 Flash: $0.75 / $3.75 לכל 1M טוקנים, חלון הקשר של 1,048,576 טוקנים, קלט מולטימודלי", מעל כותרת תחתונה שאומרת "נתוני Ling מדווחים על ידי הספק; נתוני Gemini לפי OrcaRouter ו-Artificial Analysis."
Guides & Insights

Ling-3.1-flash מול Gemini 3.8 Flash: מודל ניסיוני של 256K לעומת מודל חי של 1M טוקנים

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הצב את Ling-3.1-flash ואת Gemini 3.8 Flash זה לצד זה, ואי-ההתאמה אינה עניין של אינטליגנציה — היא עניין של מצב. Ling-3.1-flash, מודל תערובת המומחים של Ant Group עם כ-560 מיליארד פרמטרים, שהוכרז ב-29–30 בספטמבר 2026, הוא ניסיון חינם בן שבועיים עם הקשר מוגש של 256K, תקרת פלט של 32,768 טוקנים, קלט טקסט בלבד, וללא משקלים, רישיון או מחיר שפורסמו. Gemini 3.8 Flash, מודל ההסקה בדרגת Flash של Google שיצא ב-2 בספטמבר 2026, הוא API בזמינות כללית עם חלון מלא של 1,048,576 טוקנים, פלט של 65,536 טוקנים, קלט רב-מודאלי, ומחירון פומבי. על הנייר זו השוואה בין שני מודלים; בפועל זו השוואה בין מודל שאפשר לבנות עליו היום לבין מודל שאפשר רק לנסות החודש.

זו אינה סיבה לפסול את Ling-3.1-flash. מודל MoE חופשי בנפח 560B עם נטייה אג'נטית שווה שבועיים מזמן ההערכה של כל אחד. אבל זה משנה לשם מה נועדה השוואה ראש בראש: לא "על איזה מודל כדאי לי לתקנן", אלא "האם מודל הניסוי טוב מספיק כדי שאגַדֵּר את התשובה בעוד חמישה עשר ימים". אלה שאלות שונות, ויש להן תשובות שונות בכל אחד מהצירים שלהלן.

שלושת הדברים שמכריעים את זה לפני שכל בנצ'מרק עושה זאת

רוב ההשוואות מתחילות בציונים. זו צריכה להתחיל בזמינות, כי הפער שם אינו עניין של מידה.

• תמחור — Ling-3.1-flash חינמית למשך תקופת הניסיון שלה ואין לה כלל מחירון מפורסם לאחר הניסיון. Gemini 3.8 Flash רשומה במחיר של $0.75 למיליון טוקנים בקלט ו-$3.75 למיליון בפלט במהלך תקופת המבצע שלה, ותחזור ל-$1.50 / $7.50 ב-1 בינואר 2027. מחירי מחירון לפי דיווח הספק; שניהם עשויים להשתנות.

• הקשר — Ling-3.1-flash מספק 262,144 טוקנים בניסוי, כאשר 1,000,000 מוזכר כיעד הסופי. Gemini 3.8 Flash מספק את מלוא 1,048,576 הטוקנים היום. אם עומס העבודה שלך תלוי בחלון של מיליון טוקנים, רק לאחד מהשניים האלה יש אותו כעת.

• משקלים — ל-Ling-3.1-flash אין כאלה שפורסמו: אין מאגר, אין רישיון, אין צ׳קפוינט, רק הצהרת כוונה לפתוח בקוד פתוח לאחר הניסוי. Gemini 3.8 Flash סגור ותמיד יהיה, אבל זהו API מנוהל שאפשר לפנות אליו היום בלי עמימות.

כאשר קוראים אותם יחד, שלושתם יוצרים נקודה אחת: היתרונות הבולטים של מודל Ling הם או פרסומיים (חינם) או עתידיים (הקשר של 1M, משקלים פתוחים), בעוד שהיתרונות של מודל Gemini הם חוזיים. האסימטריה הזו עוברת דרך כל מה שבא בהמשך.

היכן שמודל Ling באמת מנצח

שני מקומות, ושניהם אמיתיים.

הראשון הוא העלות במהלך ההערכה. ניסיון חינם של שבועיים על מודל בגודל כזה אינו גימיק שיווקי שמוחקים מעליו — זוהי הדרך הזולה ביותר לגלות אם mixture-of-experts בגודל 560B מתמודד עם הפרומפטים שלך. Gemini 3.8 Flash, יהא מחירו אשר יהא, אינו בחינם, והערכה רצינית על פני כמה אלפי קריאות עולה כסף אמיתי.

השני הוא מגמת הפתיחות. Ling-3.1-flash הוא היורש של מודל שכן שוחרר עם משקולות ברישיון MIT, ו-Ant הצהירה בפומבי שהיא מתכוונת לשחרר גם את זה כקוד פתוח. אם זה יגיע עם רישיון מתירני, תקבלו משהו ש-Gemini 3.8 Flash לעולם לא יוכל להציע: את האפשרות לארח בעצמכם, לכוונן עדין, או לזקק מודל בסיס של 560B. המלכוד הוא זה שהכי חשוב — אתם מהמרים על הבטחה, וההבטחה של הדור הקודם קוימה באיחור של שבועיים, לא כערובה.

היכן ש-Gemini 3.8 Flash לא קרוב להפסיד

הסר את המשפט ואת שאלת הפתיחות, וההשוואה התפעולית נוטה בבירור לטובת גוגל.

• קלט — Gemini 3.8 Flash מקבל טקסט, תמונה, וידאו, קובץ ואודיו. Ling-3.1-flash מקבל טקסט ומחזיר טקסט. עבור זרימות עבודה של מסמכים, צילומי מסך או וידאו זה לא העדפה, זה גבול יכולת.

• תקרת פלט — 65,536 טוקנים לעומת 32,768. רלוונטי ברגע שאתה מייצר דוחות, קבצי קוד, או פלט מובנה ארוך במעבר אחד.

• תפוקה — בדיקות בלתי תלויות ממקמות את מהירות הפלט החציונית של Gemini 3.8 Flash קרוב ל-249 אסימונים לשנייה, כאשר הטלמטריה בת שבעת הימים של OrcaRouter עצמה מודדת 552 אסימונים לשנייה ב-p50 של 4.95 שניות לאסימון הראשון. האירוח הניסיוני של Ling-3.1-flash דווח בכ-63 אסימונים לשנייה. מודל Gemini נמצא בדרגת מהירות שונה.

• עומק ייחוס — מאחורי Gemini 3.8 Flash עומד מערך של מדידות בלתי תלויות; המספרים של Ling-3.1-flash הם כולם ממקור ראשון, בנקודת קצה חדשה לגמרי, ואף צד שלישי עדיין לא הריץ אותם מחדש.

• סוכנים מולטימודליים — כל דבר שצריך לקרוא צילום מסך, קובץ PDF או שיחה מוקלטת הוא משימה של Gemini מעצם הגדרתה, ולא בשל איכות.

Headless capture of the OrcaRouter model page for Gemini 3.8 Flash, model ID google/gemini-3.8-flash. It is marked FEATURED and credited to Google with a 2026-09-02 date, carries Vision, Audio, Tools, JSON and Reasoning capability chips, and describes the model as Google's most intelligent Flash model with significant gains over 3.7 Flash on software engineering, agentic tasks and multi-step reasoning. A stat strip reads input $0.75 and output $3.75 per 1M tokens, p50 time to first token 4.95 s, p95 10.00 s and 149.9M tokens of traffic over seven days; the pricing table lists $0.750 input, $3.75 output and $0.075 cache read per 1M tokens.

בנצ'מרקים, ולמה שתי הקבוצות לא ממש ברות השוואה

המקרה המדווח על ידי הספק עבור Ling-3.1-flash הוא ציון מצטבר של 81.0 בחמישה בנצ'מרקים של סוכנים, עם 40.4% ב-Terminal-Bench 4.0, 55.9% ב-SWE-Atlas, ו-65.35% ב-HealthBench Professional; הדיווח של Ant עצמה מוסיף 1,673 Elo ב-GDPVal-AA v2.1 ו-75.16 ב-FrontierSWE. כל אחד מאלה הוא מדידה של Ant עצמה. לא פורסם harness, ויותר מכך, אין משקולות שאפשר להריץ עליהן מחדש את הסוויטה.

התמונה של Gemini 3.8 Flash שונה במהותה. בבנייה הנוכחית של ה-Intelligence Index מבית Artificial Analysis (v4.3.2), הוא משיג 40.9 במאמץ הסקה גבוה, 39.8 בבינוני ו-33.5 בנמוך — וכדאי לציין שהמדד עודכן לאחרונה, כך שנתונים שפורסמו על המודל הזה מוקדם יותר בסתיו חושבו בבנייה שונה ואינם ניתנים להשוואה ישירה לאלה. ההצהרות של Google עצמה לגבי המודל כוללות 54.9 ב-HLE-Verified ותוצאות חזקות ב-Terminal-Bench 2.1 בטווח הגבוה של שנות ה-80. נתונים עצמאיים ונתוני ספק, זה לצד זה, שניהם לגיטימיים, ואין להחליף ביניהם.

יש השוואה צולבת אחת נקייה ששווה לערוך, מפני ששניהם נמצאים באותה משפחת בנצ'מרקים. ב-Terminal-Bench 4.0, נתון הספק של Ling-3.1-flash הוא 40.4%. Claude Sonnet 5.5 — מודל בדרג ביניים, לא מודל דגל — משיג 70.6% באותה גרסה. השורה הבודדת הזו היא הטיעון החזק ביותר נגד קריאת הכרטיס של Ant כ"סמוך לחזית": המודל תחרותי במדדים האג'נטיים ש-Ant בחרה להדגיש, ובבירור מאחור במדד הקידוד בטרמינל שבו קיים נתון חיצוני.

Generated two-column scoreboard titled "Ling-3.1-flash vs Gemini 3.8 Flash - the scoreboard". The Ling-3.1-flash column reads Context 262,144, Output 32,768, Input text only, Price free trial, Weights none, Speed ~63 tok/s. The Gemini 3.8 Flash column reads Context 1,048,576, Output 65,536, Input text, image, audio, Price $0.75 / $3.75, Weights closed, Speed 552 tok/s. A footer reads "Ling figures vendor-reported; Gemini figures per OrcaRouter and Artificial Analysis."

הצורה המעשית של הבחירה

אם אתם צריכים לבנות משהו בשבועיים הקרובים, התשובה אינה צמודה, וזה לא בא להמעיט בערכו של Ling-3.1-flash. Gemini 3.8 Flash הוא היחיד מבין השניים שנותן לכם נקודת קצה יציבה, מחיר מפורסם, חלון מלא של מיליון טוקנים, קלט מולטימודלי, ורישיון שאפשר לקרוא. זהו מודל ברמת Flash לייצור.

Ling-3.1-flash הוא יעד הערכה. הערך שלו כרגע הוא בכך שההערכה חינמית והמודל מעניין: מודל MoE בן 560B שרק ~25B ממנו פעילים לכל טוקן הוא הימור על דלילות, ו-Ant מיצבה אותו בדיוק עבור עומסי העבודה של סוכנים, חיפוש ואוטומציה משרדית — אותם עומסים שמודלים בדרגת Flash מתחרים עליהם. הרצת הפרומפטים שלך דרכו במהלך חלון הניסוי כדאית בדיוק משום שאיש מחוץ ל-Ant עוד לא עשה זאת — אתה תהיה בין הראשונים להחזיק בדעה שאינה מטעם הספק.

עץ ההחלטות ההגיוני החודש: להפנות את הייצור אל Gemini 3.8 Flash, לנצל את תקופת הניסיון החינמית כדי להריץ את Ling-3.1-flash מול הפרומפטים הקשים ביותר שלך, ולהשאיר את שאלת המשקולות הפתוחות כהסתעפות האמיתית. אם המשקולות יגיעו מתירניות ומחיר ינחת בקרבת דרגת ה-Flash, Ling-3.1-flash הופך לאפשרות שנייה של ממש — כזו שאפשר לארח בעצמך, מה ש-Gemini לעולם לא יהיה. אם הן יגיעו עם תנאים, תקופת הניסיון תסתיים, וכך גם ההשוואה.

להריץ את שניהם ממפתח אחד, ולהיות כנים לגבי מה שחסר

Gemini 3.8 Flash נמצא כיום בקטלוג של OrcaRouter תחת מזהה המודל google/gemini-3.8-flash, במחיר המחירון של Google עצמה ללא כל תוספת — כך שכאשר התעריף המבצעי יסתיים בינואר, המחיר שאתם משלמים כאן יתעדכן אוטומטית בהתאם, במקום שתצטרכו חוזה חדש. DeepSeek-V4.1-Flash, מודל ה-Flash הזול האחר ששווה למדוד באותו ניסוי, מופיע באותו קטלוג במחיר המחירון של הספק שלו, כך שבדיקה תלת-כיוונית של מודל הניסיון מול אפשרויות Flash-tier מבוססות רצה מאחורי מפתח API יחיד עם מעבר אוטומטי במקרה של כשל ביניהן.

Ling-3.1-flash אינו נמצא בקטלוג שלנו, ובדיקה מול ה-API הציבורי שלנו למודלים מחזירה "לא נמצא" עבורו ועבור הדור הקודם — כך שההצגה הכנה היא שהניסיון פועל היכן שהוא פועל, דרך המשטח של הספק עצמו ופלטפורמות הסקה של צדדים שלישיים, ואנחנו לא טוענים שאנחנו מארחים אותו. זה החלק בהשוואה הזו שעשוי להשתנות הכי מהר: מודל בתקופת ניסיון חינמית עם מחיר שלא הוכרז הוא בדיוק מסוג הדברים שנוחתים בשכבת ניתוב ברגע ש-Ant והמארחים שלה מפרסמים מחירון, והעברה ישירה ללא תוספת מחיר פירושה שביום שזה יקרה, המחיר כאן הוא המחיר שם.

אז המסקנה צרה יותר ממה שמספרי הפרמטרים מרמזים. Ling-3.1-flash הוא המודל השאפתני יותר והתוצאה המחקרית המעניינת יותר; Gemini 3.8 Flash הוא זה שאפשר להשיק על גביו. עד שיהיו רישיון ומחיר, זה כל ההבדל — וזה לא הבדל ששורת בנצ'מרק תכריע בו.

Headless capture of the Artificial Analysis page for Gemini 3.8 Flash (High), marked "Released September 2026". Summary tiles read Intelligence 41 (rank 50 of 224), Speed 248.5 output tokens per second (rank 4 of 224), Cost $1.24 per Intelligence Index task at $0.75 input and $3.75 output per 1M tokens with a 90% cache discount (rank 62 of 224), and Verbosity 170M output tokens (rank 96 of 224). The comparison summary states the model is notably fast but very verbose, takes text, image, speech and video input, outputs text, and has a 1M-token context window, and the page names the current Artificial Analysis Intelligence Index build as v4.3.2.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית