כרטיס כותרת ראשי עבור 'Ling 3.0 Tiny מול Gemini 3.5 Flash-Lite' עם כתובית 'חינם זה לא זול — המוביל הנוכחי הוא עדיין ההימור הבטוח' ושני כרטיסי נתונים: Ling 3.0 Tiny (מדד AA 23, מילולי מאוד, חינם עד 14 באוגוסט) ו-Gemini 3.5 Flash-Lite (מדד AA 36, ~490 tok/s, $0.30 / $2.50). לוגו OrcaRouter ממוקם בפינה התחתונה-ימנית.
Guides & Insights

Ling 3.0 Tiny נגד Gemini 3.5 Flash-Lite: חינם אינו זול, והשחקן הקיים הוא עדיין ההימור הבטוח

מחבר

Jim Song

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

"חינם" היא המילה היקרה ביותר באוצר המילים של שוק המודלים, כי בדרך כלל זה אומר שמישהו עומד לגבות ממך תשלום עבור משהו אחר מלבד המחיר הרשום. זו המלכודת שמסתתרת במפגש בין Ling 3.0 Tiny, מודל ההיסק MoE החדש עם 7.9B פרמטרים של Ant Group InclusionAI, לבין Gemini 3.5 Flash-Lite, השכבה הנוכחית הזולה והמהירה ביותר של Gemini מבית Google. Ling 3.0 Tiny הוא חינמי לשימוש כרגע ועולה $0.06 / $0.18 למיליון טוקנים לאחר המבצע של 14 באוגוסט — אבל Artificial Analysis מדדה אותו שורף 210M טוקני פלט רק כדי לדרג אותו במחלקה של 56 דגמים, לעומת חציון של 63M, וסימנה אותו כ"מאוד מילולי". Gemini 3.5 Flash-Lite עולה פי חמישה לטוקן, במחיר של $0.30 / $2.50, ועם זאת יש לו מדד אינטליגנציה עצמאי של 36 — 13 נקודות מעל Ling 3.0 Tiny — ומהירות פלט של כ-490 טוקנים בשנייה. המחיר הזול יותר, הדובר המהיר יותר, והציון הנמוך יותר — כל אלה הם אותו הדגם. זה כל הסיפור של ההשוואה הזו, וכל הסיבה לחשוב פעמיים לפני שאתה בוחר כברירת מחדל במצטרף החדש רק בגלל המחיר.

שני המודלים נמצאים בשכבת התקציב, אך הם נמצאים בנקודות שונות במחזור החיים שלה. Gemini 3.5 Flash-Lite הוא המודל הבוגר הקיים: הושק ב-21 ביולי 2026, נמדד מחדש ברציפות על ידי צד שלישי, ונפרס באופן נרחב כשכבת ברירת המחדל לעבודה אגנטית רגישה להשהיה בנפח גבוה. Ling 3.0 Tiny הוא בן שבוע, מתומחר כדי לרכוש משתמשים, וקיבל ציון בדיוק פעם אחת. מאמר זה מבדיל בין מה שכל מודל הוא בפועל, מה אומרים המספרים העצמאיים, ומדוע המחיר "החינמי" הוא המספר הכי פחות שימושי בהשוואה.

Ling 3.0 Tiny, המצטרף החדש עם מד

Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.

The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Screenshot of the Artificial Analysis page for Ling 3.0 Tiny, showing an Intelligence Index of 23, price $0.00 / $0.00 on the free tier, a 210M-token verbosity read versus a 63M median, and output speed listed as N/A. REUSED from the what-is-ling-3-0-tiny explainer (audited).

Gemini 3.5 Flash-Lite, המכהן

Gemini 3.5 Flash-Lite היא התשובה של Go​ogle לאותה שאלה, משווקת מדרגה אחת מתחת לקו Gemini 3.5. היא מולטי-מודאלית מלידה בקלט — טקסט, תמונות, וידאו, אודיו וקבצים — עם פלט טקסט, חלון הקשר של 1M טוקנים, עד 64K טוקני פלט, ומאמץ חשיבה ניתן לכוונון (מינימלי, נמוך, גבוה) כך שצינור עיבוד יכול לכוון את העומק ואת החשבון, לכל בקשה. הציון העצמאי שלה הוא קפיצת דור אמיתית: מדד Artificial Analysis Intelligence Index 36, מדורגת #12 מתוך 151 מודלים במעקב, עלייה מ-25 עבור Gemini 3.1 Flash-Lite. במהירות היא המודל המהיר ביותר בסדרת 3.5 — Go​ogle ציינה 350 טוקני פלט בשנייה בהשקה, והדף החי של AA מדד סביב 490 טוקנים בשנייה, מדורגת #2 בין המודלים במעקב. המספרים הסוכנותיים המדווחים על ידי הספק — 74.0% ב-OSWorld-Verified, 54% ב-Terminal-Bench 2.1, 72.2% במבחן שליפת מחטים מרובת נקודות של 128K — הם של Go​ogle עצמה ומשקפים כיוון ולא אמת מוחלטת, ושאלה פתוחה אחת (computer-use מופיע כמובנה בבלוג של Go​ogle אך אינו נתמך במסמכי ה-API) כדאי לבדוק לפני שמסתמכים עליה.

זה גם, לכל טוקן, לא זול עבור השכבה שלו. השם "Lite" מתאר את מקומו של המודל במערך, לא מחירון שיורד: Gemini 2.5 Flash-Lite היה $0.10 / $0.40, 3.1 Flash-Lite היה $0.25 / $1.50, ו-3.5 Flash-Lite הוא $0.30 / $2.50 למיליון טוקנים, עם קלט במטמון ב-$0.03. יתרון היעילות נובע ממהירות ומכלכלת טוקנים, והמדידות של Artificial Analysis עצמן מראות שהעלות האמיתית למשימה הוכפלה בקירוב מדור לדור, בזמן שהזמן למשימה נחתך בחצי.

לוח התוצאות העצמאי, הנקרא בהקשר

שים את שני הדגמים על אותו מדד והפער בולט: Gemini 3.5 Flash-Lite עם 36, ו-Ling 3.0 Tiny עם 23. אבל השוואת הכותרת הזו היא רק חצי מהתמונה, כי שני הדגמים לא נמדדים מול אותו שדה. AA ממקמת את Ling 3.0 Tiny במקום ה-6 מתוך 56 במחלקת הדגמים הזעירים שלה, מול חציון מחלקתי של 8 — הרבה מעל הממוצע לדגם בגודלו. Gemini 3.5 Flash-Lite נמצא במקום ה-12 מתוך 151 בשדה המנוטר הרחב יותר. האחד הוא דגם זעיר יוצא דופן; השני הוא דגם תקציבי מוצק במאגר הפתוח. שתי ההצהרות נכונות, והן אומרות דברים שונים. Ling 3.0 Tiny הוא ערך טוב יותר עבור מחלקת הגודל שלו מאשר Gemini 3.5 Flash-Lite עבור השכבה שלו — ובכל זאת Gemini 3.5 Flash-Lite הוא עדיין הדגם המסוגל יותר בפער ניכר על אותו סולם בלתי תלוי.

Comparison scoreboard for Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite. Left column Ling 3.0 Tiny: AA 23, $0.06 / $0.18 after promo, 210M output tokens, text-only, 256K context, speed N/A (Vercel 264 tok/s). Right column Gemini 3.5 Flash-Lite: AA 36, $0.30 / $2.50, 43M output tokens, text + image + video + audio, 1M context, ~490 tok/s (AA). Footer: 'Both models per Artificial Analysis.' OrcaRouter logo composited bottom-right.

הממדים, שורה אחת לכל אחד:

• ציון עצמאי — מדד AA של Ling 3.0 Tiny: 23 (#6/56, חציון כיתה 8) לעומת מדד AA של Gemini 3.5 Flash-Lite: 36 (#12/151).

• מחיר — Ling 3.0 Tiny $0.06 / $0.18 לכל 1M לאחר מבצע חינמי לעומת Gemini 3.5 Flash-Lite $0.30 / $2.50 לכל 1M (קלט במטמון $0.03).

• מילוליות — Ling 3.0 Tiny הפיק 210M טוקני פלט לאורך ריצת האינדקס, לעומת Gemini 3.5 Flash-Lite שנמדד אך לא היה מילולי לפי דגל זה.

• מודאליות — Ling 3.0 Tiny מבוסס טקסט בלבד לעומת Gemini 3.5 Flash-Lite קלט טקסט, תמונה, וידאו, שמע וקבצים.

• הקשר — 256K ב-Ling 3.0 Tiny לעומת 1M ב-Gemini 3.5 Flash-Lite, עם פלט מקסימלי של 64K בשניהם.

• מהירות — Ling 3.0 Tiny ~90–264 tokens/s בנקודות הקצה שפרסמו מספר לעומת Gemini 3.5 Flash-Lite ~490 tokens/s במדידה החיה של AA.

שורת המהירות היא זו שסביר להניח שתזוז. מהירות הפלט של Ling 3.0 Tiny באמת לא מוכרעת: Artificial Analysis מציינת אותה כ-N/A, בעוד Vercel מפרסמת 264 טוקנים לשנייה. המדידה של Gemini 3.5 Flash-Lite, כ-490 טוקנים לשנייה, היא מדידת AA חיה שנלקחה הרבה אחרי שהתנודתיות של תקופת ההשקה שלו שככה. עבור דרגה רגישה להשהיה, זה ההבדל בין כמות ידועה לשאלה פתוחה.

כלכלת האריכות: למה חינם אינו זול

הנה החישוב שבדרך כלל מכריע את ההשוואה הזו. הריצו את אותה משימה כבדת-חשיבה — נניח 4,000 טוקנים של קלט ו-2,000 טוקנים של פלט — דרך שני המודלים אחרי שמבצע הקידום של Ling 3.0 Tiny מסתיים. Ling 3.0 Tiny מחייב (4,000 × $0.06 + 2,000 × $0.18) / 1,000,000, בערך $0.0006. Gemini 3.5 Flash-Lite מחייב (4,000 × $0.30 + 2,000 × $2.50) / 1,000,000, בערך $0.0062. על ספירת טוקנים זהה Ling 3.0 Tiny זול פי 10. ואז מוסיפים את הנדרנות: מודל חשיבה הפולט טוקני חשיבה כפלט לא מייצר ספירת טוקנים זהה. אם יחס הנדרנות של Ling 3.0 Tiny — 210M לעומת 63M — מתקיים בעומס העבודה שלך, העלות האפקטיבית למשימה גדלה בערך פי 3 בצד הפלט, והיתרון של פי 10 מתכווץ לכיוון פי 3–4. עדיין זול יותר — אבל כבר לא חינמי, ולא באותה ליגה כפי שנדמה ממספר ה-210M.

המסגור הכנה הוא ששני המודלים אינם תחליפים באותה רמת איכות. הציון 23 של Ling 3.0 Tiny הוא הישג יוצא דופן עבור מודל עם 1.3B פרמטרים פעילים; הציון 36 של Gemini 3.5 Flash-Lite הוא ליגה אחרת לגמרי של יכולת, ועוד ראייה, ועוד קונטקסט של 1M, ועוד מהירות מוכחת. משלמים על הפער הזה — פי חמישה במחיר לכל טוקן, ויותר לכל משימה כשמחשבים את הפרשי המהירות — אבל זה פער יכולת אמיתי, לא שיווקי. אם עומס העבודה שלך יכול לחיות עם האיכות של המודל הזול יותר, Ling 3.0 Tiny הוא התמורה הטובה יותר. אם עומס העבודה שלך צריך את היכולת, שום יתרון מחיר לא סוגר את הפער.

היכן שהנתב מרוויח את לחמו

זו בדיוק צורת העומס שבה שכבת ניתוב מנצחת התחייבות למודל יחיד, ועובדות האירוח חשובות לאופן שבו בונים אותה. Gemini 3.5 Flash-Lite זמין ב-OrcaRouter במחיר המחירון של הספק — $0.30 כניסה / $2.50 יציאה לכל 1M, מועבר עם 0% תוספת, כך שהמספר בכרטיס התעריפים של Google הוא המספר אצלנו, וכל הורדת מחיר עתידית תיכנס באותו היום. הוא יושב מאחורי אותו endpoint תואם-OpenAI כמו 200+ מודלים אחרים, עם failover אוטומטי בין ספקים למקרה שספק בסיסי מתדרדר באמצע ריצה, ו-DSL הניתוב יכול לשלוח prompt למספר מודלים ולשמור את התשובה הטובה ביותר.

Ling 3.0 Tiny אינו ב‑OrcaRouter; הוא מוגש דרך נקודות קצה משלו, חינמי היום. השילוב הזה דווקא מחזק את הטיעון לניתוב ולא מחליש אותו. נצלו את חלון הזמן החינמי כדי לבצע benchmark ל‑Ling 3.0 Tiny מול התעבורה שלכם לפני שזה מתחיל לעלות כסף. לאחר מכן בנו את מסלול הייצור על הדרגה המנוחסת — Gemini 3.5 Flash‑Lite עבור הקריאות שצריכות ראייה, הקשר ארוך או פרופיל מהירות יציב, כששכבת הניתוב חופשית להסלים למודל יקר יותר עבור המיעוט הקשה. דרגה חינמית היא ניסוי מצוין ותלות שבירה; הדרגה המנוחסת היא מה שאפשר לבנות עליו מוצר. ב‑OrcaRouter אפשר להריץ את שניהם באותו גרף — Ling 3.0 Tiny דרך נקודת קצה ישירה, Gemini 3.5 Flash‑Lite דרך מפתח — ולתת לנתב להחליט לכל בקשה.

Screenshot of the OrcaRouter model page for Gemini 3.5 Flash-Lite (google/gemini-3.5-flash-lite) showing $0.30 input / $2.50 output per 1M tokens, a 1M-token context, up to 64K max output, multimodal text + image + video + file + audio input, and a p50 time-to-first-token of 819ms over the last 7 days. Fresh Edge-headless capture, audited.

פסק דין

אם אתה בוחר בין שני אלה ולא מנתב אותם ביחד, ההחלטה פשוטה לנסח וקשה לאהוב. Ling 3.0 Tiny הוא העסקה הטובה יותר והמודל החלש יותר: דרגת חשיבה טקסטואלית בלבד בת שבוע, עם ציון מצוין ביחס לגודלו, מחיר אגרסיבי, ותמונה לא פתורה של מהירות ומילוליות. הוא ראוי להערכה מיידית במסגרת ניסיון חינמי, וכדאי לדעת שהשימוש בו ימדד מ-14 באוגוסט. Gemini 3.5 Flash-Lite הוא ברירת המחדל הבטוחה יותר לייצור: הוא קיבל באופן עצמאי ציון גבוה ב-13 נקודות, מולטי-מודאלי, קונטקסט של 1M, מהיר פי חמישה במדידה מוכרעת, ומתומחר בהתאם. חינם אינו זול כשהמודל מדבר פי שלושה יותר כדי לחשוב בתקרת יכולת נמוכה יותר – והמודל הקיים הוא ההימור הבטוח מסיבה טובה.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube