
Ling 3.0 Tiny נגד Gemini 3.5 Flash-Lite: חינם אינו זול, והשחקן הקיים הוא עדיין ההימור הבטוח
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekחדשDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- qwenחדשQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 586 tok/s
- orcaחדשOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0642אינטליגנציה59כתיבת קוד
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232אינטליגנציה42כתיבת קוד
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226אינטליגנציה39כתיבת קוד
- anthropicAnthropic: Claude Sonnet 52026-06-3055אינטליגנציה72כתיבת קוד
- klingKling: Kling 3.0 Turbo2026-06-1757אינטליגנציה52כתיבת קוד57מתמטיקה
- z-aiZ.ai: GLM 5.22026-06-1653אינטליגנציה69כתיבת קוד60מתמטיקה
"חינם" היא המילה היקרה ביותר באוצר המילים של שוק המודלים, כי בדרך כלל זה אומר שמישהו עומד לגבות ממך תשלום עבור משהו אחר מלבד המחיר הרשום. זו המלכודת שמסתתרת במפגש בין Ling 3.0 Tiny, מודל ההיסק MoE החדש עם 7.9B פרמטרים של Ant Group InclusionAI, לבין Gemini 3.5 Flash-Lite, השכבה הנוכחית הזולה והמהירה ביותר של Gemini מבית Google. Ling 3.0 Tiny הוא חינמי לשימוש כרגע ועולה $0.06 / $0.18 למיליון טוקנים לאחר המבצע של 14 באוגוסט — אבל Artificial Analysis מדדה אותו שורף 210M טוקני פלט רק כדי לדרג אותו במחלקה של 56 דגמים, לעומת חציון של 63M, וסימנה אותו כ"מאוד מילולי". Gemini 3.5 Flash-Lite עולה פי חמישה לטוקן, במחיר של $0.30 / $2.50, ועם זאת יש לו מדד אינטליגנציה עצמאי של 36 — 13 נקודות מעל Ling 3.0 Tiny — ומהירות פלט של כ-490 טוקנים בשנייה. המחיר הזול יותר, הדובר המהיר יותר, והציון הנמוך יותר — כל אלה הם אותו הדגם. זה כל הסיפור של ההשוואה הזו, וכל הסיבה לחשוב פעמיים לפני שאתה בוחר כברירת מחדל במצטרף החדש רק בגלל המחיר.
שני המודלים נמצאים בשכבת התקציב, אך הם נמצאים בנקודות שונות במחזור החיים שלה. Gemini 3.5 Flash-Lite הוא המודל הבוגר הקיים: הושק ב-21 ביולי 2026, נמדד מחדש ברציפות על ידי צד שלישי, ונפרס באופן נרחב כשכבת ברירת המחדל לעבודה אגנטית רגישה להשהיה בנפח גבוה. Ling 3.0 Tiny הוא בן שבוע, מתומחר כדי לרכוש משתמשים, וקיבל ציון בדיוק פעם אחת. מאמר זה מבדיל בין מה שכל מודל הוא בפועל, מה אומרים המספרים העצמאיים, ומדוע המחיר "החינמי" הוא המספר הכי פחות שימושי בהשוואה.
Ling 3.0 Tiny, המצטרף החדש עם מד
Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.
The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Gemini 3.5 Flash-Lite, המכהן
Gemini 3.5 Flash-Lite היא התשובה של Google לאותה שאלה, משווקת מדרגה אחת מתחת לקו Gemini 3.5. היא מולטי-מודאלית מלידה בקלט — טקסט, תמונות, וידאו, אודיו וקבצים — עם פלט טקסט, חלון הקשר של 1M טוקנים, עד 64K טוקני פלט, ומאמץ חשיבה ניתן לכוונון (מינימלי, נמוך, גבוה) כך שצינור עיבוד יכול לכוון את העומק ואת החשבון, לכל בקשה. הציון העצמאי שלה הוא קפיצת דור אמיתית: מדד Artificial Analysis Intelligence Index 36, מדורגת #12 מתוך 151 מודלים במעקב, עלייה מ-25 עבור Gemini 3.1 Flash-Lite. במהירות היא המודל המהיר ביותר בסדרת 3.5 — Google ציינה 350 טוקני פלט בשנייה בהשקה, והדף החי של AA מדד סביב 490 טוקנים בשנייה, מדורגת #2 בין המודלים במעקב. המספרים הסוכנותיים המדווחים על ידי הספק — 74.0% ב-OSWorld-Verified, 54% ב-Terminal-Bench 2.1, 72.2% במבחן שליפת מחטים מרובת נקודות של 128K — הם של Google עצמה ומשקפים כיוון ולא אמת מוחלטת, ושאלה פתוחה אחת (computer-use מופיע כמובנה בבלוג של Google אך אינו נתמך במסמכי ה-API) כדאי לבדוק לפני שמסתמכים עליה.
זה גם, לכל טוקן, לא זול עבור השכבה שלו. השם "Lite" מתאר את מקומו של המודל במערך, לא מחירון שיורד: Gemini 2.5 Flash-Lite היה $0.10 / $0.40, 3.1 Flash-Lite היה $0.25 / $1.50, ו-3.5 Flash-Lite הוא $0.30 / $2.50 למיליון טוקנים, עם קלט במטמון ב-$0.03. יתרון היעילות נובע ממהירות ומכלכלת טוקנים, והמדידות של Artificial Analysis עצמן מראות שהעלות האמיתית למשימה הוכפלה בקירוב מדור לדור, בזמן שהזמן למשימה נחתך בחצי.
לוח התוצאות העצמאי, הנקרא בהקשר
שים את שני הדגמים על אותו מדד והפער בולט: Gemini 3.5 Flash-Lite עם 36, ו-Ling 3.0 Tiny עם 23. אבל השוואת הכותרת הזו היא רק חצי מהתמונה, כי שני הדגמים לא נמדדים מול אותו שדה. AA ממקמת את Ling 3.0 Tiny במקום ה-6 מתוך 56 במחלקת הדגמים הזעירים שלה, מול חציון מחלקתי של 8 — הרבה מעל הממוצע לדגם בגודלו. Gemini 3.5 Flash-Lite נמצא במקום ה-12 מתוך 151 בשדה המנוטר הרחב יותר. האחד הוא דגם זעיר יוצא דופן; השני הוא דגם תקציבי מוצק במאגר הפתוח. שתי ההצהרות נכונות, והן אומרות דברים שונים. Ling 3.0 Tiny הוא ערך טוב יותר עבור מחלקת הגודל שלו מאשר Gemini 3.5 Flash-Lite עבור השכבה שלו — ובכל זאת Gemini 3.5 Flash-Lite הוא עדיין הדגם המסוגל יותר בפער ניכר על אותו סולם בלתי תלוי.

הממדים, שורה אחת לכל אחד:
• ציון עצמאי — מדד AA של Ling 3.0 Tiny: 23 (#6/56, חציון כיתה 8) לעומת מדד AA של Gemini 3.5 Flash-Lite: 36 (#12/151).
• מחיר — Ling 3.0 Tiny $0.06 / $0.18 לכל 1M לאחר מבצע חינמי לעומת Gemini 3.5 Flash-Lite $0.30 / $2.50 לכל 1M (קלט במטמון $0.03).
• מילוליות — Ling 3.0 Tiny הפיק 210M טוקני פלט לאורך ריצת האינדקס, לעומת Gemini 3.5 Flash-Lite שנמדד אך לא היה מילולי לפי דגל זה.
• מודאליות — Ling 3.0 Tiny מבוסס טקסט בלבד לעומת Gemini 3.5 Flash-Lite קלט טקסט, תמונה, וידאו, שמע וקבצים.
• הקשר — 256K ב-Ling 3.0 Tiny לעומת 1M ב-Gemini 3.5 Flash-Lite, עם פלט מקסימלי של 64K בשניהם.
• מהירות — Ling 3.0 Tiny ~90–264 tokens/s בנקודות הקצה שפרסמו מספר לעומת Gemini 3.5 Flash-Lite ~490 tokens/s במדידה החיה של AA.
שורת המהירות היא זו שסביר להניח שתזוז. מהירות הפלט של Ling 3.0 Tiny באמת לא מוכרעת: Artificial Analysis מציינת אותה כ-N/A, בעוד Vercel מפרסמת 264 טוקנים לשנייה. המדידה של Gemini 3.5 Flash-Lite, כ-490 טוקנים לשנייה, היא מדידת AA חיה שנלקחה הרבה אחרי שהתנודתיות של תקופת ההשקה שלו שככה. עבור דרגה רגישה להשהיה, זה ההבדל בין כמות ידועה לשאלה פתוחה.
כלכלת האריכות: למה חינם אינו זול
הנה החישוב שבדרך כלל מכריע את ההשוואה הזו. הריצו את אותה משימה כבדת-חשיבה — נניח 4,000 טוקנים של קלט ו-2,000 טוקנים של פלט — דרך שני המודלים אחרי שמבצע הקידום של Ling 3.0 Tiny מסתיים. Ling 3.0 Tiny מחייב (4,000 × $0.06 + 2,000 × $0.18) / 1,000,000, בערך $0.0006. Gemini 3.5 Flash-Lite מחייב (4,000 × $0.30 + 2,000 × $2.50) / 1,000,000, בערך $0.0062. על ספירת טוקנים זהה Ling 3.0 Tiny זול פי 10. ואז מוסיפים את הנדרנות: מודל חשיבה הפולט טוקני חשיבה כפלט לא מייצר ספירת טוקנים זהה. אם יחס הנדרנות של Ling 3.0 Tiny — 210M לעומת 63M — מתקיים בעומס העבודה שלך, העלות האפקטיבית למשימה גדלה בערך פי 3 בצד הפלט, והיתרון של פי 10 מתכווץ לכיוון פי 3–4. עדיין זול יותר — אבל כבר לא חינמי, ולא באותה ליגה כפי שנדמה ממספר ה-210M.
המסגור הכנה הוא ששני המודלים אינם תחליפים באותה רמת איכות. הציון 23 של Ling 3.0 Tiny הוא הישג יוצא דופן עבור מודל עם 1.3B פרמטרים פעילים; הציון 36 של Gemini 3.5 Flash-Lite הוא ליגה אחרת לגמרי של יכולת, ועוד ראייה, ועוד קונטקסט של 1M, ועוד מהירות מוכחת. משלמים על הפער הזה — פי חמישה במחיר לכל טוקן, ויותר לכל משימה כשמחשבים את הפרשי המהירות — אבל זה פער יכולת אמיתי, לא שיווקי. אם עומס העבודה שלך יכול לחיות עם האיכות של המודל הזול יותר, Ling 3.0 Tiny הוא התמורה הטובה יותר. אם עומס העבודה שלך צריך את היכולת, שום יתרון מחיר לא סוגר את הפער.
היכן שהנתב מרוויח את לחמו
זו בדיוק צורת העומס שבה שכבת ניתוב מנצחת התחייבות למודל יחיד, ועובדות האירוח חשובות לאופן שבו בונים אותה. Gemini 3.5 Flash-Lite זמין ב-OrcaRouter במחיר המחירון של הספק — $0.30 כניסה / $2.50 יציאה לכל 1M, מועבר עם 0% תוספת, כך שהמספר בכרטיס התעריפים של Google הוא המספר אצלנו, וכל הורדת מחיר עתידית תיכנס באותו היום. הוא יושב מאחורי אותו endpoint תואם-OpenAI כמו 200+ מודלים אחרים, עם failover אוטומטי בין ספקים למקרה שספק בסיסי מתדרדר באמצע ריצה, ו-DSL הניתוב יכול לשלוח prompt למספר מודלים ולשמור את התשובה הטובה ביותר.
Ling 3.0 Tiny אינו ב‑OrcaRouter; הוא מוגש דרך נקודות קצה משלו, חינמי היום. השילוב הזה דווקא מחזק את הטיעון לניתוב ולא מחליש אותו. נצלו את חלון הזמן החינמי כדי לבצע benchmark ל‑Ling 3.0 Tiny מול התעבורה שלכם לפני שזה מתחיל לעלות כסף. לאחר מכן בנו את מסלול הייצור על הדרגה המנוחסת — Gemini 3.5 Flash‑Lite עבור הקריאות שצריכות ראייה, הקשר ארוך או פרופיל מהירות יציב, כששכבת הניתוב חופשית להסלים למודל יקר יותר עבור המיעוט הקשה. דרגה חינמית היא ניסוי מצוין ותלות שבירה; הדרגה המנוחסת היא מה שאפשר לבנות עליו מוצר. ב‑OrcaRouter אפשר להריץ את שניהם באותו גרף — Ling 3.0 Tiny דרך נקודת קצה ישירה, Gemini 3.5 Flash‑Lite דרך מפתח — ולתת לנתב להחליט לכל בקשה.

פסק דין
אם אתה בוחר בין שני אלה ולא מנתב אותם ביחד, ההחלטה פשוטה לנסח וקשה לאהוב. Ling 3.0 Tiny הוא העסקה הטובה יותר והמודל החלש יותר: דרגת חשיבה טקסטואלית בלבד בת שבוע, עם ציון מצוין ביחס לגודלו, מחיר אגרסיבי, ותמונה לא פתורה של מהירות ומילוליות. הוא ראוי להערכה מיידית במסגרת ניסיון חינמי, וכדאי לדעת שהשימוש בו ימדד מ-14 באוגוסט. Gemini 3.5 Flash-Lite הוא ברירת המחדל הבטוחה יותר לייצור: הוא קיבל באופן עצמאי ציון גבוה ב-13 נקודות, מולטי-מודאלי, קונטקסט של 1M, מהיר פי חמישה במדידה מוכרעת, ומתומחר בהתאם. חינם אינו זול כשהמודל מדבר פי שלושה יותר כדי לחשוב בתקרת יכולת נמוכה יותר – והמודל הקיים הוא ההימור הבטוח מסיבה טובה.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
