Qwen 3.7 Flash: המודל החזותי הזול-במאה של עליבאבא לסוכנים שבאמת מסתכלים על מסכים
Guides & Insights

Qwen 3.7 Flash: המודל החזותי הזול-במאה של עליבאבא לסוכנים שבאמת מסתכלים על מסכים

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

צוות Qwen של עליבאבא בילה את השנתיים האחרונות בהשקת שורה צפופה של דגמים כמעט בכל רמת מחיר ויכולת שניתן להעלות על הדעת, וב-27 ביולי 2026, דגם נוסף נחת בשקט כרשימת API מסחרית: qwen/qwen3.7-flash. הוא לא הגיע עם חגיגות של השקת דגם דגל, ועליבאבא לא פרסמה דוח טכני, חבילת אמות מידה או תרשים ארכיטקטורה עבורו. מה שהוא כן הגיע איתו הוא תיאור שחשוב הרבה יותר למפתחים מניקוד נוסף בטבלת דירוג: מודל חשיבה של ראייה-שפה, חלון הקשר של מיליון טוקנים, ותמחור כה נמוך שבקושי נרשם כשורת עלות.

השילוב הזה — זול, הקשר רחב, ו"רואה" תמונות באופן טבעי — מציב את Qwen 3.7 Flash ישר בקטגוריה שהפכה לאחת התחרותיות והשימושיות ביותר בכל שוק המודלים: סוס העבודה הרב-מודאלי בעלות נמוכה. אלה לא המודלים שמנצחים בטבלאות אמות המידה. אלה המודלים שנקראים עשרה מיליון פעמים ביום בלולאות סוכן, בצינורות אוטומציה של דפדפן ובכלי תמיכה, כי במחיר של $0.03 לקלט ו-$0.13 לפלט למיליון טוקנים, העלות בעצם מפסיקה להיות אילוץ עיצובי.

קטע זה הוא הסבר ראשוני: מהו Qwen 3.7 Flash בפועל, מה אליבאבא חשפה (וחשוב מכך, מה היא לא חשפה), כיצד הכלכלה מתנהלת עם מתמטיקת טוקנים אמיתית, והיכן הוא משתלב לצד שאר משפחת Qwen — כולל Qwen 3.8 ו-Qwen 3.7 Max הגדולים בהרבה — ומול מתחרים מולטימודליים זולים כמו Gemini 3.5 Flash-Lite. כמו כן נעבור על האופן שבו שכבת ניתוב כמו OrcaRouter מתייחסת למודל כזה: לא כמודל ראשי, אלא כשכבת ברירת מחדל שבולעת בשקט את עיקר התעבורה המולטימודלית.

תקציר

Qwen 3.7 Flash הוא מודל ראייה-שפה של צוות Qwen של עליבאבא, הרשום תחת מזהה המודל qwen/qwen3.7-flash מאז 27 ביולי 2026. הוא בנוי לסוכנים מולטי-מודאליים, קידוד חזותי, חיפוש ואינטראקציה עם מחשב/ממשק משתמש, עם חוזקות מוצהרות בזיהוי אובייקטים והבנה מרחבית. הוא תומך ב-חלון הקשר של 1,000,000 טוקנים והמחיר הוא 0.03$ לכל 1M טוקני קלט ו-0.13$ לכל 1M טוקני פלט — בין המודלים בעלי יכולות הראייה הזולים ביותר הקיימים באשר הם. אורך הפלט המרבי, מספר הפרמטרים המדויק והארכיטקטורה הם לא נחשפו רשמית; השערות בקהילה מצביעות על עיצוב קטן מסוג mixture-of-experts ועל אפשרות להיות מבשר לשחרור Qwen 3.7 עם משקלים פתוחים, אך זה אינו מאושר. הוא מודל נפרד, קטן וזול יותר גם מ-Qwen 3.8 (דגל המשקלים הפתוחים של עליבאבא שהוכרז בנפרד, עם 2.4T פרמטרים) וגם מ-Qwen 3.7 Max (הדגל הגדול יותר באותו דור). אף ערכת אמות מידה עצמאית — כולל Artificial Analysis — לא דירגה אותו עדיין, לכן יש להתייחס לטענות האיכות כמוקדמות ולא מוכחות עד שיהיו נתונים של צד שלישי.

נקודות עיקריות

• Qwen 3.7 Flash הוא שפה-חזותית, לא טקסט בלבד — הוא ממוקם עבור סוכנים מולטי-מודליים, קידוד חזותי, חיפוש, ומשימות שימוש במחשב, לא צ'אט כללי.

• המחיר הוא $0.03 למיליון טוקנים בקלט ו-$0.13 למיליון טוקנים בפלט, בערך בטווח המחירים של הרמה הזולה ביותר של מודלים רב-מודאליים קרובים לחזית הקיימים בשוק כיום.

• חלון ההקשר הוא מיליון טוקנים, מה שחשוב יותר עבור הפעלות סוכן מרובות-סבבים ועשירות בתמונות ממה שזה נשמע, מאחר שתמונות וצילומי מסך צורכים טוקנים במהירות.

• הערות התמחור של הרישום מציינות שעם prompt caching על הקשר חוזר, העלות האפקטיבית יכולה לרדת ב-60-80% ממחיר המחירון — מנוף משמעותי ללולאות סוכן שמשחזרות את אותה הנחיית מערכת או היסטוריית צילומי מסך.

Alibaba לא פרסמה נתונים על מספר הטוקנים המרבי של הפלט, מספר הפרמטרים, או פרטי הארכיטקטורה; כל דבר ספציפי יותר שקראת במקום אחר הוא מסקנה של הקהילה, לא גילוי של הספק.

• זה לא Qwen 3.8 (דגם הדגל הפתוח במשקל 2.4T) ולא Qwen 3.7 Max (דגם הדגל הסגור הגדול יותר באותו גל השקה) — למרות הדמיון בשמות, אלו שלושה דגמים שונים עם שלוש מטלות שונות.

• אין ארגון אמות מידה עצמאי, כולל Artificial Analysis, פרסם ציונים עבור Qwen 3.7 Flash נכון לכתיבת שורות אלה — האיכות באמת לא מוכחת מחוץ לתיאור הספק.

מהו Qwen 3.7 Flash למעשה

הסר את מוסכמת השמות ו-Qwen 3.7 Flash היא התשובה של עליבאבא לשאלה שכל מעבדה מרכזית שאלה כעת: איך נראה מודל כשכל תקציר התכנון שלו הוא "לטפל בתנועה חזותית, סוכנותית, בעלת נפח גבוה בצורה הזולה ביותר האפשרית מבלי להיות חסר תועלת"? גוגל ענתה על כך עם שכבות Gemini Flash ו-Flash-Lite. OpenAI ענתה עם קווי ה-mini וה-nano שלה. התשובה של עליבאבא, בדור הזה, היא Qwen 3.7 Flash.

התיאור הרשמי מתמקד בארבעה מקרי שימוש: סוכנים רב-מודליים, קידוד חזותי, חיפוש, ואינטראקציה עם מחשב או ממשק משתמש. זו רשימה מכוונת מאוד. זו לא "יכולת כתיבה יצירתית מעולה" או "חשיבה חזקה בבעיות אולימפיאדת מתמטיקה" — זוהי רשימה של תפקידים שבהם מודל צריך להסתכל על צילום מסך, דף אינטרנט, חלק ממשק משתמש, או הבדל קוד המוצג בצורה חזותית, ואז לפעול עליו. עליבאבא גם מציינת זיהוי אובייקטים והבנה מרחבית כחוזקות מסוימות, המתיישבות עם המסגרת של שימוש במחשב ואינטראקציה עם ממשק משתמש: סוכן שעומד ללחוץ על כפתורים, לקרוא תבניות, או לנווט במסך צריך לדעת היכן הדברים נמצאים, לא רק מה הם אומרים.

כדאי להיות מפורשים לגבי משמעות המונח "הסקה" בהקשר זה. Qwen 3.7 Flash מתואר כמודל הסקה חזותי-שפתי, כלומר הוא צפוי לעבוד דרך משימות חזותיות רב-שלביות ולא רק לספק כיתוב לתמונה או לענות על שאלת חיפוש בודדת. זה ההבדל בין "תאר את צילום המסך הזה" לבין "הנה צילום מסך של טופס עם שלוש שגיאות אימות — הבן מה לא בסדר ותגיד לי איזה שדה לתקן קודם."

מפרטים והמיקוד הרב-מודלי-הסוכני

הנה הרשימה המלאה של מה שבאמת אושר, לעומת מה שלא.

אושר: היצרן הוא צוות Qwen של עליבאבא. הוא רשום תחת מזהה הדגם qwen/qwen3.7-flash, פעיל מאז 27 ביולי 2026. הוא מקבל קלט מולטימודאלי (ראייה ושפה). חלון ההקשר הוא 1,000,000 טוקנים. התמחור הוא $0.03 לכל 1M טוקני קלט ו-$0.13 לכל 1M טוקני פלט. הערות התמחור של הרישום עצמו מציינות ששמירה במטמון של פרומפט על הקשר חוזר יכולה להוריד את העלות האפקטיבית ב-60-80% לעומת המחיר הרשום עבור עומסי עבודה שעושים שימוש חוזר באותן הוראות מערכת או תמונות ייחוס בין קריאות — פרט שחשוב מאוד ללולאות סוכן שמשדרות מחדש את אותה היסטוריית צילומי מסך או סכמת כלים בכל סיבוב.

לא נחשף: מגבלת אסימוני פלט מקסימלית. מספר פרמטרים מדויק. ארכיטקטורה (דחוסה לעומת תערובת מומחים). הרכב נתוני האימון. כל ציוני בנצ'מרק של צד ראשון.

ספקולציה קהילתית (תייגו כך, כי זה כל מה שזה):לאור השם "Flash", התמחור האגרסיבי, והדפוס שבו פעלה עליבאבא בדורות קודמים של Qwen, כמה משקיפים חושדים ש‑Qwen 3.7 Flash משתמש בארכיטקטורת תמהיל מומחים קטנה המותאמת לעלות מחשוב נמוכה לכל טוקן, ושהוא עשוי להיות צעד מקדים (תצוגה מקדימה או זיקוק) לקראת שחרור עתידי של Qwen 3.7 במשקלים פתוחים, בדומה לאופן שבו גרסאות "flash" או "turbo" קודמות של Qwen לפעמים קדמו לשחרורים רחבים יותר. אף אחד מזה לא אושר על ידי עליבאבא. יש להתייחס לזה כניחוש מושכל, לא כעובדה, עד שיתפרסם דו"ח טכני רשמי או כרטיס מודל שיאמר אחרת.

היעדר נתון רשמי על תפוקה מקסימלית ראוי לציון עבור כל מי שבונה מול המודל הזה: אם מקרה השימוש שלך מייצר פלטים מובנים ארוכים (מטעני JSON גדולים, יצירת קוד מרובה קבצים, תמלילים ארוכים), בדוק אמפירית את תקרת הפלט בפועל לפני שאתה מתחייב אליו בסביבת ייצור, מכיוון שאינך יכול לבדוק בתיעוד מספר שאינו קיים.

דוגמה מחושבת לתמחור: מה זה באמת עולה

מספרים קטנים כל כך קל לפסוח עליהם, אז בואו נעשה את החשבון כראוי.

במחיר של $0.03 ל-1M אסימוני קלט ו-$0.13 ל-1M אסימוני פלט, קריאה בודדת עם 2,000 אסימוני קלט (צילום מסך בגודל סביר בתוספת הוראה קצרה) ו-300 אסימוני פלט (תשובה מובנית) עולה: 2,000/1,000,000 × $0.03 = $0.00006 עבור קלט, בתוספת 300/1,000,000 × $0.13 = $0.000039 עבור פלט. סה"כ: בערך $0.0001 לקריאה — מאית הסנט.

קח את זה להיקף. הרץ מיליון מאותן קריאות — עומס יומי סביר למוצר סוכן בגודל בינוני שעושה ניתוח צילומי מסך או בדיקות מצב ממשק — ותגיע ל: 1,000,000 × 2,000 = 2 מיליארד טוקני קלט × $0.03/1M = $60, ועוד 1,000,000 × 300 = 300 מיליון טוקני פלט × $0.13/1M = $39. סה״כ: כ-$99 עבור מיליון קריאות של סוכן ראייה. אפילו לפני הוספת prompt caching (שהערות הרישום מציעות שיכול לקצץ את זה ב-60-80% עבור עומסי עבודה עם הקשר חוזר), זה מספר שרוב הצוותים יכולים לאשר בלי ישיבת תקציב.

כעת השוו תרחיש כבד יותר: סוכן שמשתמש במחשב (computer-use agent) שמנהל הקשר שוטף של 50,000 טוקנים (צילומי מסך, היסטוריית פעולות, תוצאות כלים) ומייצר 500 טוקנים של פעולה בכל צעד, רץ 100,000 פעמים ביום. עלות קלט: 100,000 × 50,000 = 5 מיליארד טוקנים × $0.03 למיליון = $150 ליום. עלות פלט: 100,000 × 500 = 50 מיליון טוקנים × $0.13 למיליון = $6.50 ליום. זה בערך $156 ליום, או כ-$4,700 לחודש, עבור עומס עבודה סוכנותי אגרסיבי עם הקשר ארוך — וזה עוד לפני הנחת מטמון על החלקים החוזרים של אותו הקשר של 50K, אשר בלולאת שימוש במחשב (אותה הנחיית מערכת, אותן הגדרות כלים, מצב מסך חופף) הוא בדיוק סוג העומס שעבורו נבנה מטמון ההנחיה.

הדרכות בתרחישים מהעולם האמיתי

משימות ראייה בנפח גבוה

תארו לעצמכם צינור עיבוד קטלוג מוצרים שצריך לסווג, לתייג ולחלץ תכונות מכמה מאות אלפי תמונות מוצר ביום — זו בדיוק סוג העבודה שבה עלות לכל טוקן מתרבה מהר מספיק כדי לשבור תקציב במודל ראייה ברמה בינונית, אך נשארת נוחה ובמחיר סביר בתמחור של Qwen 3.7 Flash. זיהוי אובייקטים והבנה מרחבית, שתי היכולות שאליבאבה מציינת במפורש, מתמפות ישירות ל"מה יש בתמונה הזו, איפה זה, ובאיזה מצב זה."

קידוד חזותי

"קידוד חזותי" בתור מקרה שימוש מוגדר מציע זרימות עבודה כמו: להזין למודל צילום מסך של ממשק משתמש מעוצב יחד עם קוד הרכיב הבסיסי, ולבקש ממנו לזהות את חוסר ההתאמה, או לקחת ייצוא מ‑Figma ולקבל בחזרה מימוש ראשוני. זוהי קטגוריית משימות שמענישה במיוחד מודלי קוד טקסטואליים בלבד — אפשר לתאר באג פריסה במילים, אבל מודל שבאמת יכול לראות את הריווח השבור או הכפתור שאינו מיושר יאבחן אותו מהר יותר ובאמינות גבוהה יותר.

סוֹכְנָנִי / שימוש במחשב

זהו תרחיש השימוש המרכזי. סוכן שימוש במחשב חייב להסתכל על מסך, להבין מה ניתן ללחוץ עליו, להחליט על פעולה, ולחזור על כך — לעיתים קרובות עשרות צעדים בכל משימה. הכלכלה כאן אכזרית עבור מודלים יקרים: משימת אוטומציה של דפדפן או שולחן עבודה בת 30 צעדים, כאשר כל צעד נושא צילום מסך חדש, יכולה לצבור מאות אלפי טוקנים לפני סיום המשימה. במחירי מודלי הקצה מדובר בכסף אמיתי למשימה; במחירי Qwen 3.7 Flash, הפעלת אלפי הפעלות כאלה ביום נשארת בהישג תקציב של צוות קטן.

חיפוש חזותי – התאמת תמונה מול מאגר, אימות שתוצאה שאוחזרה אכן תואמת תמונת ייחוס, או עיגון שאילתת חיפוש בצילום מסך של מה שהמשתמש מסתכל עליו – נהנה מאותו שילוב של הקשר רחב (כדי להחזיק תמונות מועמדות מרובות או סט מסמכים שאוחזר ארוך) ועלות נמוכה לכל קריאה (מכיוון שלולאות חיפוש-ואימות לעיתים קרובות אומרות קריאות דגם רבות לכל שאילתת משתמש, לא אחת).

איך לגשת ולהשתמש ב-Qwen 3.7 Flash

Qwen 3.7 Flash נקרא באמצעות מזהה המודל qwen/qwen3.7-flash, והוא עובד עם כל כלי תואם OpenAI — כלומר אינטגרציות קיימות בסגנון chat-completions או בסגנון responses יכולות להפנות אליו עם שינוי שם המודל וללא שכתוב קוד לקוח. כאן גם שכבת ניתוב כמו OrcaRouter הופכת למעשית ולא תיאורטית: במקום לקודד מודל יחיד לתוך כל שירות, נקודת קצה מאוחדת תואמת OpenAI מאפשרת להגדיר מודל מולטימודלי זול ומסוגל כדרגת ברירת המחדל לתעבורת ראייה וסוכנים, ולשמור מודלי חשיבה יקרים יותר לתת-קבוצת הבקשות שבאמת זקוקות להן. עבור מודל שכל הצעת הערך שלו היא "זול מאוד, די יכול, לא מוכח בחזית," סוג כזה של ניתוב מדורג — זול כברירת מחדל, הסלמה כשצריך — הוא ככל הנראה הדרך הנכונה לפרוס אותו בייצור במקום להמר על כך שצנרת שלמה תתבסס על מודל יחיד לא מאומת.

עיצוב בקשות מולטי-מודאליות סטנדרטי חל: קלטי תמונה לצד טקסט באותה הודעה, חלונות הקשר גדולים להפעלות מרובות תמונות או מרובות סבבים, וחיוב לפי אסימון שמופיע בבירור בלוחות המחוונים לשימוש. בדוק את תקרת אורך הפלט המעשית עבור עומס העבודה שלך לפני שתסתמך עליה, מכיוון שהמקסימום אינו מפורסם.

מגבלות כנות ומה שטרם אושר

כדי להיות ישירים לגבי מה שבאמת לא ידוע כאן: אין נתוני אמת מידה בלתי תלויים על Qwen 3.7 Flash מ-Artificial Analysis או מכל מעריך דומה נכון לכתיבת שורות אלו. כל מה שקשור לאיכותו — עד כמה הוא באמת מבצע בהיגיון חזותי, עד כמה הוא אמין למשימות רב-שלביות אוטונומיות, ואיך הוא מתמודד עם גורמי הסחה בתרחישי הקשר ארוך — נתמך כרגע רק בשפת המיצוב של Alibaba עצמה, לא על ידי צד שלישי שמפעיל אותו דרך מערך בדיקות מתוקנן. תיאור ספק ואימות בלתי תלוי אינם אותו הדבר, והקוראים צריכים לשקול את יכולות המודל הזה בהתאם עד שיתקיים האימות הזה.

{{1}}מעבר למדדים, Alibaba לא חשפה את הארכיטקטורה, מספר הפרמטרים, או אורך הפלט המרבי.{{/1}} {{2}}התאוריה על "מודל MoE קטן, אולי מבשר ל-Qwen 3.7 עם משקלים פתוחים" שמסתובבת בקהילה היא ניחוש סביר המבוסס על דפוסי שמות ותמחור, אבל היא ספקולציה, לא משהו ש-Alibaba אישרה.{{/2}} {{3}}אם שקיפות מודל (ארכיטקטורה מפורסמת, משקלים פתוחים, דוח טכני) היא דרישה עבור מקרה השימוש שלך, Qwen 3.7 Flash אינו עומד כרגע ברף הזה — הוא מודל סגור, זמין רק באמצעות API, עם תיעוד ציבורי מינימלי מעבר לרישום ה-API שלו.{{/3}}

כיצד זה משתווה: Qwen 3.8, Qwen 3.7 Max, ומתחרים זולים

השמות כאן מבלבלים אנשים, אז כדאי להיות מדויק. Qwen 3.8 הוא דגל פתוח משקל של עליבאבא שהוכרז בנפרד, לפי הדיווחים בנוי סביב עיצוב עם 2.4 טריליון פרמטרים — מודל שונה מהותית עם מטרה שונה: מודל גדול, פתוח, לשימוש כללי שנועד להתחרות בחזית, לא שכבת כלי זול רב‑מודאלי. Qwen 3.7 Max הוא הדגל הסגור הגדול יותר, ככל הנראה בעל יכולת גבוהה יותר, באותה גל השקה "3.7" — המודל שתפנה אליו כשמשימה דורשת איכות מקסימלית ללא קשר לעלות. Qwen 3.7 Flash, נושא המאמר הזה, הוא הנקודה השלישית והזולה ביותר בקונסטלציה הזו: קטן יותר, מהיר יותר, זול משמעותית, וממוקד ספציפית לעומסי עבודה רב‑מודאליים‑סוכנותיים ולא למצוינות לשימוש כללי. אל תניח שיכולת או התנהגות עוברות בין שלושת אלה רק בגלל שלשניים מהם יש אותו מספר גרסה — הם מודלים שונים עם עבודות שונות.

נגד תחרות מבחוץ, ההשוואה הקרובה ביותר היא של גוגל Gemini 3.5 Flash-Lite, אשר תופסת נישה דומה: שכבה בעלות נמוכה, רב‑מודאלית, בעלת תפוקה גבוהה, המיועדת בדיוק לסוג עומסי העבודה בנפח שתוארו לעיל. שני המודלים מתחרים בעיקר על אותם צירים — מחיר לאסימון, אורך הקשר, וטיפול רב‑מודאלי — ולא על מדדי היגיון גולמיים, שכן אף אחד מהם לא ממוקם כמודל היגיון גבולי. ללא נתוני בנצ'מרק בלתי תלויים עבור Qwen 3.7 Flash, טענה ישירה על איכות מול Gemini 3.5 Flash‑Lite אינה משהו שמאמר זה יכול לטעון באחריות; מה שניתן לומר הוא שהתמחור של Qwen 3.7 Flash תחרותי עם או מתחת לשכבה זו, וחלון ההקשר של 1M שלו נדיב עבור מודל בקטגוריית מחיר זו, שזה בדיוק סוג הפער שהופך שכבות רב‑מודאליות זולות לכדאיות לבדיקה אמפירית מול עומס העבודה הספציפי שלך, במקום לבחור על בסיס מחיר בלבד.

שאלות נפוצות

מהו Qwen 3.7 Flash?

זהו מודל הנמקה של ראייה-שפה מצוות Qwen של עליבאבא, שנבנה עבור סוכנים מולטי-מודאליים, קידוד ויזואלי, חיפוש ואינטראקציה עם מחשב/ממשק משתמש, ומופיע תחת מזהה המודל qwen/qwen3.7-flash מאז 27 ביולי 2026.

כמה עולה Qwen 3.7 Flash?

$0.03 לכל מיליון אסימוני קלט ו-$0.13 לכל מיליון אסימוני פלט — בין הדגמים הזולים ביותר בעלי יכולות ראייה הקיימים כיום, כאשר הרישום מציין כי הנחות נוספות של 60-80% אפשריות באמצעות שמירת prompt במטמון עבור הקשר חוזר.

מהו חלון ההקשר?

1,000,000 אסימונים.

האם Qwen 3.7 Flash זהה ל-Qwen 3.8?

לא. Qwen 3.8 הוא דגם הדגל הפתוח-משקל של עליבאבא שהוכרז בנפרד, עם 2.4 טריליון פרמטרים. Qwen 3.7 Flash הוא דגם רב-מודאלי סגור, קטן וזול בהרבה, עם מטרה שונה. אסור לבלבל ביניהם למרות ששניהם משורת Qwen של עליבאבא.

האם Qwen 3.7 Flash זהה ל-Qwen 3.7 Max?

לא. Qwen 3.7 Max הוא דגם הדגל הגדול יותר באותו גל השקה של "3.7". Qwen 3.7 Flash הוא הדרגה הקטנה, המהירה והזולה בהרבה, המיועדת למשימות מולטימודליות וסוכנות בנפח גבוה, במקום לפלט באיכות מקסימלית.

האם Qwen 3.7 Flash תומך בתמונות?

כן, זה מודל ראייה-שפה — הוא מקבל קלט רב-מודלי (תמונה וטקסט) וממוצב במיוחד סביב משימות חזותיות כמו זיהוי עצמים, הבנה מרחבית, תכנות חזותי ואינטראקציה עם מחשב/ממשק משתמש.

מהו אורך הפלט המקסימלי?

לא פורסם רשמית על ידי עליבאבא. כל מי שבונה עומס עבודה בייצור צריך לבדוק ישירות את תקרת הפלט המעשית ולא להניח מספר.

האם Qwen 3.7 Flash הוא מודל תערובת מומחים?

לא מאושר. חלק מהקהילה משערים שהוא משתמש בארכיטקטורת MoE קטנה על בסיס תמחור ותבנית השמות שלו, אך עליבאבא לא פרסמה פרטי ארכיטקטורה, כך שזה נשאר השערה ולא עובדה.

איך זה משתווה ל- Gemini 3.5 Flash-Lite?

שניהם תופסים רמה מולטימודלית דומה בעלות נמוכה ובעלת תפוקה גבוהה, ומתחרים בעיקר במחיר ובאורך ההקשר ולא במבחני היגיון גולמיים. עדיין אין נתוני אמת מידה בלתי תלויים כדי לבצע השוואת איכות מובהקת עבור Qwen 3.7 Flash.

איפה אוכל לגשת ל-Qwen 3.7 Flash?

באמצעות מזהה המודל qwen/qwen3.7-flash דרך כל לקוח תואם OpenAI, או דרך שכבת ניתוב כמו OrcaRouter שיכולה להגדיר אותו כשכבה מולטי-מודאלית זולה כברירת מחדל לצד מודלים אחרים.

האם Qwen 3.7 Flash טוב?

לא מוכח באופן עצמאי נכון לכתיבת שורות אלה — אף ארגון אמת מידה של צד שלישי, כולל Artificial Analysis, לא פרסם ציונים עבורו. הצעת הערך שלו היא מחיר וגודל הקשר, לא יתרון איכות מוכח, כך שכדאי לבדוק אותו אמפירית מול עומס העבודה הספציפי שלך לפני שמתחייבים.

שורה תחתונה

Qwen 3.7 Flash לא מנסה לנצח בלידרבורד, ואליבאבא לא נתנה לאף אחד את התיעוד כדי לבדוק אפילו אם היה רצון. מה שהיא מנסה לעשות הוא להפוך עומסי עבודה של ראייה וסוכנים – ניתוח צילומי מסך, בדיקות קוד חזותיות, לולאות שימוש במחשב, חיפוש חזותי – לזולים מספיק שעלות תפסיק להיות הסיבה שבגללה לא בונים את הפיצ'ר. במחיר של $0.03/$0.13 למיליון טוקנים עם קונטקסט של מיליון טוקנים, הכלכלה באמת תומכת בתעבורת סוכנים מולטי-מודאלית בנפח גבוה ובזמינות תמידית, באופן שדגמים מעטים בכל רמת איכות יכולים להשתוות אליו. המלכוד הוא כנות לגבי הפערים: אין מדדים בלתי-תלויים, אין ארכיטקטורה או אורך פלט מקסימלי שפורסמו, ואי-ודאות אמיתית לגבי איך היא מתמודדת מול מתחרות מבוססות ברמת מחיר נמוכה כמו Gemini 3.5 Flash-Lite. התייחסו אליה כברירת מחדל מבטיחה וזולה במיוחד לעומסי עבודה מולטי-מודאליים-סוכניים שכדאי לבדוק כבר עכשיו – ושמרו בראש בבירור שהיא נפרדת לחלוטין מ-Qwen 3.8 ו-Qwen 3.7 Max, שהן דגמים שונים שפותרים בעיות שונות לגמרי.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית