
Qwen3.8-LiveTranslate מול Qwen 3.8: התנגשות שמות, לא קרב הוגן
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
חפשו אחד מהדגמים האלה — ויוצג לכם האחר. Qwen3.8-LiveTranslate, שיצא לאור ב-19 בספטמבר 2026, וQwen3.8-Max — הדגם שאליו רוב האנשים מתכוונים כשהם כותבים "Qwen 3.8" בלי סיומת, זמין באופן כללי מאז 3 באוגוסט 2026 ורענן כ-Qwen3.8-Max-0902 ב-2 בספטמבר — חולקים קידומת של דור אחד וכמעט שום דבר אחר. האחד הוא מערכת תרגום סימולטני שלוקחת אודיו פנימה ומחזירה אודיו מתורגם וטקסט החוצה, כשהחיוב עבורה נעשה דרך WebSocket תחת המזהה qwen3.8-livetranslate-flash-realtime. האחר הוא מודל כללי דליל מסוג תערובת מומחים עם 2.4 טריליון פרמטרים וחלון הקשר של 1M טוקנים, שאינו מסוגל לשמוע דבר. העמדתם זה מול זה היא שגיאת קטגוריה, והעובדה שכל כך הרבה אנשים מגיעים לטעות הזו היא הסיפור האמיתי כאן: הספק משיק כיום לפחות ארבעה דברים שונים תחת השם Qwen 3.8, וסכמת השמות אינה אומרת לכם איזה מהם אתם רוצים.
מה כל אחד הוא בפועל
דור Qwen 3.8 הושק בשכבות לאורך המחצית השנייה של 2026, והשכבות אינן ניתנות להחלפה זו בזו.
Qwen3.8-Max הוא דגם הדגל המתארח: מודל MoE דליל עם כ-2.4 טריליון פרמטרים בסך הכול וכ-95 מיליארד פעילים בכל מעבר קדימה, חלון הקשר של מיליון טוקנים, וקלט טקסט, תמונה וווידאו עם פלט טקסט בלבד. התמחור שלו הוא $2.00 למיליון טוקני קלט ו-$6.00 למיליון טוקני פלט, עם קריאות מטמון ב-$0.250 למיליון. ציונים שדווחו על ידי הספק מציבים אותו ב-86.6 ב-Terminal-Bench 2.1, 92.6 ב-GPQA Diamond, 67.7 ב-SWE-bench Pro ו-43.6 ב-Humanity's Last Exam.
Qwen3.8-2.4T-A95B הוא פרסום המשקולות הפתוחות של אותו דור, שפורסם ב-12 באוגוסט 2026: 512 מומחים מנותבים על פני 92 שכבות, 69 מהשכבות הללו משתמשות בקשב ליניארי, ולכ-4.89 טרה-בייט של משקולות. זהו המודל שרוב האנשים מתכוונים אליו ב"Qwen 3.8" כשהם מדברים על להריץ משהו בעצמם ולא על קריאה ל-API.
Qwen3.8-27B הוא צ'קפוינט פתוח וקטן באותה משפחה, וQwen3.8-LiveTranslate הוא המומחה — מתורגמן בזמן אמת בארכיטקטורת Interleave, הבנוי על עיצוב Thinker–Talker היברידי מבוסס MoE, עם 60 שפות מקור מזוהות ו-29 זמינות לפלט דיבור.
הציר שמפריד ביניהם אינו גודל. הוא מודאליות. ל-Qwen3.8-Max אין נתיב קלט אודיו ואין פלט אודיו כלל. לבקש ממנו לפרש שיחה חיה אינו עניין של לנסח לו פרומפט טוב יותר; היכולת לא נמצאת במודל.
ניגוד המפרט
כשמונחים זה לצד זה, שני הדגמים בקושי חופפים באף ממד שחשוב לקונה:
• תפקיד עיקרי — Qwen3.8-LiveTranslate: פרשנות סימולטנית מדיבור לדיבור. Qwen3.8-Max: חשיבה כללית, תכנות, ועבודה טקסטואלית סוכנית ומולטימודאלית.
• אופן הקלט — Qwen3.8-LiveTranslate: אודיו ותמונה. Qwen3.8-Max: טקסט, תמונה ווידאו.
• מודאליות פלט — Qwen3.8-LiveTranslate: טקסט ואודיו מסונתז. Qwen3.8-Max: טקסט בלבד.
• חלון הקשר — Qwen3.8-LiveTranslate: 53,248 אסימונים (49,152 קלט / 4,096 פלט). Qwen3.8-Max: 1,000,000 אסימונים.
• משקלים — Qwen3.8-LiveTranslate: סגור, API בלבד. Qwen3.8-Max: מתארח, עם האח הפתוח Qwen3.8-2.4T-A95B שפורסם תחת אותו דור.
• מגבלות קצב — Qwen3.8-LiveTranslate: 10 בקשות ו-100,000 אסימונים בדקה. Qwen3.8-Max: תפוקת אירוח סטנדרטית, ללא תקרת זמן אמת לכל בקשה.
פער ההקשר הוא זה שמפתיע אנשים. Qwen3.8-Max מחזיק מיליון טוקנים; המתרגם מחזיק כחמישה אחוזים מכך. אבל מתרגם בזמן אמת לא צריך הקשר ארוך — הוא צריך זיכרון קצר ומהיר מאוד. תקרת הקלט שלו, 49,152 טוקנים, מותאמת לנשיאת מספר הדקות האחרונות של שיחה קדימה כדי לשמור על עקביות בשמות ובמונחים, וזה בדיוק התפקיד ש"פתרון עמימות בהקשר ארוך" ממלא. לשפוט את המתרגם לפי מספר ההקשר שלו זה כמו לשפוט מנוע מרוץ לפי מכל הדלק שלו.

למה השוואת מחירים היא מלכודת
בחישוב למיליון טוקנים, המתורגמן נראה יקר באופן דרמטי יותר מדגם הדגל: 7.50 דולר למיליון טוקני קלט אודיו לעומת 2.00 דולר למיליון טוקני קלט טקסט, ו-30.00 דולר למיליון טוקני פלט אודיו לעומת 6.00 דולר למיליון טוקני פלט טקסט.
ההשוואה הזו חסרת משמעות, והיא הטעות הנפוצה ביותר שנעשית בנוגע לסוג הזה של מודלים. טוקנים של אודיו וטוקנים של טקסט אינם אותה יחידה. דיבור מקודד לטוקנים של אודיו בצפיפות שאין לה שום קשר לאותו תוכן בכתב — דקה של שיחה צורכת vastly יותר טוקנים של אודיו מאשר התמלול שלה צורך טוקנים של טקסט, והאודיו בפלט מוסיף זרם שני על גבי זה. הצגת שני הקצבים זה לצד זה מרמזת על יחס עלויות שאינו קיים בפועל.
ההבדל המבני חשוב יותר מהבדל המחיר. Qwen מחייבת לפי טוקן עבור המתרגם, בעוד שחלק ניכר משוק הדיבור בזמן אמת מחייב לפי דקת סשן. שני מודלי תמחור אלה מתנהגים באופן שונה לחלוטין כשהאודיו שלך נעשה שקט יותר, הסשנים שלך נעשים קצרים יותר, או הדוברים מפסיקים — מונה לפי דקות מחייב על שקט, ומונה לפי טוקנים לא. אם אתה בונה מודל עלויות, השאלה אינה איזה תעריף נמוך יותר; אלא איזה מונה מעניש את צורת השימוש שלך. ושימו לב לפיצול האזורי: התמחור בבייג'ינג עומד על ¥40 / ¥3.3 / ¥100 / ¥160 למיליון עבור קלט אודיו, קלט תמונות, פלט טקסט ופלט אודיו בהתאמה, נמוך באופן מהותי מהתעריפים בסינגפור, וזה מסוג ההבדלים שנעשים גלויים רק כשמשווים את השניים שורה אחר שורה.
נקודה נוספת לזכותו של המתורגמן בכל הנוגע לעלות: Qwen שמרה על התעריפים האלה כמעט ללא שינוי לעומת Qwen3.5-LiveTranslate, כאשר בייג'ינג נותרה ללא שינוי וסינגפור מעט זולה יותר. דור חדש שמגיע בלי העלאת מחיר אינו הנורמה בשוק הזה.
משקלים פתוחים לעומת API בלבד הם קו ההפרדה האמיתי
אם אתם בוחרים בין שני אלה על בסיס עיקרון ולא על בסיס יכולת, העובדה המכרעת היא רישוי.
Qwen3.8-Max זמין באופן מתארח, והמשקלים בדרגת Max של הדור הזה פורסמו בקוד פתוח בשם Qwen3.8-2.4T-A95B באוגוסט. המסלול הזה קיים, אך הוא אינו מסלול של מה בכך: 4.89 TB של משקלים הם חומרת מרכז נתונים, ורישיון המשקלים הפתוחים מחייב ארגונים שמכניסים יותר מ-50 מיליון דולר בתקופה של שנים-עשר חודשים להשיג רישיון מסחרי מ-Alibaba Cloud.
ל-Qwen3.8-LiveTranslate אין נתיב כזה. הוא בעל משקולות סגורות וקיים רק כ-API, נגיש דרך WebSocket Realtime API שמחייב ש-target_languageיוגדר ב-session.update לפני שזז אודיו כלשהו, ואינו תומך בקריאה לפונקציות, לא בפלט מובנה, לא בשמירת הקשר במטמון, לא בהסקה באצוות ולא בכיוונון עדין. אם הדרישה שלך היא להריץ את המתרגם על החומרה שלך, המודל הזה אינו עונה עליה, ושום כמות של הנדסה לא תשנה זאת.
זה חשוב לסוג מסוים של קונה: זה שלא יכול לשלוח אודיו לצד שלישי — בית חולים, משרד עורכי דין, קבלן ממשלתי. עבור כל השאר, השאלה המעשית היא האם המתורגמן טוב מספיק כדי להצדיק את התלות, והתשובה לכך היא מדידה ש-Qwen טרם אפשרה לאף אחד לבצע.

בחירה לפי תפקיד, לא לפי שם
התשובה הנכונה ל"Qwen3.8-LiveTranslate או Qwen 3.8" היא שאתה כנראה זקוק לתשובה לשאלה אחרת.
• אם העבודה היא תרגום בזמן אמת — פגישה, שיחה, שידור — רק אחד מאלה יכול לעשות זאת, והוא לא דגם הדגל.
• אם המשימה היא לסכם את מה שנאמר, לחלץ פריטי פעולה, לענות על שאלות בנוגע לתמלול, או לכתוב את הודעת ההמשך — רק דגם הדגל יכול לעשות זאת, והוא אינו המתורגמן.
• אם התפקיד הוא גם וגם, אתה בונה פייפליין, ואתה תשלם לשני ספקים עם שני חוזים ושתי קבוצות של אישורי גישה אלא אם כן תאחד במכוון.
המקרה השלישי הוא המקרה הנפוץ, וכאן הרצת שני החצאים מאחורי נקודת קצה אחת מפסיקה להיות נוחות ומתחילה להיות ארכיטקטורה. Qwen3.8-Max נמצא ב-OrcaRouter במחיר המחירון של הספק, 2.00 דולר למיליון טוקנים בקלט ו-6.00 דולר למיליון טוקנים בפלט, עם אפס תוספת המועברת הלאה, כך שהורדת מחיר של Qwen מגיעה לחשבון שלך באותו יום ולא בחידוש החוזה הבא, ומעבר אוטומטי לגיבוי פירושו שהחצי המסכם של הצינור לא מאבד זמינות כשספק אחד חווה שעה רעה.
כדי להבהיר לגבי החצי השני, כי ההבחנה הזו חשובה: Qwen3.8-LiveTranslate אינו בקטלוג שלנו. הוא זמין דרך ה-API של Model Studio של Alibaba עצמה ובנקודת הקצה לניסוי של הספק בכתובת omni.qwen.ai/live-translate, ואנחנו לא מתכוונים לרמוז שאנחנו מנתבים מודל שאיננו מנתבים. מה שאפשר להעמיד מאחורי מפתח אחד היום הוא הסטאק במורד הזרם — המודלים שצורכים את מה שהמתורגמן מייצר.

בעיית השמות היא הממצא האמיתי
ארבעה מודלים, קידומת אחת, בלי מוסכמת סיומת שקורא יכול לסמוך עליה. "Qwen 3.8" מתפרש כמודל הדגל המתארח, הצ'קפוינט הפתוח של 2.4T, מודל ה-27B הקטן, או המתורגמן — תלוי במי שמקליד ומה הוא קרא לאחרונה. טבלאות הבנצ'מרק המפורסמות לא עוזרות, כי למודל הדגל יש אותן ולמתורגמן לרוב אין: את Qwen3.8-Max אפשר למקם על Terminal-Bench או GPQA Diamond, בעוד שהראיות של Qwen3.8-LiveTranslate הן פיגור ממוצע של 2.3 שניות, 85.7 xCOMET-XXL על FLEURS כפי שדווח על ידי הספק, ושיעור שגיאות דיאריזציה של 9.7% כפי שדווח בעצמו, בלי שכפול בלתי תלוי.
אז ההשוואה שהעמוד הזה נועד לענות עליה היא בעצם אזהרה. לפני שאתם משווים את Qwen 3.8 למשהו, קבעו לאיזה Qwen 3.8 אתם מתכוונים. אם הוא קולט אודיו, זה המתורגמן, וזה מומחה שקונים למשימה אחת. אם הוא קולט וידאו, זה דגם הדגל, וזה גנרליסט שקונים לעשרים האחרות. כל הערכה שמערבבת ביניהם תפיק מסקנה שאינה נוגעת לאף אחד מהם.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
