כרטיס כותרת הירו עבור Qwen3.8 Max Prime, שכבת השירות של Alibaba עם תפוקה של פי 1.5–2 עבור דגם הדגל Qwen3.8-Max, עם תגי מפרט המציגים אותם 2.4T סה״כ ו~95B פעילים, Prime ב-$3.301/$9.902, סטנדרטי ב-$1.65/$4.951.
Guides & Insights

Qwen3.8 Max Prime: Alibaba הציבה כרטיס תעריפים שני לצד ספינת הדגל שלה

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-22 בספטמבר 2026, בכנס יונצ'י (Yunqi) בהאנגג'ואו, הודיעה קו העסקים MaaS של אליבאבא על שכבת שירות שהיא מכנה Prime mode — 优速模式 — והציבה עבורה מזהה מודל חדש במחירון: qwen3.8-max-prime. המזהה הזה אינו מודל חדש. הוא Qwen3.8-Max, דגל ה-mixture-of-experts הדליל בעל 2.4 טריליון פרמטרים, שהגיע לזמינות כללית ב-3 באוגוסט 2026, המסופק דרך נתיב מהיר יותר. Qwen3.8 Max Prime נושא את אותן המשקולות, את אותו חלון ההקשר, את אותם כלים ואת אותן מגבלות שימוש כמו מודל הבסיס. מה ששונה הוא התפוקה והמחיר, והמחיר כמעט מוכפל.

זו הפעם השנייה בשבעה שבועות ש-Alibaba משנה את האופן שבו Qwen3.8-Max נמכר בלי לשנות את מהותו. ב-2 בספטמבר החברה שחררה רענון post-trained שסומן כ־Qwen3.8-Max-0902, שמתמקד בקידוד ובעבודה סוכנית, API בלבד. ב-22 בספטמבר נוספה דרגת המהירות. אף אחד מהשניים לא היווה השקה, וקריאה של אחד מהם כהשקה תעלה לך כסף.

Scoreboard infographic for Qwen3.8 Max Prime: underlying model Qwen3.8-Max GA August 3 2026, 2.4T total and ~95B active parameters, throughput 1.5-2x standard, Prime price $3.301/$9.902, standard price $1.65/$4.951, no independent Prime score yet.

מה זה בעצם מצב Prime

התיעוד של Alibaba עצמו מתאר את מצב Prime כערוץ עבור "תרחישים רגישים למהירות פלט" — עוזרי קידוד AI, הסקת סוכנים רב-שלבית, שיחה בזמן אמת — ומציין את היתרון בבירור: TPS מוגבר ל-פי 1.5 עד 2 מה-API הסטנדרטי. אין פרמטר חדש להגדיר. אתה מחליף את המודל ערך ל-Prime ID ואתה בנתיב המהיר.

התיעוד גם מפורש באותה מידה לגבי מה שלא משתנה: "יכולות הנתמכות על ידי המודל ומגבלות השימוש זהים לאלה של המודל המקורי." אז אין הקשר גדול יותר, אין מצב חשיבה טוב יותר, ואין משטח כלים נוסף. זו אותה ערימת הגשה, עם יותר מרווח מאחוריה.

The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.

כרטיס התעריפים, קרא בעיון

עמוד התמחור הבינלאומי של Aliba​ba מציג את שני המזהים זה לצד זה, מה שהופך את ההשוואה לנקייה במיוחד. למיליון טוקנים:

• קלט — qwen3.8-max-prime $3.301 לעומת qwen3.8-max $1.65

• פלט — qwen3.8-max-prime $9.902 לעומת qwen3.8-max $4.951

• פגיעת מטמון — qwen3.8-max-prime $0.413 לעומת תעריף קריאה מהמטמון ב-ID הסטנדרטי שאותו עמוד נושא כשורת הנחה

• יחס — פי 2.0 גם בקלט וגם בפלט, לא קירוב מעוגל אלא החשבון המדויק של המספרים שפורסמו

במחירון של סין אותו פי 2 תקף ביואן: ¥24 לקלט ו-¥72 לפלט למיליון עבור Prime ID לעומת ¥12 ו-¥36 עבור זה הסטנדרטי, עם פגיעות מטמון ב-¥3.

הנתון המצוטט בהרחבה להשקה של Qwen3.8-Max הוא $2 לקלט ו-$6 לפלט למיליון. זו הכותרת שסיקור אוגוסט רץ איתה, וזה לא המספר שבכרטיס התעריפים הבינלאומי היום. אם אתם מדמים הוצאות, השתמשו בכרטיס התעריפים של האזור שלכם ולא בכותרת ההשקה, ובדקו אותו שוב לפני שאתם מתחייבים — Aliba​ba עדכנה את העמוד הזה פעמיים מאז 2 בספטמבר.

Screenshot of Alibaba Cloud's international Model Studio pricing page listing the qwen3.8-max-prime and qwen3.8-max model IDs side by side, with Prime at $3.301 per million input tokens and $9.902 per million output tokens against $1.65 and $4.951 for the standard ID.

כלל הגבלת הקצב הוא התכונה האמיתית

השורה שרוב האנשים מדלגים עליה היא זו שחשובה ביותר לפרודקשן. התיעוד של Aliba​ba Prime קובע שכאשר השימוש שלך מגיע למגבלת הקצב, אם לפלטפורמה עדיין יש משאבים פנויים, לא תוגבל, כך שהתפוקה הזמינה לך בפועל לא תרד מתחת למגבלה המוצהרת.

זו תקרה רכה עם רצפה קשיחה, וזו צורה שונה ממגבלת שכבה סטנדרטית. המשמעות היא שהמספר 1.5–2× הוא הבטחה לגבי הרצפה, לא הגבלה על התקרה: תחת תחרות תקבלו את המגבלה, ותחת קיבולת פנויה תוכלו לקבל יותר. עבור לולאת סוכן שמבצעת עשרות קריאות עוקבות, אסימטריה זו שווה יותר ממכפיל ה-TPS הגולמי, מכיוון שהשהיית הזנב בקריאה האיטית ביותר היא שקובעת אם זרימת העבודה שלכם תסתיים.

מגבלות TPM דינמיות במודל הסטנדרטי מדורגות לפי ההוצאה החודשית ב-Model Studio — אותה משפחת תיעוד מציגה את מזהה qwen3.8-max הבסיסי ב-5,000,000, 10,000,000 ו-20,000,000 TPM בין השכבות, עם רענון חודשי. Prime לא מסיר את המבנה הזה; הוא משנה את אופן ההשפעה שלו.

Screenshot of the Artificial Analysis model page for Qwen3.8-Max on the 0902 build, showing an Intelligence Index of 45 and a measured cost per task of $5.41 on the standard ID.

מה שאף אחד עדיין לא מדד

הנה הפער בכנות. המספר 1.5–2× הוא כפי שהספק מצהיר. אין מדידת תפוקה עצמאית של מצב Prime שאנחנו מצליחים למצוא, וזה חשוב מפני שהמספרים העצמאיים של הבילד הסטנדרטי עצמו אינם מחמיאים בכל הנוגע למהירות.

Artificial Analysis, שמודדת מודלים בהארנס שלה עצמה, מדרגת כעת את Qwen3.8-Max בגרסת 0902 במדד אינטליגנציה של 45, עם GPQA Diamond ב-92.8%, Terminal-Bench Hard ב-38.9%, ו-Humanity's Last Exam ב-43.1% — ומציבה את העלות הנמדדת שלה למשימה על $5.41. אלו נתונים עצמאיים על ה-SKU הסטנדרטי, שנלכדו ב-2026-09-24. הם גם תזכורת לכך שהמדד עודכן מאז הסיקור של ההשקה באוגוסט, ולכן אין להציב ערך מדד ישן לצד ערך נוכחי ולקרוא לכך מגמה.

מה שאין ל-AA הוא שורת Prime. עד שמישהו ימדוד זאת, טענת המהירות היא של Alibaba בלבד, והגישה הנכונה היא לבחון אותה על עומס העבודה שלך ולא להניח שהיא בצמרת הטווח.

מה זה אומר לגבי החלטת הניתוב

Prime היא שכבה ש-Aliba​ba מוכרת ב-API שלה, וזה המקום היחיד להשיג אותה. אנחנו לא מארחים כאן את qwen3.8-max-prime. מה ש-OrcaRouter כן מנתב הוא הסטנדרטי Qwen3.8-Max והגרסה המקובעת שלו מתאריך Qwen3.8-Max-0902, שניהם על אותו מפתח כמו שאר משפחת Qwen3.8 — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — לצד יותר מ-200 דגמים אחרים, עם מחיר מחירון של הספק המועבר עם תוספת של 0%. החלק האחרון הזה הוא הסיבה לכך שהרענון מ-2 בספטמבר וכל שינוי תעריף עתידי של Max מגיעים לצד שלנו באותו יום שבו הם מגיעים לצד של Aliba​ba.

הפיצול המעשי נראה כך. הריצו את תעבורת ברירת המחדל שלכם על ה-ID הסטנדרטי דרך נתב, שבו מעבר חלופי מגן עליכם אם נתיב ספק בודד מתדרדר. העבירו את הקריאות הספציפיות שבהן השהיית זמן-קיר היא המוצר — ההשלמה האינטראקטיבית, צעד הסוכן ההדוק — אל Prime, ותמחרו את ההחלטה הזו מול ה-2× ולא מול ה-1.5×.

מי צריך לעבור, ומי צריך לחכות

עבור אם המשתמשים שלך ממתינים לטוקנים: השלמה אוטומטית, תור בצ'אט, לולאת עריכת קוד שבה אדם צופה. בקצה העליון של טווח המהירויות, Prime הוא ניטרלי מבחינת עלות לכל שנייה של השהיה שהוסרה — אתה משלם בדיוק כפול עבור בדיוק חצי מהזמן. בקצה התחתון של הטווח אתה משלם פי 2 עבור פי 1.5, שזה תוספת של 33% לכל שנייה שנחסכה. אם עומס העבודה שלך הוא עבודת אצווה שרצה במהלך הלילה, התוספת הזו לא קונה לך שום דבר שהיית זקוק לו.

עצור אם מודל העלויות שלך מבוסס על כותרת ההשקה של $2/$6, או אם הבקשות שלך עתירות קלט. הצהרת המהירות של הספק עוסקת ב-TPS — אסימוני פלט בשנייה — ו-prefill הוא שלב אחר בצינור העיבוד. בקשה עם הקשר ארוך משלמת כפול על אסימוני קלט, בין אם הפלט מגיע מהר יותר ובין אם לא. מדוד את המקרה הזה לפני שאתה מעביר אותו.

ובדוק את התאריך בכרטיס התעריפים שלך. Qwen3.8-Max נמצא בשוק מאז 3 באוגוסט, עבר רענון אחד, וארוז מחדש פעם אחת, והוא עדיין בן שבעה שבועות. הדרגה היא הידיעה; המודל לא.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית