כרטיס כותרת הירו שנוצר עם הכותרת 'GPT-6 Luna vs Qwen3.8-Max', כותרת המשנה 'המודל הזול ביותר כאן הוא לא זה שצופה בווידאו', כותרת תחתונה 'מחירים לפי OpenAI ו-Alibaba Cloud; נתוני מדדים לפי Artificial Analysis.', והלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

GPT-6 Luna מול Qwen3.8-Max: המודל הזול ביותר בהשוואה הזו הוא גם היחיד שצופה בווידאו

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

המסגור המובן מאליו להשוואה הזו הוא דווקא השגוי. Qwen3.8-Max מתומחר ב-2.00 דולר למיליון טוקנים בקלט וב-6.00 דולר למיליון בפלט, עם קריאות מטמון ב-0.25 דולר. GPT-6 Luna מתומחר ב-0.10 דולר וב-0.50 דולר, עם קריאות מטמון בסנט אחד. פי עשרים בקלט, פי שנים עשר בפלט, פי חמישים בקלט מהמטמון — פער מחירים כה עצום עד שההשוואה נראית מוכרעת עוד לפני שהיא מתחילה.

זה לא מוכרע, משום ששני המודלים אינם מתחרים על אותה בקשה. Qwen3.8-Max מקבל טקסט, תמונה וווידאו, ותקרת הפלט שלו של 131,072 טוקנים מעט גבוהה מזו של GPT-6 Luna, 128,000. GPT-6 Luna מקבל טקסט ותמונה בלבד. המודל של Alibaba מקבל ציון 58 במדד ה-Intelligence Index העצמאי — ראשון בקטגוריה שלו בלוח הסוכני — ואילו GPT-6 Luna מקבל 37 במאמץ מרבי, 29 בברירת המחדל שלו. האחד הוא דגל עם שושלת משקולות פתוחות ומודאליות קלט וידאו. האחר הוא שכבת נפח עם נתון מהירות ותעריף מטמון של סנט אחד. פער המחיר אינו הנחה על אותו דבר; הוא תיאור של שני דברים שונים.

מהו כל אחד מהשניים האלה

Qwen3.8-Max הוא דגם הדגל של Alibaba מדור 3.8, צ'קפוינט בדרגת Max שהמודל הבסיסי שלו — Qwen3.8-2.4T-A95B — שוחרר בפומבי תחת רישיון מותאם אישית ב-12 באוגוסט 2026, מה שהופך אותו ל-Qwen הראשון בדרגת Max עם משקלים פתוחים בכלל. דגם הדגל המתארח עצמו עדיין רשום על ידי המועצה העצמאית כקנייני. הוא כולל חלון הקשר של 1,000,000 טוקנים, תקרת פלט של 131,072 טוקנים, קלט טקסט, תמונה ווידאו, ומאמץ חשיבה הניתן לבחירה ברמה נמוכה, בינונית וגבוהה במיוחד. גרסה מוצמדת Qwen3.8-Max-0902 זמינה באותו מחיר, וזה פרט קטן עם ערך תפעולי אמיתי.

GPT-6 Luna הוא דרג היעילות של OpenAI מ-22 בספטמבר 2026, ונמצא מתחת ל-GPT-6 Sol במחיר $2.00/$10.00 ול-GPT-6 Astra, ספינת הדגל, במחיר $10.00/$50.00. קלט טקסט ותמונה, פלט טקסט, חלון של 1,050,000 טוקנים עם קלט מקסימלי של 922,000, תקרת פלט של 128,000 טוקנים, ומאמץ מ-none דרך low, medium, high, xhigh ו-max כאשר medium הוא ברירת המחדל. סגור, מזהה יחיד, זמין לכל מי שיש לו מפתח API.

אחד מקבל וידאו וניתן להוריד אותו בצורתו הבסיסית. אחד מקבל תמונות והוא מהיר. שניהם מתומחרים לשימוש בכמויות. החפיפה בין שתי ההצהרות האלה קטנה מכפי שיחס המחירים מרמז.

הכרטיסים, שורה אחר שורה

שורה אחת לכל מימד, שני הצדדים בכל אחד:

• קלט לכל 1M — GPT-6 Luna ‏$0.10 לעומת Qwen3.8-Max ‏$2.00

• פלט לכל 1M — GPT-6 Luna ‏$0.50 לעומת Qwen3.8-Max ‏$6.00

• קלט במטמון לכל 1M — GPT-6 Luna $0.01 לעומת Qwen3.8-Max $0.25 עבור קריאות מטמון משתמעות, עם קריאת מטמון מפורשת ב-$0.17 וכתיבת מטמון מפורשת ב-$2.50

• סעיף ההקשר הארוך — ‏GPT-6 Luna מכפילה את הקלט ואת המטמון ומעלה את הפלט פי 1.5 מעל 272,000 אסימוני קלט, ומוחלת על הבקשה כולה, לעומת Qwen3.8-Max — מדרגה אחידה על פני החלון המלא, וזה המקום היחיד שבו הקלף של Qwen טוב יותר מבחינה מבנית ולא רק זול יותר בשוליים

• חלון הקשר — GPT-6 Luna 1,050,000 טוקנים לעומת Qwen3.8-Max 1,000,000 טוקנים

• פלט מרבי — GPT-6 Luna‏ 128,000 טוקנים לעומת Qwen3.8-Max‏ 131,072 טוקנים

• מודאליות קלט — GPT-6 Luna טקסט ותמונה לעומת Qwen3.8-Max טקסט, תמונה ווידאו

• מאמץ חשיבה — GPT-6 Luna ללא, נמוך, בינוני (ברירת מחדל), גבוה, גבוה במיוחד, מקסימלי לעומת Qwen3.8-Max נמוך, בינוני וגבוה במיוחד

• מדד אינטליגנציה, בלתי תלוי — GPT-6 Luna 37 במאמץ מקסימלי לעומת Qwen3.8-Max 58

• Agentic Index, עצמאי — Qwen3.8-Max 58, ראשון בקטגוריה שלו; לא פורסם נתון בר-השוואה עבור GPT-6 Luna

• ציון מאמץ ברירת־מחדל — GPT-6 Luna 29 במצב הבינוני שלו כברירת מחדל לעומת Qwen3.8-Max שנמדד בהגדרה המקסימלית שלו

• עלות לכל משימת Index, באופן עצמאי — GPT-6 Luna כ-$0.07 לעומת Qwen3.8-Max $5.41

• GDPval, בלתי־תלוי — Qwen3.8-Max 1,739 Elo ב-64 סיבובים לכל משימה, שזה מסתכם לכ-1.14 דולר למשימה שהושלמה בהערכה הזו; לא פורסמה הרצה דומה של GPT-6 Luna

• שיעור ההזיות ב-AA-Omniscience — Qwen3.8-Max 40%, נסיגה מ-23% בדור הקודם; GPT-6 Luna 77%, ירידה מ-93%

• תמונת מצב מתוארכת — GPT-6 Luna מזהה מתגלגל יחיד לעומת Qwen3.8-Max-0902 הזמין כמהדורה מוצמדת מ-2 בספטמבר 2026 באותו מחיר

• משקלים — GPT-6 Luna סגור, API בלבד לעומת Qwen3.8-Max, ה-checkpoint הבסיסי Qwen3.8-2.4T-A95B ציבורי תחת רישיון מותאם מאז 12 באוגוסט 2026, בעוד שדגם הדגל המתארח מוצג כקנייני

• ב-OrcaRouter — GPT-6 Luna לא בקטלוג שלנו לעומת Qwen3.8-Max שניתן לנתב במחיר המחירון של Alibaba

Generated two-column scoreboard titled 'GPT-6 Luna vs Qwen3.8-Max - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index 37 at max effort, Context 1,050,000, Input text + image, Cost per index task $0.07. Right column Qwen3.8-Max rows: Price in/out $2.00 / $6.00, Cached input $0.25, AA Index 58, Context 1,000,000, Input text + image + video, Cost per index task $5.41. Footer: 'Prices per OpenAI and Alibaba Cloud; index figures per Artificial Analysis.'

וידאו אינו קו פיצ'רים; מדובר בעומס עבודה שונה.

שורת המודאליות היא זו שמכריעה ביותר השוואות אמיתיות מאשר שורת המחיר, והיא בדרך כלל נקראת בתור תיבת סימון.

Qwen3.8-Max מקבל וידאו. GPT-6 Luna לא. אם הפייפליין שלך צריך לבצע הסקה על הקלטת מסך, הדגמת מוצר, הקלטת הרצאה, קטע ממצלמת אבטחה או סיור בממשק משתמש, ההשוואה מסתיימת בקו הזה ופער המחיר של פי עשרים הופך ללא רלוונטי — אינך בוחר בין אפשרות יקרה לאפשרות זולה, אתה בוחר בין אפשרות לבין היעדר אפשרות. חילוץ פריימים והעברתם כתמונות הוא פתרון עוקף, לא שווה ערך, וכל מי שבנה אחד כזה יודע את ההבדל הן בעלות והן באיכות.

אם הפייפליין שלך הוא טקסט ותמונות, שורת המודאליות שותקת ושורת המחיר מדברת. זו החלוקה הכנה, וכדאי להיות בוטה לגבי באיזה צד שלה אתה נמצא לפני שתקרא משהו אחר בדף הזה.

הפער האייג'נטי הוא אמיתי והוא החצי היקר של פער המחירים

Qwen3.8-Max משיג ציון 58 במדד ה-Intelligence Index העצמאי. GPT-6 Luna משיג 37 במאמץ מרבי ו-29 בברירת המחדל הבינונית שלו. עשרים ואחת נקודות בהגדרות זהות, עשרים ותשע בברירות המחדל — במדד משולב שבו נקודה בודדת נמצאת בתוך הרעש של הרצה חוזרת, פער בגודל כזה אינו רעש.

המיקום של Qwen3.8-Max מרוכז בעבודה סוכנית. הוא משיג 58 ב-Agentic Index העצמאי, ראשון בקבוצתו, ו-1,739 Elo ב-GDPval ב-64 תורות למשימה. הנתון האחרון הוא המאלף, מכיוון שזו מדידה של מודל שמחזיק משימה יחד לאורך שישים וארבע החלטות עוקבות, וזה מגיע עם תג מחיר: בערך $1.14 לכל משימה שהושלמה בהערכה ההיא. השוו זאת לעלות של GPT-6 Luna למשימת מדד של בערך $0.07, והאמירה הכנה היא לא ש-Qwen יקר. אלא שמבקשים מ-Qwen לעשות דבר הרבה יותר קשה, והוא עושה זאת.

המסקנה הנלווית היא שהפער של עשרים ואחד נקודות של GPT-6 Luna אינו מתחלק באופן אחיד גם על פני עומס העבודה שלך. במשימה קצרה, מוגדרת היטב, הנצרכת על ידי תוכנית — לחלץ שדה זה, לסווג כרטיס זה, לנתב בקשה זו — שני המודלים יפיקו את אותה תשובה שמישה כמעט בכל הפעמים, ופער המדד יהיה בלתי נראה בהערכה שלך. במשימה הדורשת שישים וארבע פעולות עוקבות עם נקודת ביקורת בסוף, הפער הוא ההבדל בין לסיים לבין לעצור בשקט באמצע הדרך, וזו המשימה שעבורה נבנה Qwen3.8-Max, בעוד GPT-6 Luna לא נבנה עבורה.

מספר אחד פועל בכיוון ההפוך וראוי להצהיר עליו ולא לקבור אותו. שיעור ההזיות של Qwen3.8-Max בלוח הידע הכולל הוא 40%, עלייה מ־23% בדור הקודם — נסיגה של ממש, מהסוג שמתגלה כתשובות שגויות בטוחות בייצור ולא כשורת בנצ'מרק. של GPT-6 Luna הוא 77%, ירידה מ־93%. שני הנתונים גבוהים במונחים מוחלטים, והמודל הזול הוא עדיין הגרוע מבין השניים במדד זה. אף אחד מהמספרים אינו סיבה להעדיף מודל אחד; שניהם סיבות להשאיר אדם או מאמת בלולאה בכל דבר שבו עובדה מומצאת היא יקרה.

סעיף ההקשר הארוך הוא השורה היחידה שבה Qwen מנצח מבחינת מבנה.

ל-GPT-6 Luna יש סעיף שאין ל-Qwen3.8-Max: בקשות מעל 272,000 אסימוני קלט מחויבות בתעריף כפול של הקלט והמטמון וב-1.5× מתעריף הפלט, המיושם על הבקשה כולה ולא על החלק שמעבר לקו. קריאה בת 300,000 אסימונים ב-GPT-6 Luna מחויבת ב-$0.20 למיליון קלט עבור כל 300,000 האסימונים, משום שהיא חרגה ב-28,000. פצלו את אותו מסמך לשתי קריאות והעלות תחצה, בלי שינוי בפרומפט.

Qwen3.8-Max מציע תעריף אחיד לאורך כל חלון ה-1,000,000 טוקנים שלו. עבור בקשות בודדות עצומות באמת, הדבר הופך את פער מחיר הפלט – פי שנים-עשר – לקטן מכפי שהוא נראה, ואף יכול להפוך אותו: מעל 272,000 טוקני קלט, תעריף הקלט האפקטיבי של GPT-6 Luna מוכפל ל-$0.20, ותעריף הפלט שלו עולה ל-$0.75, לעומת התעריפים האחידים של Qwen – $2.00 ו-$6.00. הפער מצטמצם מפי עשרים לפי עשר בקלט, ומפי שנים-עשר לפי שמונה בפלט. עדיין רחב — אבל עומסי העבודה שסביר ביותר שיהיה להם הקשר עבודה של 300,000 טוקנים הם בדיוק אלה הסוכניים ששתי הספקיות מוכרות אליהם, והצוותים שמפעילים אותם הם הצוותים שישימו לב.

השורה המבנית האחרת היא הגרסה המוצמדת. Qwen3.8-Max-0902 זמין באותו מחיר כמו המזהה המתגלגל, כלומר צוות שזקוק להתנהגות ניתנת לשחזור לאורך עדכון מודל יכול לקבל אותה בלי לשלם תוספת. ל-GPT-6 Luna אין מקבילה. זו שורה קטנה במחירון ושורה גדולה בתחקיר שלאחר האירוע.

הרצת אחד מהם, או את שניהם

Qwen3.8-Max זמין ב-OrcaRouter במחיר המחירון של Alibaba, במסגרת תמחור pass-through שמשמעותו ששינוי בתעריפי ספק נכנס לתוקף אצלנו באותו היום. שני דברים בשכבת הניתוב שלנו מצדיקים את מקומם עבור המודל המסוים הזה: failover אוטומטי, משום שלדגם דגל מתארח עם בסיס במשקולות פתוחים שפורסם יש יותר upstreams מאשר למודל סגור של ספק יחיד, ויותר דרכים שאחד מהם יתדרדר; והטיפול ב-pinned revision, שמאפשר לנתיב להחזיק במפורש את Qwen3.8-Max-0902 במקום לרשת כל מה שהמזהה המתגלגל יפתור אליו בשבוע הבא.

GPT-6 Luna אינו בקטלוג שלנו נכון לכתיבת שורות אלה, ומגיעים אליו דרך ה-API של OpenAI עצמה, כך שצוות שרוצה את שניהם מריץ מפתח אחד עבור Qwen3.8-Max לצד מה שהוא כבר משתמש בו עבור OpenAI. זהו גם השילוב שבו ה-DSL לניתוב שווה יותר מפיצול סטטי, מפני שהגבול בין שני המודלים הוא בדיקת מודאליות ובדיקת אורך ולא העדפה: בקשות הנושאות וידאו עוברות ל-Qwen3.8-Max כי שום דבר אחר לא יכול לשרת אותן, בקשות מעל 272,000 טוקני קלט עוברות ל-Qwen3.8-Max כי הצוק של המודל האחר הופך אותן ליקרות יותר שם, וכל השאר עובר למודל שמחירו נמוך פי עשרים. זהו כלל, ומקומו בקונפיגורציה ולא בהסתעפות בקוד היישום.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

איזה מהם, ומתי

בחר ב-Qwen3.8-Max אם אחד מהבאים נכון. הפייפליין שלך צריך קלט וידאו. הבקשות שלך עוברות באופן שגרתי את 272,000 אסימוני הקלט, שם מסלול התמחור האחיד שלו מנצח את התמחור מחדש של GPT-6 Luna. הפלט שלך עולה על 128,000 אסימונים. העבודה שלך היא הרצה סוכנית לטווח ארוך עם נקודת סיום ניתנת לאימות, שבה 58 שלו בלוח הסוכנים ו-1,739 Elo ב-GDPval ב-64 סבבים לכל משימה הם ההוכחה שחשובה. או שאתה צריך גרסה מוצמדת לשחזוריות ואתה מוכן לשלם עליה — מה, במחיר זהה לזה של המזהה המתגלגל, אומר שאתה לא.

קח את GPT-6 Luna אם אף אחד מאלה לא חל ועומס העבודה שלך הוא בנפח גבוה, נצרך על ידי תוכניות, טקסט ותמונה, וקצר. סיווג, חילוץ, ניתוב, סיכום בכמות, הלולאה הפנימית של סוכן שזקוק לתשובה מהירה ולא לכזו זהירה. במחיר $0.10/$0.50 עם קריאה מהמטמון בעלות של סנט אחד ועלות למשימה שהושלמה בסביבות 1/15 מזו של Qwen3.8-Max, החשבון לא מתקרב. הגדר את פרמטר המאמץ במפורש — ברירת המחדל היא בינונית והנתון המוביל 37 הוא נתון מאמץ מרבי — ושמור על שיחות ארוכות בצד הנכון של קו 272,000 האסימונים.

הטעות שההשוואה הזו מזמינה היא לקרוא את מחיר הקלט הגבוה פי עשרים כהכרעה. זו הכרעה לגבי צורת עומס עבודה אחת, והיא שותקת לגבי שלושת הקווים שקובעים את האחרת: אם הבקשה כוללת וידאו, אם היא עוברת 272,000 טוקנים, ואם התשובה צריכה לשרוד שישים וארבעה שלבים עוקבים.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) showing the breadcrumb Home > Models > Qwen > Qwen3.8 Max (0902), a NEW badge, the model id qwen/qwen3.8-max-0902, Vision, Tools, JSON and Reasoning chips, a Qwen attribution dated 2026-09-02, the description of a September 2, 2026 snapshot accepting text, image and video input with a 1M-token context, input pricing of $2.00 and output of $6.00 per 1M tokens, a p50 time to first token of 3.50s, a p95 of 9.38s, and traffic of 196.6M tokens over seven days.

השוואות במאמר הזה3

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית