כרטיס כותרת הירו עבור מאמר המשווה בין GPT-6 Sol ל-Qwen3.8-Max, שעליו כתוב 'GPT-6 Sol מול Qwen3.8-Max' עם כותרת המשנה 'השורה היחידה שבה המודל הסגור לא יכול להתחרות', ומציג את GPT-6 Sol כקלט טקסט ותמונה ואת Qwen3.8-Max כקלט טקסט, תמונה וווידאו.
Guides & Insights

GPT-6 Sol נגד Qwen3.8-Max: השורה האחת שבה המודל הסגור לא יכול להתחרות

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

כמעט כל השוואה בין GPT-6 Sol לQwen3.8-Max תוכרע לפי עלות, וכמעט כל אחת מהן תטעה בחישוב העלות באותו כיוון. Qwen3.8-Max, דגם הדגל המתארח של הספק, תומחר ב-2.00 דולר למיליון טוקני קלט וב-6.00 דולר למיליון טוקני פלט מאז הזמינות הכללית שלו ב-3 באוגוסט 2026, כאשר תמונת המצב המתוארכת Qwen3.8-Max-0902 הגיעה ב-2 בספטמבר. GPT-6 Sol הגיע לזמינות כללית ב-22 בספטמבר 2026 במחיר של 2.00 דולר לקלט ו-10.00 דולר לפלט. מחיר קלט זהה, ופלט זול ב-40% לפי מחירון Qwen3.8-Max — ובכל זאת, בהרנס הבלתי תלוי, בערך פי חמישה עלות להשלמת משימה.

אבל יש הבדל שני, נקי יותר, שטיעון העלויות ממשיך לקבור, והוא זה שבפועל מכריע בחלק מעומסי העבודה. Qwen3.8-Max מקבל וידאו. GPT-6 Sol לא. זה לא נתון של מחיר או נתון של בנצ'מרק; זו יכולת שלאחד מהדגמים האלה יש ולשני אין אפשרות להתקרב אליה, וזה החלק היחיד בהתמודדות הזאת ששום כמות של עבודה על יעילות טוקנים לא תתקן.

A six-row scoreboard card titled 'GPT-6 Sol vs Qwen3.8-Max - the scoreboard', comparing the two models on output price, Intelligence Index, cost per task, input modality, maximum output and long-context handling. The left column lists GPT-6 Sol at $10.00 output, an Index of 48, $1.06 per task, text and image input, a 128,000-token maximum output and whole-request repricing above 272K; the right column lists Qwen3.8-Max at $6.00 output, an Index of 45, $5.41 per task, text, image and video input, a 131,072-token maximum output and a flat tier above 272K. A footer reads 'Vendor list rates; Index per Artificial Analysis.'

שני דגמי דגל, שתי צורות שונות

Qwen3.8-Max הוא מודל תערובת מומחים דלילה בעל 2.4 טריליון פרמטרים, עם כ-95 מיליארד פרמטרים פעילים לכל שאילתה — המודל המתארח השני בגודלו בייצור, אחרי Kimi K3. חלון ההקשר שלו הוא מיליון טוקנים עם תקרת פלט של 131,072 טוקנים, מודאליות הקלט שלו הן טקסט, תמונה ווידאו, והוא תומך במאמץ הסקה ברמות נמוכה, בינונית וגבוהה במיוחד עם פלטים מובנים וקריאה לכלים. הדגם המוביל המתארח אינו בעל משקלים פתוחים; הארטיפקט הניתן להורדה של אותו דור הוא מהדורה נפרדת עם מגבלות משלה.

GPT-6 Sol הוא קלט טקסט ותמונה, פלט טקסט. החלון שלו הוא 1,050,000 טוקנים עם מקסימום קלט של 922,000 טוקנים ותקרת פלט של 128,000 טוקנים, במחיר קבוע של $2.00 ו-$10.00 עם קריאה שמורה במטמון ב-$0.20 וכתיבה למטמון ב-$2.50, תוך תמחור מחדש של כל הבקשה מעל 272,000 טוקני קלט ל-$4.00 ו-$15.00. הוא סגור, בעל מזהה יחיד, ו-OpenAI תיארה את התעריפים כקבועים ולא כמבצעיים.

נתוני החלון נמצאים בטווח של כ-7% זה מזה, ותקרות התפוקה נמצאות באותו טווח. רשימת המודאליות היא הפער המבני היחיד — והוא חד-כיווני.

שורה אחר שורה

• קלט — GPT-6 Sol $2.00 למיליון טוקנים לעומת Qwen3.8-Max $2.00 למיליון טוקנים; המספר הכותרתי זהה

• פלט — GPT-6 Sol $10.00 למיליון טוקנים לעומת Qwen3.8-Max $6.00 למיליון טוקנים; התעריף של Alibaba נמוך ב-40%

• קלט במטמון — GPT-6 Sol $0.20 למיליון טוקנים לעומת Qwen3.8-Max $0.25 למיליון טוקנים עבור קריאות מטמון מרומזות, עם קריאת מטמון מפורשת ב-$0.17 וכתיבת מטמון מפורשת ב-$2.50

• חלון הקשר — GPT-6 Sol 1,050,000 טוקנים לעומת Qwen3.8-Max 1,000,000 טוקנים

• פלט מקסימלי — GPT-6 Sol 128,000 טוקנים לעומת Qwen3.8-Max 131,072 טוקנים

• מודאליות קלט — GPT-6 Sol טקסט ותמונה לעומת Qwen3.8-Max טקסט, תמונה ווידאו

• טיפול בהקשר ארוך — GPT-6 Sol מתמחר מחדש את הבקשה כולה מעל 272,000 טוקני קלט בפי 2 מתעריפי הקלט והמטמון ופי 1.5 מהפלט, לעומת Qwen3.8-Max עם מדרגה אחידה לכל אורך החלון, וזה המקום היחיד שבו מחירון התעריפים של Qwen טוב יותר מבחינה מבנית ולא רק זול יותר באופן שולי

• מאמץ הסקה — GPT-6 Sol: ללא, נמוך, בינוני (ברירת מחדל), גבוה, xhigh, מקסימלי לעומת Qwen3.8-Max: נמוך, בינוני וגבוה במיוחד

• תאריך עדכון הידע — GPT-6 Sol, 20 באפריל 2026 לעומת Qwen3.8-Max שלא פורסם כתאריך יחיד

• תמונת מצב מתוארכת — GPT-6 Sol מזהה מתגלגל יחיד לעומת Qwen3.8-Max-0902 הזמין כמהדורה מקובעת מ-2 בספטמבר 2026 באותו מחיר

שורת ההקשר הארוך ראויה ליותר תשומת לב ממה שהיא בדרך כלל מקבלת. התוספת של GPT-6 Sol היא מדרגה שמוחלת על הבקשה כולה, כך שהרצת סוכן של 900,000 טוקנים מחויבת ב-4.00$ וב-15.00$ על כל טוקן. Qwen3.8-Max גובה מדרגה אחת על פני כל החלון. עבור עומס עבודה שנמצא מעל 272,000 טוקנים, שני מחירוני התעריפים מפסיקים להיות ברי השוואה כלל — המודל הזול יותר בכותר הוא היקר יותר בפער ניכר, וכיוון הפער תלוי לחלוטין במקום שבו ההקשר שלך נמצא.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured 23 September 2026, showing an Intelligence Index score of 45, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a cost of $5.41 per Intelligence Index task, 190 million output tokens generated during the index run, a 984,000-token context window and 39.2 output tokens per second.

כרטיס התעריפים אומר 40% זול יותר. ההארנס אומר פי חמישה מהחשבון.

Artificial Analysis מדדה את Qwen3.8-Max-0902 בציון 45 במדד Intelligence Index, בעלות של 5.41 דולר לכל משימת מדד שהושלמה, לאחר שיצר 190 מיליון טוקני פלט לאורך ההרצה. הסיכום שלה מתאר את המודל כ"איטי באופן ניכר ומאוד עתיר מילים". GPT-6 Sol השיג ציון 48 בעלות של 1.06 דולר למשימה, על 77 מיליון טוקני פלט.

קרא את שלושת הזוגות האלה יחד וצורת ההתמודדות מתגלה. Qwen נמצא שלוש נקודות מדד מאחור, ייצר פי שניים וחצי טוקנים, ועלה בערך פי חמישה לכל משימה שהושלמה — לפי מחירון שבו התפוקה שלו זולה ב-40%. המנגנון אינו עדין. בתעריף של $6.00 למיליון טוקני פלט, 190 מיליון טוקנים עולים $1.14 לכל הרצת מדד בפלט בלבד לפני ספירת הקלט; בתעריף של $10.00 למיליון, 77 מיליון של Sol עולים $0.77. התעריף הזול יותר קונה יותר טוקנים, לא חשבון קטן יותר.

זו אותה תבנית שמופיעה בכל שדה הדגמים של ספטמבר, וראוי לנסח אותה ככלל ולא כעובדה על שני הדגמים האלה: במחירון לפי טוקנים, הנחה של 40% על הפלט לא שווה דבר אם המודל מייצר פי שניים וחצי טוקנים. עלות למשימה שהושלמה היא הנתון היחיד שמחזיק מעמד.

מה פרסמה אליבאבא, ובעיית קביעת המאמץ

טבלת הבנצ'מרקים של עליבאבא עצמה היא הארוכה ביותר בהשוואה הזו והפחות ברת-השוואה. נתונים שדווחו על ידי הספק מציבים את Qwen3.8-Max ביתרון ב-PaperBench וב-IFBench, בעוד שהוא מפגר ב-SWE-bench Pro וב-Humanity's Last Exam, עם סולם מאמץ חשיבה — נמוך, בינוני, גבוה במיוחד — שאין לו מיפוי ישיר לסולם שש הרמות של OpenAI. ציון שמפורסם ברמה "גבוה במיוחד" אינו אותו מוצר כמו ציון שמפורסם ברמה "בינוני", ואף אחד מהספקים אינו מסמן איזו רמה הניבה מספר נתון בתרשים השוואה.

זו הסיבה הכנה שלא להישען כאן על הטבלה של אף אחד מהספקים. המספרים של Alibaba מורצים על ההרנס של Alibaba בהגדרת המאמץ של Alibaba; אלה של OpenAI מורצים על אלה של OpenAI. הנתונים של Artificial Analysis קיימים בדיוק משום ששניהם אינם שמישים כהשוואה ראש בראש, ואלה הם הנתונים שבהם נעשה שימוש למעלה.

יכולת שחזור היא תכונה אמיתית, ומחירה אפס

תמונת המצב המתוארכת היא השורה הכי פחות מוערכת בהשוואה הזו. Qwen3.8-Max-0902 היא מהדורה מקובעת מ-2 בספטמבר 2026, ש-Alibaba טוענת שהיא מציעה את אותן היכולות ואותו התמחור כמו מודל הבסיס. קיבוע שלה פירושו שהמודל שמאחורי נקודת הקצה שלך לא משתנה לך בין יום שלישי ליום חמישי.

אין מקבילה ל-GPT-6 Sol. זהו מזהה מתגלגל יחיד — אותו עמוד מודל מכיל תמונת מצב של ברירת מחדל ואין בו גרסאות מתוארכות — מה שאומר שהדבר שהרצתם עליו בנצ'מרק בספטמבר לא מובטח להיות הדבר שאתם קוראים לו בנובמבר. עבור רוב הצוותים זה בסדר. עבור פייפליין מוסדר שצריך להדגים מה הפיק פלט, זהו הבדל אמיתי, וזהו הבדל ש-Alibaba נותנת בחינם בעוד OpenAI אינה מציעה אותו כלל.

קו הווידאו הוא זה שקובע

כל מה שלמעלה הוא השוואה. החלק הזה לא. אם הקלט שלך כולל וידאו — הקלטות מסך, צילומי בדיקה, הקלטת הרצאות, כל דבר שבו המידע נמצא בתנועה ולא בפריים קפוא — Qwen3.8-Max מקבל אותו באופן מובנה ול-GPT-6 Sol אין שום דרך להגיע אליו. אי אפשר לעקוף צורת קלט בעזרת פרומפט. אי אפשר לעבד מראש וידאו לתמונות ולקבל את אותו הדבר, כי המידע הזמני הוא העיקר, ושום כמות של נקודות אינדקס במדד טקסטואלי לא תחליף את הקלט שהמשימה שלך באמת דורשת.

גם המקרה ההפוך ראוי לציון, משום ששם ההשוואה מפסיקה להיות חד-צדדית. אם הקלט שלך הוא טקסט ותמונות, Sol זול יותר לכל משימה, בארבע נקודות לפנים בלוח הניטרלי, וזול יותר בקריאות מהמטמון. יכולת הווידאו אינה שובר שוויון לטובתך; היא פשוט אינה בשימוש.

ניתוב החלטה שיש לה שתי תשובות נפרדות

Screenshot of OrcaRouter's model page for Qwen3.8 Max (0902), captured 23 September 2026, showing the model id qwen/qwen3.8-max-0902 from provider Qwen, a 1M-token context window with a 131k-token maximum output, text, image and video input with text output, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, and a p50 time to first token of 3.50 seconds.

זהו מקרה שבו הארכיטקטורה הנכונה היא באמת שני מודלים, ולא אחד, והסיבה לכך היא שהפיצול הוא לפי מודאליות של הקלט ולא לפי מידת הקושי. צינור עיבוד שקולט וידאו ומבצע הסקה על טקסט צריך את שניהם, וכלל הניתוב הוא מאפיין של הבקשה ולא החלטת שיקול דעת.

Qwen3.8-Max נמצא בקטלוג של OrcaRouter — תמונת המצב המתוארכת qwen/qwen3.8-max-0902 ניתנת לניתוב במחיר המחירון של Alibaba תחת מודל ה-pass-through, מה שאומר ששינוי בתעריף של Alibaba נכנס לתוקף אצלנו באותו יום ולא לאחר שמשווק מחדש מנהל משא ומתן מחדש. GPT-6 Sol אינו בקטלוג שלנו נכון לכתיבת שורות אלה, וניתן להגיע אליו דרך ה-API של OpenAI עצמו. ה-DSL לניתוב הוא החלק שמתאים למקרה הספציפי הזה: כלל ששולח בקשות הנושאות וידאו בכיוון אחד ואת כל השאר בכיוון האחר הוא בדיוק מה שהוא נועד לעשות, ו-failover אוטומטי מבטיח שענף המודאליות לא יהפוך לנקודת כשל יחידה.

איפה כל אחד מנצח

• וידאו נכנס, טקסט יוצא — Qwen3.8-Max, ואין תחרות לתאר.

• קלט טקסט ותמונה, עלות לכל משימה שהושלמה כמדד — GPT-6 Sol, בפער של בערך פי חמישה בהרנס העצמאי.

• עבודה עם קידומת במטמון — GPT-6 Sol. הקריאה שלו מהמטמון זולה במעט, ונפח הטוקנים שלו קטן ממחצית.

• בקשות מעל 272,000 טוקני קלט — Qwen3.8-Max. התמחור-מחדש של Sol עבור בקשה שלמה הוא הפער הגדול ביותר בעלויות בהשוואה הזו, והוא סמוי בתעריפים המוצהרים.

• נעיצה ניתנת לשחזור — Qwen3.8-Max-0902, שאינו כרוך בעלות נוספת והוא הגרסה הנעוצה היחידה מבין השתיים.

• אם הוצג לך תרשים שבו Qwen מוביל ב-SWE-bench Pro — בדוק של מי ההרנס שהפיק אותו ובאיזו הגדרת מאמץ. בלוח העצמאי Qwen נמצא שלוש נקודות מאחור במדד המשולב, וטבלאות הספקים אינן על אותו סולם זו לזו.

השוואות במאמר הזה3

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית