כרטיס הירו מחולל שכותרתו 'GPT-6.1 Sol מול Qwen3.8-Max' עם שני פאנלים מעוגלים: משמאל 'GPT-6.1 Sol' שמפרט 'OpenAI - שוחרר ב-29 בספטמבר 2026', '$2.00 קלט / $10.00 פלט ל-1M', '$0.72 למשימה' ו-'AA Index 51.8'; מימין 'Qwen3.8-Max' שמפרט 'Alibaba - שוחרר ב-3 באוגוסט 2026', '$2.00 קלט / $6.00 פלט ל-1M', '$5.41 למשימה' ו-'AA Index 45.4'; מתחתיהם הרצועה 'אותו מחיר קלט. פי 7.5 מהחשבונית.'; כותרת תחתונה 'נתונים: Artificial Analysis v4.3.2.' והלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

GPT-6.1 Sol מול Qwen3.8-Max: החשבונית, לא המחירון

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Take one nightly repository-maintenance job, run it once a night for a month, and put GPT-6.1 Sol and Qwen3.8-Max on it in turn. On Artificial Analysis's v4.3.2 per-task figures, GPT-6.1 Sol costs $21.72 for those thirty nights and Qwen3.8-Max costs $162.27 — a gap of $140.55 a month, about $1,690 a year, for a job whose per-token price list reads $2.00 in and $10.00 out against $2.00 in and $6.00 out. The per-million rates are within a rounding error of each other on input and the Chinese model is 40% cheaper on output, yet the invoice differs by a factor of 7.5. The vendor released GPT-6.1 Sol on 29 September 2026; Qwen3.8-Max has been live since 3 August 2026.

הפער הזה אינו טריק תמחור ואינו ארטיפקט של בנצ'מרק — הוא כל מה שיש להשוואה הזאת לומר, והוא נובע ממספר אחד שאף כרטיס תעריפים לא מראה לך.

מהו כל מודל

GPT-6.1 Sol הוא ספינת הדגל הנוכחית של OpenAI בתחומי החשיבה והקידוד, שהושקה שבוע לאחר GPT-6 Sol שאותו היא מחליפה, באותו מחיר מחירון של $2.00 / $10.00, עם תעריף קלט מהמטמון של $0.10 וחלון הקשר של 1,050,000 טוקנים. היא נמכרת לעבודה אגנטית: תגיות "המתאים ביותר ל" בכרטיס המודל שלנו מציינות חשיבה, קידוד ואגנטיות, והיא נושאת את ציון האיכות מהדרג הגבוה ביותר.

Qwen3.8-Max הוא ספינת הדגל הסוכנית של אליבאבא — מודל סגור, מבוסס API בלבד, שמקבל קלט טקסט, תמונה וווידאו ומחזיק חלון הקשר של 1,000,000 טוקנים. שלא כמו מהדורות Qwen הקטנות יותר, לזה אין משקולות מפורסמות. ב-Artificial Analysis הוא ניצב על 45.42 במדד האינטליגנציה, במקום ה-17 מתוך 147 מודלים, עם מדד קידוד של 76.2 שמדרג אותו במקום ה-9 בתחום הזה. הוא לא מודל חלש. הוא פשוט יקר מכדי לתת לו לחשוב.

המספר שלא מופיע בכרטיס התעריפים

A generated two-column scoreboard titled 'GPT-6.1 Sol vs Qwen3.8-Max - the scoreboard'. Left column 'GPT-6.1 Sol': Output tokens 38,128, Reasoning tokens 25,190, Cost per task $0.72, AA Index 51.8, Time per task 640 s, Context 1.05M. Right column 'Qwen3.8-Max': Output tokens 107,730, Reasoning tokens 70,830, Cost per task $5.41, AA Index 45.4, Time per task 2,152 s, Context 1M. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Artificial Analysis מתעדת 107,730 אסימוני פלט לכל משימה עבור Qwen3.8-Max, מתוכם 70,830 הם אסימוני חשיבה. GPT-6.1 Sol מייצר 38,128 אסימוני פלט, 25,190 מהם אסימוני חשיבה. המודל הסיני כותב פי 2.8 אסימונים כדי לענות על אותה שאלה, והוא כותב אותם בעלות נמוכה ב-40% לאסימון.

• טוקנים של פלט לכל משימה — 38,128 לעומת 107,730; Qwen כותב פי 2.8 יותר

• מהם חשיבה — 25,190 vs 70,830

• עלות לכל משימה — $0.724 לעומת $5.409; Qwen עולה פי 7.5 יותר

• זמן לכל משימה — 640 שנ׳ לעומת 2,152 שנ׳; כ-11 דקות לעומת כ-36

• זמן עד לאסימון התשובה הראשון — 332.0 שנ׳ לעומת 55.1 שנ׳

• מדד האינטליגנציה — 51.83 לעומת 45.42

• חלון הקשר — 1,050,000 מול 1,000,000 טוקנים

• קלטים מתקבלים — טקסט, תמונה וקובץ לעומת טקסט, תמונה ווידאו

עשו את הכפל וההנחה נעלמת. מודל שפולט כמעט פי שלושה טוקנים בתעריף נמוך ב-40% לא עולה פחות — הוא עולה בערך פי 1.7 על הפלט בלבד, והנתון הנמדד לכל משימה מעמיד את המכפיל האמיתי על 7.5 כאשר לוקחים בחשבון קלט, קריאות מהמטמון ואורך התשובה היצרנית.

שימו לב לשורה הרביעית ולשורה החמישית, כי הן מצביעות בכיוונים מנוגדים ויחד הן מסבירות מהו Qwen3.8-Max. הוא מחזיר את הטוקן הראשון שלו בתוך 55 שניות, בעוד ש-GPT-6.1 Sol לוקח חמש וחצי דקות, ואז מבלה שלושים ושש דקות בהשלמת המשימה, בעוד שהמודל של OpenAI מסתיים באחת עשרה. זהו מודל שמתחיל לדבר מיד וחושב באורך רב מאוד. בממשק צ'אט עם תשובה בזרימה זה נקרא כמענה מהיר. במשימת לילה ללא השגחה, זהו זמן קיר שאתם גם משלמים עליו.

שלושה מקומות שבהם Qwen3.8-Max באמת מוביל

פער המדד הוא 6.4 נקודות בכל המערך כולו, מספר שמצוטטים אותו כאילו היה אחיד. הוא אינו אחיד, והמחלוקת מלמדת:

• GPQA Diamond — Qwen3.8-Max 0.9283 מול GPT-6.1 Sol לא פורסם בהרצה הזו

• GDPval — 1,671.4 לעומת 1,575.09

• Terminal-Bench 2.1 — 0.8876 לעומת לא פורסם בהרצה זו

• AutomationBench — 0.5619 מול 0.6487

• SciCode — לא פורסם בהרצה זו לעומת 0.5417 עבור GPT-6.1 Sol

• CritPT — 0.1771 לעומת 0.3171

Qwen3.8-Max מנצח בשאלות המדעיות ברמת תואר שני ובמדגם המשימות התעסוקתיות, וזו תוצאה אמיתית עבור מודל מהדור שלו והסיבה שמדד הקידוד שלו מדורג במקום ה-9 מתוך 138. הוא מפסיד בהערכות הקשות יותר הקרובות למחקר — CritPT ב-14 נקודות — והוא מפסיד ל-AutomationBench ב-8.7, וזה המבחן שהכי דומה לעבודה ממוחשבת ללא השגחה. איזה משני אלה שאתם מאמינים שחשוב יותר לעומס העבודה שלכם הוא ההחלטה האמיתית; נתון הכותרת של 6.4 נקודות הוא ממוצע על מחלוקת, לא פסק דין.

מה הטוקנים הנוספים קונים, ומה הם לא

עקבות חשיבה ארוכים אינם בזבוז מעצם הגדרתם. מודל שמשקיע 70,830 טוקנים של שיקול דעת במשימה קשה עושה משהו שהמודל הקצר יותר אולי מדלג עליו, ובהערכות שבהן Qwen3.8-Max מוביל, סביר להניח ששיקול הדעת הזה הוא ההסבר. דפוס הכשל הוא שאתה משלם על כך בכל משימה, לא רק במשימות הקשות. ספירות טוקנים של חשיבה הן מאפיין של הכיול של המודל, ולא של קושי השאלה, ומודל שחושב יותר מדי על חילוץ של שורה אחת מחייב אותך על כך.

הדרך לגלות איזו מהמשימות שלך היא איזו היא להפסיק להתייחס לבחירת המודל כאל גלובלית. מה שמביא אותנו לחלק שהוא שינוי קונפיגורציה.

כרטיס המודל שלנו עבור GPT-6.1 Sol מכיל את המספרים המוגשים של הנבדק: תעריף של $2.00 / $10.00, חלון הקשר של 1,050,000 טוקנים, p50 של 4.54 שניות עד לטוקן הראשון, ובלוק אינדקס Artificial Analysis מאוחסן באותו עמוד שבו נמצא התמחור שאפליקציה תנתב לפיו בפועל.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

מפתח אחד, מד אחד, שני דגמים

שני המודלים נגישים דרך נקודת קצה אחת של OrcaRouter — API אחד ל־200+ מודלים, שבו מחיר המחירון של הספק מועבר הלאה במרווח של 0%. הכרטיס של OrcaRouter עבור Qwen3.8-Max מציג את התעריף המוגש לצד חלון ההקשר של 1,000,000 טוקנים, מודאליות הקלט של טקסט/תמונה/וידאו ונפח של 101.4 מיליון טוקנים בשבעה ימים — המספרים שאפליקציה מנתבת לפיהם, לצד אלה שהמאמר מתווכח עליהם. ההעברה הישירה הזו חשובה במיוחד עבור Qwen3.8-Max, מפני שמודל שהכלכלה שלו נשלטת על ידי נפח טוקני הפלט הוא כזה שהספק שלו יכול לתמחר אותו מחדש בכל עת, ומדידה של העברה ישירה משמעה שהשינוי מגיע לחשבונית שלך ביום שבו Alibaba מפרסמת אותו, ולא לפי לוח הזמנים של מפיץ.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the $2.00 input and $6.00 output per-million prices, a 5.66 s p50 time to first token, 101.4M tokens over seven days, a 1,000,000-token context window and text/image/video input, above the OpenAI- and Anthropic-compatible code samples.

השימוש המעניין יותר בשכבת הניתוב כאן הוא ה-DSL לניתוב, שמאפשר לך להרכיב מודלים לקריאה אחת במקום לבחור מודל אחד עבור כל היישום. פצל את המשימה הלילית: מודל זול מסווג ומחלץ, GPT-6.1 Sol מטפל בשלבי ההיסק והאימות, ו-Qwen3.8-Max שמור למשימות שבהן ההתלבטות הארוכה שלו והחוזק המדעי שלו ברמת GPQA באמת משנים את התשובה. מעבר אוטומטי לגיבוי מכסה את השאר — אם ספק מתדרדר באמצע הריצה, הבקשה עוברת במקום שהאצווה תיכשל.

אף אחד מאלה אינו סיבה לבחור במודל. הם הסיבה לכך שאינך צריך לבצע את הבחירה פעם אחת ולחיות איתה.

השיחה, והדבר שכדאי לשים לב אליו

שלם את פי 7.5 רק במקום שבו ההרהור מצדיק זאת. במשימת לילה לשימוש כללי, GPT-6.1 Sol במחיר 0.724 דולר למשימה הוא ברירת המחדל המוצדקת, ו-1,690 דולר לשנה הוא סכום אמיתי. כאשר המשימה היא מדע קשה או חשיבה מקצועית עם תשובה ניתנת לבדיקה, ה-0.9283 של Qwen3.8-Max ב-GPQA Diamond שווה את הטוקנים — זה הדבר הספציפי שהוא עושה טוב יותר.

הדבר שכדאי לעקוב אחריו הוא האם Alibaba מתמחרת מחדש. מודל של 2.8× טוקנים במחיר $2.00/$6.00 מתומחר כאילו הטוקנים הם המשאב הנדיר; ההתנהגות של המודל עצמו הופכת את הטוקנים לשפע. אם תעריף הפלט זז באופן מהותי, החשבון במאמר הזה זז איתו, ומד ה-pass-through יראה לך את זה באותו יום שבו זה קורה.

השוואות במאמר הזה3

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית