
GPT-6.1 Sol לעומת GPT-6 Sol: מה השיג שבוע אחד של עבודה נוספת, ומה הוא לא השיג
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 397 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 195 tok/s
- OrcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- xAISpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
אם יש לך GPT-6 Sol בפרודקשן היום ואתה מנסה להחליט אם GPT-6.1 Sol שווה הגירה, התשובה תלויה לחלוטין בשאלה איזו מהעלויות שלך גדולה יותר — ושני המודלים בנויים כך שהתשובה כמעט אף פעם אינה "שניהם". GPT-6 Sol שוחרר ב-22 בספטמבר 2026 במחיר של $2.00 למיליון טוקני קלט, $0.20 במטמון, ו-$10.00 פלט. GPT-6.1 Sol שוחרר ב-29 בספטמבר 2026 במחיר $2.00 קלט, $0.10 במטמון, ו-$10.00 פלט, עם שיפור של 6.4 נקודות אחוז לפי דיווח הספק במשימות הנדסת תוכנה מורכבות במאמץ הסקה נמוך יותר. מחירי הקלט והפלט לא זזו. תעריף המטמון ירד בחצי. השורה המשתנה היחידה הזו היא כל הטיעון הפיננסי, וכל השאר הוא טיעון יכולת שבנקודה הזו בחיי המהדורה מגיע ממקור אחד בדיוק.
שלושה דברים השתנו. אחד מהם הוא חשבון.
תוריד את השיווק, והדלתא בין שתי הפריסות האלה קצרה מספיק כדי להחזיק אותה בראש.
• קלט במטמון — $0.10 למיליון טוקנים ב-GPT-6.1 Sol לעומת $0.20 ב-GPT-6 Sol. נמדד ולא רק מוצהר, והשינוי היחיד שמתבטא בחשבון.
• יכולות, לפי הספק — OpenAI מדווחת על יתרון של 6.4 נקודות ב-DeepSWE v1.1 במאמץ חשיבה ובעלות נמוכים יותר, יותר מפי שניים בציון ב-Terminal-Bench Science 0.1 במאמץ מקסימלי, שבע נקודות במערך הלא־מקוון של OSWorld 2.0 במאמץ מקסימלי, 4.8 נקודות ב-AutomationBench במאמץ בינוני, ושיעור שגיאות עובדתיות שיורד מ-11.4% ל-7.7% במערך הנחיות שנועד במכוון לעורר שגיאות. כל זה לא שוחזר.
• סולם החשיבה — GPT-6.1 Sol תומך ב־low, medium, high, xhigh וmax, ואינו תומך ב־none; GPT-6 Sol תומך בכל השישה. זהו הפער ששובר קוד, והוא זה שאף אחד לא מכניס לפוסט השקה.
כל השאר זהה או כמעט זהה: אותו חלון הקשר של 1,050,000 טוקנים, אותה תקרת פלט של 128,000 טוקנים, אותו תעריף כתיבה למטמון של $2.50, אותו סף תימחור מחדש של 272K טוקנים שמעליו בקשה שלמה מחויבת לפי 2× קלט ומטמון ו-1.5× פלט, אותה דרישת Responses-API לקריאה לכלים, ואותו היעדר תמיכה בכיוונון עדין. נקודת החיתוך של הידע עברה מ-20 באפריל ל-30 באפריל 2026 — עשרה ימים, וזה סוג של נתון שמראה עד כמה זה היה התאמה מחדש ולא בנייה מחדש.
מדוע שורת המטמון שווה יותר ממה שהיא נראית

קריאת מטמון שחצויה היא דבר מוזר להוביל איתו רענון מוצר, עד שמסתכלים על איך שנראית בפועל תעבורת סוכנים. לולאת סוכן שולחת מחדש קידומת יציבה — הנחיית מערכת, סכמות כלים, הקשר שנשלף, היסטוריית שיחה — בכל תור, ובסשן ארוך אותה קידומת מחויבת עשרות או מאות פעמים. זו התעבורה שבה שיעור מטמון מפסיק להיות שגיאת עיגול והופך לשורה הדומיננטית בחשבונית.
תריץ את המספרים על סשן סוכן ארוך בודד. נניח קידומת של 120,000 טוקנים שנעשה בה שימוש חוזר לאורך 40 סבבים, כלומר 4.8 מיליון טוקני קלט במטמון לסשן, ובנוסף 150,000 טוקני פלט טריים וצנועים. ב-GPT-6 Sol הקריאות מהמטמון מחויבות ב-$0.96 והפלט ב-$1.50 — בערך $2.46 לסשן. ב-GPT-6.1 Sol אותו סשן מחויב ב-$0.48 עבור קריאות מהמטמון ואותם $1.50 עבור הפלט: בערך $1.98. לסשן ההפרש הוא 48 סנט, וזה לא שיקול להחלטה. תכפיל את זה על פני מאה אלף סשנים בחודש וזה $48,000 — שזה כן.
שתי הסתייגויות שומרות על זה אמין. קריאות מהמטמון מחויבות בתעריף המטמון רק כשהקידומת אכן נמצאת במטמון, כך שהחיסכון הממומש שלך הוא שיעור הפגיעות שלך כפול ההפרש, ולא ההפרש עצמו. והקידומת חייבת להיות מתחת ל‑272,000 טוקנים כדי שהתעריפים הסטנדרטיים יחולו בכלל: אם חוצים את הקו הזה, כל הבקשה מתומחרת מחדש לפי 2× בקלט ובמטמון ולפי 1.5× בפלט, מה שיכול לגמד חיסכון של 10 סנט על הקידומת. סשנים עם הקשר ארוך הם אלה שבהם הכי פחות סביר שחשבון המטמון ייראה כמו בעלון הפרסום.
פער הבנצ'מרק הוא אמיתי, והוא מגיע ממקום אחד.
הפוסט ההשקה של OpenAI ספציפי באופן יוצא דופן לגבי ההערכות שלו, וזו נקודה לזכותו, אבל כל אחד מהמספרים האלה הוא הספק שמדרג את המודל שלו עצמו, וזו הנקודה לרעתו. הדפוס ביניהם עקבי: ההשוואה שעוברת הלאה היא תמיד מול GPT-6 Astra, וההשוואה ל-Astra היא תמיד השוואת עלויות. ב-DeepSWE v1.1 הטענה היא השגת ביצועים זהים ל-Astra בכערך חמישית מהעלות. ב-GDP.pdf, התקרבות לרמה המתקדמת ביותר של Astra בכערך חמישית מהעלות לכל משימה. ב-OSWorld 2.0, בפער של עד 2.1 נקודות מ-Astra בכערך שביעית מהעלות לכל משימה. במידת העובדתיות, בפער של עד 1.9 נקודות מ-Astra בפחות מחמישית מהעלות לכל משימה. זה לא מקרה של ניסוח; זו התזה של המוצר, והיא תזה על מחיר, לא על מובילות ביכולות.
המקום היחיד שבו OpenAI יוצאת מהמסגור של עצמה ראוי להערכה: ב-Terminal-Bench Science 0.1 היא מציינת במפורש ש-GPT-6 Astra עדיין מחזיק בציון הגבוה ביותר מבין המודלים שנבחנו, 68.1%, ושיש להשתמש בו למחקר המדעי הקשה ביותר. פוסט השקה שאומר לך מתי לקנות את האח היקר יותר הוא פוסט השקה שיש בו קצת משמעת.
מול GPT-6 Sol ספציפית, המצב האמיתי של ההשוואה הוא זה — אין ציון עצמאי לאף אחד מהמודלים בתצורה הזו. ל-Artificial Analysis יש הערכה מלאה של GPT-6 Sol במאמץ החשיבה המקסימלי: מדד Intelligence של 48, $1.06 לכל משימת מדד, 77 מיליון אסימוני פלט שנוצרו לעומת חציון לוח של 88 מיליון, ומדד Coding Agent של 57 בעלות של $2.99 לכל משימה. אין לו רשומה של GPT-6.1 Sol בכלל נכון ל-30 בספטמבר; ה-slug של המודל מחזיר 404 והמחרוזת לא מופיעה בלוח המובילים החי. לכן ההשוואה היחידה שנמדדה על ידי צד שלישי והזמינה היום היא בין GPT-6 Sol למודלים של מעבדות אחרות — לא בין GPT-6 Sol ליורש של עצמו. כל מי שמראה לך כרגע תרשים 6.1 מול 6.0 מראה לך את השקף של OpenAI.
המיגרציה היא שינוי מחרוזת, פרט למקומות שבהם היא לא.
ההנחיות של OpenAI עצמה לנדידה למשפחת GPT-6 שוות קריאה לפני שאתם מחליפים את המזהה, כי שני סעיפים בהן שוברים קוד עובד. הראשון הוא סולם החשיבה: אם בקשה כלשהי שולחת reasoning_effort: "none", GPT-6.1 Sol דוחה אותה, והתיקון המתועד הוא להתחיל מ-low ולהשוות במשימות מייצגות במקום להניח שההגדרה הנמוכה ביותר שקולה. תהליכי עבודה שהשתמשו ב-none כבסיס לזמן השהיה מאבדים את הבסיס הזה. השני הוא קריאה לכלים: GPT-6.1 Sol תומך ב-Chat Completions אך לא בקריאה לכלים דרכו — כלים דורשים את Responses API. אם המחסנית שלכם קוראת לפונקציות ב-/v1/chat/completions, אתם לא מחליפים מחרוזת, אלא מעבירים נקודת קצה. ההוראה של הספק עצמו למפתחים שכבר עובדים עם GPT-6 Sol היא לעבור על ההנחיות האלה לפני המעבר, וזה אות הוגן לכך שזו אינה רענון של החלפה ישירה כפי שפער של שבוע מרמז.
הפרמטרים הנותרים מתנהגים כך: מאמץ חשיבה, פלטים מובנים, סטרימינג, מטמון פרומפטים ומערך הכלים — כולם נשמרים, ואותו כלל תימחור מחדש של 272K חל באופן זהה על שני המודלים. הגדר את model ל-gpt-6.1-sol, השאר את הגדרת מאמץ החשיבה שלך במקום שבו היא נתמכה, והסר temperature, top_p ו-top_logprobs בכל פעם שמאמץ החשיבה אינו none — האחרון חל על שני המודלים והוא מקור נפוץ לשגיאות 400 לאחר כל הגירה של מודל חשיבה.
הגירה בלי להמר על נתיב פרודקשן

ההגירה הריאלית אינה החלפה חד-פעמית, אלא הרצת צל: לשלוח פרוסה מתעבורת הייצור למזהה החדש, להשאיר את הישן כמסלול שמשיב, ולהשוות על המשימות שלכם. זו בעיית ניתוב, וזה המקום היחיד שבו הפלטפורמה שדרכה אתם קוראים משנה את צורת העבודה. OrcaRouter מספקת היום את GPT-6 Sol במחיר המחירון של OpenAI עצמה ללא תוספת — הכרטיס של $2.00 / $0.20 / $10.00, כולל כלל התמחור מחדש של 272K — כך שזרוע הבסיס של ההשוואה פעילה על אותו מפתח כמו כל השאר, וניתן להוסיף את זרוע 6.1 למערך הניתוב ברגע שהיא ניתנת לקריאה, בלי חוזה שני או SDK שני. עד אז העמדה הכנה היא ש-GPT-6 Sol הוא המודל הזמין לקריאה, וכדאי לומר זאת בפשטות ולא לרמוז אחרת: openai/gpt-6.1-sol מחזיר "model not found" בנקודת הקצה הציבורית של הקטלוג שלנו היום. מעבר אוטומטי הוא מה שהופך את הרצת הצל לבטוחה כשהיא סוף סוף נוחתת — אם המסלול החדש נכשל, הבקשה תושלם על הישן, ואתם תגלו מהלוגים ולא מהמשתמשים שלכם.
מי צריך לעבור עכשיו: צוותים שהעלות שלהם נשלטת על ידי קלט שמור במטמון בסשנים ארוכים של סוכנים, וצוותים שתהליכי העבודה שלהם כבר משתמשים ב-Responses API ולעולם לא שולחים none. עבורם זה כמעט שדרוג בחינם — הספק מדווח על השיפורים ביכולות, תעריף המטמון נחצה, וההגירה היא מחרוזת אחת. מי צריך לחכות: צוותים עם none בנתיב קריטי לשיהוי, צוותים שקריאות הכלים שלהם עוברות דרך Chat Completions, וכל מי שצריך מספר מגורם חיצוני ל-OpenAI לפני שהוא מתחייב. עבור הקבוצה האחרונה הזו, להמתנה אין תאריך סיום מפורסם, והדבר ההגיוני לעשות עם הזמן הוא לבנות את מערך ההערכה שההשוואה תזדקק לו — כי כשהציון העצמאי יגיע, הוא יהיה עבור התעבורה של מישהו אחר.

השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
