לוח תוצאות השוואתי דו-טורי מיוצר שכותרתו 'GPT-6.1 Sol מול GPT-5.6 Sol – לוח התוצאות'. עמודה שמאלית 'GPT-6.1 Sol': שורות האומרות 'מדד אינטליגנציה: 51.8', 'עלות למשימת מדד: $0.72', 'קלט / פלט: $2.00 / $10.00', 'קלט במטמון: $0.10', 'אסימוני פלט בהרצת מדד: 67M', 'רצפת מאמץ: נמוכה'. עמודה ימנית 'GPT-5.6 Sol': שורות האומרות 'מדד אינטליגנציה: 47.0', 'עלות למשימת מדד: $1.99', 'קלט / פלט: $4.00 / $20.00', 'קלט במטמון: $0.40', 'אסימוני פלט בהרצת מדד: 90M', 'רצפת מאמץ: ללא'. כותרת תחתונה אומרת 'נתונים בלתי תלויים לפי Artificial Analysis v4.3.2 במאמץ מרבי; מחירי מחירון של הספק.'
Guides & Insights

GPT-6.1 Sol מול GPT-5.6 Sol: ארבע וחצי נקודות מדד, חצי מהחשבון, שתי רגרסיות

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Open​AI שחררה את GPT-6.1 Sol ב-29 בספטמבר 2026, אחד עשר שבועות אחרי GPT-5.6 Sol, שיצא ב-9 ביולי 2026 כספינת הדגל של הדור הקודם. שניהם עדיין נמכרים, שניהם עדיין זמינים לקריאה, והפער ביניהם בלוח הניטרלי הוא 4.8 נקודות — 51.8 לעומת 47.0 במדד האינטליגנציה של Artificial Analysis, כששניהם נמדדו במאמץ החשיבה המרבי על אותה סדרה של עשרה מבחנים. פער המחירים גדול בהרבה מפער הניקוד: 0.72 דולר לכל משימת אינדקס שהושלמה לעומת 1.99 דולר, ו-2.00/10.00 דולר למיליון טוקנים לעומת 4.00/20.00 דולר. זו הגרסה הקצרה. הגרסה הארוכה היא שהשדרוג אינו אחיד, ושניים מהמבחנים דווקא נסוגו לאחור.

מהו כל דגם, ומה החליף את מה

GPT-5.6 Sol היה הדגם הבכיר בסדרת 5.6 — מודל סגור, מבוסס API בלבד, עם חלון הקשר של 1,050,000 טוקנים, תקרת פלט של 128,000 טוקנים, קלט טקסט, תמונה וקבצים, וסולם הסקה הנע מללא ועד מקסימום. הוא תואר על ידי Open​AI כשכבה שנבנתה לעבודה הקשה ביותר: תהליכי עבודה סוכניים ארוכי טווח, הנדסת תוכנה מרובת קבצים, הסקה עמוקה — והתמחור בהתאם: $4.00 ו-$20.00 למיליון טוקנים, עם קלט במטמון ב-$0.40 וכתיבות למטמון ב-$5.00. מעל 272,000 טוקני קלט התמחור השתנה ל-$8.00 ו-$30.00, והוא הציע שכבת Batch ב-$2.50 ו-$15.00.

GPT-6.1 Sol הוא הדרג הבינוני של הדור שבא אחריו: מתחת ל-GPT-6 Astra, מעל ל-GPT-6 Luna, וכעת המודל ש-Open​AI מפנה אליו מפתחים רגישים לעלויות. הוא שומר על חלון של 1,050,000 טוקנים ומגבלת פלט של 128,000 טוקנים, מאריך את מועד סיום הידע מ-20 באפריל ל-30 באפריל 2026, ומצמצם את סולם המאמץ משש דרגות לחמש — low, medium (ברירת מחדל), high, xhigh, max. ה-none ערך ש-GPT-5.6 Sol קיבל מחזיר כעת שגיאה, וההנחיות של Open​AI למיגרציה מבהירות שההחלפה היא low, ולא שדרוג שקט.

כדאי לעצור על זה לרגע, מפני שזהו השינוי היחיד בגרסה שעולה כסף במקום לחסוך בו. צינור עיבוד שנעזר בnoneכדי לקבל קריאה זולה, מהירה וללא הסקה כבר לא יכול להגדיר כך, באף אחת משתי משפחות המודלים. המדרגה הזולה ביותר ב-GPT-6.1 Sol היא מדרגת הסקה, וטוקני הסקה מחויבים כטוקני פלט, בין אם אתם רואים אותם ובין אם לא.

הסולם, שליבה אחר שליבה

הלוח העצמאי מפרסם ציון ועלות הרצה עבור כל הגדרת מאמץ בשני הדגמים, מה שהופך את ההשוואה ראש בראש למשהו שימושי יותר מהשוואה בודדת. כשהם מיושרים בהגדרות שקולות:

• סולם המאמץ, GPT-6.1 Sol — מקסימום 51.8 ב-$0.72 לכל משימת אינדקס; xhigh 51.0 ב-$0.39; high 50.2 ב-$0.32; medium (ברירת המחדל) 47.8 ב-$0.21 • מהירות פלט — 59.7 טוקנים לשנייה עבור GPT-6.1 Sol לעומת 87.8 עבור GPT-5.6 Sol
• זמן עד למקטע הראשון — 332 שניות עבור GPT-6.1 Sol לעומת נתון מהיר יותר עבור GPT-5.6 Sol, מול חציון לוח של קרוב ל-4 שניות
• טוקני פלט בהרצת האינדקס — 67.2 מיליון עבור GPT-6.1 Sol לעומת 90.0 מיליון עבור GPT-5.6 Sol
• מחיר קלט / פלט — $2.00 / $10.00 לעומת $4.00 / $20.00
• קלט במטמון — $0.10 לעומת $0.40; כתיבות למטמון $2.50 לעומת $5.00
• תעריף אצווה — לא פורסם עבור GPT-6.1 Sol לעומת $2.50 / $15.00 עבור GPT-5.6 Sol
• מדרגת הקשר ארוך — מעל 272,000 טוקני קלט GPT-6.1 Sol מתמחר מחדש ל-$4.00 / $15.00 עבור הבקשה כולה לעומת $8.00 / $30.00 של GPT-5.6 Sol
• רצפת מאמץ — low לעומת none

שני דברים נובעים מהרשימה הזאת. הראשון הוא שהורדת המחיר היא מבנית ולא מבצעית: התעריף הסטנדרטי של GPT-6.1 Sol, 2.00 ו-10.00 דולר, נמוך מהתעריף של GPT-5.6 Sol באצווה של 2.50 ו-15.00 דולר, כך שאפילו המסלול המוזל של המודל הישן יקר יותר ממחיר המחירון של המודל החדש. השני הוא שהשדרוג אינו קו ישר בכל הנוגע להשהיה. GPT-6.1 Sol מייצר פלט לאט יותר בכשליש, ולקח לו 332 שניות עד לקטע הראשון בבדיקות הפרומפט הארוך של הלוח — אותו סדר גודל כמו 107 השניות של GPT-6 Sol ובערך פי שמונים מהחציון של הלוח. אם בניתם מוצר אינטראקטיבי על GPT-5.6 Sol, זוהי נסיגה תפקודית בלתי תלויה בכל מדד, והתיקון הוא ארכיטקטוני, לא פרמטר.

A generated hero card for a GPT-6.1 Sol versus GPT-5.6 Sol comparison, headed 'Four and a half index points, half the bill', with two badges reading 'GPT-6.1 Sol: $0.72 per index task' and 'GPT-5.6 Sol: $1.99 per index task', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

שתי הערכות נעו בכיוון הלא נכון

הרווח המשולב הוא 4.8 נקודות. המרכיבים אינם חיוביים באופן אחיד, וציוני ההערכה הפרטניים של המועצה מעידים על כך:

• SciCode — GPT-6.1 Sol 0.542 לעומת GPT-5.6 Sol 0.571. רגרסיה של 2.9 נקודות בקידוד מדעי.
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575.1 לעומת GPT-5.6 Sol Elo 1611.3. רגרסיה של 36 נקודות ב-Elo בעבודת ידע בעלת ערך כלכלי.
• Humanity's Last Exam — GPT-6.1 Sol 0.529 לעומת GPT-5.6 Sol 0.495. שיפור של 3.4 נקודות.
• Terminal-Bench 4.0 — GPT-6.1 Sol 0.561 לעומת GPT-5.6 Sol 0.399. שיפור של 16 נקודות, השינוי הבודד הגדול ביותר בזיווג.
• AA-Omniscience — GPT-6.1 Sol 41.5 לעומת GPT-5.6 Sol 22.0, שעוסק באמינות ידע ובהזיות ולא בשליפה גולמית.
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — חמשת הנותרים, שמשלימים את הציון המשולב ומהם מושג שאר השיפור של 4.8 נקודות.

מודל שטוב באופן ממשי בעבודת טרמינל, טוב באופן ניכר באמינות עובדתית, וגרוע באופן מדיד בקידוד מדעי וב־Elo של עבודה מקצועית — אינו מודל עדיף באופן מוחלט. זוהי נקודה אחרת על קו החזית, והוא הוצב שם במכוון: המסגור של OpenAI עצמה להשקת GPT-6.1 Sol הוא עלות לכל משימה שהושלמה באיכות הקרובה לזו של דגם הדגל, ולא ציון מקסימלי. אם עומס העבודה שלך הוא בצורת SciCode או בצורת GDPval, המספר המשולב אינו זה שחל עליך — והרגרסיה היא שכן.

ל-GPT-5.6 Sol עדיין יש את תוצאת ההקשר הארוך שפורסמה

המקום היחיד שבו למודל הישן יש נתון ולמודל החדש אין הוא דיוק אחזור בטווח ההקשר שבו משתנה המחירון של GPT-6.1 Sol. GPT-5.6 Sol מציג תוצאת MRCR v2 שפורסמה עם שמונה מחטים של 91.5% בטווח של 256,000 עד 512,000 טוקנים. ל-GPT-6.1 Sol אין מקבילה שפורסמה, ומעל 272,000 טוקני קלט כל הבקשה שלו מתומחרת מחדש ב-2× קלט ומטמון וב-1.5× פלט.

אם מחברים את שתי העובדות הללו יחד, הפלח שבו הכדאיות הכלכלית של המודל החדש היא החלשה ביותר הוא בדיוק הפלח שבו למודל הישן יש את החוזק המתועד היחיד. החיסכון אינו נעלם — $4.00 ו-$15.00 בשכבה המתומחרת מחדש לעומת $8.00 ו-$30.00 בשכבת ההקשר הארוך של GPT-5.6 Sol עצמו הם עדיין קיצוץ בחצי — אבל סיפור המחיר-החצי הוא סיפור של עומס עבודה כללי, וצינור אחזור בהקשר ארוך אינו כזה. אם זה עומס העבודה שלכם, GPT-5.6 Sol ב-$4.00 ו-$20.00 עם 91.5% מפורסמים הוא מקום שניתן להצדיק את ההישארות בו.

התוצאות האחרות שפורסמו של GPT-5.6 Sol נותרו בעינן, והן הסיבה לכך שצוותים מסוימים לא יזוזו: BrowseComp 90.4 עבור סוכני מחקר ברשת, Terminal-Bench 2.1 עם 88.8 ו-88.0, SWE-Bench Pro 64.6, Agents' Last Exam 53.6, OSWorld 2.0 עם 62.6. אלו דווחו על ידי Open​AI, על ההרנס של Open​AI, והם דווחו ביולי. מה שהשתנה מאז הוא שהלוח כעת מדרג את שני המודלים על סוויטה אחת עם מערך הגדרות אחד, והמודל הישן מפסיד בציון המשולב ובבעלות.

המיגרציה עצמה היא שינוי מחרוזת, למעט חריג אחד

אותו ספק, אותו שטח API, סמוכים בדירוג, אותו חלון ומגבלת פלט — לכן עבור רוב הסטאקים זהו מזהה מודל ומחיר שנחתך בחצי. החריגים ספציפיים וכדאי לנקוב בשמם לפני שאתם מפעילים את המתג.

אם הקוד שלך מגדיר את reasoning.effort ל-none או ל-minimal, הוא ייכשל במקום להתדרדר, ואילו low הוא התחליף המתועד. אם התעבורה שלך עולה על 272,000 אסימוני קלט, בדוק את המדרגה המתומחרת מחדש לפני שאתה מדמה את החיסכון. אם המוצר שלך תלוי בזמן עד לאסימון הראשון, מדוד לפני שאתה משיק, כי הנתון של 332 שניות של הלוח אינו שגיאת עיגול. ואם בהערכות שלך יש פרוסה בצורת SciCode או בצורת GDPval, הרץ את הפרוסה הזו על שני המודלים במקום לסמוך על המדד המשולב.

שני המודלים זמינים ב-OrcaRouter במחירי המחירון של OpenAI עצמה — GPT-6.1 Sol ב-$2.00 ו-$10.00 עם קלט במטמון ב-$0.10, GPT-5.6 Sol ב-$4.00 ו-$20.00 עם קלט במטמון ב-$0.40 — תחת מודל העברה שמעביר שינוי מחיר של OpenAI לצד שלנו באותו יום שבו הוא נכנס לתוקף, ולא אחרי שמשווק מחדש מנהל משא ומתן מחדש. מכיוון שהמחירון מועבר ללא שינוי ולא עם תוספת מחיר, החשבון במאמר הזה הוא החשבון שמקבלים: אותו מודל של $0.72 למשימה, אותה הפחתה בחצי, בלי פרימיום פלטפורמה שמתווסף באף אחד מהצדדים.

A screenshot of the OrcaRouter model page for openai/gpt-5.6-sol, showing the listing dated 2026-07-09, the model described as the flagship of OpenAI's GPT-5.6 series for deep multi-step reasoning and long-horizon agentic workflows, a 1.05M-token context with 128K maximum output, text, image and file input, and the list price of $4.00 input and $20.00 output per million tokens.

השימוש המעשי בכך ששניהם מאחורי נקודת קצה אחת הוא שההשוואה נשארת חיה. שלח תעבורה חדשה אל GPT-6.1 Sol, השאר את GPT-5.6 Sol במרחק שינוי קונפיגורציה אחד כגיבוי וכנתיב ההקשר הארוך, ותן למעבר האוטומטי לגיבוי לכסות את החלון שבו הזמינות של דגם הדגל בן החודשיים והפעלת Enterprise עדיין מתייצבות. הגירה שחותכת את החשבון בחצי ומזיזה שני תת-בנצ'מרקים לאחור אינה החלטה לקבל פעם אחת ולשכוח; היא החלטה לקבל לכל נתיב, ושכבת ניתוב היא מה שהופך את זה לזול.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

איפה שכל אחד שייך

• עבודה סוכנית וטרמינלית כללית — GPT-6.1 Sol. שש-עשרה נקודות ב-Terminal-Bench 4.0 וחצי מחיר — אין כאן תחרות צמודה.
• מהימנות עובדתית, מוצרים מבוססי תשובות מאחזור — GPT-6.1 Sol, בפער של כמעט עשרים נקודות ב-AA-Omniscience.
• תכנות מדעי — בדקו תחילה את ההערכות שלכם. לוח התוצאות מציג נסיגה של 2.9 נקודות, והמדד המשולב לא יחשוף אותה.
• עבודת ידע בעלת ערך כלכלי — אותה אזהרה. נסיגת ה-Elo של GDPval-AA היא 36 נקודות.
• אחזור בהקשר ארוך מעל 272,000 טוקנים — GPT-5.6 Sol, עד של-GPT-6.1 Sol יהיה מספר מפורסם בטווח הזה.
• משטחים אינטראקטיביים ורגישים לזמן תגובה — מדדו לפני מעבר. פלט מהיר יותר, טוקן ראשון איטי בהרבה.
• הקריאה הזולה ביותר ללא הסקה — אף אחד מהם. התצורה הזאת כבר לא קיימת במשפחה הזו.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית