כרטיס Hero שנוצר עבור GPT-6.1 Sol, שכותרתו 'הציון העצמאי הגיע', עם תגים שעליהם נכתב 'שוחרר: 29 בספטמבר 2026', 'מדד האינטליגנציה: 52 במאמץ מקסימלי' ו'עלות לכל משימת מדד: $0.72', כותרת תחתונה שעליה נכתב 'נתונים עצמאיים לפי Artificial Analysis, מדד v4.3.2, נקרא ב-30 בספטמבר 2026', והלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

הציון העצמאי הראשון של GPT-6.1 Sol פורסם: 0.84 נקודות מאחורי Astra, בפחות מרבע מעלות המשימה

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

כל כתיבה על GPT-6.1 Sol שפורסמה בימים שאחרי ההשקה של OpenAI ב-DevDay ב-29 בספטמבר 2026 — כולל הפוסט הזה בבלוג — נשאה את אותה הסתייגות: נתוני היכולות היו של הספק, ואף צד שלישי לא דירג את המודל. ההסתייגות הזו כבר אינה רלוונטית. ל-Artificial Analysis יש שורה של GPT-6.1 Sol במדד ה-Intelligence Index שלו, בהרצה במאמץ חשיבה מקסימלי, וזהו הנתון הראשון בחייו הקצרים של המודל שלא הופק על ידי OpenAI. הוא עומד על 51.8 לעומת 52.7 עבור GPT-6 Astra ו-47.5 עבור GPT-6 Sol — פער של פחות מנקודה אחת מדגל האנייה ב-$10/$50, ועלייה של 4.3 נקודות מהמודל ש-GPT-6.1 Sol מחליף. המספר שהופך את השורה למעניינת הוא זה שלצדה: הלוח מתמחר את הרצת ההערכה שמאחורי כל ציון, והרצת האינדקס של GPT-6.1 Sol עלתה $0.72 למשימה, בעוד זו של Astra עלתה $3.26. פי ארבעה וחצי מהכסף תמורת 0.84 נקודות — זוהי כל ההשוואה בשורה אחת, וכיום זהו קו מדוד ולא ניסוח של ספק.

השורה עצמה, ועל מה היא הורצה

A screenshot of the Artificial Analysis model page for GPT-6.1 Sol at maximum reasoning effort, headed 'GPT-6.1 Sol (max) Intelligence, Performance & Price Analysis', with a class-rank strip above the summary naming the model's Intelligence, Speed, Cost and Verbosity positions out of 221 models. The summary paragraph reports an Intelligence Index score of 52 against a median of 26 across 221 models in the class, $2.00 per million input tokens and $10.00 per million output tokens, $0.72 per task to evaluate on the Intelligence Index, and 67 tokens per second against an average of 74, with 67 million output tokens generated against a board median of 82 million; a panel to its right lists a 1M-token context window together with text-and-image input. The page names Intelligence Index v4.3.2 and its ten constituent evaluations.

Artificial Analysis מפרסמת את מדד האינטליגנציה שלה כמורכב מעשר הערכות, והגרסה שרצה ב-30 בספטמבר 2026 הייתה v4.3.2 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience ו-AA-LCR v1.1. כל שלושת מודלי OpenAI בכתבה הזו נמצאים על אותה גרסה, כך שההשוואה שלהלן היא השוואה שקולה, באופן שטבלת ההשקה של הספק עצמו לעולם אינה. הלוח גם רושם את תאריך ההשחרור שיש לו עבור המודל — 2026-09-29, תאריך DevDay — ומעריך אותו בתצורת מאמץ מקסימלי, שהיא ההגדרה שהעמוד מציין בכותרת שלו עצמו.

• מדד האינטליגנציה — 51.8 עבור GPT-6.1 Sol (max), 52.7 עבור GPT-6 Astra (max), 47.5 עבור GPT-6 Sol (max).
• עלות לכל משימת מדד — $0.72 עבור GPT-6.1 Sol, $3.26 עבור Astra, $1.05 עבור GPT-6 Sol. זהו הנתון של לוח הדירוג עצמו עבור מה שעלתה הרצה של הערכה מלאה אחת של המדד, ולא מחירון.
• טוקנים של פלט שהושקעו בהרצה — 67.2 מיליון עבור GPT-6.1 Sol, 60.0 מיליון עבור Astra, 76.8 מיליון עבור GPT-6 Sol. הפרשנות של AA עצמה מכנה 67 מיליון "מצומצם למדי" לעומת חציוני של 82 מיליון בלוח הדירוג, וזהו ניצחון שני, שקט יותר, על המודל שאותו הוא מחליף.
• מהירות פלט — 66.8 טוקנים בשנייה עבור GPT-6.1 Sol, 57.0 עבור Astra, 76.2 עבור GPT-6 Sol.
• המחירים כפי שלוח הדירוג מציג אותם — $2.00 קלט ו-$10.00 פלט למיליון טוקנים עבור GPT-6.1 Sol, עם קלט שמור במטמון ב-$0.10 וכתיבות מטמון ב-$2.50. ארבעת המספרים האלה תואמים בדיוק את עמוד המחירים של הספק, וזה הדבר הכי פחות דרמטי והכי שימושי בשורה הזו: רשימה בלתי תלויה של התעריפים שכבר ציטטנו.

הערת מסגור אחת לפני שהמספרים ישמשו כתחמושת. האינדקס של AA כולל עשר הערכות, וההערכות ש-OpenAI פתחה איתן את ההודעה שלה — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 — אינן ביניהן. AA מריצה גרסה משלה של AutomationBench, שאינה אותה מערכת הרצה כמו גרסת AutomationBench שהספק ציטט. לכן התיעוד העצמאי אינו מאשר ואינו מפריך את ארבע טענות הכותרת מפוסט ההשקה; הוא מודד מערך משימות שונה במידה ניכרת, וכדאי לקרוא אותו כחוות דעת שנייה על אופי המודל ולא כהכרעה לגבי אותם משפטים ספציפיים.

Astra עדיין מנצחת, בפחות מנקודה, תמורת פי ארבעה וחצי מהכסף

A generated scoreboard titled 'GPT-6.1 Sol - the independent scoreboard', listing six rows: Intelligence Index 51.8 at maximum effort, cost per index task $0.72 against GPT-6 Astra's $3.26, output tokens on the run 67.2 million, output speed 66.8 tokens per second, price $2.00 input and $10.00 output per million tokens with cached input at $0.10, and release date September 29, 2026. A footer reads that all figures are per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.

שני המודלים חושפים סולם מאמץ, והלוח כבר פרסם ציון ועלות הרצה לכל דרגה בשני הסולמות. כשהם מסודרים זה לצד זה, הסולמות אומרים משהו שהשוואה כותרתית אחת לא יכולה לומר: התצורה הטובה ביותר של GPT-6.1 Sol לא מתחרה בתצורה הטובה ביותר של Astra. היא מתחרה בתצורה השנייה בטיבה של Astra.

• GPT-6.1 Sol, מקסימום — 51.8, $0.72 לכל משימת אינדקס. GPT-6 Astra, מקסימום — 52.7, $3.26.
• GPT-6.1 Sol, גבוה במיוחד — 51.0, $0.39. GPT-6 Astra, גבוה במיוחד — 52.4, $2.31.
• GPT-6.1 Sol, גבוה — 50.2, $0.32. GPT-6 Astra, גבוה — 50.9, $1.73.
• GPT-6.1 Sol, בינוני — 47.8, $0.21. GPT-6 Astra, בינוני — 49.6, $1.54.
• GPT-6.1 Sol, נמוך — 42.1, $0.13. GPT-6 Astra, נמוך — 45.8, $0.82.

Astra מובילה בכל מדרגה, שזה הסיכום הכנה של ההתמודדות וגם החלק הכי פחות מעניין בה. החלק המעניין הוא שער החליפין. אם אתם רוצים את התצורה הזולה ביותר של Astra שמנצחת את התוצאה הטובה ביותר של GPT-6.1 Sol, זו Astra ב-xhigh: 52.4 מול 51.8, בעלות של 2.31 דולר לעומת 0.72 דולר. כלומר 0.56 של נקודת אינדקס תמורת 1.59 דולר יותר לכל הרצת הערכה — בערך פי 3.2 מהעלות תמורת פחות מאחוז אחד מהציון. אם נעים בכיוון ההפוך ומורידים את GPT-6.1 Sol ל-xhigh, מוותרים על 0.8 נקודות בעוד החשבון יורד ל-0.39 דולר, שזה זול פי 5.9 מ-xhigh של Astra ותשיעית מהרצת המאמץ המרבי של Astra.

קיימת קריאה שנייה של אותו סולם שטוענת נגד קניית Astra במאמץ מקסימלי. ארבעת השלבים הנמוכים יותר של Astra זולים יותר מהמקסימום שלה, וה-xhigh שלה נמוך ב-0.29 נקודות מהמקסימום שלה — קצת יותר מחצי אחוז מהציון תמורת קיצוץ של 29% בעלות ההרצה. כל שיחת רכש על הצמד הזה שמתחילה מ״Astra במקסימום״ ומסתיימת ב״Astra עולה פי 4.5״ משאירה מחוץ להשוואה את השלבים הזולים יותר של Astra עצמה.

שש הערכות עוברות ל-Astra, שתיים עוברות ל-GPT-6.1 Sol, שתיים בתיקו

הציון המשולב מסתיר פיצול. כשמדרגים הערכה אחר הערכה במאמץ מרבי, GPT-6.1 Sol אינו Astra חלש במעט באופן אחיד — הוא טוב יותר בשני דברים וגרוע יותר בשישה.

• GDPval-AA — Elo 1575.1 של GPT-6.1 Sol מול 1541.9 של Astra, יתרון של 33 נקודות במשימות עבודה מקצועיות. זהו הניצחון העצמאי הבודד הגדול ביותר של המודל הזול יותר.
• AA-LCR v1.1, הסקה בהקשר ארוך — 0.830 מול 0.807. GPT-6.1 Sol מוביל.
• AA-Briefcase v1.1 — Elo 1564.2 מול 1568.9. Astra ביתרון של 4.7.
• AutomationBench-AA — 0.649 מול 0.685. Astra ביתרון של 3.6 נקודות.
• Terminal-Bench 4.0 — 0.561 מול 0.591. Astra ביתרון של 3.0 נקודות.
• SciCode — 0.542 מול 0.565. Astra ביתרון של 2.3 נקודות.
• Humanity's Last Exam — 0.529 מול 0.547. Astra ביתרון של 1.8 נקודות.
• AA-Omniscience — 41.5 מול 43.4. Astra ביתרון של 1.9 נקודות.
• GDP.pdf ו-CritPt — תיקו מוחלט ב-0.310 וב-0.317 בהתאמה, בשני המודלים.

שתיים מהשורות האלה שוות יותר ממיקומן ברשימה. הפער ב-GDPval-AA הוא המקום היחיד שבו היתרון של המודל הזול יותר גדול מספיק כדי לשרוד החלפה של מערכת ההרצה, והוא נופל בדיוק על עומס העבודה שקו המיצוב של הספק מצהיר עליו — עבודה מקצועית עתירת מסמכים. ושני מקרי התיקו המוחלטים נמצאים בהערכות עם הפערים הצרים ביותר, וזו תזכורת לכך שפער משולב של 0.84 נקודות נבנה משורות שכל אחת מהן נעה בנפרד בין ניצחון של 33 נקודות להפסד של 3.6 נקודות.

בהשוואה לדגם שאותו הוא מחליף, השיפור אמיתי אך לא אחיד.

ההשוואה שחשובה לכל מי שכבר מריץ GPT-6 Sol במסלול ייצור היא זו ש-6.1 Sol עורך מול קודמו, והתיעוד העצמאי חד יותר בעניין הזה מאשר הפוסט של הספק היה. שמונה מתוך עשר הערכות משתפרות. שתיים נסוגות לאחור.

• SciCode — GPT-6.1 Sol משיג 0.542 בעוד GPT-6 Sol השיג 0.576. המודל החדש יותר גרוע בקוד מדעי ב-3.5 נקודות.
• AA-LCR v1.1 — 0.830 עבור 6.1 Sol לעומת 0.837 עבור GPT-6 Sol. הבדל של חוט השערה, אך בכיוון הלא נכון, בהערכת ההקשר הארוך.
• AA-Omniscience — 41.5 לעומת 27.1. זהו השינוי הגדול ביותר בשורה: זינוק של 14.4 נקודות בהערכת הידע, והדיוק בסט הזה עולה מ-0.545 ל-0.621.
• שיעור ההזיות על אותו סט — 0.543 עבור GPT-6.1 Sol, ירידה מ-0.601 עבור GPT-6 Sol, ועדיין מעל 0.513 של GPT-6 Astra. AA-Omniscience מפצל את הציון שלו ל"צדק" ו"טעה בביטחון", והפיצול הזה הוא המקום שבו רענון 6.1 מצדיק את עצמו: הוא מודל משמעותית פחות רמאי מ-Sol, והוא עדיין הרמאי ביותר מבין השלושה.
• Terminal-Bench 4.0 — 0.561 לעומת 0.439, רווח של 12.2 נקודות. AA-Briefcase — 1482.8 ל-1564.2 Elo. GDP.pdf — 0.248 ל-0.310.

הפרשנות היא שזה היה רענון של ידע וכלים יותר מאשר רענון של יכולת הסקה. ההערכות שהשתנו הכי הרבה הן אלו שמתגמלות ידיעת דברים ולא המצאתם; ההערכה שירדה היא צרה וטכנית. כל מי שעבר ל-6.1 Sol בגלל חיסכון במטמון מקבל את שיפור הידע כבונוס, ולא צריך להניח שהוא חל על כל מסגרת הרצה שהם מריצים.

היכן שהלוח מדרג אותו, ומה שנמצא מעל

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Sol — the independent scoreboard', with both columns carrying the same six labels. Left column 'GPT-6.1 Sol (max)': Intelligence Index 51.8, cost per index task $0.72, SciCode 0.542, long-context reasoning 0.830, AA-Omniscience 41.5, hallucination rate 0.543. Right column 'GPT-6 Sol (max)': Intelligence Index 47.5, cost per index task $1.05, SciCode 0.576, long-context reasoning 0.837, AA-Omniscience 27.1, hallucination rate 0.601. A footer reads 'Figures per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.'

בסדר ברירת המחדל של מדד האינטליגנציה בטבלת המובילים, GPT-6 Astra במאמץ מקסימלי נמצא במקום השביעי ו-GPT-6.1 Sol במאמץ מקסימלי נמצא במקום העשירי, כאשר GPT-6 Sol במאמץ מקסימלי במקום ה-20. תשע השורות שמעל GPT-6.1 Sol הן שתי קונפיגורציות של Astra, שלוש קונפיגורציות של Claude Opus 5.5, קונפיגורציה אחת של Claude Sonnet 5.5 ושתי קונפיגורציות של Claude Fable 5.1 — כך שהמודל ש-GPT-6.1 Sol הכי קרוב אליו הוא ספינת הדגל של המשפחה שלו, והמודל שהוא למעשה דחק בסדר הזה הוא קודמו, שלושה עשר מקומות למטה.

בטל את הגדרת המאמץ, והסדר מתכווץ באופן שחשוב לתכנון עלויות: GPT-6.1 Sol ב-xhigh מדורג במקום ה-13, ב-high במקום ה-15, ב-medium במקום ה-19 וב-low במקום ה-35, בעוד Astra נמצא במקום ה-14 ב-high, במקום ה-16 ב-medium ובמקום ה-26 ב-low. במילים אחרות, GPT-6.1 Sol ב-xhigh מדורג גבוה מ-Astra ב-high בלוח, ו-GPT-6.1 Sol ב-medium מדורג גבוה מ-Astra ב-low. המאמץ הוא מנוף גדול יותר כאן מבחירת המודל, לפחות בין שני אלה.

מה לעשות עם המספר, בכנות

הטענה של הספק שנבדקה בשורה הזו הייתה ש-GPT-6.1 Sol כמעט משתווה לדגם הדגל במחיר של כחמישית ממחיר דגם הדגל. הגרסה הבלתי תלויה של המשפט הזה היא: הוא נמצא בפער של עד 0.84 נקודות מדד מדגם הדגל, והרצת ההערכה שעומדת מאחורי הציון שלו עלתה 22% מזו של דגם הדגל. זה קרוב מספיק לטענה כדי שאף אחד לא אמור להרגיש שהוטעה בגללה, וזו הצהרה חזקה יותר מ"לא מאומת" בכל היבט שחשוב לקונה.

מה שהשורה הזו לא עושה הוא לתמחר את עומס העבודה שלך. ריצת אינדקס היא שילוב ספציפי של משימות, והמספר שקובע חשבון אמיתי הוא מחירון התעריפים מול פרופיל הטוקנים שלך — ולכן שורת המטמון היא עדיין השורה שצריך למדל: הקלט המטמון של GPT-6.1 Sol במחיר $0.10 לעומת $1.00 של Astra הוא פער של פי עשרה שאף ציון אינדקס לא נוגע בו. בצד שלנו, אותה העברת מחירים חלה: OrcaRouter מגישה את GPT-6 Astra, GPT-6 Sol ו-GPT-6 Luna במחירי המחירון של OpenAI עצמה בלי תוספת רווח, כך שביום שתעריף של ספק משתנה, התעריף בצד שלנו משתנה איתו במקום להמתין לחוזה שני. GPT-6.1 Sol לא נמצא בנתיבים שלנו — הקטלוג הציבורי מחזיר "model not found" עבור openai/gpt-6.1-sol היום, ואין דרך כנה לתאר דגם שאנחנו לא יכולים לשרת. מה שמפתח API אחד כן קונה לך כרגע הוא הזוג שהבנצ'מרק באמת מתווכח עליו — Astra לעבודה הקשה ביותר, Sol לנפח — כשמחירי המחירון של הספקים מועברים ללא תוספת ומעבר אוטומטי בין ספקים כשאחד מהם נכשל.

שני דברים היו מחדדים את זה עוד יותר. רתמת בדיקות עצמאית שנייה על אותו מודל תגיד לנו אם ההובלה של GDPval-AA היא תכונה של המודל או של אותה הערכה, וזו נקודת הנתונים החסרה המועילה ביותר בשורה. ומדידה עצמאית של שכבת ההקשר הארוך של 272,000 טוקנים תהיה חשובה יותר מעוד נקודת ציון משולבת, כי שם התמחור של המשפחה הזו מפסיק להיות זול.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית