
הציון העצמאי הראשון של GPT-6.1 Sol פורסם: 0.84 נקודות מאחורי Astra, בפחות מרבע מעלות המשימה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 397 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 195 tok/s
- OrcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- xAISpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
כל כתיבה על GPT-6.1 Sol שפורסמה בימים שאחרי ההשקה של OpenAI ב-DevDay ב-29 בספטמבר 2026 — כולל הפוסט הזה בבלוג — נשאה את אותה הסתייגות: נתוני היכולות היו של הספק, ואף צד שלישי לא דירג את המודל. ההסתייגות הזו כבר אינה רלוונטית. ל-Artificial Analysis יש שורה של GPT-6.1 Sol במדד ה-Intelligence Index שלו, בהרצה במאמץ חשיבה מקסימלי, וזהו הנתון הראשון בחייו הקצרים של המודל שלא הופק על ידי OpenAI. הוא עומד על 51.8 לעומת 52.7 עבור GPT-6 Astra ו-47.5 עבור GPT-6 Sol — פער של פחות מנקודה אחת מדגל האנייה ב-$10/$50, ועלייה של 4.3 נקודות מהמודל ש-GPT-6.1 Sol מחליף. המספר שהופך את השורה למעניינת הוא זה שלצדה: הלוח מתמחר את הרצת ההערכה שמאחורי כל ציון, והרצת האינדקס של GPT-6.1 Sol עלתה $0.72 למשימה, בעוד זו של Astra עלתה $3.26. פי ארבעה וחצי מהכסף תמורת 0.84 נקודות — זוהי כל ההשוואה בשורה אחת, וכיום זהו קו מדוד ולא ניסוח של ספק.
השורה עצמה, ועל מה היא הורצה

Artificial Analysis מפרסמת את מדד האינטליגנציה שלה כמורכב מעשר הערכות, והגרסה שרצה ב-30 בספטמבר 2026 הייתה v4.3.2 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience ו-AA-LCR v1.1. כל שלושת מודלי OpenAI בכתבה הזו נמצאים על אותה גרסה, כך שההשוואה שלהלן היא השוואה שקולה, באופן שטבלת ההשקה של הספק עצמו לעולם אינה. הלוח גם רושם את תאריך ההשחרור שיש לו עבור המודל — 2026-09-29, תאריך DevDay — ומעריך אותו בתצורת מאמץ מקסימלי, שהיא ההגדרה שהעמוד מציין בכותרת שלו עצמו.
• מדד האינטליגנציה — 51.8 עבור GPT-6.1 Sol (max), 52.7 עבור GPT-6 Astra (max), 47.5 עבור GPT-6 Sol (max).
• עלות לכל משימת מדד — $0.72 עבור GPT-6.1 Sol, $3.26 עבור Astra, $1.05 עבור GPT-6 Sol. זהו הנתון של לוח הדירוג עצמו עבור מה שעלתה הרצה של הערכה מלאה אחת של המדד, ולא מחירון.
• טוקנים של פלט שהושקעו בהרצה — 67.2 מיליון עבור GPT-6.1 Sol, 60.0 מיליון עבור Astra, 76.8 מיליון עבור GPT-6 Sol. הפרשנות של AA עצמה מכנה 67 מיליון "מצומצם למדי" לעומת חציוני של 82 מיליון בלוח הדירוג, וזהו ניצחון שני, שקט יותר, על המודל שאותו הוא מחליף.
• מהירות פלט — 66.8 טוקנים בשנייה עבור GPT-6.1 Sol, 57.0 עבור Astra, 76.2 עבור GPT-6 Sol.
• המחירים כפי שלוח הדירוג מציג אותם — $2.00 קלט ו-$10.00 פלט למיליון טוקנים עבור GPT-6.1 Sol, עם קלט שמור במטמון ב-$0.10 וכתיבות מטמון ב-$2.50. ארבעת המספרים האלה תואמים בדיוק את עמוד המחירים של הספק, וזה הדבר הכי פחות דרמטי והכי שימושי בשורה הזו: רשימה בלתי תלויה של התעריפים שכבר ציטטנו.
הערת מסגור אחת לפני שהמספרים ישמשו כתחמושת. האינדקס של AA כולל עשר הערכות, וההערכות ש-OpenAI פתחה איתן את ההודעה שלה — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 — אינן ביניהן. AA מריצה גרסה משלה של AutomationBench, שאינה אותה מערכת הרצה כמו גרסת AutomationBench שהספק ציטט. לכן התיעוד העצמאי אינו מאשר ואינו מפריך את ארבע טענות הכותרת מפוסט ההשקה; הוא מודד מערך משימות שונה במידה ניכרת, וכדאי לקרוא אותו כחוות דעת שנייה על אופי המודל ולא כהכרעה לגבי אותם משפטים ספציפיים.
Astra עדיין מנצחת, בפחות מנקודה, תמורת פי ארבעה וחצי מהכסף

שני המודלים חושפים סולם מאמץ, והלוח כבר פרסם ציון ועלות הרצה לכל דרגה בשני הסולמות. כשהם מסודרים זה לצד זה, הסולמות אומרים משהו שהשוואה כותרתית אחת לא יכולה לומר: התצורה הטובה ביותר של GPT-6.1 Sol לא מתחרה בתצורה הטובה ביותר של Astra. היא מתחרה בתצורה השנייה בטיבה של Astra.
• GPT-6.1 Sol, מקסימום — 51.8, $0.72 לכל משימת אינדקס. GPT-6 Astra, מקסימום — 52.7, $3.26.
• GPT-6.1 Sol, גבוה במיוחד — 51.0, $0.39. GPT-6 Astra, גבוה במיוחד — 52.4, $2.31.
• GPT-6.1 Sol, גבוה — 50.2, $0.32. GPT-6 Astra, גבוה — 50.9, $1.73.
• GPT-6.1 Sol, בינוני — 47.8, $0.21. GPT-6 Astra, בינוני — 49.6, $1.54.
• GPT-6.1 Sol, נמוך — 42.1, $0.13. GPT-6 Astra, נמוך — 45.8, $0.82.
Astra מובילה בכל מדרגה, שזה הסיכום הכנה של ההתמודדות וגם החלק הכי פחות מעניין בה. החלק המעניין הוא שער החליפין. אם אתם רוצים את התצורה הזולה ביותר של Astra שמנצחת את התוצאה הטובה ביותר של GPT-6.1 Sol, זו Astra ב-xhigh: 52.4 מול 51.8, בעלות של 2.31 דולר לעומת 0.72 דולר. כלומר 0.56 של נקודת אינדקס תמורת 1.59 דולר יותר לכל הרצת הערכה — בערך פי 3.2 מהעלות תמורת פחות מאחוז אחד מהציון. אם נעים בכיוון ההפוך ומורידים את GPT-6.1 Sol ל-xhigh, מוותרים על 0.8 נקודות בעוד החשבון יורד ל-0.39 דולר, שזה זול פי 5.9 מ-xhigh של Astra ותשיעית מהרצת המאמץ המרבי של Astra.
קיימת קריאה שנייה של אותו סולם שטוענת נגד קניית Astra במאמץ מקסימלי. ארבעת השלבים הנמוכים יותר של Astra זולים יותר מהמקסימום שלה, וה-xhigh שלה נמוך ב-0.29 נקודות מהמקסימום שלה — קצת יותר מחצי אחוז מהציון תמורת קיצוץ של 29% בעלות ההרצה. כל שיחת רכש על הצמד הזה שמתחילה מ״Astra במקסימום״ ומסתיימת ב״Astra עולה פי 4.5״ משאירה מחוץ להשוואה את השלבים הזולים יותר של Astra עצמה.
שש הערכות עוברות ל-Astra, שתיים עוברות ל-GPT-6.1 Sol, שתיים בתיקו
הציון המשולב מסתיר פיצול. כשמדרגים הערכה אחר הערכה במאמץ מרבי, GPT-6.1 Sol אינו Astra חלש במעט באופן אחיד — הוא טוב יותר בשני דברים וגרוע יותר בשישה.
• GDPval-AA — Elo 1575.1 של GPT-6.1 Sol מול 1541.9 של Astra, יתרון של 33 נקודות במשימות עבודה מקצועיות. זהו הניצחון העצמאי הבודד הגדול ביותר של המודל הזול יותר.
• AA-LCR v1.1, הסקה בהקשר ארוך — 0.830 מול 0.807. GPT-6.1 Sol מוביל.
• AA-Briefcase v1.1 — Elo 1564.2 מול 1568.9. Astra ביתרון של 4.7.
• AutomationBench-AA — 0.649 מול 0.685. Astra ביתרון של 3.6 נקודות.
• Terminal-Bench 4.0 — 0.561 מול 0.591. Astra ביתרון של 3.0 נקודות.
• SciCode — 0.542 מול 0.565. Astra ביתרון של 2.3 נקודות.
• Humanity's Last Exam — 0.529 מול 0.547. Astra ביתרון של 1.8 נקודות.
• AA-Omniscience — 41.5 מול 43.4. Astra ביתרון של 1.9 נקודות.
• GDP.pdf ו-CritPt — תיקו מוחלט ב-0.310 וב-0.317 בהתאמה, בשני המודלים.
שתיים מהשורות האלה שוות יותר ממיקומן ברשימה. הפער ב-GDPval-AA הוא המקום היחיד שבו היתרון של המודל הזול יותר גדול מספיק כדי לשרוד החלפה של מערכת ההרצה, והוא נופל בדיוק על עומס העבודה שקו המיצוב של הספק מצהיר עליו — עבודה מקצועית עתירת מסמכים. ושני מקרי התיקו המוחלטים נמצאים בהערכות עם הפערים הצרים ביותר, וזו תזכורת לכך שפער משולב של 0.84 נקודות נבנה משורות שכל אחת מהן נעה בנפרד בין ניצחון של 33 נקודות להפסד של 3.6 נקודות.
בהשוואה לדגם שאותו הוא מחליף, השיפור אמיתי אך לא אחיד.
ההשוואה שחשובה לכל מי שכבר מריץ GPT-6 Sol במסלול ייצור היא זו ש-6.1 Sol עורך מול קודמו, והתיעוד העצמאי חד יותר בעניין הזה מאשר הפוסט של הספק היה. שמונה מתוך עשר הערכות משתפרות. שתיים נסוגות לאחור.
• SciCode — GPT-6.1 Sol משיג 0.542 בעוד GPT-6 Sol השיג 0.576. המודל החדש יותר גרוע בקוד מדעי ב-3.5 נקודות.
• AA-LCR v1.1 — 0.830 עבור 6.1 Sol לעומת 0.837 עבור GPT-6 Sol. הבדל של חוט השערה, אך בכיוון הלא נכון, בהערכת ההקשר הארוך.
• AA-Omniscience — 41.5 לעומת 27.1. זהו השינוי הגדול ביותר בשורה: זינוק של 14.4 נקודות בהערכת הידע, והדיוק בסט הזה עולה מ-0.545 ל-0.621.
• שיעור ההזיות על אותו סט — 0.543 עבור GPT-6.1 Sol, ירידה מ-0.601 עבור GPT-6 Sol, ועדיין מעל 0.513 של GPT-6 Astra. AA-Omniscience מפצל את הציון שלו ל"צדק" ו"טעה בביטחון", והפיצול הזה הוא המקום שבו רענון 6.1 מצדיק את עצמו: הוא מודל משמעותית פחות רמאי מ-Sol, והוא עדיין הרמאי ביותר מבין השלושה.
• Terminal-Bench 4.0 — 0.561 לעומת 0.439, רווח של 12.2 נקודות. AA-Briefcase — 1482.8 ל-1564.2 Elo. GDP.pdf — 0.248 ל-0.310.
הפרשנות היא שזה היה רענון של ידע וכלים יותר מאשר רענון של יכולת הסקה. ההערכות שהשתנו הכי הרבה הן אלו שמתגמלות ידיעת דברים ולא המצאתם; ההערכה שירדה היא צרה וטכנית. כל מי שעבר ל-6.1 Sol בגלל חיסכון במטמון מקבל את שיפור הידע כבונוס, ולא צריך להניח שהוא חל על כל מסגרת הרצה שהם מריצים.
היכן שהלוח מדרג אותו, ומה שנמצא מעל

בסדר ברירת המחדל של מדד האינטליגנציה בטבלת המובילים, GPT-6 Astra במאמץ מקסימלי נמצא במקום השביעי ו-GPT-6.1 Sol במאמץ מקסימלי נמצא במקום העשירי, כאשר GPT-6 Sol במאמץ מקסימלי במקום ה-20. תשע השורות שמעל GPT-6.1 Sol הן שתי קונפיגורציות של Astra, שלוש קונפיגורציות של Claude Opus 5.5, קונפיגורציה אחת של Claude Sonnet 5.5 ושתי קונפיגורציות של Claude Fable 5.1 — כך שהמודל ש-GPT-6.1 Sol הכי קרוב אליו הוא ספינת הדגל של המשפחה שלו, והמודל שהוא למעשה דחק בסדר הזה הוא קודמו, שלושה עשר מקומות למטה.
בטל את הגדרת המאמץ, והסדר מתכווץ באופן שחשוב לתכנון עלויות: GPT-6.1 Sol ב-xhigh מדורג במקום ה-13, ב-high במקום ה-15, ב-medium במקום ה-19 וב-low במקום ה-35, בעוד Astra נמצא במקום ה-14 ב-high, במקום ה-16 ב-medium ובמקום ה-26 ב-low. במילים אחרות, GPT-6.1 Sol ב-xhigh מדורג גבוה מ-Astra ב-high בלוח, ו-GPT-6.1 Sol ב-medium מדורג גבוה מ-Astra ב-low. המאמץ הוא מנוף גדול יותר כאן מבחירת המודל, לפחות בין שני אלה.
מה לעשות עם המספר, בכנות
הטענה של הספק שנבדקה בשורה הזו הייתה ש-GPT-6.1 Sol כמעט משתווה לדגם הדגל במחיר של כחמישית ממחיר דגם הדגל. הגרסה הבלתי תלויה של המשפט הזה היא: הוא נמצא בפער של עד 0.84 נקודות מדד מדגם הדגל, והרצת ההערכה שעומדת מאחורי הציון שלו עלתה 22% מזו של דגם הדגל. זה קרוב מספיק לטענה כדי שאף אחד לא אמור להרגיש שהוטעה בגללה, וזו הצהרה חזקה יותר מ"לא מאומת" בכל היבט שחשוב לקונה.
מה שהשורה הזו לא עושה הוא לתמחר את עומס העבודה שלך. ריצת אינדקס היא שילוב ספציפי של משימות, והמספר שקובע חשבון אמיתי הוא מחירון התעריפים מול פרופיל הטוקנים שלך — ולכן שורת המטמון היא עדיין השורה שצריך למדל: הקלט המטמון של GPT-6.1 Sol במחיר $0.10 לעומת $1.00 של Astra הוא פער של פי עשרה שאף ציון אינדקס לא נוגע בו. בצד שלנו, אותה העברת מחירים חלה: OrcaRouter מגישה את GPT-6 Astra, GPT-6 Sol ו-GPT-6 Luna במחירי המחירון של OpenAI עצמה בלי תוספת רווח, כך שביום שתעריף של ספק משתנה, התעריף בצד שלנו משתנה איתו במקום להמתין לחוזה שני. GPT-6.1 Sol לא נמצא בנתיבים שלנו — הקטלוג הציבורי מחזיר "model not found" עבור openai/gpt-6.1-sol היום, ואין דרך כנה לתאר דגם שאנחנו לא יכולים לשרת. מה שמפתח API אחד כן קונה לך כרגע הוא הזוג שהבנצ'מרק באמת מתווכח עליו — Astra לעבודה הקשה ביותר, Sol לנפח — כשמחירי המחירון של הספקים מועברים ללא תוספת ומעבר אוטומטי בין ספקים כשאחד מהם נכשל.
שני דברים היו מחדדים את זה עוד יותר. רתמת בדיקות עצמאית שנייה על אותו מודל תגיד לנו אם ההובלה של GDPval-AA היא תכונה של המודל או של אותה הערכה, וזו נקודת הנתונים החסרה המועילה ביותר בשורה. ומדידה עצמאית של שכבת ההקשר הארוך של 272,000 טוקנים תהיה חשובה יותר מעוד נקודת ציון משולבת, כי שם התמחור של המשפחה הזו מפסיק להיות זול.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
