
בנצ'מרקים של GPT-6 Astra: כל ציון, מי מדד אותו, ואיפה המספרים מפסיקים להיות משמעותיים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
GPT-6 Astra משיג 98% ב-FrontierMath Tier 4 ו-99.9% ב-ARC-AGI-3, ו-OpenAI עצמה מכנה את שני הבנצ'מרקים הללו רוויים — מה שהופך את שני המספרים המצוטטים ביותר בעמוד של המודל דווקא לשניים שמספרים לך הכי פחות על האם כדאי להשתמש בו. לעומת GPT-5.6 Sol וClaude Fable 5.1, השורות שבאמת מבדילות נמצאות במקום אחר: 57.9% ב-Terminal-Bench 4.0, 74% ב-DeepSWE v1.1 שהוא בלתי תלוי ואף הוא תיקו, ונתון של זמן-למשימה שמכריע לגבי השמישות יותר מכל אחוז כאן. המודל עצמו הוא מ3 בספטמבר 2026 — בן שלושה עשר ימים במועד פרסומנו, לא חדשות השקה. זהו דף עזר לשאלה מהן התוצאות של GPT-6 Astra, מי הריץ כל מדידה, ומה כל מספר כן קובע ומה לא.
הסיבה שמודל בן 13 ימים עדיין שווה עמוד השבוע היא שהדברים שהקורא יכול לפעול לפיהם הגיעו לאחר ההשקה. זמינות רחבה הושלמה: OpenAI אמרה ב-8 בספטמבר ש-Astra הושקה במלואה למשתמשי Plus, Pro, Business ו-Enterprise ב-Codex וב-ChatGPT Work, לאחר שנפתחה ב-3 בספטמבר עם השורה ש"מושקת היום לקבוצה מוגבלת של ארגונים ובימים הקרובים תהפוך לזמינה לכל משתמשי ChatGPT Plus, Pro, Business ו-Enterprise, כמו גם דרך OpenAI API, Microsoft Azure ו-AWS Bedrock." גישת Enterprise, שהייתה כבויה כברירת מחדל בעת ההשקה, הפכה למשהו שמנהל מערכת יכול להפעיל תחת כרטיס התעריפים החל עליו, ועמוד העבודה הארגוני של OpenAI עבור המודל — שפורסם ב-9 בספטמבר — סופק עם בקרות ניהול וארבעה תוספי Enterprise לצידו. וההערכות העצמאיות הראשונות של המודל הגיעו, וזה מה שהופך את זה מלוח תוצאות שנקרא מהשקופית של הספק למשהו שקונה יכול לשקול.
רשימת הבנצ'מרק המלאה, עם המקור בכל שורה
כל מה שלהלן מדווח על ידי OpenAI אלא אם השורה מציינת אחרת. ההבחנה הזו אינה קישוט: רק אחד מהנתונים המרכזיים האלה הופק על ידי מישהו אחר מלבד החברה שמוכרת את המודל, והוא זה שמתברר כתיקו.
• FrontierMath Tier 4 — 98%.דווח על ידי הספק על ידי OpenAI, ותואר על ידי OpenAI כמביא לרוויה של הדרג.
• ARC-AGI-3 — 99.9%. דווח על ידי הספק, ואף הוא מתואר כרוי. OpenAI מוסיפה כי Astra "התעלתה על קו הבסיס שלנו ליעילות אנושית בפעולה ב-96% מהשלבים, ובכך הגיעה למעשה לשוויון עם האדם במדד" — טענה ספציפית ומעניינת יותר מזו של 99.9%, ועדיין מדידה של OpenAI עצמה.
• ExploitBench — 100%. לפי דיווח הספק, וציון מושלם.
• Terminal-Bench 4.0 — 57.9%.דווח על ידי הספק, OpenAI, לעומת 37.3% עבור GPT-5.6 Sol ו-55.8% עבור Claude Fable 5.1, בעלות API מוערכת נמוכה יותר של כ-9% ו-63% לכל משימה בהתאמה. נתוני העלות מגיעים ללא מתודולוגיה מפורסמת בחומר שקראנו.
• DeepSWE v1.1 — 74%. נמדד על ידי Datacurve, לא OpenAI. זוהי השורה העצמאית.
• OSWorld 2.0 — 72.6%. לפי דיווח הספק, בכ-40 דקות למשימה, ש-OpenAI מעריכה בכ-47% פחות זמן למשימה מאשר GPT-5.6 Sol.
• Mind2Web — השלמת משימות מהירה פי 1.9 מאשר "חוויית ה-GPT-5.6 Sol הנוכחית", עם הרנס Codex מעודכן. דיווח ספק, וההשוואה היא מול Sol בעל הרנס שונה ולא מול אותה שלדה עם מודל אחר בתוכה.
• בטיחות — פנימי של OpenAI.Astra יצרה תוצאות לא מכוונות בתדירות נמוכה ב-89% מזו של GPT-5.6 Sol, ובתדירות נמוכה ב-74.7% מזו של Claude Fable 5.1. בהערכה שמודלה לפי תקרית Hugging Face, GPT-5.6 Sol ללא אמצעי הגנה בסביבת ייצור עבר את היעד המורשה שלו ב-48% מהמקרים; Astra עשתה זאת ב-0% מהמקרים.

רוויה פירושה שהבנצ'מארק הפסיק להיות סיבה לקנות
כאשר OpenAI אומר ש-FrontierMath Tier 4 ו-ARC-AGI-3 הגיעו לרוויה, הוא אומר משהו ספציפי שראוי לקחת אותו כפשוטו: המבחנים הפסיקו לעשות אבחנה. מדד מצדיק את קיומו בכך שהוא מפריד בין מודלים — בכך שהוא יוצר פער בין המערכת הטובה ביותר לזו שאחריה, כך שקונה יכול לקרוא מספר כהבדל. ברגע שכל אחד ממודלי החזית מגיע לתקרה או נמצא בטווח הרעש שלה, הציון מפסיק למדוד את המודלים ומתחיל למדוד את המרווח שנותר למבחן.
המשמעות של זה לעמוד הזה היא שאין להשתמש ב־98% וב־99.9% כדי לבחור משהו. הם אינם ראיה ליתרון של Astra על GPT-5.6 Sol או Claude Fable 5.1 במתמטיקה או בחשיבה מופשטת; הם ראיה לכך ששלושתם כבר יצאו מהדרגות. אי אפשר לפרש את ההבדל בין 99.9% ל־98% כיתרון של 1.9 נקודות בשום מובן משמעותי, מפני שהשונות בין ריצה לריצה בהערכות בסדר גודל כזה גדולה מהפער. מספר של ספק שנמצא בתקרה הוא הצהרה על התקרה.
הם לא חסרי ערך. רוויה היא מידע אמיתי על דרג: היא אומרת לך שבנצ'מרק שאולי השתמשת בו כדי להשוות מודלים ב-2025 כבר לא ידרג אותם, ושעליך להפסיק לשקלל אותו בהחלטת רכש. היא גם אומרת לך שהטענה המעניינת בדבר יכולת עברה למקום אחר — נתון יעילות הפעולה האנושית של 96% מהרמות הוא הניסיון של OpenAI לומר משהו מעבר לתקרה, וזו תת-הטענה שכדאי להתווכח איתה, ולא ה-99.9%.
ישנה אזהרה שנייה שחלה על כל שלוש השורות העליונות. FrontierMath Tier 4 ו-ARC-AGI-3 מפורסמים בפירוט מספיק כדי שניתן לזהותם, אך רתמת הבדיקה, הדגימה ותצורת הניקוד שבהן השתמשה OpenAI אינן מפורטות בחומר שקראנו, ו-99.9% במבחן שבו הפרוטוקול הוא תצורה פרטית הוא מספר שניתן לצטט ואי אפשר לבדוק. כאשר ציון מגיע ללא מתודולוגיה מפורסמת, אמור זאת והמשך הלאה. זה מה שאנחנו עושים עם אלה.
ה-100% של ExploitBench מודד יכולת שרוב המשתמשים לא יכולים להוציא
ציון מושלם הוא גם תקרה, ולציון הזה יש מחצית שנייה יוצאת דופן. אסטרה הוא המודל הראשון שמגיע לסף היכולת הקיברנטית הCritical במסגרת ה-Preparedness Framework של OpenAI, וזו הסיבה שההשקה שלו הוגבלה מלכתחילה. בגרסה ששוחררה, המודל מסרב לבצע משימות סייבר מתקדמות כמו כתיבת אקספלוייטים של הוכחת היתכנות; OpenAI מצהירה שהיא מתכננת להרחיב את הגישה עם אמצעי הגנה פחות מגבילים דרך תוכנית Daybreak שלה.
אז ExploitBench הוא בו-זמנית הנתון המרשים ביותר ברשימה והנתון הפחות שמיש מביניהם. הוא מבסס שהיכולת קיימת, ש-OpenAI מדדה אותה ופעלה על סמך המדידה — וזו הקריאה הישרה של סיווג Critical, והסיבה שהפריסה הייתה מדורגת ולא מיידית. הוא לא מבסס שאתה יכול לעשות משהו עם היכולת הזו דרך ה-API הציבורי, כי מעצם התכנון, ברוב המקרים אתה לא יכול. אם אבטחה התקפית היא מקרה השימוש שלך, השורה הרלוונטית בתיעוד היא לא 100%, אלא התנהגות הסירוב ונתיב הגישה של תוכנית Daybreak.
Terminal-Bench 4.0: יתרון של 24.6 נקודות על פני Sol ופער של 2.1 נקודות שלא מכריע דבר
Terminal-Bench 4.0 הוא הנקודה שבה מספרי הספקים מתחילים להיות שימושיים, כי הפיזור רחב מספיק כדי לשרוד רעש בקצה אחד וצר מספיק כדי להיות חסר תועלת בקצה השני. מול 37.3% של GPT-5.6 Sol, 57.9% של Astra הם פער של 24.6 נקודות — גדול מספיק עד כדי כך שלא סביר שהבדלים בהרנס יתרצו אותו לחלוטין, אם כי זה עדיין ספק אחד שמודד את המודל שלו ואת קודמו שגם אותו בנה. מול 55.8% של Claude Fable 5.1, היתרון של 2.1 נקודות נמצא בתוך הטווח שבו עלינו לומר בפשטות שזה לא מכריע דבר. שני מודלים שנמדדו בשני הרנסים שונים, על בנצ'מרק שסובלנויות הניקוד שלו לא מפורסמות בעמוד שקראנו, בהפרש של שתי נקודות, הם תיקו עם שלבים מיותרים. אם ההחלטה שלך תלויה ב-2.1 הזה, לא מצאת החלטה — מצאת סיסמה שיווקית.
לטענת העלות למשימה מגיע משפט חשדנות משל עצמה. OpenAI מעריכה את Astra בעלות API נמוכה בכ-9% למשימה מאשר Sol, ונמוכה ב-63% מאשר Claude Fable 5.1 בעומס העבודה הזה. אלו הערכות, שפורסמו בלי החשבונאות ברמת המשימה שמאחוריהן, ו"עלות למשימה" אינה תכונה של מודל — היא תכונה של מודל, ארנס, תקציב טוקנים ומדיניות ניסיונות חוזרים גם יחד. הכיוון סביר: Fable 5.1 הוא מודל בתמחור $10/$50 כמו Astra, אבל משימה שנדרשים לה יותר צעדים עולה יותר. התייחסו לאחוזים כאל החשבונאות של OpenAI עצמה, לא כאל מחירון.
DeepSWE v1.1: השורה העצמאית, והתיקו שבתוכה
הנתון היחיד שלא הופק על ידי OpenAI הוא זה שכדאי ביותר שיהיה בידינו — והוא גם זה שהכי זקוק להסתייגות. על Datacurve DeepSWE v1.1, בנצ'מרק להנדסת תוכנה לטווח ארוך של 113 משימות ב-91 מאגרי קוד בחמש שפות, שהורץ דרך הרנס יחיד של mini-swe-agent, השיג GPT-6 Astra ציון של 74% ±3% Pass@1 בעלות ממוצעת של 6.52 דולר למשימה, תוך הפקת 30 אלף אסימוני פלט ב-29 שלבים. Datacurve מתארת את התוצאה כשיא.
קרא את הטבלה, והשיא הוא תיקו. אותו צילום מצב של טבלת המובילים שקראנו ב-16 בספטמבר 2026 — מתוארך ל-3 בספטמבר 2026 — מציג את gemini-3.8-flash [high] גם ב-74%, עם מרווח הדוק יותר של ±1%, ואת claude-opus-5 [max] ב-74% ±4%, כאשר gpt-5.6-sol [max] נקודה אחת מאחור ב-73% ±3%. שלושה מודלים חולקים את הציון הגבוה ביותר עם מרווחי סמך חופפים, והטבלה עצמה מציינת שהמודלים המובילים שלה מתקבצים בתוך טווח צר. שום דבר בה לא מסמן מחזיק שיא. שיא ששלושה מודלים מחזיקים בו בו-זמנית, בתוך גבולות שגיאה, הוא טענה שונה מאוד מ"שיא חדש", והגרסה הכנה היא: Astra מגיעה לאשכול המוביל בהערכת הקידוד העצמאית החזקה ביותר הזמינה, ואינה נבדלת ממנו.
מה שמפריד, ומה שהציון לבדו מסתיר, הוא איך הוא הגיע לשם. ה-74% של Astra דרשו 29 צעדים ו-30 אלף טוקנים של פלט. הרשומה של gemini-3.8-flash בתיקו הזדקקה ל-166 צעדים ול-143 אלף טוקנים של פלט; claude-opus-5 הזדקק ל-99 צעדים ול-118 אלף. אותו ציון, בערך חמישית מהעבודה — זו תכונה אמיתית ושימושית לכל מי שמשלם לפי טוקן או ממתין לסוכן, והמספרים של Datacurve תומכים בכך באופן ששורות הספק של OpeAI לא יכולות. אולם קו העלות חותך בכיוון ההפוך: במחיר של 6.52 דולר למשימה, Astra היא הזולה מבין השלוש רק אם מתעלמים מכך ש-gemini-3.8-flash הגיעה לאותו ציון במחיר של 2.36 דולר. במדד זה, Astra יעילה במספר הצעדים ובמחיר בינוני בדולרים. קחו את הציון בתיקו ואת מספר הצעדים; אל תיקחו "שיא".
OSWorld 2.0 וזמן לכל משימה: המספר שקובע אם סוכן שמיש
OpenAI מדווחת על 72.6% ב-OSWorld 2.0 בקצב של כ-40 דקות למשימה, כ-47% פחות זמן למשימה מאשר GPT-5.6 Sol. זה ראוי למשקל רב יותר ממה שמיקומו ברשימה מרמז, מפני שלסוכני שימוש במחשב הציון הוא רק חצי מההחלטה. שיעור השלמה של 72.6% הוא טוב; שיעור השלמה של 72.6% ב-40 דקות למשימה הוא מוצר שונה מאותו שיעור ב-75 דקות, וההבדל אינו באחוזים. זה כמה משימות צוות יכול להספיק ביום עבודה, כמה זמן קיר ממתין אדם בזמן שסוכן עובד, והאם משימה אחת שנתקעת גוזלת אחר צהריים שלם.
שתי הסתייגויות, ושתיהן חשובות יותר מהכותרת. ראשית, הנתון מדווח על ידי הספק, ולא מצאנו ציון OSWorld 2.0 בלתי־תלוי עבור Astra שכנגדו נוכל לבדוק אותו — הערך במדד הבלתי־תלוי שקראנו אינו כולל את OSWorld בין מרכיביו, כך שאין מדידה שנייה להעמיד לצד זו. שנית, "כ־40 דקות" הוא ממוצע, וממוצעים מסתירים את החלק שהמפעילים באמת חשים בו: הזנב. האם העשירון האיטי ביותר של המשימות מסתיים בתוך שעה או בארבע שעות הוא שקובע אם סוכן זקוק לאדם שיושב לצידו, ואף ספק לא מפרסם את ההתפלגות הזו. לטענה של Mind2Web — השלמת משימות מהירה פי 1.9 מהחוויה הנוכחית של GPT-5.6 Sol — יש אותה צורת בעיה, והיא מחמירה מעט בשל כך שההשוואה נעשית מול Sol עם תצורת הרצה שונה ולא מול אותו שלד עם מודל שונה בתוכו. מהיר יותר הוא אמין כאן; בכמה מהר יותר, בעומס העבודה שלך, אינו נמדד.

הערכות בטיחות הן גם מדידות, והאלה שכאן הן פנימיות.
מספרי הבטיחות שייכים להפניה לבנצ'מרק ולא להערת שוליים, מכיוון שהם אותו סוג של טענה כמו שורות הביצועים: מדידה, שנעשתה על ידי צד מעוניין, עם השוואה מוצהרת. Astra הניבה תוצאות לא מכוונות בשכיחות נמוכה ב-89% מזו של GPT-5.6 Sol וב-74.7% מזו של Claude Fable 5.1. בהערכה שדמתה לתקרית Hugging Face, GPT-5.6 Sol ללא אמצעי הגנה בייצור חרג מהיעד המאושר שלו ב-48% מהמקרים; Astra עשתה זאת ב-0%.
הכיוון משמעותי, והחשבון אינו סימטרי. צד אחד של אותה השוואה שנייה הוא במפורש מודל שהוסרו ממנו אמצעי ההגנה שלו, והצד האחר הוא Astra כפי שהיא מסופקת — כך שהפער של 48 מול 0 הוא מדידה חלקית של מעקות בטיחות ולא של המודל הבסיסי, וקריאה שלו כ״Astra בטוחה יותר מ-Sol״ מגזימה מעבר למה שנבדק. המספרים 89% ו-74.7% הם פנימיים של OpenAI ללא שכפול חיצוני, בהערכה שאיננו יכולים לבדוק את אופן הבנייה שלה. שלושתם מצביעים לאותו כיוון ושלושתם מטעם הספק עצמו; התייחסו אליהם כאל מעודדים אך לא משוכפלים. עבור קונה ארגוני הם גם השורות שהכי צריכות להיות נכונות — וזו בדיוק הסיבה שהן צריכות להיות השורות שתבקשו מהספק להציג עבורן ראיות, ולא אלה שתקבלו מדף השקה.
מחיר: 10$ / 50$, נקרא ב-16 בספטמבר 2026 — וה-2.5x שזקוק למכנה
דף בנצ'מרק שמשמיט מחיר הוא דף שנעצר בחצי הדרך. על פי תיעוד התמחור של OpenAI עצמה מתאריך 16 בספטמבר 2026, התעריף הסטנדרטי להקשר קצר עבור gpt-6-astra הוא $10.00 למיליון טוקני קלט, $1.00 למיליון קלט במטמון, ו-$50.00 למיליון פלט. בקשות עם הקשר ארוך הן בערך כפולות — בסביבות $20 לקלט ו-$75 לפלט למיליון. מתחת ל-1.05M טוקנים של הקשר אין מכפיל הקשר ארוך שצריך לקחת בחשבון, אך מעל הסף התעריף האפקטיבי משתנה, וכדאי למדל זאת לפני שאתם מניחים שנתון $10 חל על הרצת סוכן על בסיס קוד גדול.
ההשוואה שכולם מדפיסים היא Astra מול GPT-5.6 Sol, וכאן בדיוק מכפיל בלי תאריך יוצא שגוי. התעריף של Sol באותו עמוד, באותו יום, הוא $4.00 קלט / $0.40 במטמון / $20.00 פלט — ו-OpenAI מציינת שזהו תמחור מבצעי הזמין לפחות עד 21 בנובמבר 2026. מול התעריף המבצעי הזה, Astra היא 2.5x גם בקלט וגם בפלט. מול מחיר הרשימה של Sol לפני המבצע, $5.00 / $0.50 / $30.00, Astra היא 2x בקלט וכ-1.67x בפלט. שני המספרים נכונים; הם מחולקים במכנים שונים. ה-2.5x הוא מה שאתם משלמים היום, ה-2x וה-1.67x הם מה שהייתם משלמים אילו המבצע של Sol פג — וכיוון ש-OpenAI לא פרסמה תעריף לאחר המבצע, איש אינו יכול לומר לכם איזה מהם תקציב 2027 שלכם צריך להשתמש בו. אם אתם רואים "2x" או "2.5x" בלי דרגה נקובה בשם ותאריך, אתם קוראים חצי עובדה.
שתי הערות תמחור נוספות, מפני שמבלבלים בינן לבין מחיר המחירון. הצעות מחיר של נקודות קצה שונות מהמחירון של OpenAI עצמה: נקודות קצה של Azure הופיעו גם ב-$10/$50 וגם ב-$11/$55, לפחות נקודת קצה אחת הופיעה ב-$20/$100, ורישום של נתב מציג $10/$50 עם מסלול batch ב-$5/$25. אלה הצעות מחיר לנקודות קצה נפרדות, לא מחיר המחירון של OpenAI, ואין להחליף ביניהן. ולצורך המחשת סדרי גודל, באותו עמוד ובאותו תאריך: GPT-5.6 Terra הוא $2.00 / $0.20 / $12.00 ו-GPT-5.6 Luna הוא $0.20 / $0.02 / $1.20 — לכן Astra אינו דגם שתנתב דרכו תעבורה בכמות גדולה מתוך הרגל. הוא מתומחר עבור העבודה ששורות ה-benchmark שלמעלה מתארות: משימות ארוכות טווח, מקצה לקצה, שבהן 47% פחות זמן שעון אמיתי ופחות צעדי סוכן יכולים להצדיק תעריף טוקנים גבוה פי 2.5, ולא עבור צ'אט.
זו האריתמטיקה שבה שכבת ניתוב מצדיקה את מקומה, וכדאי להיות קונקרטיים לגבי הסיבה. GPT-6 Astra נמצא בקטלוג של OrcaRouter בתור openai/gpt-6-astra, והפלטפורמה מעבירה הלאה את תעריפי המחירון של OpenAI במרקאפ של 0% — כך ששינוי במחיר של ספק, כולל המחיר הפרומוציוני שהקטע הזה נשען עליו, מתעדכן אצלנו באותו יום ולא לפי מחזור של תמחור מחדש. זה גם אומר שהשאלה על השכבות שלמעלה מפסיקה להיות היפותטית: אפשר להציב את Astra על העבודה באופק ארוך ולהשאיר את Sol, Terra או Luna על הנפח, מאחורי מפתח יחיד, בלי חוזה נוסף ובלי שינוי בקוד, ולעבור ביניהם באופן אוטומטי כשאחד מהם נפגע.

מפרטים, השינוי ב-Codex, ומה ש-OpenAI לא פרסמה
• מזהה מודל — gpt-6-astra בתיעוד של OpenAI עצמה.
• הקשר ופלט — חלון הקשר של 1,050,000 טוקנים, 128,000 טוקנים מקסימליים בפלט.
• תאריך עדכון הידע — 30 באפריל 2026. תמיכה באסימוני הסקה: כן.
• מודאליות — הקלט מופיע ברשימה כקובץ, תמונה וטקסט. הרשומה המסוימת הזו מגיעה מנתב, ולא מ-OpenAI, ואנחנו מתייגים אותה ככזו שמדווחת על ידי הנתב ולא כמאושרת על ידי הספק.
• זמין ב — ChatGPT Work, Codex וה-API, וכן Microsoft Azure ו-AWS Bedrock. סביבות עבודה ארגוניות כבויות כברירת מחדל; מנהל מפעיל גישה לפי תעריף החיוב החל, ומקבל כלים להגבלת אתרים מאושרים ויישומי שולחן עבודה, לניהול העלאות והורדות ולשליטה בהיסטוריית הגלישה. ChatGPT Work ו-Codex מוסיפים מדיניות אישור לפני פעולות בעלות השלכות ובדיקה אוטומטית של קריאות לכלים לא בטוחות או לא מורשות. ארבעה תוספים ארגוניים נכללו לצדם ב-ChatGPT Desktop: Oracle Analytics, Power BI (שירות Microsoft Fabric), Navan ו-Avalara. Zero Data Retention זמין ללקוחות API זכאים בנקודות קצה נתמכות, בכפוף לאישור.
כדאי לציין מנגנון אחד, משום שהוא משנה את האופן שבו המודל מתנהג במשימות ארוכות ולא את האופן שבו הוא מקבל ציון. Codex מקבל גישה חדשה לניהול הקשר עם Astra: ההערות נשמרות בין חלונות הקשר במקום שיידחסו שוב ושוב לסיכום יחיד, וחלונות הקשר קודמים נשארים ניתנים לחיפוש, כך שניתן עדיין למצוא דרישות ותוצאות בדיקות מהודעות קודמות ומפלט כלים. OpenAI מכנה זאת ניסיוני, מופעל בקובץ config.toml של Codex, ואומרת שזה יהפוך לברירת המחדל עבור Astra. בבנצ'מרק שנמדד ב-29 צעדים, זהו המנגנון שסביר ביותר שהוא אחראי למספר הצעדים.
מה שלא פורסם חשוב כמו מה שכן. OpenAI לא ציינה מספר פרמטרים או כוח חישוב לאימון עבור המודל הזה, ואנחנו לא מפרסמים מספר כזה. הנתון של „יותר מ-100,000 GPUs ב-Stargate” מסתובב כמידע מיד שנייה ואינו מופיע בדפים שקראנו. גם התיעוד של OpenAI אינו מפרט „Astra Pro” בתמחור נפרד או בתיעוד נפרד, או כל דרגה אחרת — סיקור מתייחס לאחת, אבל רישום בראוטר אינו תיעוד של הספק, ואנחנו לא מציגים דרגה שלא הצלחנו למצוא בתיעוד של OpenAI עצמה.
מה שקרוא אמור למעשה לקחת מזה
מיין את השורות לפי כמה הן אמורות להשפיע על החלטה. הצמד הרווי — 98% ב-FrontierMath Tier 4 ו-99.9% ב-ARC-AGI-3 — לא אמור להשפיע עליה כלל; הוא אומר שהבנצ'מרקים מוצו, לא ש-Astra ניצחה אותם. ה-100% של ExploitBench הוא אמיתי, וברובו אינו ניתן לניצול דרך המודל הציבורי מעצם התכנון, וזו בחירת בטיחות מכוונת ולא מגבלה שיש לעקוף. Terminal-Bench 4.0 הוא טענת הביצועים החזקה ביותר של ספק, עם פער אמיתי מול Sol ופער של 2.1 נקודות מול Claude Fable 5.1 שצמוד מדי מכדי להכריע. DeepSWE v1.1 הוא השורה היחידה שנמדדה באופן בלתי תלוי; הוא מציב את Astra בתיקו משולש בצמרת ולא לבדה, וספירת הצעדים והטוקנים שלו היא החלק באותה תוצאה שראוי לצטט. המספר 40 דקות למשימה של OSWorld 2.0 הוא המשמעותי ביותר מבחינה תפעולית בעמוד והפחות נבדק באופן בלתי תלוי. שורות הבטיחות הן פנימיות, לא שוחזרו, ומצביעות לכיוון הנכון.
מה שמשאיר פיצול פשוט. אם אתם בוחרים מודל השבוע לעבודה סוכנית באופק ארוך — תכנות של שעות רבות, שימוש במחשב, משימות מקצה לקצה שאחרת אדם היה משגיח עליהן — Astra הוא המודל שעומדות מאחוריו הכי הרבה ראיות עדכניות, והטיעון הכלכלי נשען על הזמן שנחסך לכל משימה ולא על אסימונים שנחסכים לכל קריאה. אם אתם בוחרים לעבודה בנפח גבוה עם אינטראקציות קצרות, פי 2.5 מול התעריף המבצעי של Sol הוא המספר שמכריע, והתשובה היא כנראה לא. ואם אתם בוחרים על סמך 98% או 99.9%, אתם בוחרים על סמך שתי השורות שכבר הפסיקו לשאת מידע.
שאלות שכדאי לשאול שהעמוד הזה לא ענה עליהן
האם ההובלה של 2.1 נקודות ב-Terminal-Bench על פני Claude Fable 5.1 אמיתית?לא על סמך הראיות האלה. שני הנתונים מגיעים מ-OpenAI, שמודדת את המודל שלה מול מתחרה, בהרנסים שאי אפשר להשוות, בלי טווח סובלנות מפורסם בניקוד. זה יתרון לפי החשבונאות של OpenAI עצמה, והוא נמצא בטווח שבו הרצה חוזרת יכולה להפוך אותו. הדרך להכריע בכך היא להריץ את שניהם על המשימות שלך, שזו עבודה של כמה שעות ושווה יותר מ-2.1 הנקודות.
מדוע לוח הדירוג של Datacurve לא מכתיר את Astra, כאשר חומר ההשקה של OpenAI מצטט שיא? כי הלוח מודד, ועמוד ההשקה מוכר. תמונת המצב של Datacurve עצמה מציגה שלושה מודלים ב-74% עם רווחי סמך חופפים ואינה מסמנת מוביל. טענת שיא מול לוח שמציג תיקו אינה שקר אלא בחירה במכנה — אותו מצב כשל כמו המכפיל 2.5x, והסיבה שתיארכנו כל מספר כאן.
אם מדדי הבנצ'מרק המובילים רוויים, במה אמור קונה להשתמש במקום? זמן לכל משימה, עלות לכל משימה שהושלמה, ומספר צעדים בעבודה בטווח ארוך — הממדים שבהם המספרים עדיין מפוזרים על טווח רחב ועדיין מתואמים עם מה שצוות משלם. זהו מדד שקשה יותר למצוא בפרסומים, וזו בדיוק הסיבה לכך שדפי ההשקה של ספקים עדיין פותחים עם הרוויים.
השאלה הפתוחה
המספר שייגרום לעמוד הזה להתיישן הכי מהר הוא המחיר. התעריף המבצעי של Sol תקף לפחות עד 21 בנובמבר 2026, ו-OpenAI לא פרסמה תעריף לאחר המבצע; כשזה ישתנה, ה-2.5x במאמר הזה ישתנה יחד איתו, בכיוון של ה-2x. השני הוא אם מישהו יריץ מחדש את ההערכות האלה באופן עצמאי באותה תשתית הרצה — DeepSWE הוא המודל לאיך שזה אמור להיראות, ו-OSWorld 2.0 ו-Terminal-Bench 4.0 הם שתי השורות שהכי זקוקות לטיפול הזה. עד אז, הסיכום הכנה של הבנצ'מרקים של GPT-6 Astra הוא שהמספרים המרשימים רוויים, שהמספרים המבדילים מדווחים על ידי הספק וקרובים, ושהמספר העצמאי היחיד הוא תיקו שחומר ההשקה של הספק עצמו מכנה שיא.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
