כרטיס כותרת עם הכיתוב 'GPT-6 Astra ב-Codex' ולצדו כיתוב המשנה 'הערות חוצות־חלונות, רמות מאמץ, והחשבון האמיתי', השורה 'המודל שוחרר ב-3 בספטמבר 2026 - עמוד העזר אומת ב-16 בספטמבר 2026', ושלושה כרטיסים מתויגים עבור config.toml, הערות בתוספת היסטוריה ניתנת לחיפוש, ועלות לכל סשן.
Guides & Insights

GPT-6 Astra ב-Codex: הערות חוצות חלונות, רמות מאמץ, והחשבון האמיתי

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

GPT-6 Astra הוא מודל מ-2026-09-03, והדף הזה אינו סיקור השקה — זהו מסמך הייחוס שמאפשר לכוון את סוכן הקידוד שלך אליו כעת, כשהוא זמין באופן נרחב. הסיבה שמפתח יעבור אליו היא מנגנון אחד ספציפי, וכדאי להבין אותו לפני שמוציאים עליו משהו: במקום לדחוס סשן ארוך לתקציר מאבד-מידע אחד בכל פעם שהחלון מתמלא, Codex עם GPT-6 Astra שומר הערות בין חלונות הקשר ומשאיר חלונות הקשר קודמים ניתנים לחיפוש, כך שדרישה שציינת לפני ארבעים תורות ופלט הבדיקה שנכשל לפני עשרה תורות — שניהם עדיין ניתנים לשליפה במקום להימחק בתקצור. OpenAI מכנה את התכונה ניסיונית, מפעילה אותה עם שורה בקובץ config.toml של Codex שלך, ואומרת שהיא תהפוך לברירת המחדל עבור Astra. כל מה שלמטה — התצורה המדויקת, רמות המאמץ, התוצאות הנמדדות, וחשבון סשן מפורט שמציין את שורת הקלט השמור במטמון — נקרא מהדפים של OpenAI עצמה ב-2026-09-16, וכל נתון של צד שלישי מסומן ככזה.

שני דברים קרו השבוע שמשנים את המשוואה בכל הנוגע לאימוץ שלו. ב-12 בספטמבר 2026, המוביל של Co​dex ב-Ope​nAI פרסם פוסט-מורטם המאשר שניסוי ניהול ההקשר עצמו הכיל באג — הוא גרם לעצירות מוקדמות ותגובות להודעות מיושנות, והושבת עבור כ-4,000–5,000 המשתמשים שהשתמשו בו — ו-Ope​nAI הוציאה איפוס שימוש מלא למשתמשי Co​dex ו-Astra בחצות שבין 12 ל-13 בספטמבר. באותו שבוע, סביבות עבודה ארגוניות שבהן Astra היה כבוי כברירת מחדל בהשקה הפכו לניתנות לניהול תחת כרטיס התעריפים שלהן. אז העמדה הכנה היא: המנגנון שווה אימוץ, הבנייה עדיין נעה מתחת לרגליים שלך, וכדאי לנסות אותו על ענף ולא על דדליין.

מה באמת חדש ב-Codex עם GPT-6 Astra?

בקש מכל סוכן קידוד לעבוד במשך שש שעות ותיתקל באותו קיר. חלון ההקשר מתמלא, הארנס מתמצת את התמליל לבלוק צפוף אחד כדי לפנות מקום, והתמצית מאבדת מידע בדיוק בדרך שמזיקה — הסיבה שתיקון קודם נכשל, הצורה המדויקת של בדיקה שנכשלת, אילוץ שהמשתמש הזכיר בדרך אגב בסיבוב השלישי. פרט שנשלף, לא פרט מסוכם, הוא הדבר שרצית באמת.

האינטגרציה של Astra עם Codex משנה את הצורה של זה. התיעוד של OpenAI ל-Codex מציין זאת במפורש: "Astra שומרת הערות בין חלונות הקשר ויכולה לחפש הודעות קודמות ותוצאות כלים מאותה משימה." ההערות עמידות וניתנות לכתיבה; ההיסטוריה שמאחוריהן נשארת קריאה, כך שאפשר עדיין לחפש בחלון קודם את הראיות המקוריות גם לאחר שההערה עליהן נכתבה. דרישות ותוצאות בדיקה מהודעות קודמות ומפלט כלים נשארות ניתנות למציאה.

OpenAI מציינת במפורש שזו אינה עבודה גמורה. מסמך התצורה שלה מתאר את הדגל כ"הפעל ניהול הקשר ניסיוני (כבוי כברירת מחדל)" ואומר שהתכונה "משתמשת בהערות ובהיסטוריה הניתנת לחיפוש כדי לשמר פרטים שנצברו". התיעוד גם מציין שהיא "אינה זמינה עם התחברות מסוג Business, Enterprise או מפתח API בעת ההשקה". גם זה אינו הקשר אינסופי — המודל עדיין מבצע הסקה בתוך חלון סופי, וכל קריאה חוזרת של הערה מוקדמת צורכת את תקציב הקלט של אותו תור. החלון הוא 1,050,000 טוקנים עם מקסימום של 922,000 טוקני קלט, לפי תיעוד המודלים של OpenAI; מנגנון ההערות יושב מעל זה, והוא אינו מחליף אותו.

התצורה, בדיוק כפי ש-Ope​nAI מתעדת אותה

ההגדרה היא צאצא של הטבלה [features] בקובץ config.toml של Codex שלך — הקובץ נמצא ב-~/.codex/ אלא אם כן דרסת את CODEX_HOME. נתיב המפתח המתועד הוא features.context_management.experimental_mode, מסוג בוליאני, והערך הוא true:

[features.context_management]
experimental_mode = true

אם כבר יש לך טבלת [features] בקובץ, הוסף את המפתח היחסי בתוכה במקום להכריז על הטבלה פעמיים:

[features]
context_management.experimental_mode = true

השתמשו בצורה אחת או באחרת. פוסטים קהילתיים על הדגל מדווחים שהצהרה על הנתיב המנוקד בשורש ואחר כך פתיחת טבלת [features] בהמשך אותו קובץ עלולות להיכשל בפרסור כטבלה מוצהרת מחדש — זה כלל של TOML ולא של OpenAI — אבל אנשים נכווים מזה, אז בחרו צורה אחת והיצמדו אליה. לאחר העריכה, התחילו חדשה משימה: ההגדרה אינה חלה בדיעבד על סשן שכבר פועל.

החלק העוסק במודל באותו קובץ אינו יוצא דופן, והתיעוד של Ope​nAI מתאר ישירות את המפתחות האלה — model הוא "Model to use", והברירת מחדל של model_provider היא openai:

מודל = "gpt-6-astra"
ספק_מודל = "openai"
מאמץ_חשיבה_של_המודל = "גבוה"

אזהרה אחת לגבי קריאת גרסאות תיעוד. אסמכתת התצורה של Codex מפרטת את model_reasoning_effort כמקבל minimal, low, medium, high ו-xhigh, ומציינת ש-xhigh תלוי במודל — בעוד שעמוד המודל של OpenAI ב-API עבור gpt-6-astra מתעד את reasoning.effort כ-low, medium, high, xhigh ו-max. הסליידר בלקוח וה-API אינם מתארים את אותה קבוצה, לכן הגדירו effort במפורש ואמתו מה הלקוח שלכם קיבל במקום להניח.

בחירת המודל — וכלל הגישה שמכשיל אנשים

התיעוד של מודל Codex של OpenAI מציג את צורת ה-CLI ישירות: codex -m gpt-6-astra. בהפעלה אינטראקטיבית, /model מחליף את המודל ומכוונן את מאמץ החשיבה; בהרצה חד-פעמית, codex exec -m gpt-6-astra "Review the current changes" פועל באותה צורה. באפליקציית הדסקטופ ובהרחבה ל-IDE, בקרת המודל נמצאת מתחת לקומפוזר.

כלל הגישה הוא המקום שבו אנשים טועים, וכדאי לקרוא אותו פעמיים כיוון שלשתי התכונות יש שערים שונים:

• המודל — זמין ב-ChatGPT Work, Co​dex וב-API, וגם מוצע ב-Microsoft Azure וב-AWS Bedrock. עמוד ההשקה של Ope​nAI אומר ש-Astra "מושק היום לקבוצה מוגבלת של ארגונים, ובימים הקרובים יהיה זמין לכל משתמשי ChatGPT Plus, Pro, Business ו-Enterprise".

• ניהול ההקשר הניסיוני — מצומצם יותר. התיעוד של Ope​nAI מציין שהוא "דורש התחברות ל-ChatGPT ב-Plus, Pro או Pro Lite" ושהוא "אינו זמין עם התחברות של Business, Enterprise או מפתח API בהשקה".

השורה השנייה היא זו שצריך להפנים. אפשר לקרוא ל-gpt-6-astra עם מפתח API, ואפשר לשלם עליו במסלול Business — אבל תכונת ההערות החוצת־חלונות לא תהיה שם. אם מנגנון ההערות הוא הסיבה שאתם עוברים, אתם זקוקים להתחברות ל-ChatGPT מסוג Plus, Pro או Pro Lite בלקוח Codex, ולא למפתח API. OpenAI מציגה זאת כזמינות שתלויה ב"הפריסה, שיטת ההתחברות שלכם והלקוח שלכם", שזו הגרסה המנומסת של אותו דבר.

A screenshot of OpenAI's official Codex models documentation showing the model and reasoning control beneath the composer set to '5.6 Sol Extra High', a note that Ultra mode uses subagents, and a Recommended models row of three cards - Astra described as the most capable model for complex work across code, apps and research with advanced reasoning and computer use, 5.6 Sol for complex coding and cybersecurity, and 5.6 Terra as the balanced lower-cost model. A GPT-5.5 retirement notice dated October 14, 2026 appears above.

שתי הסתייגויות נוספות, המסומנות כדיווחים ולא כתיעוד של הספק. הסיקור של ההשקה קובע כי נדרשת גרסה 0.153.0 ואילך של Co​dex CLI עבור Astra; לא הצלחנו לאשר את רצפת הגרסה הזו בעמודים של Ope​nAI עצמה. ותיעוד Co​dex מתאר ערכות מוגדרות מראש של בורר המודלים — Astra Light, Astra Medium, Astra Extra High, המוצעות לחשבונות Pro, Business ($100) ו-Enterprise זכאים לצד סליידר החשיבה. אלו עמדות בבורר, לא מוצרים נפרדים: Ope​nAI מתעדת מזהה מודל אחד, gpt-6-astra, עם סט מפרטים אחד ומחיר אחד, ואינה מפרסמת מפרט או תעריף נפרדים לשום תצורה של "Astra Pro" או "Astra Medium". יש להתייחס לכל נתון המצוטט עבור דרגת Astra בעלת שם כאל בלתי מאומת.

אם אתה רוצה לנסות את המודל לפני שאתה מתחייב לנתיב ייצור עבורו, לנתב אותו דרך נקודת קצה אחת לצד המודל הנוכחי שלך היא הדרך הזולה לגלות — GPT-6 Astra נמצא בקטלוג של OrcaRouter, כך שהרצת השוואה עולה לך במחרוזת מודל אחת במקום בחוזה שני וב-SDK שני.

מאמץ חשיבה: חמש רמות, ומה העלות של כל אחת מהן

תיעוד ה-API של Ope​nAI עבור gpt-6-astra מפרט חמש רמות מאמץ — נמוך, בינוני, גבוה, xhigh ומקסימום — וההנחיה של Co​dex ישירה לגבי אופן השימוש בהן: "השתמשו במאמץ ההסקה הנמוך ביותר שמפיק את התוצאה שאתם צריכים," והתחילו מברירת המחדל, והעלו אותו כאשר משימה דורשת תכנון מעמיק יותר.

הסיבה לכך שיקר להתעלם מהעצה הזו במודל הזה במיוחד היא היכן שאסימוני החשיבה נוחתים על החשבון. אסימוני חשיבה הם אסימוני פלט, והפלט ב-Astra הוא $50.00 למיליון — פי עשרה מתעריף הקלט ופי חמישים מתעריף הקלט השמור במטמון. אז העסקה אינה מופשטת:

• כל 1,000 טוקני חשיבה נוספים בכל תור עולים $0.05 לפי תעריף הפלט.

• לאורך סשן של 150 תורים, החזקת 1,000 אסימוני חשיבה נוספים בכל תור עולה כ-7.50 דולר; החזקת 5,000 נוספים עולה כ-37.50 דולר.

• בסשן המעובד שלהלן, הפלט הוא ממילא השורה הבודדת הגדולה ביותר, בשיעור של $0.200 לתור, לעומת $0.090 של קריאות מטמון — גידול החשיבה הוא האיבר שמזיז את הסכום הכולל במהירות הרבה ביותר.

מה ש-Ope​nAI לא מפרסמת הוא טבלה לפי רמת מאמץ: אין נתון של הספק לגבי כמה טוקני חשיבה xhigh או max פולטים במשימת קידוד ביחס ל-medium, ואין בנצ'מרק של הספק שמפורק לפי רמת מאמץ. כל מי שמצטט בפניך יחס מדויק של "max עולה פי 2" מצטט את המדידה שלו עצמו, ולא של Ope​nAI. השיטה הישרה היא להריץ משימה מייצגת אחת בשתי רמות מאמץ ולקרוא את בלוק השימוש בתשובה — המספר הזה, כפול 50 דולר למיליון, הוא תוספת המאמץ האמיתית שלך.

התוצאות הנמדדות, כל אחת עם המקור שלה

עבודת קידוד וטרמינל, הכול מדווח על ידי OpenAI אלא אם צוין אחרת. Terminal-Bench 4.0: GPT-6 Astra ב-57.9%, לעומת 37.3% עבור GPT-5.6 Sol ו-55.8% עבור Claude Fable 5.1 — כש-OpenAI מעריכה עלות API נמוכה בכ-9% לכל משימה לעומת GPT-5.6 Sol ונמוכה ב-63% לעומת Claude Fable 5.1. DeepSWE v1.1 של Datacurve מציב את Astra ב-74.1% במדד של Datacurve עצמה, נתון ש-Datacurve מתארת כשיא חדש ואשר חלק מהסיקור מעגל ל-74%. במערך הסוכני הרחב יותר, OpenAI מדווחת על OSWorld 2.0 ב-72.6% בכמה-40 דקות למשימה — כ-47% פחות זמן למשימה מאשר GPT-5.6 Sol — לצד FrontierMath Tier 4 ב-98%, ARC-AGI-3 ב-99.9% ו-ExploitBench ב-100%, שכולם מתוארים על ידי OpenAI כרמות רוויות או רוויות למעשה. אלה המספרים של הספק; לא שחזרנו אותם, ובחינה בלתי תלויה של נתון ARC-AGI-3 על ידי ARC Prize מצאה שהוא נמדד בסביבת מתאם-ספק מיוחדת ונופל בתנאים סטנדרטיים.

הנתון שאינו מספר ספק הוא זה שתהליך עבודה של סקירת קוד צריך להחשיב ביותר. CodeRabbit פרסמה הערכה משלה של Astra ב-2026-09-04, והתוצאה מצומצמת יותר מהכותרת. בבקשות משיכה חוצות-קבצים — הסקירות הקשות שמחייבות לקשר שינוי להשלכותיו במקום אחר במאגר הקוד — Astra תפסה כ-20% יותר באגים מ-GPT-5.6 Sol, עם כיסוי באגים שמיש של 57.1% לעומת 47.6%. בסקירות כלליות הרווח נעלם ברובו: 61.3% לעומת 59.0%, כ-4% יותר. CodeRabbit מאפיינת את שניהם כ"תוצאות מוקדמות, כיווניות" שאינן קובעות דירוג, ומציינת שהשיטה שלה אינה מבודדת את הגורם לשיפור. דף ההשקה של OpenAI מאפיין את אותה עבודה כ"יותר מפי שניים בבקשות משיכה חוצות-קבצים"; הפרסום של CodeRabbit עצמה נותן את ה-20% ואת אחוזי הכיסוי שלעיל. קראו את האחוזים, לא את הסיכום.

A single-column scoreboard titled 'GPT-6 Astra in Codex - the scoreboard' with six rows: Terminal-Bench 4.0 at 57.9%, DeepSWE v1.1 at 74.1%, Mind2Web at 1.9x faster, context window of 1,050,000 tokens, cached input at $1.00 per 1M, and output at $50.00 per 1M. A footer reads 'OpenAI-reported except DeepSWE v1.1 (Datacurve); pricing per OpenAI, read September 16, 2026.'

חוסר הסימטריה הזה הוא המספר השימושי ביותר בעמוד הזה כדי להחליט כיצד לפרוס את המודל, והוא מצביע לאותו כיוון כמו המחיר: הרווח מתרכז בהיסק חוצה־קבצים, ולכן שם משקיעים את המודל.

מה השימוש במחשב ב-Co​dex משנה עבור זרימת העבודה שלך

Ope​nAI אומרת שרתמת Co​dex המעודכנת מאיצה את השלמת המשימות של GPT-6 Astra ב-Mind2Web פי 1.9 לעומת חוויית GPT-5.6 Sol הנוכחית. Mind2Web היא אוטומציה של משימות רשת, אז יש לקרוא זאת כך: עבודת סוכן שצריכה לגעת בדפדפן או ב-GUI מסתיימת מהר יותר באופן מהותי, ואותה רתמה מעודכנת היא מה שאתם מריצים כשאתם מפעילים את Co​dex בכלל. התרשים הנלווה הוא תוצאת OSWorld 2.0 שלמעלה — 72.6% בכ-40 דקות למשימה, כ-47% פחות זמן למשימה מאשר Sol.

עבור מפתח, ההשלכה המעשית היא שינוי במה ששווה להאציל. תהליכי עבודה שהיו בעבר איטיים מדי כדי לאוטמט מקצה לקצה — לתפעל קונסולת staging ללא API, לשחזר באג דרך ממשק משתמש, לעבור על טופס רב-שלבי כדי ליצור fixture — נכנסים לטווח שבו הרצת סוכן זולה יותר מאשר לעשות זאת ביד. זה גם מעלה את הערך של הבקרות בצד הארגוני ש-OpenAI השיקה לצידן: ChatGPT Work ו-Codex מוסיפים מדיניות אישור, כלומר אישור לפני פעולות בעלות השלכות, וסקירה אוטומטית של קריאות כלים לא בטוחות או לא מורשות. אם אתם נותנים לסוכן ללחוץ דרך ממשק אמיתי, שכבת הסקירה הזו היא הדבר שעומד בין הרצה גרועה לבין אחר צהריים גרוע — וזו הסיבה שגישה ארגונית כבויה כברירת מחדל, כשמנהל מפעיל אותה לפי המחירון החל, היא תכונת ממשל ולא מכשול.

תמחור של זרימת העבודה, לא של הטוקן

הנה המחיר, עם שם ותאריך. מעמוד התמחור של OpenAI, נקרא בתאריך 2026-09-16, gpt-6-astra standard הוא $10.00 למיליון טוקני קלט, $1.00 למיליון טוקני קלט במטמון, $12.50 למיליון כתיבות מטמון ו-$50.00 למיליון טוקני פלט. Batch ו-Flex פועלים בחצי מהתעריפים האלה; מצב Fast מכפיל אותם. שורת הקלט במטמון היא זו שקובעת את החשבון שלך בלולאה סוכנית, מפני שסוכן קידוד שולח מחדש הקשר גדול, שכמעט אינו משתנה, בכל סיבוב בודד, וקלט במטמון עולה עשירית מקלט טרי.

שני ספים חשובים לפני החישוב. התיעוד של מודל Ope​nAI קובע שפרומפטים מעל 272,000 טוקני קלט מתומחרים בפי 2 מתעריפי הקלט והמטמון ובפי 1.5 מתעריף הפלט עבור הבקשה כולה — לא רק העודף — ובעמוד התמחור מופיעה שורת ההקשר הארוך עם 20.00$ לקלט, 2.00$ לקלט מהמטמון ו-75.00$ לפלט. וכל טוקן חשיבה מחויב בתעריף הפלט, כפי שהוסבר לעיל.

קחו ריפקטור לילי מציאותי: 150 סבבי מודל, בממוצע 100,000 טוקני קלט בכל סבב, מהם 90,000 הם קריאה מהמטמון ו-10,000 הם חדשים, ו-4,000 טוקני פלט בכל סבב כולל הסקה. מתחת לסף של 272K, בתעריפים סטנדרטיים:

• קלט שמור במטמון — 90,000 טוקנים × $1.00 למיליון = $0.090 לכל תור

• קלט חדש — 10,000 טוקנים × ‏$10.00 למיליון = ‏$0.100 לכל תור

• פלט — 4,000 טוקנים × $50.00 למיליון = $0.200 לכל תור

• סה"כ — $0.390 לתור, כך ש-150 תורות הם בערך $58.50 עבור הסשן

כעת העבר את אותו סשן אל מעבר לסף. ב-300,000 טוקני קלט לכל תור — 270,000 במטמון, 30,000 טריים — כל הבקשה מתומחרת מחדש, כך שקלט במטמון מוכפל ל-$2.00, קלט טרי מוכפל ל-$20.00 והפלט עולה ל-$75.00:

• קלט במטמון — 270,000 × $2.00 למיליון = $0.540 לכל סבב

• קלט חדש — 30,000 × $20.00 למיליון = $0.600 לתור

• פלט — 4,000 × $75.00 למיליון = $0.300 לתור

• סה"כ — $1.44 לתור, או בערך $216.00 עבור 150 תורים

אותה צורת משימה, חשבון גבוה פי כ-3.7, וכל ההבדל הוא באיזה צד של 272,000 אסימונים יושב התמלול שלך. זהו הטיעון בעד מנגנון ההערות בשורה אחת: אם הערות עמידות והיסטוריה ניתנת לחיפוש מאפשרות לך לשמור על הקשר עבודה רזה יותר במקום לגרור את כל התמלול קדימה, התכונה מחזירה את עצמה באסימוני קלט לפני שהיא בכלל עוזרת לאיכות. זהו גם הטיעון בעד לא לתת להרצה ללא השגחה להגדיל תמלול ללא תקרה.

A screenshot of the OrcaRouter model page for GPT-6 Astra showing the catalog id openai/gpt-6-astra, 1M tokens of context and 128K max output, text, image and file input with text output, reasoning, coding and agentic use cases, $10.00 per 1M input and $50.00 per 1M output, the /v1/chat/completions and /v1/responses endpoints, and an OpenAI-compatible code sample pointed at api.orcarouter.ai/v1.

לשם המחשה, אותו סשן של 150 תורות עם אותו פרופיל טוקנים בשכבות הזולות יותר: GPT-5.6 Terra בתעריפים המפורסמים שלה — $2.00 לקלט / $0.20 למטמון / $12.00 לפלט — מסתכם בכ-12.90 דולר, ו-GPT-5.6 Luna ב-$0.20 / $0.02 / $1.20 מסתכם בכ-1.29 דולר. אלה חישובים אריתמטיים על התעריפים המפורסמים של OpenAI, לא טענה שהן יסיימו את אותה המשימה — וזו בדיוק הנקודה של שני הסעיפים הבאים.

אם אתם משווים את כל זה בין ספקים, כדאי לדעת ש-OrcaRouter מעביר הלאה את מחיר המחירון של הספק בתוספת של 0%, כך ששינוי מחיר של ספק נכנס לתוקף בנקודת הקצה המנותבת באותו יום ולא בחשבונית הבאה.

מצבי הכשל שיש לתכנן סביבם

Astra הוא מודל אופק ארוך המבוסס על עיצוב הקשר ארוך, ושני החצאים של התיאור הזה הם המקום שבו שוכנות הבעיות. אלה ממצאים של הקהילה ותחקירים שלאחר אירוע מטעם ספקים, ולא המדידות שלנו.

• הניסוי לניהול הקשר סבל מבאג השבוע. הניתוח שלאחר התקלה של Ope​nAI מ-2026-09-12 מאשר שהניסוי בהצטרפות מרצון "גרם לעצירות מוקדמות ולתשובות להודעות מיושנות", והשפיע על כ-4,000–5,000 משתמשים, והוא הושבת. אותו ניתוח שלאחר התקלה מציין שני גורמים נוספים לתלונות האיכות בשבוע ההשקה: מיומנויות שנכתבו עבור מודלים מוקדמים יותר שפעלו שלא כשורה ומנעו מ-Astra לבדוק את עבודתה שלה, ומנועי הגשה שהוגדרו באופן שגוי שגרמו להידרדרות בזנב התעבורה. איפוס שימוש בוצע לאחר מכן בחצות שבין 09-12 ל-09-13.

• חשיבת יתר והתפשטות בדיקות. שרשור r/codex שזכה לתפוצה רחבה מתאר את Astra כשהיא מגיבה לבקשת פיצ'ר קטנה בכך שהיא בונה תחילה שכבות של אימות, בדיקות עשן ובדיקות גיבוב, מריצה אותן בכמה סדרים, ומדווחת שמד השימוש כמעט אזל הרבה לפני שהפיצ'ר היה קיים. הדיווחים הם תיאורים אישיים ולא מדידות מבוקרות, ותלונות דומות הופצו על מודלי חזית אחרים חודש לפני כן — לכן יש להתייחס לכך כדפוס אמיתי שצריך לתחום את העבודה מולו, ולא כקצב שאפשר לתכנן לפיו.

• ריצות שאינן מסתיימות. ארמין רונאכר, יוצר Flask, תיאר שהשאיר את Astra בריצה ללא השגחה במשך 35 שעות, שבסיומן היא ייצרה כ-75,000 שורות נטו ב-79 קומיטים, כ-1,400 הודעות בין סוכנים וכ-1,200 דולר בעלויות API — כ-15.50 דולר לקומיט — כאשר, להערכתו, לא סופק שום דבר בעל ערך. הדיווחים על מספר הטוקנים משתנים, לכן יש להתייחס לנתון הזה בערבון מוגבל. הוא הציג את תנאי העצירה החסר כבעיה בהרנס לא פחות מאשר בעיה במודל, וזו הפרשנות המעשית: הגדירו מהי השלמה לפני שמתחילים.

• גם הכשל ההפוך קיים. דיווחים מהקהילה מתארים ש-Astra נעצרת לפני השלמת משימה וממתינה להנחיה להמשיך, וזהו אותו גורם שורש במבט מהצד האחר — תפיסה לא מספקת של המושג "הושלם". הגדרה מפורשת של "הושלם" היא השורה בעלת הערך הגבוה ביותר בהנחיית המשימה שלך.

• מפגשים ארוכים עלולים להפוך לבלתי ניתנים לשחזור. בעיות פתוחות ב-Co​dex מדווחות על מלכוד-22 שבו חלון ההקשר מתמלא, הדחיסה האוטומטית מופעלת, למשימת הדחיסה עצמה נגמר ההקשר, והשרשור אינו ניתן לשחזור — ולחוד, שמסלולי ההערות וההיסטוריה הנייטיביים מחזירים 404 ב-Pro עם Astra בתצורות מסוימות, בעוד החלפת חלונות עלולה לאבד את מצב המשימה. שניהם דיווחים פתוחים ולא הצהרות של הספק, אך הם מצדדים בשמירת ההרצות עם נקודות ביקורת ב-git במקום לסמוך על כך שהמפגש ישרוד.

• הערות מיושנות הן מאפיין תכנוני, לא באג. שום דבר לא מבטיח שהערה משקפת את מצבו הנוכחי של הקובץ שהיא מתארת, והחיפוש הוא התאמת תת-מחרוזת מילולית ולא סמנטית. שמור את נתיב המקור עם ההערה, אמת מחדש בעת שינוי, והתייחס להערות של הרצה ללא השגחה כראיות לבדיקה ולא כאמת שעליה להסתמך.

• מגבלות השימוש הן התלונה העכשווית. דוחות מהשבוע של 2026-09-14 כוללים מגבלות שהן עד פי ארבעה הדוקות יותר מאשר בשבוע ההשקה, ותלונה שלא נפתרה שלפיה מאמץ xhigh צורך פחות מהמכסה מאשר medium — ואם זה נכון, משמעות הדבר היא שמאמץ ומכסה אינם נעים יחד. Ope​nAI לא פרסמה מגבלות מספריות לפי תוכנית עבור Astra.

מתי מודל זול יותר הוא הבחירה הנכונה

התוצאות הנמדדות לעיל מקבלות עבורך את החלטת הניתוב. היתרון של Astra מתרכז בעבודה שמשתרעת על פני קבצים או על פני שעות: סקירה חוצת-קבצים, משימות סוכניות ארוכות-טווח, תהליכי שימוש במחשב. בעריכות רגילות של קובץ בודד, ריפקטורים מכניים, בניית תשתית לבדיקות ועיצוב, הפער הכולל של ~4% בסקירה מול GPT-5.6 Sol אינו מצדיק מחיר של פי ~2.5 מהמחיר הנוכחי לכל טוקן — והמסקנה של CodeRabbit עצמה מצביעה לאותו כיוון, וממליצה על ניתוב משימות חכם במקום החלפה גורפת. שמור את המודל היקר למשימות שבהן היתרון שלו בא לידי ביטוי, ותנתב את השאר למטה.

באופן קונקרטי, חלוקה עובדת: GPT-6 Astra לשינויים חוצי קבצים, בסיסי קוד לא מוכרים, ריצות סוכן של שעות ארוכות וכל דבר שנוגע בדפדפן; GPT-5.6 Terra לעריכות ממוקדות, קוד תבניתי ויצירת בדיקות; GPT-5.6 Luna לסיווג, חילוץ ומעברים מכניים בנפח גבוה. לפי חשבון הסשן שלמעלה, ההבדל בין להריץ הכל על Astra לבין להריץ שליש ממנו על Astra הוא ההבדל בין כ-$58.50 לכ-$28 עבור אותן 150 פניות.

לעשות את החלוקה הזו נכון — בדיוק לשם כך נועדה שכבת ניתוב. OrcaRouter מציבה יותר מ-200 מודלים מאחורי API אחד, כך שהחלוקה שלעיל היא שינוי בקונפיגורציה ולא שלוש אינטגרציות — ומעבר אוטומטי בין שרתים (failover) משמעו שתכונה ניסיונית שחווה שבוע רע, כפי שקרה לזו, פוגעת באיכות ההרצה שלך במקום להביא אותה לסיומה. עבור מודל שמנגנון ההקשר שלו Ope​nAI עצמה עדיין מגדירה כניסיוני והשביתה לזמן קצר, הגדרת נתיב שני אינה פרנויה; זוהי מידת הזהירות הנכונה.

מה לראות מכאן

ארבעה דברים ישנו את העמוד הזה, וכל הארבעה פתוחים. האם הניסוי לניהול הקשר יופעל מחדש ובאיזו צורה — OpenAI אומרת שהוא יהפוך לברירת המחדל עבור Astra, מה שאומר ששורת התצורה שלמעלה תפסיק בסופו של דבר להיות משהו שאתם מגדירים. האם דיווחי 404 בהערות ובהיסטוריה ב-Pro ייסגרו, שכן זה ההבדל בין מנגנון שעובד כמתועד לבין מנגנון שעובד בכמה נתיבים. האם OpenAI מפרסמת נתוני טוקנים או עלות לפי מאמץ, שזה המספר החסר בכל החלטת מאמץ היום. והאם מכסות השימוש שהתהדקו במהלך שבוע ההשקה יירפו לאחר שהביקוש שהביא לעצירת מינויים חדשים ל-Pro ב-$200 ב-2026-09-10 ייספג.

עד אז, ספר המשחק קצר. קבעו את המודל עם codex -m gpt-6-astra, הפעילו את הניסוי רק אם יש לכם התחברות Plus, Pro או Pro Lite בלקוח, קבעו את המאמץ במפורש במקום לסמוך על תווית של סליידר, שמרו על הקשר העבודה שלכם מתחת ל-272,000 טוקנים, כי שם החיוב מוכפל, הגדירו מה נחשב ל"הושלם" לפני שאתם עוזבים, ותנתבו את העבודה הקלה למקום זול יותר. המודל הוא מ-2026-09-03 והוא לא הולך לשום מקום; הכלים סביבו הם אלה שעדיין מתגבשים.

השאלות שעולות

האם שווה להפעיל את תכונת ההערות בין חלונות עבור משימות בגודל רגיל?באופן כללי לא. היא קיימת כדי לפתור אובדן על פני גבולות חלון ההקשר, ולכן במשימה שנכנסת לחלון אחד היא מוסיפה חלקים נעים — כולל נתיב קוד ניסיוני שהושבת בגלל באג ב-2026-09-12 — בלי להסיר שום כאב. הפעל אותה לעבודה באופק ארוך והשאר אותה כבויה לעריכה ממוקדת.

האם חלון של 1,050,000 טוקנים יכול להחליף את השליפה בהגדרה שלי? לא מבחינת עלות. קריאה חוזרת של הקשר גדול בכל תור מחויבת בכל תור, ומעל 272,000 טוקני קלט כל הבקשה מתומחרת מחדש ל-$20.00 קלט ול-$75.00 פלט. שלב שליפה ששומר על הקשר עבודה קטן יותר הוא בדרך כלל התכנון הזול יותר, וזו הסיבה שמנגנון ההערות מעניין: זוהי שליפה הבנויה לתוך ה-harness.

מה קורה להערות כשמשימה מסתיימת? התיעוד של OpenAI מגדיר את היקף המנגנון לאותה משימה, ותיאורים קהילתיים מתארים את ההערות כמאוחסנות כנגד אותה משימה ולא כמועברות הלאה באופן אוטומטי. אל תניחו שמשימה חדשה יורשת את ההערות של המשימה הקודמת; כל דבר שחייב לשרוד שייך למאגר שלכם, לא לזיכרון של הסוכן.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית