
GPT-6 Astra API: מזהה המודל, נקודת הקצה, ומה באמת עולה משימה ארוכת טווח
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
The short version: GPT-6 Astra is callable today at https://api.openai.com/v1 under a single model id, gpt-6-astra, at $10.00 per million input tokens, $1.00 cached input and $50.00 output — the figures OpenAI's own pricing page carried on September 16, 2026. The model itself is from September 3, 2026, thirteen days before this page was written, so nothing here is launch coverage and nothing here is framed as an announcement. This is the reference page for the developer question that comes after availability: what string to pass, which endpoint takes it, what the 1,050,000-token window really buys, what the account has to look like first, and what one genuine long-horizon agent run costs on a rate card that quietly reprices itself above 272,000 input tokens. GPT-5.6 Sol appears throughout only as the price baseline it is sold above, never as the subject.
הסיבה שמודל בן שלושה עשר יום ראוי לעמוד השבוע היא שהדרכים אליו השתנו לאחר שההשקה השתנתה, ונתיב ה-API הוא כעת הרגיל. כאשר OpenAI שחררה את Astra ב-3 בספטמבר, היא תיארה פריסה ולא זמינות; עד 8 בספטמבר היא כבר אמרה שהמודל נפרס במלואו למשתמשי Plus, Pro, Business ו-Enterprise ב-Codex וב-ChatGPT Work, ועד השבוע של 14 בספטמבר AWS הציגה אותו ב-Bedrock ו-Microsoft Foundry הציעה אותו כזמין באופן כללי. עבור קורא API, הרצף הזה חשוב פחות ממה שזה נשמע — נקודת הקצה הייתה פעילה ומתועדת כל הזמן — אבל זה כן אומר שלשאלות הרכש סביבו יש כעת תשובות שלא היו להן ביום ההשקה. כל מה שלהלן נקרא מתוך תיעוד המודלים של OpenAI עצמה, עמוד התמחור ועמוד בקרות הנתונים ב-16 בספטמבר 2026, וכל דבר שמגיע ממקום אחר אומר זאת במשפט שנושא אותו.
מזהה המודל, ושאלת תמונת המצב נענתה בכנות
המחרוזת שצריך להעביר היא gpt-6-astra — אותיות קטנות, עם מקף, ללא קידומת ספק. זהו המזהה היחיד ש-OpenAI מתעדת עבור המודל הזה.
אם אתה מחפש תמונת מצב מתוארכת לנעוץ, אין כזו למצוא, ואנחנו לא הולכים להמציא סיומת שנראית סבירה. עמוד המודל של OpenAI עבור GPT-6 Astra מפרט רשומה אחת בדיוק תחת Snapshots, והיא ה-gpt-6-astra החשוף. אין -2026-09-03 בסגנון צורה מתוארכת ואין -latest כינוי בצד הספק. ראינו כינוי משתנה בצורה של ~openai/gpt-astra-latest ברשומת נתב במהלך המחקר; זהו מבנה שער שנבנה על גבי מזהה הספק, לא משהו ש-OpenAI מפרסמת, ואסור שהוא ייכנס לקונפיגורציה שלך כאילו הוא היה.
ההשלכה המעשית קטנה, אך ראויה לציון. ניתן לאחזר את אובייקט המודל כדי לוודא עם מה שאתה מדבר:
curl https://api.openai.com/v1/models/gpt-6-astra -H "Authorization: Bearer $OPENAI_API_KEY"
נעצו את המזהה החשוף בערך תצורה במקום להקליד אותו בתריסר מקומות קריאה. אם OpenAI תוסיף בהמשך תמונות מצב מתוארכות, המזהה החשוף הופך למטרה נעה, והערך הנעוץ שלכם מתחיל להשתנות לכם מתחת לרגליים — מקום אחד לעריכה הוא ההבדל בין שינוי של שתי דקות לבין אחר צהריים של חיפושי grep.
נקודת הקצה: כתובת URL בסיסית, תאימות, ובקשה שרצה
The base URL is https://api.openai.com/v1. Per OpenAI's model documentation, GPT-6 Astra is supported on Responses (/v1/responses), Chat Completions (/v1/chat/completions) and Batch (/v1/batch). It is explicitly not supported on Realtime, Assistants, Fine-tuning, Embeddings, image generation and editing, video, audio, moderation, or the legacy Completions endpoint — and those absences matter as much as the presence list, because a team that planned around the Assistants API or a fine-tuned variant has to replan rather than rewrite.
בנוגע לתאימות: זהו ה-API הראשון־מטעם של OpenAI עצמה, שהוא פורמט התקשורת שכל SDK וכל לקוח תואמי OpenAI נכתבו לפיו. כל דבר שמדבר בפורמט הזה יתקשר עם gpt-6-astra בלי שים — אתם מחליפים את מחרוזת המודל ואם אתם נודדים ממודל OpenAI ישן יותר, גם את שמות הפרמטרים שלמטה. עבודה חדשה צריכה להשתמש ב-Responses API: זהו המשטח שעליו OpenAI מתעדת את בקרת החשיבה של המודל הזה, זה המקום שבו חיים הכלים המובנים, והתמיכה של Chat Completions במודלים החדשים ביותר הייתה היסטורית הרדודה מבין השניים.
קריאת סטרימינג מינימלית, עם מאמץ חשיבה מוגדר:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "gpt-6-astra", "input": "רשום את הקבצים שתשנה כדי להעביר את השירות הזה מ-API האימות המיושן.", "reasoning": {"effort": "high"}, "max_output_tokens": 16000, "stream": true}'
ואותו הדבר בפייתון, ששם רוב הקוראים ימצאו את עצמם למעשה:
from openai import OpenAI
client = OpenAI()
stream = client.responses.create(model="gpt-6-astra", input="פרט את הקבצים שבהם היית משנה כדי להעביר את השירות הזה מה-API הישן של האימות.", reasoning={"effort": "high"}, max_output_tokens=16000, stream=True)
for event in stream:
if event.type == "response.output_text.delta": print(event.delta, end="")
שלושה דברים בבקשה הזו ספציפיים למודל הזה ולא הועתקו מ-quickstart גנרי.
• מאמץ החשיבה הוא חוגת עלות, לא רק חוגת איכות. בעמוד המודל של OpenAI מפורטים הערכים הנתמכים: low, medium, high, xhigh ו-max. שימו לב היכן מתחילה הרשימה: אין none או minimal עבור GPT-6 Astra, כך שהרצפה עלתה. אסימוני חשיבה מחויבים כאסימוני פלט במחיר של $50.00 למיליון, כלומר הפיכת המאמץ מ-high ל-max היא החלטה עם תג מחיר, לא שדרוג איכות בחינם.
• הזרמה נתמכת, וזו הדרך הכנה להריץ תורות ארוכות. בקשה בודדת במודל הזה יכולה להפיק עד 128,000 אסימוני פלט. ההמתנה לכך שכל זה יגיע בגוף תגובה אחד, בלי שום יכולת לראות אם הוא מתקדם, היא הדרך שבה אתם מוצאים את עצמכם מנחשים לגבי פסקי זמן.
• שמירת פרומפטים במטמון היא מפורשת כאן.Responses API מתעד prompt_cache_breakpoint על תוכן טקסט, תמונה וקובץ, עם מצב explicit, המסמן "את הסוף המדויק של קידומת פרומפט לשימוש חוזר" ויורש את ה-TTL שלו מ-prompt_cache_options.ttl של הבקשה. במודל שתעריף הקלט השמור במטמון בו הוא עשירית מתעריף הקלט שאינו שמור במטמון, המקום שבו תציב את הגבול הזה הוא השורה בעלת המינוף הגבוה ביותר בבקשה שלך.

מה באמת אומר חלון של 1,050,000 טוקנים
המספרים המתועדים הם חלון הקשר של 1,050,000 טוקנים, קלט מקסימלי של 922,000 טוקנים, פלט מקסימלי של 128,000 טוקנים, ותאריך חיתוך ידע של 30 באפריל 2026.
התחילו בחשבון שאנשים מפספסים: 922,000 ועוד 128,000 שווה 1,050,000. החלון משותף בין מה שאתם שולחים לבין מה שהמודל עשוי להחזיר, ותקרת הפלט מוקצית מתוכו. אינכם יכולים לשלוח 1,050,000 טוקנים של קלט; התקרה המעשית לבקשה בודדת היא 922,000, ופחות מכך אם אתם רוצים מקום לתשובה אמיתית.
מה קונים במיליון טוקנים ביחידות שאתם באמת עובדים בהן? המרות מטוקנים לטקסט הן משוערות, ואלה שלנו ולא של OpenAI, אבל הן בסדר הגודל הנכון: בקצב של כארבעה תווים לטוקן, 1,050,000 טוקנים הם בסדר גודל של 750,000 מילים, או משהו כמו מאה אלף שורות קוד. זהו מאגר בגודל בינוני, בשלמותו, ועוד נשאר מקום לפלט הכלים שסוכן מייצר בזמן עבודתו. תרחיש האופק הארוך שלשמו נמכר המודל הוא בדיוק זה: סוכן שקרא קובץ לפני שעה ועדיין יכול לראות מה נאמר בו, במקום סוכן שדחס את הבוקר לפסקת סיכום.
ואז החלק שמקומו בעמוד עלויות ולא בעמוד מפרט. התיעוד של המודל של OpenAI קובע שפרומפטים עם יותר מ-272,000 טוקני קלט מתומחרים ב-פי 2 מתעריפי הקלט והמטמון ופי 1.5 מהפלט עבור הבקשה כולה. עמוד התמחור מציג זאת כשורה שנייה: הקשר ארוך ב-GPT-6 Astra הוא 20.00 דולר לקלט, 2.00 דולר לקלט במטמון ו-75.00 דולר לפלט. כך ששלושת הרבעים העליונים של החלון הזה הם רצועת מחיר, לא רק מרווח עודף. הרצה שתמלולה עולה על 272,000 טוקנים משלמת כפול על כל טוקן קלט — כולל אלה שבמטמון — עבור הבקשה כולה, וזו התנודה הגדולה ביותר בכלכלה של המודל הזה. זה מפורט במלואו בהמשך.
עוד מכניקה שכדאי להכיר, כי זוהי ההודאה של הספק עצמו שחלון אחד אינו כל התשובה. עבור Codex, OpenAI מתארת גישה ניסיונית להקשר שמגיעה עם Astra, שבה הערות נשמרות לאורך חלונות הקשר במקום דחיסה חוזרת ונשנית לסיכום אחד, כאשר חלונות מוקדמים יותר נשארים ניתנים לחיפוש כך שדרישות ותוצאות בדיקה מהודעות מוקדמות יותר ומפלט כלים נשארים ניתנים לאיתור. OpenAI מכנה אותה ניסיונית, אומרת שהיא מופעלת ב-config.toml של Codex, ואומרת שהיא תהפוך לברירת המחדל עבור Astra. אם אתם בונים את המקבילה בעצמכם על ה-API, זו הצורה שיש להעתיק: הערות עמידות בתוספת היסטוריה ניתנת לשליפה, ולא פרומפט הירואי אחד.
והגבול של המספר עצמו: חלון גדול הוא קיבולת, לא ערובה לקשב לאורכו. הנתונים המדווחים על ידי הספק לגבי אופק ארוך הם מדריך טוב יותר להתנהגות מאשר מספר הטוקנים — OpenAI מדווחת על OSWorld 2.0 ב-72.6% בכ-40 דקות למשימה, ועל Terminal-Bench 4.0 ב-57.9% לעומת 37.3% עבור GPT-5.6 Sol. אלה המספרים של OpenAI עצמה, שלא שוחזרו על ידינו, והתמונה העצמאית קרובה אך לא זהה: Artificial Analysis מדדה את Astra ב-59.1% ב-Terminal-Bench v4.0 לעומת 52.0% עבור Claude Fable 5.1 ו-39.9% עבור GPT-5.6 Sol. שניהם מסכימים שפער האופק הארוך לעומת הדור הקודם הוא אמיתי; אף אחד מהם אינו מהווה תחליף להרצת המשימה שלך.
מודאליות קלט, ושאלת הקובץ נותרה פתוחה בכנות
בדף המודל של OpenAI מפורטות מודאליות קלט של טקסט ותמונה, עם פלט טקסט. ללא אודיו, ללא וידאו, ללא יצירת תמונות במודל זה.
קלט תמונה נכנס בתור חלק תוכן בתוך הודעת משתמש. סוג החלק הוא input_image, והתמונה מסופקת או ככתובת URL מלאה או כ-data URL מסוג base64 בשדה image_url, או כ-file_id מה-Files API. קיים שדה detail אופציונלי בערכים auto, low, high או original, וברירת המחדל שלו היא auto. המבנה הוא:
{"model": "gpt-6-astra", "input": [{"role": "user", "content": [{"type": "input_text", "text": "מה השתנה בצילום המסך הזה?"}, {"type": "input_image", "image_url": "data:image/png;base64,...", "detail": "high"}]}]}
התיעוד החזותי של OpenAI מפרט את PNG, JPEG, WEBP ו-GIF לא מונפש כמקובלים, עד 512 MB של מטען כולל לכל בקשה ועד 1,500 תמונות לכל בקשה, כאשר תמונות עם יותר מ-30,000 פאצ'ים נדחות במקום להיות מוקטנות. אלו הן מגבלות החזון הכלליות של הפלטפורמה ולא ספציפיות ל-Astra, ותמונות מחויבות בטוקנים כמו כל קלט אחר.
כעת השאלה שאיתה הקוראים באמת מגיעים, והתשובה הכנה. האם אפשר לשלוח קבצים או קובצי PDF? לא הצלחנו לאשר קלט מסמכים עבור המודל הזה בתיעוד של OpenAI, ואנחנו לא מתכוונים לרמוז שזה עובד. Responses API אכן מגדיר חלק תוכן input_file, כך שהתשתית קיימת ב-API באופן כללי; אבל העמוד של OpenAI עבור GPT-6 Astra מפרט טקסט ותמונה כמודאליות הקלט שלו ואינו מפרט file, ולא מצאנו הצהרה של OpenAI המתעדת קלט PDF עבור נקודת הקצה הזו. רישום של נתב עבור אותו מודל כן מציג file לצד טקסט ותמונה — התייחסו לכך כאל דיווח של נתב, שזה מה שנתב רושם על נתיב ולא מה שהספק מבטיח. אם קליטת מסמכים היא קריטית לעומס העבודה שלכם, בדקו אותה מול נקודת הקצה האמיתית לפני שאתם בונים עליה, והכינו מנגנון גיבוי של OCR-to-text. זה ההבדל בין אחר צהריים של בדיקות לבין שכתוב.
שורת המחיר המלאה, והרצה אחת לטווח ארוך שתומחרה
כל נתון בסעיף זה נלקח מדף התמחור של OpenAI עצמה ב-16 בספטמבר 2026, וכולם מתייחסים למיליון טוקנים במסלול Standard, אלא אם השורה מציינת אחרת.
• הקשר קצר, עד 272K קלט — $10.00 קלט, $1.00 קלט במטמון, $12.50 כתיבה למטמון, $50.00 פלט.
• הקשר ארוך, מעל 272K קלט — $20.00 קלט, $2.00 קלט שמור במטמון, $25.00 כתיבה למטמון, $75.00 פלט, מיושם על הבקשה המלאה.
• Batch and Flex — מחצית מ-Standard: $5.00 / $0.50 / $6.25 / $25.00 הקשר קצר, $10.00 / $1.00 / $12.50 / $37.50 הקשר ארוך.
• מצב מהיר — פי שניים מ-Standard: $20.00 / $2.00 / $25.00 / $100.00 עבור הקשר קצר, $40.00 / $4.00 / $50.00 / $150.00 עבור הקשר ארוך. OpenAI מציינת שמצב מהיר אינו זמין עבור GPT-6 Astra עם אחסון נתונים באיחוד האירופי.
• שהיית נתונים — נקודות קצה שמשתמשות בו נושאות תוספת של 10% עבור מודלים שיצאו לאור ב-5 במרץ 2026 או לאחר מכן. GPT-6 Astra עומד בתנאי הסף, ולכן פריסת שהיית נתונים גבוהה ב-10% מכל מספר שלעיל.
הנתון שיש להפנים הוא תעריף הקלט השמור במטמון. $1.00 מול $10.00 מהווה הנחה של 90% על החלק מהפרומפט שאתה שולח שוב — ובעומס עבודה של סוכן, זה כמעט כל הפרומפט. כתיבות למטמון מחויבות ב-$12.50, או פי 1.25 מתעריף הקלט ללא מטמון, כך שנקודת האיזון פשוטה: שליחת 100,000 טוקנים ללא מטמון פעמיים עולה $2.00, ואילו כתיבת אותה קידומת פעם אחת וקריאתה בחזרה פעם אחת עולה $1.35. המטמון משתלם מהשימוש החוזר השני והלאה, וסוכן שעובד עם אותו תמליל במשך מאה סבבים עושה בו שימוש חוזר מאה פעמים.
מה שמביא אותנו לחשבון שבאמת קובע אם המודל הזה משתלם, כי התעריף הכותרתי אינו המספר שמופיע בחשבונית. הנה הרצה מדומה — שלנו, שנבנתה על התעריפים המפורסמים של OpeNAI, לא חשבון מדוד — עבור סוג המשימה שלשמה נמכר המודל: סוכן קוד אוטונומי שמבצע מיגרציה בקנה מידה של מאגר לאורך כמה שעות, 120 קריאות למודל, תמליל עבודה שממוצעו סביב 500,000 טוקני קלט לקריאה ככל שהוא מצטבר, 80% מהקלט הזה מוגש מהמטמון, ו-400,000 טוקני פלט לאורך הריצה, כולל חשיבה.
בתעריפי Standard להקשר קצר:
• קלט ללא מטמון — 12M טוקנים × $10.00 = $120.00
• קלט במטמון — 48 מיליון טוקנים × $1.00 = $48.00
• פלט — 0.4M אסימונים × $50.00 = $20.00
• סה"כ ≈ $188.00 עבור ההרצה
אותה הרצה ברצועת ההקשר הארוך, וזה מה שתמלול שנמצא מעל 272,000 טוקנים לקריאה מקבל בפועל:
• קלט שאינו במטמון — 12M טוקנים × $20.00 = $240.00
• קלט שמור במטמון — 48M טוקנים × $2.00 = $96.00
• פלט — 0.4M טוקנים × $75.00 = $30.00
• סה"כ ≈ $366.00 עבור ההרצה
שתי מסקנות נובעות מכך, ואף אחת מהן אינה נראית מהמחיר הכותרתי. ראשית, המקום שבו יושב התמלול שלך שווה באותה מידה כמו איזה מודל אתה בוחר — אותה משימה בדיוק כמעט מכפילה את עצמה בתלות בשאלה אם היא חוצה את סף 272K, מה שהופך משמעת הקשר (לאחזר את 100K הנכונים במקום לשאת 600K) לטכניקת בקרת עלויות במודל הזה, ולא רק לטכניקת ביצועים. שנית, המטמון שווה יותר ממה שההנחה מרמזת: ללא פגיעות מטמון כלל, התסריט הראשון נושא $600.00 של קלט במקום $168.00, וההרצה עולה כ-$620 במקום $188. הפעל מטמון לפני שאתה מעלה את מאמץ החשיבה.
עבור קו הבסיס, אותו תמהיל טוקנים על GPT-5.6 Sol לפי התעריפים שדף התמחור של OpenAI הציג ב-16 בספטמבר — 4.00$ קלט, 0.40$ קלט במטמון, 20.00$ פלט בהקשר קצר — מסתכם בבערך 75.20$, ובשורת ההקשר הארוך של Sol (8.00$ / 0.80$ / 30.00$) בבערך 146.40$. זה הופך את ההרצה הזו לבערך פי 2.5 בכל אחד מהטווחים. שתי הסתייגויות לגבי המכפיל הזה, כי הוא כבר גרם לבלבול במקומות אחרים: המספר של Sol הוא תעריף מבצעי — OpenAI אומרת שהמבצע זמין לפחות עד 21 בנובמבר 2026 — ואילו זה של Astra הוא מחיר מחירון, כך שהמכפיל מודד את שני כרטיסי התעריפים של היום ולא עובדה יציבה על המודלים, והוא מצטמצם אם המבצע יפוג. וה-"2.5x" הישן שמסתובב עבור Astra מחושב לעיתים מול המחירון שלפני המבצע של Sol של 5.00$/30.00$, מה שנותן פי 2 בקלט ובערך פי 1.67 בפלט. ציינו איזה תעריף של Sol אתם מתכוונים, אחרת המספר חסר ערך.
עוד שורה אחת: מסלול Batch מחצה את כל זה, ומביא את הריצה הראשונה לכדי כ-94$. אם תוכל להשתמש בו תלוי בפרק הבא.

אפס שמירת נתונים, וההנחה שפוסלת את עצמה
OpenAI מצהירה שאפס שמירת נתונים (Zero Data Retention) זמין ללקוחות API זכאים בנקודות קצה נתמכות, בכפוף לאישור — ושני חלקי המשפט הזה עושים עבודה אמיתית. זה לא מתג בשירות עצמי: הזכאות כפופה לאישור מראש מ-OpenAI ולקבלת דרישות נוספות, ומתחילים את זה בשיחה עם המכירות. לאחר אישור, היא מוגדרת ברמת הארגון או הפרויקט תחת הגדרות → ארגון → בקרות נתונים, בלשונית שמירת נתונים, שבה פרויקט יכול לרשת את ברירת המחדל של הארגון, להגדיר ZDR במפורש, לבחור בניטור שימוש לרעה מותאם (Modified Abuse Monitoring), או להשבית את שניהם.
מה זה משנה בפועל: ZDR מחריג תוכן לקוחות מיומני ניטור שימוש לרעה, ומחליף את ברירת המחדל של שמירה של עד 30 יום, והפרמטר store ב-/v1/responses וב-/v1/chat/completions מטופל כ-false גם אם בקשה מנסה להגדיר אותו כ-true.
הפרט החשוב ביותר בעמוד בנושא עלויות: /v1/batches אינו ברשימת נקודות הקצה הזכאיות ל-ZDR. עמוד בקרת הנתונים של OpenAI מפרט אותו כלא זכאי, כאשר מצב היישום נשמר עד למחיקה. לכן ב-GPT-6 Astra, ההנחה של 50% של שכבת Batch ו-Zero Data Retention סותרים זה את זה — עומס עבודה המחויב לציות שזקוק ל-ZDR צריך לתקצב את תעריף Standard, לא את תעריף ה-Batch, והנתון של $94 לעיל אינו זמין לו.
שלוש הסתייגויות נוספות, שנאמרות בפשטות משום שדף שמפריז במכירת ZDR גרוע מדף שמשמיט אותו. ZDR אינו מוחלט: במסגרת "Eyes Off" OpenAI שומרת לעצמה את הזכות להפוך מודלים לבלתי זכאים ל-ZDR עבור לקוחות מסוימים, בהודעה מוקדמת בכתב, ובמסגרת "Safety Retention" תוכן עשוי להישמר ולהיבדק בידי אדם כאשר מסווגים מסמנים סיכון חמור. קלטי תמונות וקבצים שסומנו כבעלי פוטנציאל ל-CSAM נשמרים לבדיקה ידנית גם במסגרת ZDR. ו-ZDR נעצר בגבול של OpenAI — אם הסוכן שלך קורא לשרת MCP מרוחק או ל-API של ספק אחר, התעבורה הזו כפופה למדיניות השימור של אותו צד, ולא למדיניות הזו. לחוד, שהיית נתונים היא בקרה שונה מ-ZDR, דורשת אישור משלה ותיקון Modified Retention מחוץ לארצות הברית, וכרוכה בתוספת של 10% שהוזכרה לעיל. אם אתה מסתמך על שמירה במטמון במסגרת ZDR, קרא את עמוד בקרות הנתונים של OpenAI כדי לדעת מה נשמר במטמון; אנחנו לא מתכוונים להדפיס נתון שימור לגביו שלא הצלחנו לקרוא שם בעצמנו.
מגבלות קצב כמתועד, וזו שנושכת ראשונה
עמוד המודל של OpenAI מפרסם את המגבלות האלה לפי שכבה עבור GPT-6 Astra — בקשות וטוקנים לדקה, ואז מגבלת תור האצווה:
• דרג 1 — 500 RPM, 500,000 TPM, תור אצווה 1,500,000
• דרגה 2 — 5,000 סל״ד, 1,000,000 TPM, תור אצווה 3,000,000
• דרג 3 — 5,000 RPM, 2,000,000 TPM, תור אצוות 100,000,000
• דרג 4 — 10,000 RPM, 4,000,000 TPM, תור אצווה 200,000,000
• דרגה 5 — 15,000 RPM, 40,000,000 TPM, תור אצווה 15,000,000,000
שתי מגבלות שנציין כלא מתועדות במקום למלא אותן: אין מגבלה מפורסמת לחבילת החינם, מפני ש-GPT-6 Astra אינו בחבילת החינם כלל; ולא מצאנו תקרה מפורסמת מעל דרגה 5 ולא טבלת מגבלות נפרדת למצב Fast. אם ספק לא פרסם מגבלה, יש להתייחס להיעדרה כאל שאלה בלתי פתורה — אל תניחו שהיא בלתי מוגבלת.
המספר שפוגע ראשון בעומס העבודה של סוכן הוא 500,000 TPM של דרג 1. קריאה בודדת במודל הזה יכולה לשאת תמליל של 500,000 טוקנים, מה שאומר שבקשה אחת יכולה לצרוך דקה שלמה מתקציב הטוקנים שלך בדרג הכניסה. חלון הקשר של מיליון טוקנים לא מועיל במיוחד לסוכן שמחזיק את אותו תמליל לאורך 120 תורות אם הדרג לא יכול לדחוף את הטוקנים. יש להתאים את הדרג לנפח הטוקנים מהדוגמה המעובדת למעלה, לא למספר הבקשות — ושים לב ששדרוג הדרג תלוי בהוצאות ובהיסטוריית החשבון, כך שכדאי לבסס אותו לפני דדליין ולא במהלכו.
Azure ו-AWS Bedrock, שורה אחת כל אחד
• Microsoft Azure — GPT-6 Astra ניתן לפריסה ב-Microsoft Foundry תחת אותו מזהה gpt-6-astra, כאשר הכיסוי של Foundry מתארך את הזמינות הכללית לתחילת ספטמבר 2026 ומדווח על פריסות ב-Global Standard וב-US Data Zone, ללא EU Data Zone בהשקה, ותעריפים השווים או הקרובים למחירון של OpenAI, עם שורת הקשר ארוך. אנו קוראים זאת מכיסוי של Foundry ולא מדף הקטלוג של Microsoft עצמה, שלא הצלחנו להגיע אליו היום — אמתו את רשימת הפריסות הנוכחית, מערך האזורים והתעריף בתיעוד של Microsoft עצמה לפני תכנון פריסה עליו.
• AWS Bedrock — רשום כ-openai.gpt-6-astra, זמין דרך ממשקי ה-API הנתמכים של Bedrock ומאושר בסיכום השבועי של AWS dated 15 בספטמבר 2026, עם היקף הממשל של Bedrock עצמו (בידוד נקודות קצה של VPC, הצפנת KMS, Guardrails) והצהרת AWS שנתוני הסקה אינם משמשים לאימון המודל. הסקה באזור (in-region) והסקה חוצת-אזורים גיאוגרפית ב-Bedrock מחויבות ב-10% מעל תעריפי הבסיס; נתון זה הוא מידע ממקור משני בקריאה שלנו, לכן יש לבדוק את עמוד התמחור של AWS עצמה.
אף אחד מהמסלולים לא משנה את המודל. שניהם משנים את הרכש, ובעיני קורא ארגוני זה כל העניין: פריסה של Foundry או Bedrock יכולה לשבת בתוך התחייבות ענן קיימת, לרשת את ה-IAM, הלוגים וגבול הרשת שלה, ולנחות על חשבונית שהפיננסים כבר אישרו — לעתים קרובות זה ההבדל בין פיילוט למשהו שבאמת יוצא לדרך. המחיר שמשלמים הוא שאתה מקבל את מחזור החיים של המודל של הענן ואת התעריף של הענן, ושני העננים מדווחים במחיר השווה למחירון של OpenAI או גבוה ממנו, ולא נמוך ממנו.
היכן משתלב ראוטר, כולל החלקים שמתנגדים לו
GPT-6 Astra נמצא בקטלוג של OrcaRouter בתור openai/gpt-6-astra, ו-OrcaRouter מעביר את מחיר המחירון של הספק הלאה בתוספת של 0% — מחיר הספק הוא המחיר שלנו, ושינוי מחיר של ספק נכנס לחשבון שלך באותו היום ולא בעת החידוש. במודל במחיר כזה זו אינה טענת טעות עיגול: החישוב לעיל הוא אותו חישוב שהיית משלם ישירות.

הטיעון האמיתי לניתוב כאן אינו המחיר, אלא ההפיכות. Astra הוא בערך פי 2.5 מהמודל שמתחתיו, והעלות שלו משתנה בהתאם לסף שהארכיטקטורה שלך שולטת בו, כך שרוב הצוותים רוצים לנסות אותו על פרוסה מתעבורה אמיתית לפני שהם מתחייבים לנתיב ייצור. באמצעות מפתח אחד אתה יכול להציב אותו מאחורי אותו endpoint כמו המודלים שאתה כבר מריץ, לשלוח לו חלק מהתעבורה, ולעבור אוטומטית למשהו זול יותר כשהוא לא מצדיק את הפער — שינוי קונפיגורציה ולא מיגרציה, עם API אחד שמכסה יותר מ-200 מודלים, DSL לניתוב שמרכיב כמה מודלים לקריאה אחת, ומיזוג מודלים כשאתה רוצה שפאנל יענה יחד.
החלקים שמתנגדים לכך, בניסוח הפשוט ביותר. נתב הוא עוד תחנה בנתיב הבקשה ועוד גורם בזרימת הנתונים — ובמודל הזה זה לא היפותטי, כי ZDR מאושר לכל ארגון בנפרד ב-OpenAI, ובקשה מנותבת אינה מכוסה אוטומטית באישור ה-ZDR שלך. אם אתם שולחים נתונים ברגולציה, ודאו את תנאי הנתונים של המסלול לפני שאתם שולחים אותם, והיו מוכנים להתקשר לספק ישירות עבור עומס העבודה הזה. ניתוב גם מוסיף רכיב שעלול להיכשל או להוסיף השהיה, והוא הופך את החלפת המודלים לקלה כל כך עד שאפשר לשנות את מה שמשיב למשתמשים שלכם בלי לבדוק את זה. שום דבר מזה לא גובר על טיעון הניסוי והאפשרות לחזור בך עבור רוב הצוותים; כל זה שווה לדעת לפני שאתם מחליטים שהנתב בחינם. העמדנו את פלטפורמות הניתוב זו מול זו בכתבה נפרדת במקום לחזור על ההשוואה כאן.
שלוש שאלות שאינן תשובות בנות פסוקית אחת
האם ניתן לכוונן את GPT-6 Astra, או להשתמש בו עם ה-Assistants API?לא, בשני המקרים, וזהו גבול תכנוני ולא הגדרה שפספסת. עמוד המודלים של OpenAI מפרט את Chat Completions, Responses ו-Batch כנקודות הקצה הנתמכות, ומפרט במפורש את Fine-tuning ו-Assistants כלא נתמכים, ואין שורה של GPT-6 Astra בטבלת התמחור של כיוונון עדין של OpenAI. אם הארכיטקטורה שלך תלויה במודל דגל מכוונן, יש לספק ל-Astra פרומפטים במקום זאת, מה שמעביר את העלות מהאימון לאסימוני קלט — וב-$10.00 למיליון על פרומפט מערכת גדול, זהו סעיף תקציבי אמיתי ולא הערת שוליים.
האם המודל יסרב לעבודת אבטחה שאני מורשה לבצע? לפעמים, כן, וכדאי לדעת זאת לפני שאתם בונים. GPT-6 Astra הוא המודל הראשון של OpenAI שמגיע לסף היכולת הקריטי באבטחת סייבר לפי מסגרת המוכנות של החברה, ובמצבו כפי ששוחרר הוא מסרב למשימות סייבר מתקדמות כגון כתיבת אקספלוייטים של הוכחת היתכנות. OpenAI אומרת שהיא מתכננת להרחיב את הגישה עם אמצעי הגנה פחות מגבילים דרך תוכנית Daybreak שלה. עבור מגן זה מופיע כסירוב שאינו הגבלת קצב ואינו באג — הקצו לו מקום בטיפול השגיאות שלכם במקום לנסות שוב לתוכו.
האם אני צריך אישור מיוחד כדי לקרוא למודל הזה? לא עבור נקודת הקצה הסטנדרטית — אין רשימת המתנה ואין שלב אישור כדי לקרוא ל-gpt-6-astra, רק חשבון עם חיוב. מה שכן עשוי לדרוש אישור הוא כל מה שמסביב לכך: Zero Data Retention, שכפוף להגשת בקשה; שהיית נתונים מחוץ לארצות הברית, שדורשת תיקון נפרד; ושדרוג דירוג, אם בכוונתך להעביר כמויות טוקנים בקנה מידה של סוכנים דרך חשבון Tier 1. המודל הוא החלק הקל ברכש.
למה לשים לב, ומי צריך לפעול עכשיו
אם אתם בונים על המודל הזה, ארבעת הדברים ששווה לנטר נמצאים כולם בצד הספק וכולם מתוארכים. האם OpenAI מפרסמת תמונת מצב מתוארכת עבור gpt-6-astra — מה שיהפוך את המזהה החשוף למטרה נעה ויהפוך את נעיצת הגרסה למשמעותית. האם הסף של 272,000 טוקנים זז, כי השורה הבודדת הזו שווה לחשבון שלכם יותר מכל מדד ביצועים בעמוד. האם התעריפים של Bedrock ו-Foundry מתכנסים אל מחיר המחירון של OpenAI או נשארים מעליו, כי זה מכריע את מסלול הרכש לא פחות מהמודל עצמו. והאם תוכנית Daybreak משנה את מה שנקודת הקצה תסרב לו, שבעבור צוותי אבטחה הוא ההבדל בין כלי שמיש לבין דמו.
באשר למי שצריך לפעול, החלוקה ברורה. אם אתם כבר משלמים עבור GPT-5.6 Sol בתעריפי מבצע עבור עבודת סוכנים לטווח ארוך, ה-2.5x הוא אמיתי והשאלה מצומצמת: האם שיעור השלמת המשימות בעומס העבודה שלכם מצדיק את פער המחיר? הריצו אותו על פלח של תעבורה אמיתית וגלו — הדוגמה המחושבת שלמעלה אומרת לכם כמה עולה הפלח לפני שאתם מתחילים. אם העבודה שלכם היא צ'אט בהקשר קצר או סיווג בנפח גבוה, זה לא המודל שלכם; התמחור מחדש של הקשר ארוך ותעריף הפלט של $50.00 הופכים אותו לדרך יקרה לעשות משהו ש-GPT-5.6 Luna עושה בשבריר מהמחיר. ואם אתם ארגון עם דרישת תאימות, התחילו קודם בשיחה על ZDR, כי היא תנאי סף להנחת Batch, לתוספת המחיר של ריזידנסי ולבחירת המסלול שלכם — ואף אחד מאלה אינו החלטה שתוכלו לקבל ביום שבו תזדקקו לה.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
