כרטיס כותרת שנוצר עבור שכבת Ultrafast עם הכותרת 'GPT-6 Astra Ultrafast', כתובית המשנה 'פי שישה מהקצב, בכל שורה' ושתי תגיות שעליהן כתוב 'מתומחר וזמין באופן כללי' ו'הנתיב המהיר אינו מודל שני'.
Guides & Insights

GPT-6 Astra Ultrafast ב-6x: מה המחירון המפורסם באמת עולה לך

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

GPT-6 Astra Ultrafast הפסיק להיות רשימת המתנה ב-29 בספטמבר 2026. כעת זו דרגת שירות ניתנת לרכישה עם מחיר מפורסם, והמחיר הזה הוא בדיוק פי שישה מהסטנדרטי בכל שורה בודדת. המודל שמתחת — GPT-6 Astra, ספינת הדגל של החברה, הושק ב-3 בספטמבר 2026 — לא השתנה; מה שהשתנה ב-DevDay הוא שהמסלול המהיר מעליו הפך לזמין באופן כללי, ותיעוד ה-API של החברה קובע כעת בפשטות ש-Ultrafast "זמין באופן נרחב עבור GPT-6 Astra, עם גישת תצוגה מקדימה עבור GPT-5.6 Sol." בפעם הראשונה אפשר להכניס את הדרגה הזו לשורת תקציב, והמספר שצריך לכתוב שם הוא $60.00 למיליון טוקני קלט ו-$300.00 למיליון טוקני פלט, כפי שנקרא מדף התמחור של החברה עצמה ב-30 בספטמבר 2026.

זה הופך את השאלה הזו לשונה מזו שסיקור ההשקה ענה עליה. העובדה המעניינת השבוע אינה שהדרגה קיימת — התצוגה המקדימה הוכרזה ב-13 באוגוסט 2026, וסוקרה עד מוות. העובדה המעניינת היא שלדרגה בלי מחיר יש כעת מחיר, והחשבון הנובע מכך אינו מחמיא באופן ספציפי וניתן לכימות. פי שישה אינו תוספת מחיר שסופגים במשיכת כתפיים; זו תוספת מחיר שצריך להרוויח בחזרה בפחות סבבים, והאם תוכל לעשות זאת הוא מאפיין של עומס העבודה שלך ולא של המודל.

האחיזות המרובות בכל קו, וזה הדבר הראשון שצריך להבין

כשקוראים את עמוד התמחור של OpenAI ב-30 בספטמבר 2026, העמודה Ultrafast עבור GPT-6 Astra היא פי 6 קבוע מהעמודה Standard, ולא תוספת מחיר על חלק מהשורות ולא על אחרות. זה חשוב, כי זה אומר שאינך יכול לצאת מכך באמצעות אופטימיזציה על ידי שינוי צורת הבקשות שלך.

• GPT-6 Astra, שירות סטנדרטי, בקשות של עד 272,000 אסימוני קלט — $10.00 לקלט, $1.00 לקלט במטמון, $12.50 לכתיבה למטמון, $50.00 לפלט, לכל 1M אסימונים.

• GPT-6 Astra Ultrafast, אותו סף — $60.00 קלט, $6.00 קלט במטמון, $75.00 כתיבה למטמון, $300.00 פלט, לכל 1M טוקנים. בדיוק פי 6 בכל ארבעת השורות.

• מעל 272,000 טוקני קלט, הבקשה כולה מתומחרת מחדש — Standard עובר ל-$20.00 / $2.00 / $25.00 / $75.00, Ultrafast עובר ל-$120.00 / $12.00 / $150.00 / $450.00. עדיין פי 6. כלל ההקשר הארוך ש-OpenAI מתעדת עבור GPT-6 Astra הוא תעריפי קלט ומטמון של פי 2 עם פלט של פי 1.5 על הבקשה כולה ברגע שחוצים את הסף, והוא חל באופן זהה על שני המסלולים.

• הדרגות האחרות באותו כרטיס — Batch ו-Flex הם 50% מ-Standard, ומצב Fast הוא פי 2 מ-Standard. לכן סולם המכפילים עבור המודל הזה הוא 0.5x, 1x, 2x, 6x, בלי שלב ביניים בין השניים האחרונים.

אין ל-Ultrafast מקבילה ל-Batch. Batch ו-Flex הם הנחות שאתם קונים עם תזמון רופף יותר במסלול הסטנדרטי; אין גרסה איטית וזולה של המסלול המהיר. אם אתם רוצים את המהירות, אתם משלמים את מכפיל ה-6x על כל טוקן שאתם שולחים וכל טוקן שאתם מקבלים בחזרה, ואין שילוב של קלט שמור במטמון וקלט טרי שמשפר את היחס.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP carries a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

כמה באמת עולה שיחה אחת

ההפשטה נעשית קלה יותר להבנה כשיש שתי בקשות קונקרטיות. שתיהן משתמשות בתעריפים המפורסמים של OpenAI לפי מיליון; החשבון הוא שלנו.

קריאה בודדת עם 20,000 טוקני קלט ותשובה בת 2,000 טוקנים מחויבת ב-0.30 דולר במסלול Standard — 20,000 טוקנים במחיר של 10 דולר למיליון הם 0.20 דולר, ועוד 2,000 במחיר של 50 דולר למיליון הם 0.10 דולר. אותה קריאה במסלול Ultrafast מחויבת ב-1.80 דולר. בדיוק פי שישה, כפי שפורסם.

עכשיו המקרה שבאמת מתאר לולאת סוכן: שיחה בת 200,000 טוקנים, שבה 190,000 טוקנים הם קידומת במטמון ורק 10,000 הם טריים, ושמפיקה צעד של 1,000 טוקנים. Standard גובה $0.19 עבור הקריאה מהמטמון, $0.10 עבור הקלט הטרי ו-$0.05 עבור הפלט — $0.34 לצעד. Ultrafast גובה $1.14, $0.60 ו-$0.30 — $2.04 לצעד. שוב פי 6, אבל תראו מה התמהיל עשה: המטמון הוא מנוף העלויות היעיל ביותר במודל הזה, ובכל זאת מסלול Standard עדיין זול בדיוק פי 6, כך שסוכן שעושה שימוש כבד במטמון לא מרוויח דבר באופן פרופורציונלי מהשכבה המהירה, וזה גם לא מרכך את הפרמיה.

המשמעות היא החלק ששווה להפנים. מכיוון שהמכפיל קבוע, נקודת האיזון אינה קשורה כלל לתמהיל הטוקנים שלך. היא תלויה כולה במספר הסבבים. Ultrafast מחזיר את העלות שלו בעומס עבודה רק כאשר הרצתו מפחיתה את מספר הסבבים המחויבים בפי שישה בערך — בין אם על ידי כיווץ לולאת ניסיונות חוזרים למעבר אחד, ובין אם על ידי החלפת רצף של קריאות הבהרה קצרות בסשן אינטראקטיבי מהיר אחד. אם עומס העבודה שלך מבצע את אותו מספר סבבים כמו קודם, רק מוקדם יותר, אתה קונה שיפור בהשהיה במחיר של פי 6 בדיוק, ותו לא.

מגבלות קצב וגיאוגרפיה הן התקרות שאינן מפורסמות.

שני אילוצים נמצאים מחוץ למחיר וקל לפספס אותם כשקוראים כרטיס תעריפים.

הראשון הוא תפוקה. Ultrafast עבור GPT-6 Astra זמין לכל משתמשי ה-API, אך בתחילה במגבלות קצב נמוכות: OpenAI מתעדת 500,000 טוקנים לדקה עבור דרגות 1 עד 3, 1,000,000 עבור דרגה 4 ו-5,000,000 עבור דרגה 5. עבור דרגה שנמכרת על מהירות, זו תקרה ממשית — הקשר סוכן של 200,000 טוקנים בחצי מיליון טוקנים לדקה הוא שתיים וחצי בקשות בדקה בדרגה נמוכה. ההנחיה של OpenAI עצמה מצביעה על אותה בעיה מהצד השני, וממליצה בחום על WebSockets בדיוק משום שעומס רשת לכל בקשה יכול לאכול את ההשהיה שהדרגה משלמת עליה.

השני הוא רזידנסי. Ultrafast תומכת ברזידנסי נתונים בארה"ב ובעיבוד גלובלי בלבד. היא אינה תומכת בנקודות קצה לעיבוד אזורי באיחוד האירופי או באזורים אחרים מחוץ לארה"ב. אם הפריסה שלך תלויה בנקודת קצה לרזידנסי באיחוד האירופי עבור GPT-6 Astra, השכבה הזו לא תהיה זמינה לך בשום מחיר, וזהו גבול קשיח ולא בחירת תצורה. שים לב גם שנקודות קצה לרזידנסי כרוכות בתוספת של 10% עבור מודלים ששוחררו ב-5 במרץ 2026 או לאחר מכן, ו-GPT-6 Astra הוא אחד מהם.

הכותרת של המהירות ירדה מ-14x ל-8x

כדאי לנסח זאת בזהירות, כי המספר שמסתובב ברוב הסיקורים כבר מיושן. עמוד התיעוד של OpenAI ל-Ultrafast, כפי שמפורסם היום, כולל את השורה "שכבת שירות ה-API המהירה ביותר שלנו, עם מהירויות של עד פי 8 מאשר במצב Standard." הכרזת התצוגה המקדימה מ-13 באוגוסט 2026 עבור GPT-5.6 Sol הבטיחה "מהירות של עד פי 14 מעיבוד Standard" ועד 750 אסימוני פלט לשנייה על חומרת Cerebras.

אלה אינן אותה טענה, וההבדל אינו חזרה בו אלא שינוי נושא. הנתון של פי 14 נמדד על GPT-5.6 Sol בתצוגה מקדימה מוגבלת; הנתון של פי 8 הוא מה ש-OpenAI מפרסמת עבור הדרגה כפי שהיא כעת, כאשר GPT-6 Astra הוא המודל הזמין שלה באופן נרחב. כל מי שבונה תקציב על בסיס פי 14 על Astra, בונה תקציב על בסיס מספר ש-OpenAI לא פרסמה עבור Astra. הקריאה הישרה היא ששני המספרים הם תקרות שדווחו על ידי הספק לתפוקת פלט, ששניהם אינם הבטחת השהיה עבור עומס העבודה שלך, ושזמן מקצה לקצה עדיין כולל עיבוד קלט, קריאות לכלים והתזמור שלך. התייחס לפי 8 כמספר לתכנון, והתייחס לכל דבר טוב יותר כבונוס שאתה מאמת על התעבורה שלך במקום להניח.

מה לעשות עם זה ביום שני

כלל ההחלטה שנובע מהחשבון צר יותר מכפי שהשיווק מרמז, וכדאי לרשום אותו לפני שמישהו יציע להפעיל את Ultrafast על פני כל האסטייט.

הפעל אותו במקום שבו עומס העבודה תלוי השהיה ואינטראקטיבי, ובמקום שבו אדם ממתין. טריאז' תקריOT, הסלמת תמיכה בזמן אמת, לולאת מחקר שבה אנליסט עורך איטרציות בתוך ישיבה אחת — אלה המקרים שבהם הערך של התשובה שמגיעה עכשיו ולא בעוד ארבע דקות אינו פרופורציונלי למחיר הטוקנים, ובהם חשבון של פי 6 על מספר קטן של סבבים הוא קטן באופן טריוויאלי מהעלות של האדם שממתין. הדוגמאות של OpenAI עצמה בהודעת התצוגה המקדימה היו בדיוק בצורה הזו: קריאת לוגים בזמן שהשבתה מתרחשת, כיווץ לולאת מחקר של לילה שלם לכדי סשן עבודה.

השאר את זה כבוי כאשר עומס העבודה מוגבל בתפוקה או בעל אופי של אצווה. אינדוקס מחדש לילי, מעבר סיווג גורפ, דוח מתוזמן, השלמת נתונים היסטוריים — לאף אחד מאלה לא אכפת מהשהיה בשעון קיר, כולם נקבעים בעיקר לפי מספר הטוקנים, ולכולם יש אפשרות של 0.5x ממש שם באותו כרטיס תעריפים ב-Batch וב-Flex. לשלם פי 12 מתעריף Batch כדי לסיים מוקדם יותר הוא הדרך הברורה ביותר לבזבז כסף בטבלה הזאת.

האמצע המגושם הוא לולאת הקידוד הסוכנית, ושם החשבון של ספירת התורות מכריע. אם המהירות אכן מבטלת ניסיונות חוזרים — אם המעבר הראשון של המודל על שינוי רב-קבצים מצליח לעיתים קרובות יותר משום שהוא לא נאבק בפסק זמן — אז Ultrafast יכול להיות זול יותר לכל משימה שהושלמה למרות שהוא פי 6 לכל טוקן. זוהי טענה מדידה לגבי העקבות שלך, לא טענה כללית, והמדידה זולה: ספור תורות מחויבות לכל משימה שהושלמה בשתי השכבות והכפל בתעריף. אם היחס אינו קרוב לשישה, השכבה המהירה היא רכישת השהיה ויש להצדיק אותה ככזו.

השכבה מתומחרת; המסלולים סביבה אינם אותה שאלה.

הערה מעשית אחת על איך להחזיק בזה. GPT-6 Astra בשירות סטנדרטי פעיל ב-OrcaRouter בתור openai/gpt-6-astra בתעריף של הספק עצמו — $10.00 קלט ו-$50.00 פלט למיליון טוקנים, עם מדרגת ההקשר הארוך של 272K ל-$20.00 / $75.00 — מוגש בתוספת של 0%, כלומר מחיר המחירון של הספק מועבר הלאה וכל שינוי של הספק מגיע לחשבון שלך באותו יום שבו הוא מגיע למחירון של OpenAI במקום בחידוש החוזה הבא שלך. אותו מפתח מגיע ליותר מ-200 מודלים, כך שהמסלול הסטנדרטי יכול לשבת מאחורי אותו לקוח כמו המסלול הזול או מודל של מתחרה בלי אינטגרציה שנייה.

מה שאנחנו לא עושים הוא לספק את שכבת Ultrafast. זהו דגל של שכבת שירות בחשבון OpenAI ולא מודל שניתן לנתב אליו בנפרד — אתם מגדירים service_tier: "ultrafast" בבקשה אל gpt-6-astra — והיא מחויבת על ידי OpenAI לחשבון שלכם לפי התעריפים שלמעלה. אם תפעילו אותה, היא נמצאת באינטגרציה הישירה שלכם עם OpenAI, ו-OrcaRouter הוא המקום הנכון לתעבורת שכבת ה-Standard שאתם מנתבים לצידה. לומר זאת בפשטות מועיל יותר מלהרמז על יכולת שאין לנו.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1M-token context window, 128K maximum output, text, image and file input, text output, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure, and 155.1M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

כלל ההחלטה, בפסקה אחת

פי שישה הוא המחיר של דרגה, לא המחיר של מודל: המשקלים, חלון ההקשר של 1,050,000 טוקנים, תקרת הפלט של 128,000 טוקנים והתשובות זהים כולם ל-GPT-6 Astra הסטנדרטי. מה שאתם קונים הוא תפוקת פלט מהירה עד פי 8, לפי מחירון שהוא פי 6 בכל שורה, בכפוף למגבלות קצב ראשוניות נמוכות ולהגבלת תושבות בארה"ב שמחריגה לחלוטין את האיחוד האירופי. העסקה הזו נכונה בבירור עבור אדם שממתין לתשובה, שגויה בבירור עבור עבודת אצווה מתוזמנת שיש לה מסלול זמין בחצי מחיר, ובאמת לא מוכרעת עבור לולאות אג'נטיות שבהן התשובה תלויה בשאלה אם המהירות מסירה סבבים. מדדו את מספר הסבבים בטרייסים שלכם לפני שאתם מתחייבים, ותנתבו את השאר במחיר מחירון.

A screenshot of OpenAI's Ultrafast documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the recommendation to use WebSockets because per-request network overhead can reduce the latency gains, the note that Ultrafast for GPT-6 Astra is available to all API users at low rate limits with higher limits or Sol preview access available through an OpenAI account team, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית