כרטיס כותרת שנוצר עם הכותרת 'GPT-6 Astra Ultrafast פועל על Blackwell', כותרת המשנה 'NVIDIA מציינת את החומרה שמאחורי ה-8x', ושלושה כרטיסים שעליהם כתוב 'חומרה: GPUs של Blackwell', 'מכפיל מחיר: פי 6.00 מהתעריף הרגיל' ו'מהירות מוצהרת: עד פי 8', עם כותרת תחתונה 'פוסט של NVIDIA, 1 באוקטובר 2026 - נתונים כפי שדווחו על ידי הספק'.
Guides & Insights

GPT-6 Astra Ultrafast פועל על Blackwell: NVIDIA חושפת את החומרה שמאחורי פי 8

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-1 באוקטובר 2026 פרסמה NVIDIA פוסט מאת Dion Harris שכותרתו "איך NVIDIA GPUs עוזרים להאיץ את GPT-6 Astra Ultrafast של OpenAI", והמשפט במרכזו הוא הפעם הראשונה שאחת משתי החברות אמרה על איזו חומרה רצה שכבת השירות: "GPT-6 Astra Ultrafast, שרץ על NVIDIA Blackwell GPUs, זמין כעת ב-OpenAI API ולמשתמשי ChatGPT Work ו-Codex הזכאים." זו החדשה, והיא מצומצמת יותר ממה שהכותרת מרמזת. GPT-6 Astra, המודל, שוחרר ב-3 בספטמבר 2026. שכבת השירות Ultrafast מעליו הפכה לזמינה באופן נרחב ב-29 בספטמבר 2026. הטענה בדבר המהירות — יצירת טוקנים מהירה עד פי 8 מאשר במצב הסטנדרטי של Astra — הייתה כבר בת יומיים כאשר NVIDIA חזרה עליה.

מה שמעלה את השאלה שהפוסט באמת עונה עליה: לא "כמה מהר זה", אלא "של מי הסיליקון הזה".

A screenshot of OpenAI's Ultrafast mode documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the note that Ultrafast for GPT-6 Astra is currently available to all API users at low rate limits with higher limits or Sol preview access requestable through an OpenAI account team, the recommendation to use WebSockets because without a persistent connection network overhead can reduce the latency gains, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

שלושה דברים שהפוסט באמת הוסיף

הוצא את החזרה על הנאמר, והפוסט מ-1 באוקטובר מספק שלוש עובדות.

• החומרה — Blackwell. התיעוד של OpenAI עצמה ל-Ultrafast, שפורסם ב-30 בספטמבר, מתאר את מהירות הרמה, את תצורתה ואת מגבלות הקצב שלה, ואינו מזכיר שום GPU כלל. כך שהייחוס לשבב מבוסס על מקור יחיד — ספק החומרה. זה לא הופך אותו לשקרי; זה הופך אותו לטענה של ספק על הציוד של עצמו, וראוי לתייג אותה ככזו.

• שני מהנדסים בשמם — פיליפ טייה, ראש מערך האינפרנס של OpenAI, ואודאי רודאראג'ו, סמנכ״ל הטכנולוגיה של OpenAI לענייני מחשוב, ששניהם צוטטו בגלוי בשמם בשאלה ממה נבעה ההאצה.

• הקהל — "משתמשים זכאים של ChatGPT Work ו-Codex," שהוא רחב יותר מהמסגור של API בלבד שאיתו הושק המסלול. התיעוד של OpenAI עצמו עדיין אומר ש-Ultrafast עבור GPT-6 Astra "זמין לכל משתמשי ה-API במגבלות קצב נמוכות," וההסתייגות הזו של מגבלות נמוכות לא בוטלה באופן רשמי.

שני הציטוטים, ומדוע הם החלק המעניין

התרומה של טילט היא לולאה ולא בנצ'מרק. ההשקעה של NVIDIA בכלים ובתיעוד, הוא אומר, "אפשרה לנו להפוך את המודלים שלנו לטובים באופן יוצא דופן בתכנות", ואז Astra יכולה "להפוך את הידע הזה לקרנלים בעלי ביצועים גבוהים שהופכים את החומרה של NVIDIA לאטרקטיבית". רודאראג'ו בוטה יותר לגבי כיוון העבודה: "השתמשנו במודלים הפנימיים שלנו כדי לייעל את ההסקה על GPUs של NVIDIA".

בקריאה משותפת, זוהי טענה על פריסה ולא על יכולת: המודלים המובילים של OpenAI טובים כעת מספיק בכתיבת קרנלים של GPU עד כדי כך ש-OpenAI משתמשת בהם כדי לייעל את מחסנית ההגשה שלה. זה גם מתיישב עם הקטע היחיד בפוסט של NVIDIA שאינו עוסק בשבוע ההשקה בכלל — כותרת שנקראת "שיפור מתמיד בביצועים," בטענה שהסקה בפריסה נהיית מהירה יותר עם הזמן מכיוון ש-OpenAI ממשיכה לכוון את המודלים שלה לתוכנה של NVIDIA שעליה היא פועלת.

שום דבר מזה אינו מדידה. מדובר בשני מהנדסים שמתארים תהליך, שפורסם על ידי החברה שמכרה את ה-GPUs. הקריאה הכנה היא שהתהליך סביר, זול להאמין לו, ואינו ניתן להפרכה מבחוץ — וזה נכון גם לגבי כל מספר מהירות בסיפור הזה.

Blackwell כאן, Cerebras שם

הדבר השימושי ביותר שהפוסט הזה עושה הוא לחשוף פיצול שאיש לא הסביר. ב-13 באוגוסט 2026, OpenAI הציגה בתצוגה מקדימה דרג מהיר מעל מודל אחר — GPT-5.6 Sol שרץ "עד פי 14" מהר יותר — וציינה את Cerebras כשותפה שמאחורי זה, ותיארה חומרה בקנה מידה של פרוסה שמייצרת עד 750 טוקנים של פלט בשנייה. שבעה שבועות לאחר מכן, הדרג המהיר מעל Astra פועל על Blackwell, והמספר הוא פי 8.

שני דרגים מהירים, שתי תשובות חומרה, אחת מהן שותפה מומחית והאחרת הספקית הגדולה ביותר של החברה עצמה. אף אחד מהספקים לא פרסם השוואה בין שני נתיבי ההגשה, ואף מעריך בלתי תלוי לא מדד אף אחד מהם. שימו לב גם למה שהפוסט של NVIDIA עושה עם השם השני: "Rubin" מופיע פעם אחת, בתוך הציטוט של Tillet על מודלים שכותבים קרנלים עבור "מעבדי GPU של Blackwell ו-Rubin". זו אמירה על מה שהמודלים של OpenAI יכולים לתכנת, לא אמירה שמשהו מוגש על Rubin היום.

המספר ש-NVIDIA לא הדפיסה

יש נתון בסיפור הזה שאף חברה לא שמה לצד ה-8x, והוא זה שקובע אם צוות מפעיל את המסלול. מחירון Ultrafast המפורסם של OpenAI מפרט את gpt-6-astra במחיר $60.00 למיליון טוקני קלט, $6.00 קלט במטמון, $75.00 כתיבה למטמון ו-$300.00 פלט. אותו מודל במסלול הסטנדרטי הוא $10.00 ו-$50.00, עם קלט במטמון ב-$1.00 וכתיבה למטמון ב-$12.50. כל עמודה היא בדיוק פי שישה מהתעריף הסטנדרטי.

• המכפיל — פי 6.00 בקלט, בפלט, בקלט במטמון ובכתיבה למטמון. לא "עד". שש.

• התקרה — פי 8, הנתון ששני הספקים מצטטים בצירוף "עד" וללא תנאים מוצהרים.

• מה זה אומר — מכפיל המחיר נמצא מתחת למקרה הטוב ביותר המוצהר של המסלול עצמו. בתקרה העסקה משתלמת; בכל דבר מתחת ל-6x בתעבורה שלך, אתה משלם יותר לכל יחידת זמן שנחסכת ממה שהשיווק מרמז. ולכן המבחן המשמעותי היחיד של המסלול הזה הוא מדידה על הבקשות שלך.

• שלב ההקשר הארוך — מעל 272,000 אסימוני קלט, תעריפי Ultrafast הופכים ל-$120.00 עבור קלט ול-$450.00 עבור פלט, פי שישה מהתעריפים המדורגים של המסלול הסטנדרטי עצמו.

• האותיות הקטנות המבצעיות — OpenAI מתעדת סולם טוקנים לדקה של Ultrafast: 500,000 עבור דרגות שימוש 1 עד 3, 1,000,000 עבור דרגה 4 ו-5,000,000 עבור דרגה 5; Ultrafast תומך בשהות נתונים בארה"ב ובעיבוד גלובלי בלבד, ללא נקודת קצה לעיבוד אזורי באיחוד האירופי או באזור אחר שאינו ארה"ב; והתיעוד ממליץ על WebSockets עבור Ultrafast "במיוחד עבור יישומים סוכניים שמבצעים קריאות כלים רבות ברצף מהיר", ומזהיר ש"ללא חיבור מתמשך, תקורת הרשת עלולה להפחית את השיפורים בהשהיה."

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that regional processing endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP endpoints carry a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

הנקודה האחרונה היא זו שיש לפעול לפיה. צוות שמפעיל את הדרגה ומותיר מתחתיה HTTP לכל בקשה שילם פי שישה מהתעריף כדי להחזיר חלק מההאצה להקמת חיבור — דרך מתועדת وניתנת למניעה לבזבז את הכסף.

איך זה נראה מנקודת קצה אחת

GPT-6 Astra זמין ב-OrcaRouter בתור openai/gpt-6-astra: חלון הקשר של 1,050,000 טוקנים, עד 128,000 טוקני פלט, קלט טקסט, תמונה וקבצים, ומחיר המחירון של OpenAI מועבר ישירות במחיר $10.00 לקלט ו-$50.00 לפלט למיליון טוקנים, כשהוא עולה ל-$20.00 ו-$75.00 מעל 272,000 טוקני קלט. הבנצ'מרק הראשי בקטלוג שלו הוא 96.1 ב-GPQA Diamond.

שכבת ה-Ultrafast אינה נמצאת ב-OrcaRouter, והיא גם לא יכולה להיות: היא מאפיין של חשבון OpenAI עם בקרת גישה ולא מזהה מודל, ולכן openai/gpt-6-astra-ultrafast מחזיר model-not-found. אם תפעילו את השכבה, היא תחיה באינטגרציה הישירה שלכם עם OpenAI. מה שנקודת קצה עם יותר מ-200 מודלים עם 0% תוספת מחיר נותנת לכם במצב הזה הוא לא הנתיב המהיר — אלא השליטה. מכיוון שמחיר המחירון של הספק מועבר הלאה ולא מתומחר בתוספת, שינוי בתעריפי OpenAI נוחת בצד שלנו באותו יום שבו הוא נוחת אצלם, ומכיוון שנתיב Astra הסטנדרטי כבר קיים, הניסוי שמכריע את ההחלטה הזו הוא שורת קונפיגורציה אחת: אותו פרומפט, שכבה סטנדרטית, ומודל זול יותר לצידו, על אותו מפתח. זה הדבר הקרוב ביותר למדד השהיה שרוב הצוותים אי-פעם יריצו, והוא לא עולה דבר להקים.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

מה שטרם נמדד

שלושה דברים ניתנים לבדיקה היום. השכבה קיימת, היא מופיעה בכרטיס התעריפים בדיוק פי שישה מהתעריף הרגיל, והחל מ-1 באוקטובר היא מיוחסת בפומבי ל-NVIDIA Blackwell GPUs.

דבר אחד אינו נכון: המכפיל על התעבורה שלך. שום ספק לא פרסם התפלגות השהיה עבור השכבה ברמת מקביליות מוצהרת, ואף צד שלישי לא שחזר את פי 8. אין גם בנצ'מרק שמשווה את Astra על Ultrafast ל-Astra ב-standard, ולא אמור להיות בנצ'מרק מחמיא כזה — מדובר באותו צ'קפוינט בנתיב מהיר יותר, לכן הגדרות זהות אמורות להפיק תשובות זהות במהירויות שונות. אם שני המסלולים שלך מתפצלים באותם פרומפטים, יש לך דיווח באג, לא פיצ'ר.

אז התמצית השימושית של ה-1 באוקטובר קטנה מכפי שההכרזה נשמעת. זה אותו דרג באותו מחיר עם אותה תקרת מהירות לא מאומתת, שכעת עוטה תווית חומרה. התווית הזו חשובה — היא מספרת לך על איזו סדרת מאיצים OpenAI מרחיבה את זה, והיא מספרת לך שסיפור הדרג המהיר עבר משותף מומחה לספק ה-GPU הגדול בתעשייה בתוך פחות מחודשיים. היא רק לא מספרת לך דבר על תקציב ההשהיה שלך, ואף פוסט לא יעשה זאת.